Analista Pleno De Observabilidade E Operações De Ia
Vertis Solutions
Job Description
Missão da posição
Atuar na sustentação e monitoração de soluções de IA e automação utilizadas em ambientes operacionais, garantindo disponibilidade, desempenho, qualidade e confiabilidade dos serviços. O profissional será responsável por acompanhar o funcionamento dos fluxos de automação, identificar falhas, apoiar a resolução de incidentes e contribuir para a evolução contínua das práticas de observabilidade e operação.Principais responsabilidadesOperação e Sustentação
- Monitorar aplicações, serviços e componentes utilizados pelas soluções de IA e automação.
- Atuar na análise e resolução de incidentes operacionais.
- Investigar falhas de integração, comunicação entre sistemas, APIs e fontes de dados.
- Acompanhar logs, métricas, alertas e indicadores de desempenho.
- Executar procedimentos operacionais de recuperação, restart e validação dos serviços.
- Documentar ocorrências, soluções e procedimentos operacionais.
- Analisar logs, traces e métricas para identificação de problemas.
- Apoiar a criação e manutenção de dashboards e alertas.
- Monitorar indicadores de disponibilidade, latência, taxa de erro e utilização dos serviços.
- Apoiar iniciativas de melhoria da observabilidade das aplicações.
- Participar de análises de causa raiz de incidentes.
- Apoiar a investigação de comportamentos inesperados em aplicações que utilizam IA Generativa.
- Identificar se uma ocorrência está relacionada a dados, integração, configuração ou comportamento do modelo.
- Reproduzir cenários reportados pelos usuários e registrar evidências.
- Trabalhar em conjunto com equipes de desenvolvimento, dados e infraestrutura na resolução dos problemas.
- Identificar oportunidades de automação operacional.
- Criar scripts simples de diagnóstico e apoio à operação.
- Contribuir para melhoria da confiabilidade e desempenho dos serviços.
- Participar de revisões pós-incidente e definição de ações preventivas.
- Linux
- Containers Docker
- Conceitos de Kubernetes ou OpenShift
- APIs REST e JSON
- Git
- Conhecimento básico de CI/CD
Experiência com pelo menos algumas das ferramentas abaixo:
- Grafana
- Prometheus
- Elastic / Kibana
- OpenTelemetry
- Jaeger
- Python para automação e troubleshooting
- SQL
- Shell Script
- Testes e validação de APIs
Conhecimentos básicos ou intermediários em:
- IA Generativa
- LLMs
- Conceitos de prompts
- RAG (desejável)
- Tool Calling (desejável)
- OpenShift
- Langfuse
- LangChain ou LangGraph
- MCP (Model Context Protocol)
- PostgreSQL
- Kafka
- Airflow
- Ambientes de telecomunicações
- Processos ITIL
- Monitoramento de aplicações distribuídas
Buscamos uma pessoa com perfil investigativo e proativo, capaz de atuar em ambientes dinâmicos e colaborativos.
Competências desejadas:
- Capacidade analítica
- Facilidade para troubleshooting
- Organização
- Comunicação clara
- Trabalho em equipe
- Senso de prioridade
- Responsabilidade operacional
- Curiosidade e interesse por novas tecnologias
- Ciência da Computação
- Sistemas de Informação
- Engenharia da Computação
- Engenharia de Telecomunicações
- Análise e Desenvolvimento de Sistemas
- Áreas correlatas
- Entre 2 e 4 anos em sustentação de aplicações, observabilidade, DevOps, NOC avançado, SRE júnior ou operações de TI.
- Experiência com ambientes Linux e aplicações em produção.
- Vivência com monitoramento, análise de incidentes e troubleshooting.
- Diferencial ter atuado em projetos de IA Generativa ou automação inteligente.