⚡ New

[Tech] Especialista SRE | IA | REMOTO

TOTVS

RemoteFull-timeMid LevelRemote

Job Description

Você fará parte do time de Site Reliability Engineering (SRE), sendo responsável por estabelecer padrões de qualidade dos serviços de infraestrutura, acompanhando as inovações do mercado e garantindo a excelência do ecossistema tecnológico dos ambientes Cloud TOTVS.

Será responsável por assegurar a confiabilidade, disponibilidade, desempenho, segurança e evolução contínua dos serviços sob sua responsabilidade, atuando como referência técnica na implementação de soluções, automação de processos, observabilidade, governança e melhoria contínua, contribuindo diretamente para os objetivos estratégicos da companhia.


O QUE VOCÊ VAI FAZER:

  • Monitorar continuamente a saúde dos sistemas, criar alertas eficazes e garantir cobertura proativa de incidentes.
  • Responder rapidamente a incidentes críticos, coordenando mitigação, comunicação e resolução.
  • Gerir mudanças, atualizações e implantações com foco em segurança, estabilidade e disponibilidade.
  • Construir e manter pipelines, bibliotecas e automações para provisionamento, deploy e operação em ambientes Cloud de alta disponibilidade.
  • Estabelecer e garantir padrões de security by design em infraestrutura, código e dados.
  • Projetar e evoluir soluções de observabilidade ponta a ponta, integrando logs, métricas, traces e eventos.
  • Criar, gerenciar e melhorar indicadores de confiabilidade (SLIs, SLOs, MTTR, MTTA).
  • Conduzir post-mortems blameless e implementar ações corretivas e preventivas.
  • Influenciar decisões arquiteturais e operacionais visando resiliência, escalabilidade e custo eficiente.
  • Documentar padrões técnicos, playbooks e comunicar impactos técnicos em linguagem de negócio.
  • Definir prioridades estratégicas do backlog de SRE, equilibrando confiabilidade, velocidade de entrega, segurança e custos.
  • Apoiar auditorias, conformidade e governança de segurança em alinhamento com times de risco e compliance.
  • Capacidade de mentorar e influenciar tecnicamente outros times, promovendo cultura de automação, segurança e confiabilidade e fomentando a cultura de ownership sobre sistemas em produção.
  • Disseminar conhecimento técnico por meio de mentorias, treinamentos, workshops, documentações e apresentações internas e externas, contribuindo para o desenvolvimento da equipe.
  • Buscar continuamente novas tecnologias, soluções e referências de mercado junto a fabricantes e fornecedores, avaliando sua viabilidade técnica e de negócio.


O QUE ESPERAMOS DE VOCÊ:

  • Domínio de conceitos avançados de SRE, DevSecOps e gestão de incidentes.
  • Automação de infraestrutura e pipelines em alto nível, utilizando Shell, Python, Go, Node.js ou Groovy.
  • Experiência com monitoramento e observabilidade distribuída (Prometheus, Grafana, Loki, ELK/Elastic Stack, Datadog, New Relic, OpenTelemetry).
  • Atuação sólida com Cloud pública (GCP, AWS ou equivalente), incluindo provisionamento, automação e otimização de custos.
  • Experiência em CI/CD e DevSecOps avançado, com ferramentas como Git/GitOps, Jenkins, ArgoCD, Maven, SonarQube/Cloud.
  • Proficiência em contêineres e orquestração (Docker, Kubernetes) e Infraestrutura como Código (Terraform, Ansible, CloudFormation, Chef).
  • Vivência com serviços de mensageria e data streaming como Kafka, Redis Streams, Google Pub/Sub, Dataflow.
  • Experiência com bancos de dados SQL e NoSQL, incluindo PostgreSQL, AloyDB, MySQL, MongoDB, Elasticsearch, BigQuery.
  • Experiência em gestão de incidentes e troubleshooting em sistemas complexos, utilizando PagerDuty, Opsgenie, StatusPage, Splunk ou equivalentes.
  • Conhecimento em segurança da informação, compliance e governança de ambientes cloud (LGPD, Privacy by Design, SAST/DAST, IAM, Secret Management).
  • Familiaridade com ambientes de alto volume de dados, tráfego e experiência com design resiliente.
  • Experiência ou interesse em DataOps/MLOps, atuando com pipelines de dados e IA em larga escala (desejável).
  • Background em arquitetura e desenvolvimento de software, com domínio de versionamento, APIs, microserviços e padrões REST/gRPC.
  • Vivência em metodologias ágeis (Scrum, Kanban ou similares).
  • Uso de IA assistiva e ferramentas de produtividade como GitHub Copilot, ChatGPT ou similares (diferencial).
  • Conhecimento de redes TCP/IP, DNS, HTTP/HTTPS, TLS, Load Balancers, CDN, VPN, proxies e troubleshooting de conectividade.
  • Administração avançada Linux, análise de performance, gerenciamento de processos, memória, disco, rede e troubleshooting em ambientes produtivos.


SERIA LEGAL SE TIVESSE:

  • Certificações relevantes (AWS, GCP, Kubernetes, ITIL, Security+).
  • Experiência com políticas de segurança como zero-trust.
  • Experiência em FinOps e gestão de custos em ambientes distribuídos.
  • Experiência com blue/green deployments, canary releases e chaos engineering.
  • Experiência com padronização de deploys por templates (Helm/Kustomize).
  • Prática com observabilidade unificada via OpenTelemetry e tracing distribuído.
  • Vivência em construção de plataformas internas (IDP), uso de Backstage, automação de ambientes.
  • Inglês: Intermediário/Avançado


Benefícios

  • Universidade em Rede TOTVS, uma universidade Corporativa com conteúdos e certificações gratuitos para cada pessoa colaboradora;
  • Programa +Saudáveis, que cuida de cada TOTVER com assessoria e ações voltadas para o bem estar em corpo, mente e finanças pessoais;
  • Programa +Vantagens, a maior rede de descontos da América Latina, exclusivos para nossas pessoas colaboradoras;
  • Programa + Cuidado, programa de apoio pessoal para pessoas colaboradoras e familiares, com orientações em diversas especialidades como: psicologia, serviço social, pet consultoria...
  • Einstein Conecta, benefício de orientação médica online pelos médicos do Hospital Israelita Albert Einstein, totalmente gratuito;
  • Plano de saúde e odontológico;
  • Vale refeição e / ou alimentação;
  • Vale transporte e fretados em algumas estações do metrô;
  • Licença maternidade e paternidade estendida;
  • Espaço de lactário;
  • Bicicletário;
  • Vestiário;
  • Seguro de vida;
  • Auxílio creche;
  • Previdência privada;
  • Escritório que estimula a criatividade e produtividade com ambientes para lanches, salas de jogos, mesas de bilhar e poltronas para relaxar;
  • Gympass.

Posted Today

Related Jobs

Related Searches

Apply Now