Engenheiro de dados databricks/dbt/streaming/ml/ai
Leega Consultoria
Job Description
Diferenciais
- Experiência com MLflow e Databricks ML
- Experiência prática com pipelines de RAG, vetorização/embeddings e bancos vetoriais
- Conhecimento em integração com ferramentas de IA generativa ou APIs de Machine Learning
- Vivência com Kubernetes para orquestração de workloads
- Experiência com Terraform (infraestrutura como código)
- Familiaridade com arquiteturas orientadas a eventos ou streaming (Kafka, Pub/Sub)
Trabalho 100% remoto
Projeto: Até Dez/2026 podendo prorrogar.
Buscamos um(a) Engenheiro(a) de Dados Sênior para atuar em uma frente de habilitação de Dados para IA um papel estruturante, e não de execução pura de pipelines ou delivery de produto.
Esse(a) profissional será responsável por definir caminhos e direcionamentos arquiteturais da plataforma de dados, criar mecanismos e padrões para o consumo de dados não estruturados (PDF, áudio, imagens e vídeos) por aplicações de IA, e habilitar outros times a construir sobre essa base.
É um papel que combina visão de arquitetura com atuação hands-on: colocar a mão na massa, executar testes práticos, validar abordagens e melhorar continuamente os processos.
Principais responsabilidades:
- Definir caminhos, padrões e direcionamentos arquiteturais para a plataforma de dados voltada a IA
- Estruturar e criar mecanismos para ingestão, processamento e disponibilização de dados não estruturados (PDF, áudio, imagens, vídeos)
- Definir a estrutura dos dados para consumo por modelos de IA/ML e IA generativa
- Automatizar, melhorar e propor mudanças em processos de dados existentes
- Realizar provas de conceito e testes práticos para validar soluções antes de escalá-las
- Atuar como referência técnica em um time de habilitação, apoiando times multidisciplinares
- Construir e evoluir pipelines de dados escaláveis integrados a aplicações externas
Requisitos obrigatórios:
- Experiência sólida com Databricks e Apache Spark para processamento distribuído em larga escala
- Domínio de Python e SQL aplicados à engenharia de dados (Scala como diferencial)
- Experiência com processamento de dados não estruturados (documentos/PDF, áudio, imagens ou vídeos) para consumo por IA
- Experiência em definição de arquitetura de dados e direcionamento técnico (não apenas execução)
- Familiaridade com preparação de dados para IA/ML e IA generativa (feature engineering, chunking, embeddings, consumo por modelos)
- Experiência em integração de dados com sistemas externos (APIs, serviços SaaS, streaming)
- Vivência em cloud computing, preferencialmente GCP
- Conhecimento de Delta Lake (arquitetura Lakehouse, versionamento e governança de dados)
- Experiência com modelagem e transformação de dados com DBT
- Prática com pipelines de dados (ETL/ELT) escaláveis e robustos
- Experiência com versionamento de código (Git) e CI/CD
- Experiência em ambientes ágeis e colaboração com times multidisciplinares
- Perfil hands-on com autonomia para propor, testar e melhorar processos