⚡ New

Engenheiro de dados databricks/dbt/streaming/ml/ai

Leega Consultoria

RemoteFull-timeMid LevelRemote

Job Description

Diferenciais

  • Experiência com MLflow e Databricks ML
  • Experiência prática com pipelines de RAG, vetorização/embeddings e bancos vetoriais
  • Conhecimento em integração com ferramentas de IA generativa ou APIs de Machine Learning
  • Vivência com Kubernetes para orquestração de workloads
  • Experiência com Terraform (infraestrutura como código)
  • Familiaridade com arquiteturas orientadas a eventos ou streaming (Kafka, Pub/Sub)


Trabalho 100% remoto

Projeto: Até Dez/2026 podendo prorrogar.



Buscamos um(a) Engenheiro(a) de Dados Sênior para atuar em uma frente de habilitação de Dados para IA um papel estruturante, e não de execução pura de pipelines ou delivery de produto.

Esse(a) profissional será responsável por definir caminhos e direcionamentos arquiteturais da plataforma de dados, criar mecanismos e padrões para o consumo de dados não estruturados (PDF, áudio, imagens e vídeos) por aplicações de IA, e habilitar outros times a construir sobre essa base.

É um papel que combina visão de arquitetura com atuação hands-on: colocar a mão na massa, executar testes práticos, validar abordagens e melhorar continuamente os processos.


Principais responsabilidades:

  • Definir caminhos, padrões e direcionamentos arquiteturais para a plataforma de dados voltada a IA
  • Estruturar e criar mecanismos para ingestão, processamento e disponibilização de dados não estruturados (PDF, áudio, imagens, vídeos)
  • Definir a estrutura dos dados para consumo por modelos de IA/ML e IA generativa
  • Automatizar, melhorar e propor mudanças em processos de dados existentes
  • Realizar provas de conceito e testes práticos para validar soluções antes de escalá-las
  • Atuar como referência técnica em um time de habilitação, apoiando times multidisciplinares
  • Construir e evoluir pipelines de dados escaláveis integrados a aplicações externas


Requisitos obrigatórios:

  • Experiência sólida com Databricks e Apache Spark para processamento distribuído em larga escala
  • Domínio de Python e SQL aplicados à engenharia de dados (Scala como diferencial)
  • Experiência com processamento de dados não estruturados (documentos/PDF, áudio, imagens ou vídeos) para consumo por IA
  • Experiência em definição de arquitetura de dados e direcionamento técnico (não apenas execução)
  • Familiaridade com preparação de dados para IA/ML e IA generativa (feature engineering, chunking, embeddings, consumo por modelos)
  • Experiência em integração de dados com sistemas externos (APIs, serviços SaaS, streaming)
  • Vivência em cloud computing, preferencialmente GCP
  • Conhecimento de Delta Lake (arquitetura Lakehouse, versionamento e governança de dados)
  • Experiência com modelagem e transformação de dados com DBT
  • Prática com pipelines de dados (ETL/ELT) escaláveis e robustos
  • Experiência com versionamento de código (Git) e CI/CD
  • Experiência em ambientes ágeis e colaboração com times multidisciplinares
  • Perfil hands-on com autonomia para propor, testar e melhorar processos

Posted Today

Related Jobs

Related Searches

Apply Now