Senior Machine Learning Ops/LLM Ops Engineer
METRICA Portugal
Job Description
Queres fazer parte da construção de soluções de IA em produção, com impacto real e foco em fiabilidade, observabilidade e governança de dados? Na Metrica estamos à procura de um(a) Senior ML Ops / LLM Ops Engineer para liderar a implementação e operação de uma plataforma de ML/LLM Ops end to end.
Nesta função, serás responsável pela execução técnica da estratégia definida pela liderança de IA, garantindo que toda a pipeline de produção desde a ingestão de dados até à deteção de regressões funciona de forma robusta, escalável e segura.
Principais responsabilidades:
- Conceber e desenvolver uma pipeline de ingestão independente da origem para tráfego de produção de ML/LLM.
- Definir a arquitetura de armazenamento, retenção de dados e políticas de privacidade de acordo com requisitos empresariais e regulamentares.
- Implementar dashboards e ferramentas de análise que permitam às equipas investigar rapidamente problemas em produção.
- Desenvolver sistemas de avaliação automática (autoraters) e classificadores baseados em LLM para monitorização contínua.
- Construir mecanismos de triagem automática para identificação de falhas recorrentes.
- Implementar workflows de geração de novos casos de teste (evaluation mining) e alertas de regressão associados a novas versões de modelos e prompts.
- Garantir anonimização de dados (PII Redaction) na ingestão e classificação de conteúdos relacionados com segurança e abuso.
- Definir e operar toda a arquitetura da plataforma, incluindo ferramentas, alojamento, controlo de acessos e mecanismos de eliminação de dados.
Requisitos obrigatórios:
- Experiência comprovada na construção e operação de plataformas de dados ou ML em ambiente de produção.
- Experiência prática na implementação de sistemas de avaliação de modelos ML/LLM, incluindo conjuntos de regressão, autoraters, pipelines "LLM-as-a-Judge" e golden datasets.
- Experiência com ferramentas de tracing e observabilidade para aplicações baseadas em LLM.
- Experiência na implementação de mecanismos de anonimização de dados pessoais (PII) ou controlos equivalentes em ambientes regulados ou multi-tenant.
- Conhecimento sólido dos principais modos de falha de sistemas baseados em IA, incluindo:
- Falhas em Retrieval (RAG)
- Loops infinitos em agentes
- Degradação ASR/TTS
- Regressões de prompts ou modelos
- Domínio de Python em contexto de desenvolvimento de produção.
- Mentalidade hands‑on e forte capacidade de execução técnica.
Valorizamos também:
- Experiência em plataformas SaaS multi‑tenant.
- Experiência com Microsoft Azure e AWS.
- Capacidade para avaliar soluções self‑hosted versus serviços geridos.
- Conhecimentos de metodologias de autorating e prevenção de contaminação de datasets.
- Experiência com bases de dados vetoriais, embeddings e descoberta automática de padrões de falha.
- Experiência com ferramentas de versionamento de dados (LakeFS, DVC, Delta Lake).
- Conhecimentos de GDPR e processos de direito ao apagamento.
- Experiência em ambientes Embedded, Automotive ou similares.
- Conhecimento funcional de outro idioma além do inglês.
- Experiência com:
- Conhecimentos de SQL e TypeScript.
- Experiência com Android ou Android Automotive OS (AAOS).
O que esperamos alcançar:
Nos primeiros 30 dias:
- Benchmark da stack tecnológica concluído, incluindo recomendações sobre analytics, versionamento de dados e estratégia de alojamento.
- Pipeline de ingestão funcional em ambiente de staging, com anonimização de dados implementada.
Nos primeiros 90 dias:
- Componentes críticos da plataforma em produção:
- Ingestão
- Redação de PII
- Classificação de segurança
- Processos de eliminação de dados
- Primeiros casos de avaliação gerados automaticamente e integrados no processo de validação.
Ao fim de 6 meses:
- Processo contínuo de descoberta de novos casos de teste para avaliação de modelos.
- Monitorização de custos e utilização por cliente e funcionalidade.
- Sistema de alertas de regressão fiável e integrado no ciclo de deployment.
- Plataforma preparada para suportar novos clientes mantendo elevados padrões de escalabilidade, privacidade e conformidade
Se procuras um desafio onde possas construir infraestruturas críticas para sistemas de IA em produção e contribuir diretamente para a evolução de soluções de próxima geração, gostaríamos de conhecer o teu perfil.
#J-18808-Ljbffr