Senior Machine Learning Ops/LLM Ops Engineer

METRICA Portugal

LisboaFull-timeMid LevelOn-site

Job Description

Queres fazer parte da construção de soluções de IA em produção, com impacto real e foco em fiabilidade, observabilidade e governança de dados? Na Metrica estamos à procura de um(a) Senior ML Ops / LLM Ops Engineer para liderar a implementação e operação de uma plataforma de ML/LLM Ops end to end.

Nesta função, serás responsável pela execução técnica da estratégia definida pela liderança de IA, garantindo que toda a pipeline de produção desde a ingestão de dados até à deteção de regressões funciona de forma robusta, escalável e segura.

Principais responsabilidades:

  • Conceber e desenvolver uma pipeline de ingestão independente da origem para tráfego de produção de ML/LLM.
  • Definir a arquitetura de armazenamento, retenção de dados e políticas de privacidade de acordo com requisitos empresariais e regulamentares.
  • Implementar dashboards e ferramentas de análise que permitam às equipas investigar rapidamente problemas em produção.
  • Desenvolver sistemas de avaliação automática (autoraters) e classificadores baseados em LLM para monitorização contínua.
  • Construir mecanismos de triagem automática para identificação de falhas recorrentes.
  • Implementar workflows de geração de novos casos de teste (evaluation mining) e alertas de regressão associados a novas versões de modelos e prompts.
  • Garantir anonimização de dados (PII Redaction) na ingestão e classificação de conteúdos relacionados com segurança e abuso.
  • Definir e operar toda a arquitetura da plataforma, incluindo ferramentas, alojamento, controlo de acessos e mecanismos de eliminação de dados.

Requisitos obrigatórios:

  • Experiência comprovada na construção e operação de plataformas de dados ou ML em ambiente de produção.
  • Experiência prática na implementação de sistemas de avaliação de modelos ML/LLM, incluindo conjuntos de regressão, autoraters, pipelines "LLM-as-a-Judge" e golden datasets.
  • Experiência com ferramentas de tracing e observabilidade para aplicações baseadas em LLM.
  • Experiência na implementação de mecanismos de anonimização de dados pessoais (PII) ou controlos equivalentes em ambientes regulados ou multi-tenant.
  • Conhecimento sólido dos principais modos de falha de sistemas baseados em IA, incluindo:
  • Falhas em Retrieval (RAG)
  • Loops infinitos em agentes
  • Degradação ASR/TTS
  • Regressões de prompts ou modelos
  • Domínio de Python em contexto de desenvolvimento de produção.
  • Mentalidade hands‑on e forte capacidade de execução técnica.

Valorizamos também:

  • Experiência em plataformas SaaS multi‑tenant.
  • Experiência com Microsoft Azure e AWS.
  • Capacidade para avaliar soluções self‑hosted versus serviços geridos.
  • Conhecimentos de metodologias de autorating e prevenção de contaminação de datasets.
  • Experiência com bases de dados vetoriais, embeddings e descoberta automática de padrões de falha.
  • Experiência com ferramentas de versionamento de dados (LakeFS, DVC, Delta Lake).
  • Conhecimentos de GDPR e processos de direito ao apagamento.
  • Experiência em ambientes Embedded, Automotive ou similares.
  • Conhecimento funcional de outro idioma além do inglês.
  • Experiência com:
  • Conhecimentos de SQL e TypeScript.
  • Experiência com Android ou Android Automotive OS (AAOS).

O que esperamos alcançar:

Nos primeiros 30 dias:

  • Benchmark da stack tecnológica concluído, incluindo recomendações sobre analytics, versionamento de dados e estratégia de alojamento.
  • Pipeline de ingestão funcional em ambiente de staging, com anonimização de dados implementada.

Nos primeiros 90 dias:

  • Componentes críticos da plataforma em produção:
  • Ingestão
  • Redação de PII
  • Classificação de segurança
  • Processos de eliminação de dados
  • Primeiros casos de avaliação gerados automaticamente e integrados no processo de validação.

Ao fim de 6 meses:

  • Processo contínuo de descoberta de novos casos de teste para avaliação de modelos.
  • Monitorização de custos e utilização por cliente e funcionalidade.
  • Sistema de alertas de regressão fiável e integrado no ciclo de deployment.
  • Plataforma preparada para suportar novos clientes mantendo elevados padrões de escalabilidade, privacidade e conformidade

Se procuras um desafio onde possas construir infraestruturas críticas para sistemas de IA em produção e contribuir diretamente para a evolução de soluções de próxima geração, gostaríamos de conhecer o teu perfil.

#J-18808-Ljbffr

Posted 1 weeks ago

Related Jobs

Related Searches

Apply Now