Sobre a oportunidade
Somos aliados do médico durante toda a sua jornada e buscamos por pessoas que se identifiquem com nosso propósito, valores e cultura para se juntarem ao nosso time. Vamos juntos transformar a saúde com quem tem a medicina como vocação! Esta é uma vaga aberta na frente de Dados para trabalhar de forma remota. Ao assumir o cargo de Engenheiro (a) de Marchine Learning Sr na Afya, seu objetivo principal será sustentar o ciclo de vida de ML clássico, dar suporte de plataforma à Ciência de Dados em GenAI, e garantir que tudo isso rode com governança e escalabilidade. Você atuará na área de Dados dentro da diretoria de Tecnologia e fará parte de uma equipe multidisciplinar, relacionando-se no dia a dia com pessoas de times como Cientista de Dados, Engenharia de dados e SRE. Todas as nossas oportunidades são abertas a pessoas com deficiência (PcD) e reabilitadas do INSS.
Responsabilidades
COMO VOCÊ VAI TRANSFORMAR A SAÚDE NO DIA A DIA: Sustentar o ciclo de vida completo dos modelos — feature engineering, treino, validação, registro e deploy. Monitorar modelos em produção e conduzir retreinamento quando houver degradação de performance ou drift. Manter e evoluir as esteiras de CI/CD que promovem modelos e pipelines entre ambientes (dev, hml, prod). Automatizar e produtizar pipelines de avaliação (evals) de modelos e agentes, em apoio direto à Ciência de Dados. Construir e manter pacotes internos de métricas reutilizáveis, para experimentos avaliados de forma padronizada. Operar a infraestrutura de fine-tuning de modelos de linguagem. Administrar o AI Gateway — roteamento de modelos, rate limits, controle e atribuição de custo. Garantir a governança de features, experimentos e modelos, sempre alinhada às políticas da Afya. Atuar como ponte técnica entre Ciência de Dados, Engenharia de IA, Engenharia de Dados e SRE. Aplicar práticas de escalabilidade, segurança e custo na infraestrutura de ML/IA sob sua responsabilidade.
Requisitos
O QUE BUSCAMOS (mas não esperamos que uma única pessoa atenda a todos os requisitos): Databricks como plataforma principal, em nível de referência técnica: Model Serving, Unity Catalog e Asset Bundles, com MLflow para registro, versionamento e avaliação de modelos. Experiência equivalente em SageMaker, Vertex AI ou Azure ML conta, com disposição para se aprofundar em Databricks. Python, SQL e Apache Spark / PySpark em nível avançado, aplicados a pipelines de Machine Learning em produção (scikit-learn, XGBoost). CI/CD e infraestrutura como código para promover modelos e pipelines entre desenvolvimento, homologação e produção: GitHub Actions, Terraform (ou IaC equivalente), cloud (Azure, AWS ou GCP) e gestão de segredos. Operação de modelo em produção: promoção e rollback de versão (troca de alias e verificação pós-deploy), monitoramento de performance, custo e drift, e resposta a incidentes de endpoint — indisponibilidade, latência e queda de qualidade. Leitura estatística de resultados de avaliação para decidir promoção ou reversão de versão, com governança dos experimentos, das versões de modelo e dos dados de inferência. Aqui essa decisão afeta produtos usados por milhares de médicos todo dia. LLMOps na perspectiva de plataforma: exposição a pelo menos uma destas frentes — AI Gateway (roteamento multi-provedor e atribuição de custo), automação de pipelines de avaliação (evals) e pacotes internos de métricas reutilizáveis, ou infraestrutura de fine-tuning de LLMs. Liderança técnica sênior, sem gestão de pessoas: definir a arquitetura da plataforma de ML, negociar contratos técnicos com Ciência de Dados, Engenharia de IA, Engenharia de Dados e SRE, e mentorar engenheiros plenos. Ensino superior ou graduação tecnológica completa em Ciência da Computação, Análise e Desenvolvimento de Sistemas, Engenharia (Computação, Software ou Elétrica), Sistemas de Informação, Estatística, Matemática ou áreas correlatas. Inglês técnico avançado para leitura de documentação, release notes e papers. Experiência consolidade em Engenharia de Machine Learning / MLOps, com experiência comprovada sustentando modelos em produção: treino automatizado, validação, promoção, deploy, monitoramento e retreino.