Sobre a oportunidade
Buscamos um(a) Engenheiro(a) de Dados Sênior para atuar em nosso ecossistema de dados na GCP, participando ativamente do processo de migração da nossa arquitetura de lakehouse para um modelo baseado em dbt e BigQuery. Você trabalhará na evolução de pipelines, na modernização de práticas de engenharia analítica e na garantia de qualidade, governança e performance dos dados.
Responsabilidades
Desenvolver, otimizar e manter pipelines de dados em ambiente de lakehouse na GCP Atuar na migração de workloads existentes para dbt + BigQuery, incluindo modelagem, testes e documentação Construir e manter jobs de processamento distribuído com Spark Trabalhar com tabelas Iceberg, garantindo versionamento, evolução de schema e performance de leitura/escrita Escrever código Python de qualidade para orquestração, transformação e automação de dados Orquestrar pipelines utilizando Cloud Composer (Airflow) Colaborar com times de dados, produto e engenharia para garantir a confiabilidade e escalabilidade da plataforma Apoiar decisões técnicas relacionadas à arquitetura de dados, incluindo contêinerização de workloads (Kubernetes) Definir e aplicar boas práticas de engenharia de dados (CI/CD, testes automatizados, versionamento, observabilidade)
Requisitos
Experiência sólida como Engenheiro(a) de Dados, atuando em ambientes de grande volume de dados Vivência prática com GCP (BigQuery, Cloud Storage, Dataproc ou similares) Experiência com dbt para modelagem e transformação de dados Conhecimento avançado em Python para desenvolvimento de pipelines e automações Experiência com Apache Spark (PySpark ou Scala) Experiência com Apache Iceberg (ou outros formatos de tabela como Delta Lake/Hudi, com disposição para migrar para Iceberg) Experiência com Cloud Composer (Airflow) para orquestração de pipelines Conhecimento básico de Kubernetes (conceitos, deploys simples, troubleshooting) Experiência com versionamento (Git) e práticas de CI/CD Boa comunicação e capacidade de trabalhar em ambientes de transição arquitetural