Engenheiro de Dados Sr

Cadmus
Onsite

About The Position

Projetar, desenvolver e manter pipelines batch end-to-end (ingestão, transformação, modelagem e disponibilização) processando volumes na casa dos terabytes. Construir e otimizar jobs PySpark, com atenção a particionamento, shuffle, skew, uso de memória e custo de execução. Desenvolver, manter e evoluir DAGs no Apache Airflow, garantindo idempotência, tratamento de falhas, retries e SLAs adequados. Modelar e implementar transformações em dbt, garantindo testes, documentação, lineage e boas práticas de versionamento. Evoluir camadas de dados (raw, curated, analytics) seguindo padrões consistentes de qualidade, contratos e SLAs. Investigar e resolver incidentes em pipelines de produção, atuando na causa raiz e propondo melhorias estruturais. Implementar e manter mecanismos de data quality, observabilidade e monitoramento. Colaborar com times de analytics e negócio para entender requisitos, propor modelagens adequadas e garantir confiabilidade dos dados entregues. Contribuir com decisões de arquitetura, code reviews e disseminação de boas práticas dentro do time.

Requirements

  • Residir em São Paulo, capital;
  • Formação em ensino superior completo em Tecnologia, exatas ou área correlatas;
  • Experiência sólida (5+ anos) em engenharia de dados, com pelo menos parte significativa em ambientes de larga escala.
  • Python avançado, com boas práticas de código, testes e modularização.
  • Forte experiência com PySpark em produção, incluindo tuning e troubleshooting de jobs em escala.
  • SQL avançado, com domínio de window functions, CTEs, otimização de queries e modelagem analítica.
  • Experiência prática com dbt em projetos de médio/grande porte (modelos incrementais, testes, macros, exposures).
  • Experiência sólida com Apache Airflow em produção, incluindo desenvolvimento de DAGs complexas, uso de operadores customizados, sensors, gerenciamento de dependências e troubleshooting de execuções.
  • Vivência consolidada em AWS para dados (S3, Glue, EMR/EMR Serverless, Athena, IAM, Lambda, entre outros).
  • Conhecimento de formatos de tabela abertos (Iceberg, Delta ou Hudi) e suas implicações em performance e custo.
  • Capacidade de discutir e justificar trade-offs de arquitetura (custo, latência, complexidade, manutenibilidade).

Nice To Haves

  • Experiência prática na aplicação de políticas de Segurança e Conformidade de Dados (LGPD/GDPR);
  • Experiência com Apache Iceberg em produção.
  • Vivência com Infrastructure as Code (Terraform, CDK).
  • CI/CD aplicado a projetos de dados (testes automatizados, deploy de DAGs, dbt em pipeline).
  • Conhecimento de data contracts, catálogo de dados e governança.
  • Experiência prévia em ambientes de streaming (Kinesis, Kafka, Flink) — mesmo que a vaga seja focada em batch.
  • Experiência com DuckDB ou ferramentas equivalentes para processamento analítico eficiente.
  • Contribuições para projetos open source ou conteúdo técnico publicado

Responsibilities

  • Projetar, desenvolver e manter pipelines batch end-to-end (ingestão, transformação, modelagem e disponibilização) processando volumes na casa dos terabytes.
  • Construir e otimizar jobs PySpark, com atenção a particionamento, shuffle, skew, uso de memória e custo de execução.
  • Desenvolver, manter e evoluir DAGs no Apache Airflow, garantindo idempotência, tratamento de falhas, retries e SLAs adequados.
  • Modelar e implementar transformações em dbt, garantindo testes, documentação, lineage e boas práticas de versionamento.
  • Evoluir camadas de dados (raw, curated, analytics) seguindo padrões consistentes de qualidade, contratos e SLAs.
  • Investigar e resolver incidentes em pipelines de produção, atuando na causa raiz e propondo melhorias estruturais.
  • Implementar e manter mecanismos de data quality, observabilidade e monitoramento.
  • Colaborar com times de analytics e negócio para entender requisitos, propor modelagens adequadas e garantir confiabilidade dos dados entregues.
  • Contribuir com decisões de arquitetura, code reviews e disseminação de boas práticas dentro do time.
© 2026 Teal Labs, Inc
Privacy PolicyTerms of Service