Projetar, desenvolver e manter pipelines batch end-to-end (ingestão, transformação, modelagem e disponibilização) processando volumes na casa dos terabytes. Construir e otimizar jobs PySpark, com atenção a particionamento, shuffle, skew, uso de memória e custo de execução. Desenvolver, manter e evoluir DAGs no Apache Airflow, garantindo idempotência, tratamento de falhas, retries e SLAs adequados. Modelar e implementar transformações em dbt, garantindo testes, documentação, lineage e boas práticas de versionamento. Evoluir camadas de dados (raw, curated, analytics) seguindo padrões consistentes de qualidade, contratos e SLAs. Investigar e resolver incidentes em pipelines de produção, atuando na causa raiz e propondo melhorias estruturais. Implementar e manter mecanismos de data quality, observabilidade e monitoramento. Colaborar com times de analytics e negócio para entender requisitos, propor modelagens adequadas e garantir confiabilidade dos dados entregues. Contribuir com decisões de arquitetura, code reviews e disseminação de boas práticas dentro do time.
Stand Out From the Crowd
Upload your resume and get instant feedback on how well it matches this job.
Job Type
Full-time
Career Level
Senior
Education Level
Associate degree