Cadmus Soluções em TI
IT Services & IT Consulting
See how your profile stacks up against this role.
We compared the job requirements to your profile to show where you're strong and where you fall short.
O que você vai fazer por aqui:
• Projetar, desenvolver e manter pipelines batch end-to-end (ingestão, transformação, modelagem e disponibilização) processando volumes na casa dos terabytes.
• Construir e otimizar jobs PySpark, com atenção a particionamento, shuffle, skew, uso de memória e custo de execução.
• Desenvolver, manter e evoluir DAGs no Apache Airflow, garantindo idempotência, tratamento de falhas, retries e SLAs adequados.
• Modelar e implementar transformações em dbt, garantindo testes, documentação, lineage e boas práticas de versionamento.
• Evoluir camadas de dados (raw, curated, analytics) seguindo padrões consistentes de qualidade, contratos e SLAs.
• Investigar e resolver incidentes em pipelines de produção, atuando na causa raiz e propondo melhorias estruturais.
• Implementar e manter mecanismos de data quality, observabilidade e monitoramento.
• Colaborar com times de analytics e negócio para entender requisitos, propor modelagens adequadas e garantir confiabilidade dos dados entregues.
• Contribuir com decisões de arquitetura, code reviews e disseminação de boas práticas dentro do time.
O que esperamos de você:
• Residir em São Paulo, capital;
• Formação em ensino superior completo em Tecnologia, exatas ou área correlatas;
• Experiência sólida (5+ anos) em engenharia de dados, com pelo menos parte significativa em ambientes de larga escala.
• Python avançado, com boas práticas de código, testes e modularização.
• Forte experiência com PySpark em produção, incluindo tuning e troubleshooting de jobs em escala.
• SQL avançado, com domínio de window functions, CTEs, otimização de queries e modelagem analítica.
• Experiência prática com dbt em projetos de médio/grande porte (modelos incrementais, testes, macros, exposures).
• Experiência sólida com Apache Airflow em produção, incluindo desenvolvimento de DAGs complexas, uso de operadores customizados, sensors, gerenciamento de dependências e troubleshooting de execuções.
• Vivência consolidada em AWS para dados (S3, Glue, EMR/EMR Serverless, Athena, IAM, Lambda, entre outros).
• Conhecimento de formatos de tabela abertos (Iceberg, Delta ou Hudi) e suas implicações em performance e custo.
• Capacidade de discutir e justificar trade-offs de arquitetura (custo, latência, complexidade, manutenibilidade).
After you apply, unlock the direct contact details of the people who actually make the call. A quick follow-up makes you 5x more likely to land an interview.
Marcus Rivera
Chief Revenue Officer

Sutherland Global Services

Logic20/20, Inc.

Origami Risk

Benchmark Analytics

GuidePoint Security

Cadmus Soluções em TI

Cadmus Soluções em TI

Cadmus Soluções em TI