Sou profissional de dados com experiência em TI e foco em sistemas de dados confiáveis. Escrevo sobre as decisões que ficam entre “o pipeline executou” e “o dado pode ser usado com confiança”: contratos, idempotência, qualidade, observabilidade, transformação e modelagem analítica.
Este site funciona como minha biblioteca técnica. Nos artigos, apresento o problema, as decisões de arquitetura, os exemplos de código, os testes e as limitações da solução. Quando há uma implementação de referência, o conteúdo aponta para a evidência versionada no GitHub.
Minha linha editorial
Concentro meu trabalho em três pilares:
- Reliable Data Engineering: qualidade, contratos, idempotência, lineage e observabilidade;
- Data Pipelines at Scale: PySpark, SQL, batch, incremental, APIs e CDC;
- Analytics Engineering: modelagem dimensional, marts, métricas e camadas de consumo.
Como penso uma solução analítica
- começo pela pergunta de negócio e pelo contrato da saída;
- defino a granularidade antes de criar métricas;
- separo dados brutos, transformações intermediárias e modelos de consumo;
- documento regras, premissas e limitações;
- trato testes e observabilidade como parte da entrega.
Tecnologias e competências
- Python, Pandas e PySpark
- SQL e modelagem de dados
- ETL/ELT e integração de fontes heterogêneas
- Modelagem dimensional e construção de camadas analíticas
- Qualidade, rastreabilidade e documentação de dados
- Jupyter Notebook e Power BI
- Git e GitHub
Desenvolvimento atual
Estou aprofundando transformação modular com dbt, testes automatizados, documentação de modelos e definição de métricas em uma camada semântica. Meu compromisso editorial é separar claramente o que foi implementado, o que é uma proposta de evolução e quais premissas sustentam cada resultado.
Explore a biblioteca técnica ou veja as implementações no GitHub.