Sou profissional de dados com experiência em TI e foco em sistemas de dados confiáveis. Escrevo sobre as decisões que ficam entre “o pipeline executou” e “o dado pode ser usado com confiança”: contratos, idempotência, qualidade, observabilidade, transformação e modelagem analítica.

Este site funciona como minha biblioteca técnica. Nos artigos, apresento o problema, as decisões de arquitetura, os exemplos de código, os testes e as limitações da solução. Quando há uma implementação de referência, o conteúdo aponta para a evidência versionada no GitHub.

Minha linha editorial

Concentro meu trabalho em três pilares:

  1. Reliable Data Engineering: qualidade, contratos, idempotência, lineage e observabilidade;
  2. Data Pipelines at Scale: PySpark, SQL, batch, incremental, APIs e CDC;
  3. Analytics Engineering: modelagem dimensional, marts, métricas e camadas de consumo.

Como penso uma solução analítica

  • começo pela pergunta de negócio e pelo contrato da saída;
  • defino a granularidade antes de criar métricas;
  • separo dados brutos, transformações intermediárias e modelos de consumo;
  • documento regras, premissas e limitações;
  • trato testes e observabilidade como parte da entrega.

Tecnologias e competências

  • Python, Pandas e PySpark
  • SQL e modelagem de dados
  • ETL/ELT e integração de fontes heterogêneas
  • Modelagem dimensional e construção de camadas analíticas
  • Qualidade, rastreabilidade e documentação de dados
  • Jupyter Notebook e Power BI
  • Git e GitHub

Desenvolvimento atual

Estou aprofundando transformação modular com dbt, testes automatizados, documentação de modelos e definição de métricas em uma camada semântica. Meu compromisso editorial é separar claramente o que foi implementado, o que é uma proposta de evolução e quais premissas sustentam cada resultado.

Explore a biblioteca técnica ou veja as implementações no GitHub.