Esta biblioteca organiza os conteúdos por problema técnico, não apenas por data de publicação. Se você está chegando agora, comece pela série Reliable Data Pipelines.
Reliable Data Pipelines
Arquitetura e decisões para pipelines que podem falhar, ser reprocessados e ainda assim entregar dados corretos.
- Idempotência em pipelines: como reprocessar sem duplicar dados — Estratégias práticas para repetir uma carga após falhas sem perder registros, duplicar fatos ou avançar o watermark cedo demais.
- Fontes heterogêneas: projetando um pipeline de dados confiável — Integração de CSV, API e PostgreSQL até um mart de vendas com métricas documentadas e testáveis.
PySpark & SQL
Processamento distribuído, transformação e estratégias para trabalhar com volume e fontes diversas.
- Idempotência em pipelines: como reprocessar sem duplicar dados — Estratégias práticas para repetir uma carga após falhas sem perder registros, duplicar fatos ou avançar o watermark cedo demais.
- Fontes heterogêneas: projetando um pipeline de dados confiável — Integração de CSV, API e PostgreSQL até um mart de vendas com métricas documentadas e testáveis.
- Pipeline distribuído para minerar padrões de crimes na Inglaterra — Transformação de 124 mil ocorrências em modelos analíticos e padrões frequentes com SparkR e FP-Growth.
Data Quality
Contratos, validações, reconciliação, quarentena e critérios para decidir quando um pipeline deve bloquear a publicação.
- Idempotência em pipelines: como reprocessar sem duplicar dados — Estratégias práticas para repetir uma carga após falhas sem perder registros, duplicar fatos ou avançar o watermark cedo demais.
- Fontes heterogêneas: projetando um pipeline de dados confiável — Integração de CSV, API e PostgreSQL até um mart de vendas com métricas documentadas e testáveis.
- Pipeline de dados para previsão de preços de carros usados — Modelagem de anúncios, regras de qualidade e métricas de mercado antes da camada de Machine Learning.
- Da ocorrência ao indicador: dados de crimes de São Francisco — Modelagem de 150 mil ocorrências em fatos, dimensões e indicadores temporais e geográficos.
- Pipeline distribuído para minerar padrões de crimes na Inglaterra — Transformação de 124 mil ocorrências em modelos analíticos e padrões frequentes com SparkR e FP-Growth.
- Do CSV ao modelo: preparando dados do ENEM 2016 — Da ingestão à camada analítica: qualidade, modelagem e métricas educacionais prontas para consumo.
Analytics Engineering
Granularidade, fatos, dimensões, marts e métricas preparadas para análises e dashboards.
- Pipeline de dados para previsão de preços de carros usados — Modelagem de anúncios, regras de qualidade e métricas de mercado antes da camada de Machine Learning.
- Da ocorrência ao indicador: dados de crimes de São Francisco — Modelagem de 150 mil ocorrências em fatos, dimensões e indicadores temporais e geográficos.
- Do CSV ao modelo: preparando dados do ENEM 2016 — Da ingestão à camada analítica: qualidade, modelagem e métricas educacionais prontas para consumo.
Próximos temas da série
- Watermarks em pipelines incrementais;
- Data Contracts e evolução de schema;
- deduplicação com PySpark;
- tabelas de quarentena;
- testes que devem bloquear uma publicação;
- batch, CDC ou streaming;
- observabilidade e reconciliação;
- reprocessamento seguro.