Esta biblioteca organiza os conteúdos por problema técnico, não apenas por data de publicação. Se você está chegando agora, comece pela série Reliable Data Pipelines.

Reliable Data Pipelines

Arquitetura e decisões para pipelines que podem falhar, ser reprocessados e ainda assim entregar dados corretos.

PySpark & SQL

Processamento distribuído, transformação e estratégias para trabalhar com volume e fontes diversas.

Data Quality

Contratos, validações, reconciliação, quarentena e critérios para decidir quando um pipeline deve bloquear a publicação.

Analytics Engineering

Granularidade, fatos, dimensões, marts e métricas preparadas para análises e dashboards.

Próximos temas da série

  • Watermarks em pipelines incrementais;
  • Data Contracts e evolução de schema;
  • deduplicação com PySpark;
  • tabelas de quarentena;
  • testes que devem bloquear uma publicação;
  • batch, CDC ou streaming;
  • observabilidade e reconciliação;
  • reprocessamento seguro.