Sobre o projeto
Este repositório é uma lista curada abrangente de ferramentas e recursos de engenharia de dados, organizada em seções claras. Abrange uma ampla variedade de tópicos, incluindo bancos de dados relacionais, chave-valor, colunares, de documentos, de grafos, distribuídos e de séries temporais; ferramentas de comparação de dados; frameworks de ingestão de dados como Kafka, Airbyte, Meltano e dlt; sistemas de arquivos incluindo HDFS, S3, Alluxio e JuiceFS; formatos de serialização como Avro, Parquet, ORC e Protobuf; ferramentas de processamento de stream e em lote; gráficos e dashboards; orquestração de fluxos de trabalho; gerenciamento de data lake; a stack ELK; Docker; conjuntos de dados; monitoramento com Prometheus; profiling de dados; gerenciamento de esquema; testes; e recursos da comunidade, incluindo fóruns, conferências, podcasts e livros. Cada entrada inclui uma breve descrição e um link para o projeto, tornando-o uma referência prática para desenvolvedores que constroem pipelines de dados e gerenciam infraestrutura de dados.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.