Sobre o projeto
O Apache DataFusion é um mecanismo de consulta extensível projetado para desenvolvedores que constroem sistemas analíticos e de banco de dados de alto desempenho. Escrito em Rust e utilizando o Apache Arrow para seu formato em memória, ele apresenta um planejador de consultas completo e um mecanismo de execução vetorizado, multi-threaded, de streaming e colunar.
As principais capacidades incluem:
- APIs: Fornece interfaces de SQL e DataFrame para consultas.
- Suporte a Dados: Suporte integrado para formatos CSV, Parquet, JSON e Avro.
- Extensibilidade: Permite a personalização de fontes de dados, linguagens de consulta, funções e operadores.
- Ecossistema: Integrado com subprojetos, incluindo DataFusion Python, DataFusion Java, DataFusion Comet (acelerador Spark) e DataFusion Ballista (execução distribuída).
O mecanismo é adequado para a criação de mecanismos de consulta específicos de domínio, novas plataformas de banco de dados e pipelines de dados. Ele inclui vários recursos opcionais para compressão, expressões criptográficas e criptografia modular do Parquet.