Sobre o projeto

O Apache DataFusion é um mecanismo de consulta extensível projetado para desenvolvedores que constroem sistemas analíticos e de banco de dados de alto desempenho. Escrito em Rust e utilizando o Apache Arrow para seu formato em memória, ele apresenta um planejador de consultas completo e um mecanismo de execução vetorizado, multi-threaded, de streaming e colunar. As principais capacidades incluem: - APIs: Fornece interfaces de SQL e DataFrame para consultas. - Suporte a Dados: Suporte integrado para formatos CSV, Parquet, JSON e Avro. - Extensibilidade: Permite a personalização de fontes de dados, linguagens de consulta, funções e operadores. - Ecossistema: Integrado com subprojetos, incluindo DataFusion Python, DataFusion Java, DataFusion Comet (acelerador Spark) e DataFusion Ballista (execução distribuída). O mecanismo é adequado para a criação de mecanismos de consulta específicos de domínio, novas plataformas de banco de dados e pipelines de dados. Ele inclui vários recursos opcionais para compressão, expressões criptográficas e criptografia modular do Parquet.