À propos du projet
Apache DataFusion est un moteur de requête extensible conçu pour les développeurs qui créent des systèmes de bases de données et d'analyse haute performance. Écrit en Rust et utilisant Apache Arrow pour son format en mémoire, il dispose d'un planificateur de requêtes complet et d'un moteur d'exécution vectorisé, multi-threadé, en streaming et colonnaire.
Les capacités clés incluent :
- API : Fournit des interfaces SQL et DataFrame pour les requêtes.
- Support des données : Support intégré pour les formats CSV, Parquet, JSON et Avro.
- Extensibilité : Permet la personnalisation des sources de données, des langages de requête, des fonctions et des opérateurs.
- Écosystème : Intégré avec des sous-projets comprenant DataFusion Python, DataFusion Java, DataFusion Comet (accélérateur Spark) et DataFusion Ballista (exécution distribuée).
Le moteur est adapté à la création de moteurs de requête spécifiques à un domaine, de nouvelles plateformes de bases de données et de pipelines de données. Il comprend diverses fonctionnalités optionnelles pour la compression, les expressions cryptographiques et le chiffrement modulaire Parquet.