Об этом проекте
Apache DataFusion — это расширяемый движок запросов, разработанный для разработчиков высокопроизводительных баз данных и аналитических систем. Написанный на Rust и использующий Apache Arrow для формата данных в памяти, он обладает полноценным планировщиком запросов, а также колоночным, потоковым, многопоточным и векторизованным движком исполнения.
Ключевые возможности включают:
- API: предоставляет интерфейсы SQL и DataFrame для выполнения запросов.
- Поддержка данных: встроенная поддержка форматов CSV, Parquet, JSON и Avro.
- Расширяемость: позволяет настраивать источники данных, языки запросов, функции и операторы.
- Экосистема: интеграция с такими подпроектами, как DataFusion Python, DataFusion Java, DataFusion Comet (акселератор Spark) и DataFusion Ballista (распределенное исполнение).
Движок подходит для создания специализированных движков запросов, новых платформ баз данных и конвейеров данных. Он включает различные дополнительные функции для сжатия, криптографических выражений и модульного шифрования Parquet.