Об этом проекте

Apache DataFusion — это расширяемый движок запросов, разработанный для разработчиков высокопроизводительных баз данных и аналитических систем. Написанный на Rust и использующий Apache Arrow для формата данных в памяти, он обладает полноценным планировщиком запросов, а также колоночным, потоковым, многопоточным и векторизованным движком исполнения. Ключевые возможности включают: - API: предоставляет интерфейсы SQL и DataFrame для выполнения запросов. - Поддержка данных: встроенная поддержка форматов CSV, Parquet, JSON и Avro. - Расширяемость: позволяет настраивать источники данных, языки запросов, функции и операторы. - Экосистема: интеграция с такими подпроектами, как DataFusion Python, DataFusion Java, DataFusion Comet (акселератор Spark) и DataFusion Ballista (распределенное исполнение). Движок подходит для создания специализированных движков запросов, новых платформ баз данных и конвейеров данных. Он включает различные дополнительные функции для сжатия, криптографических выражений и модульного шифрования Parquet.