このプロジェクトについて
Apache DataFusionは、高性能なデータベースや分析システムを構築する開発者向けに設計された拡張可能なクエリエンジンです。Rustで記述され、メモリ形式にApache Arrowを利用しており、完全なクエリプランナーと、カラムナ(列指向)、ストリーミング、マルチスレッド、ベクトル化された実行エンジンを備えています。
主な機能は以下の通りです:
- API:クエリ実行のためのSQLおよびDataFrameインターフェースの両方を提供します。
- データサポート:CSV、Parquet、JSON、Avro形式を標準でサポートしています。
- 拡張性:データソース、クエリ言語、関数、およびオペレータのカスタマイズが可能です。
- エコシステム:DataFusion Python、DataFusion Java、DataFusion Comet(Sparkアクセラレータ)、DataFusion Ballista(分散実行)などのサブプロジェクトと統合されています。
このエンジンは、ドメイン固有のクエリエンジン、新しいデータベースプラットフォーム、およびデータパイプラインの作成に適しています。また、圧縮、暗号化式、およびParquetモジュール暗号化のための様々なオプション機能が含まれています。