このプロジェクトについて

Daftは、AIおよびマルチモーダルワークロード向けに設計された高性能データエンジンです。ユーザーは画像、音声、動画、埋め込み、構造化データを単一のフレームワーク内で処理でき、PythonネイティブでRustを動力とするコアを持つと説明されています。 READMEで強調されている主な機能: - ネイティブなマルチモーダル処理: 画像、音声、動画、埋め込みを構造化データとともに1つのフレームワークで扱えます。 - 組み込みAI操作: OpenAI、Transformers、またはカスタムモデルを使用して、LLMプロンプトの実行、埋め込みの生成、データの分類を大規模に行えます。 - Pythonネイティブ、Rust駆動: 中心はPythonで、内部はRust。JVMの複雑さを回避します。 - シームレスなスケーリング: ローカルで開始し、RayまたはKubernetes上の分散クラスタへスケールできます。 - ユニバーサルな接続性: S3、GCS、Iceberg、Delta Lake、Hugging Face、Unity Catalogからデータにアクセスできます。 - すぐに使える信頼性: インテリジェントなメモリ管理と適切なデフォルト設定。 インストールは`pip install daft`で行い、Python 3.10以上が必要です。READMEでは、実世界のEコマースデータセットを読み込み、商品画像を処理し、AI推論を大規模に実行するクイックスタートに加え、サンプル、ユーザーガイド、APIリファレンスを案内しています。ベンチマークページも参照されています。 このプロジェクトはコントリビューションを歓迎し、good first issuesを掲載しています。Scarfを通じて非識別可能なテレメトリを収集しており、`DO_NOT_TRACK=true`を設定することで無効にできます。READMEでは、セッションIDやユーザー識別子は収集せず、独自のコードやデータも収集しないと述べています。 READMEの比較表では、DaftをPandas、Polars、Modin、Ray Data、PySpark、Dask DFと並べ、クエリオプティマイザ、マルチモーダル対応、分散実行、Arrowベース、ベクトル化実行、アウトオブコア処理などの属性で位置づけています。DaftはApache 2.0の下でライセンスされています。