このプロジェクトについて

GraphRAGは、大規模言語モデルを用いて非構造化テキストから意味のある構造化データを抽出するために設計されたデータパイプラインおよび変換スイートです。その中核となる考え方は、質問応答のための的を絞ったコンテキストを形成するために使用できるナレッジグラフ記憶構造を構築し、LLMが非公開データや物語データについて推論する能力を高めることです。 このリポジトリはMicrosoft Researchによるもので、公式にサポートされたMicrosoft製品ではなく、研究プロジェクトであると明記されています。2024年7月の初回リリース以降、このプロジェクトは大部分がメンテナンスモードに入っています。新しいプルリクエストは受け付けておらず、新機能も実装していませんが、メンテナーは必要に応じて、特にCVEに対処するために、バグ修正と依存関係の更新を行います。 始めるには、公式ドキュメントのコマンドラインクイックスタートが推奨されています。READMEでは、GraphRAGのインデックス作成は高コストな操作になり得ると強く警告しており、すべてのドキュメントを読み、関与するプロセスとコストを理解し、小さく始めるよう促しています。また、GraphRAGを自分のデータで使用する際に最良の結果を得るにはプロンプトチューニングを推奨しています。すぐに使える設定では最適な結果が得られない可能性があるためです。 バージョン管理のガイダンスは破的変更の文書で提供されています。ユーザーは、最新の設定形式を確保するためにマイナーバージョンアップの間に graphrag init --root [path] --force を実行し、以前のデータセットの再インックス作成を避けるためにメジャーバージョンアップの間に提供された移行用ノートブックを実行するよう勧められています。これは設定とプロンプトを上書きする可能性があるため、バックアップが推されます。 このプロジェクトには、GraphRAGとは何か、何ができるか、想定される用途、評価指標、制限事項、責任ある使用のための運用設定を扱うResponsible AI FAQが含まれています。また、Microsoftの商標およびプライバシーポリシーに従っています。 全体として、GraphRAGはナレッジグラフと検索拡張生成を組み合わせるモジュール式アプローチを提供しますが、採用を検討するユーザーは、その研究プロジェクトとしての位置づけ、メンテナンスモードの制約、およびインデックス作成にかかる可能性のある大きなコストを認識しておく必要があります。