このプロジェクトについて

DeepAnalyzeは中国人民大学と清華大学のチームによって開発された、自律データサイエンス向けのエージェント型大規模言語モデル(agentic LLM)です。その目標は、人間の介入なしにデータ準備、分析、モデリング、可視化、レポート生成といったデータサイエンスの全プロセスを完了し、複数のデータソースに対してオープンな深層研究を実施することです。 主な機能 - 完全なデータサイエンスプロセスをカバー:データ準備、分析、モデリング、可視化、レポート生成などのタスクを自動実行。 - オープンなデータ研究:構造化データ(データベース、CSV、Excel)、半構造化データ(JSON、XML、YAML)、非構造化データ(TXT、Markdown)を処理し、分析レポートを生成。 - 全スタックのオープンソース:モデル(DeepAnalyze-8B)、コード、トレーニングデータ(DataScience-Instruct-500K)、デモがすべて公開されており、ローカルデプロイや二次開発が容易。 使用方法 - モデルはvLLMを介してデプロイでき、OpenAI互換のAPIインターフェースを提供。16GBから80GBのGPUメモリシナリオをカバーするメモリ構成推奨表が付属し、量子化モデルとFP8 KVキャッシュをサポート。 - 複数のインターフェースを提供:WebUI、WebUI v2(HeyWhale APIとDockerベースのサンドボックスコード実行をサポート)、JupyterUI、コマンドラインインターフェース(中英対応)。 - APIキー申請チャネルと使用ドキュメントを提供し、独自のOpenAI互換サービスを構築することも可能。 トレーニングと評価 - DeepSeek-R1-0528-Qwen3-8BまたはDeepAnalyze-8Bをベースにしたファインチューニングをサポートし、単一能力のファインチューニング、多能力エージェントのコールドスタートトレーニング、強化学習トレーニングスクリプトを提供。 - playgroundで既存のデータサイエンスベンチマークの評価プロセスを統一し、DeepAnalyzeや自作エージェントの評価を容易に実施可能。 エコシステムと関連プロジェクト - 関連プロジェクトには、SkillAdam(エージェントスキル自動最適化プラグイン)、DeepPrep(データ準備エージェント)、CoDA-Bench(データ集約型分析タスク向けコードエージェントベンチマーク)、DA-Studio(WebUI v2の背後にあるシステム)が含まれます。 - トレーニングフレームワークはms-swiftとSkyRLに基づき、トレーニングデータソースにはReasoning-Table、Spider、BIRD、DABStepなどが含まれます。 適用シナリオ 自動化されたデータ分析、バッチ分析レポート生成、またはローカルでのプライベートデプロイ型データ分析アシスタントを必要とするユーザーやチームに適しています。