このプロジェクトについて
DeepAnalyzeは中国人民大学と清華大学のチームによって開発された、自律データサイエンス向けのエージェント型大規模言語モデル(agentic LLM)です。その目標は、人間の介入なしにデータ準備、分析、モデリング、可視化、レポート生成といったデータサイエンスの全プロセスを完了し、複数のデータソースに対してオープンな深層研究を実施することです。
主な機能
- 完全なデータサイエンスプロセスをカバー:データ準備、分析、モデリング、可視化、レポート生成などのタスクを自動実行。
- オープンなデータ研究:構造化データ(データベース、CSV、Excel)、半構造化データ(JSON、XML、YAML)、非構造化データ(TXT、Markdown)を処理し、分析レポートを生成。
- 全スタックのオープンソース:モデル(DeepAnalyze-8B)、コード、トレーニングデータ(DataScience-Instruct-500K)、デモがすべて公開されており、ローカルデプロイや二次開発が容易。
使用方法
- モデルはvLLMを介してデプロイでき、OpenAI互換のAPIインターフェースを提供。16GBから80GBのGPUメモリシナリオをカバーするメモリ構成推奨表が付属し、量子化モデルとFP8 KVキャッシュをサポート。
- 複数のインターフェースを提供:WebUI、WebUI v2(HeyWhale APIとDockerベースのサンドボックスコード実行をサポート)、JupyterUI、コマンドラインインターフェース(中英対応)。
- APIキー申請チャネルと使用ドキュメントを提供し、独自のOpenAI互換サービスを構築することも可能。
トレーニングと評価
- DeepSeek-R1-0528-Qwen3-8BまたはDeepAnalyze-8Bをベースにしたファインチューニングをサポートし、単一能力のファインチューニング、多能力エージェントのコールドスタートトレーニング、強化学習トレーニングスクリプトを提供。
- playgroundで既存のデータサイエンスベンチマークの評価プロセスを統一し、DeepAnalyzeや自作エージェントの評価を容易に実施可能。
エコシステムと関連プロジェクト
- 関連プロジェクトには、SkillAdam(エージェントスキル自動最適化プラグイン)、DeepPrep(データ準備エージェント)、CoDA-Bench(データ集約型分析タスク向けコードエージェントベンチマーク)、DA-Studio(WebUI v2の背後にあるシステム)が含まれます。
- トレーニングフレームワークはms-swiftとSkyRLに基づき、トレーニングデータソースにはReasoning-Table、Spider、BIRD、DABStepなどが含まれます。
適用シナリオ
自動化されたデータ分析、バッチ分析レポート生成、またはローカルでのプライベートデプロイ型データ分析アシスタントを必要とするユーザーやチームに適しています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.