About this project
DeepAnalyze 由中国人民大学与清华大学团队开发,定位为面向自主数据科学的智能体大语言模型(agentic LLM)。其目标是在无需人工干预的情况下完成数据科学全流程任务,包括数据准备、分析、建模、可视化以及报告生成,并支持对多种数据源开展开放式深度研究。
主要能力
- 覆盖完整数据科学流程:自动执行数据准备、分析、建模、可视化与报告生成等任务。
- 开放式数据研究:可处理结构化数据(数据库、CSV、Excel)、半结构化数据(JSON、XML、YAML)以及非结构化数据(TXT、Markdown),最终产出分析报告。
- 全栈开源:模型(DeepAnalyze-8B)、代码、训练数据(DataScience-Instruct-500K)与演示均已开源,便于本地部署或二次开发。
使用方式
- 模型可通过 vLLM 部署,提供 OpenAI 风格 API 接口,并附带内存配置建议表,覆盖 16GB 至 80GB 显存场景,支持量化模型与 FP8 KV Cache。
- 提供多种交互界面:WebUI、WebUI v2(支持 HeyWhale API 与基于 Docker 的沙箱代码执行)、JupyterUI 以及命令行界面(支持中英文)。
- 提供 API Key 申请渠道与使用文档,也支持自行搭建 OpenAI 风格服务。
训练与评估
- 支持基于 DeepSeek-R1-0528-Qwen3-8B 或 DeepAnalyze-8B 进行微调,提供单能力微调、多能力智能体冷启动训练与强化学习训练脚本。
- 在 playground 中统一了多数现有数据科学基准的评估流程,便于评估 DeepAnalyze 或自研智能体。
生态与相关项目
- 相关项目包括 SkillAdam(智能体技能自动优化插件)、DeepPrep(数据准备智能体)、CoDA-Bench(面向数据密集型分析任务的代码智能体基准)以及 DA-Studio(WebUI v2 背后的系统)。
- 训练框架基于 ms-swift 与 SkyRL,训练数据来源包括 Reasoning-Table、Spider、BIRD、DABStep 等。
适用场景
适合需要自动化数据分析、批量生成分析报告、或在本地私有化部署数据分析助手的用户与团队。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.