About this project

DeepAnalyze 由中国人民大学与清华大学团队开发,定位为面向自主数据科学的智能体大语言模型(agentic LLM)。其目标是在无需人工干预的情况下完成数据科学全流程任务,包括数据准备、分析、建模、可视化以及报告生成,并支持对多种数据源开展开放式深度研究。 主要能力 - 覆盖完整数据科学流程:自动执行数据准备、分析、建模、可视化与报告生成等任务。 - 开放式数据研究:可处理结构化数据(数据库、CSV、Excel)、半结构化数据(JSON、XML、YAML)以及非结构化数据(TXT、Markdown),最终产出分析报告。 - 全栈开源:模型(DeepAnalyze-8B)、代码、训练数据(DataScience-Instruct-500K)与演示均已开源,便于本地部署或二次开发。 使用方式 - 模型可通过 vLLM 部署,提供 OpenAI 风格 API 接口,并附带内存配置建议表,覆盖 16GB 至 80GB 显存场景,支持量化模型与 FP8 KV Cache。 - 提供多种交互界面:WebUI、WebUI v2(支持 HeyWhale API 与基于 Docker 的沙箱代码执行)、JupyterUI 以及命令行界面(支持中英文)。 - 提供 API Key 申请渠道与使用文档,也支持自行搭建 OpenAI 风格服务。 训练与评估 - 支持基于 DeepSeek-R1-0528-Qwen3-8B 或 DeepAnalyze-8B 进行微调,提供单能力微调、多能力智能体冷启动训练与强化学习训练脚本。 - 在 playground 中统一了多数现有数据科学基准的评估流程,便于评估 DeepAnalyze 或自研智能体。 生态与相关项目 - 相关项目包括 SkillAdam(智能体技能自动优化插件)、DeepPrep(数据准备智能体)、CoDA-Bench(面向数据密集型分析任务的代码智能体基准)以及 DA-Studio(WebUI v2 背后的系统)。 - 训练框架基于 ms-swift 与 SkyRL,训练数据来源包括 Reasoning-Table、Spider、BIRD、DABStep 等。 适用场景 适合需要自动化数据分析、批量生成分析报告、或在本地私有化部署数据分析助手的用户与团队。