这个项目能做什么
Tongyi DeepResearch 是阿里通义实验室发布的开源智能体大语言模型,旨在处理长周期、深度的信息检索任务。旗舰模型 Tongyi-DeepResearch-30B-A3B 总参数为 30.5B,每个 token 激活 3.3B 参数,上下文长度为 128K。该模型可在 HuggingFace 和 ModelScope 上获取,并提供 ModelScope 和 HuggingFace Spaces 在线演示、百炼(Bailian)服务选项,以及 OpenRouter API 端点,无需本地 GPU 即可进行推理。
该仓库提供模型卡片、技术博客和 arXiv 报告,以及实用工具:包含 ReAct 风格智能体脚本和 shell 运行器的 inference 文件夹,以及包含基准测试脚本的 evaluation 目录。安装使用 Python 3.10 在隔离的 conda 或 virtualenv 环境中进行,从 requirements.txt 安装依赖,并通过 .env 文件配置 API 密钥。所引用的外部服务包括用于网络搜索和 Google Scholar 的 Serper、用于页面阅读的 Jina、用于页面摘要的 OpenAI 兼容 API、用于文件解析的 Dashscope,以及用于 Python 解释器沙箱的 SandboxFusion 端点。
评估数据可以以 JSON 或 JSONL 格式提供,每条记录包含一个问题和一个用于自动评判的参考答案。基于文档的问题可以引用放置在 eval_data/file_corpus 目录中的文件。README 中说明了两种推理范式:用于评估核心内在能力的 ReAct,以及应用测试时扩展的基于 IterResearch 的 "Heavy" 模式。所描述的训练细节包括全自动合成数据流水线、大规模智能体数据持续预训练,以及使用定制 Group Relative Policy Optimization 框架的端到端在线策略强化学习、token 级策略梯度、留一优势估计和负样本过滤。
该项目还列出了更广泛的深度研究智能体家族,并附有关于网络遍历、自主信息检索、数据合成、视觉语言研究智能体、上下文摘要和并行思维的相关论文。README 提及了跨数据集(如 Humanity's Last Exam、BrowseComp、BrowseComp-ZH、WebWalkerQA、xbench-DeepSearch、FRAMES 和 SimpleQA)的基准测试结果,但具体分数仅在图片中展示。其中包含常见问题解答、引用信息,以及杭州、北京和上海的研究实习生招聘公告。
评论
0 评分人数达到10人后显示
登录后参与讨论。