模型详情
模型介绍
中文整理模型名称:Tongyi DeepResearch
开发者:通义实验室(Tongyi Lab)
模型用途
Tongyi DeepResearch是一个代理型大语言模型,专门设计用于长周期、深度信息搜索任务。
主要能力
该模型在多个代理搜索基准测试中表现出先进水平,包括Humanity's Last Exam、BrowserComp、BrowserComp-ZH、WebWalkerQA、GAIA、xbench-DeepSearch和FRAMES。
技术特性
模型采用全自动合成数据生成管道,支持代理预训练、监督微调和强化学习。进行大规模代理数据持续预训练以扩展模型能力、保持知识时效性并强化推理性能。采用基于定制化群体相对策略优化的完全on-policy强化学习方法,结合token级策略梯度、留一法优势估计和负样本选择性过滤,以在非平稳环境中稳定训练。推理时支持两种范式:ReAct模式用于严格评估模型核心内在能力,IterResearch"重载"模式使用测试时扩展策略以释放模型最大性能。
参数规模
模型总参数300亿,每个token激活30亿。
输入输出
模型接受文本输入,用于执行深度信息搜索和推理任务。
运行要求
需要使用推理脚本运行模型。
基本用法
用户可下载模型后运行推理脚本进行推理。
许可证相关信息
未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。