闲社服务运行正常AI智能体自动化平台

Qwen-AgentWorld-35B-A3B

Qwen/Qwen-AgentWorld-35B-A3B

发布机构阿里云通义千问(Qwen)已核实

下载访问条件国内镜像可用

Qwen-AgentWorld-35B-A3B Qwen-AgentWorld-35B-A3B是一个原生语言世界模型,专门训练用于智能体环境模拟。该模型通过长链式思维推理来模拟智能体环境,根据智能体的动作和交互历史预测下一环境状态。 首个覆盖七个智能体交互领域的语言世界模型,单一模型涵盖MCP(工具调用)、搜索、终端、SWE(软件工程)、Android、Web和OS领域,涵盖文本和图形用户界面交互环境。

文字对话图文理解推理思考
模型详情

模型介绍

中文整理

Qwen-AgentWorld-35B-A3B

模型用途

Qwen-AgentWorld-35B-A3B是一个原生语言世界模型,专门训练用于智能体环境模拟。该模型通过长链式思维推理来模拟智能体环境,根据智能体的动作和交互历史预测下一环境状态。

主要能力

首个覆盖七个智能体交互领域的语言世界模型,单一模型涵盖MCP(工具调用)、搜索、终端、SWE(软件工程)、Android、Web和OS领域,涵盖文本和图形用户界面交互环境。

采用三阶段训练 pipeline:持续预训练(CPT)注入环境知识,监督微调(SFT)激活下一状态预测推理,强化学习(RL)提升模拟保真度。从CPT阶段开始就将环境建模作为训练目标,而非事后添加。

具备零样本泛化能力,可泛化到分布外环境(如OpenClaw);支持可控扰动和虚构世界构建。在单轮非智能体轨迹上进行LWM RL预热,可迁移到多轮工具调用智能体任务,在7个基准测试上表现良好。

输入输出

输入:智能体的动作和交互历史

输出:预测的下一环境状态/环境观察

模型根据当前环境状态和智能体采取的动作,输出对下一环境状态的预测。

运行要求

默认上下文长度为262,144个tokens。遇到内存溢出错误时可考虑减少上下文窗口,但由于Qwen-AgentWorld利用扩展上下文进行多轮环境模拟,建议保持至少128K tokens的上下文长度。

支持通过SGLang、vLLM等推理框架进行部署。使用vLLM时需要--language-model-only标志,因为模型架构包含视觉组件定义但检查点仅包含语言模型权重。

基本用法

通过OpenAI兼容API提供服务。推荐使用GitHub仓库prompts/目录中的领域特定世界模型系统提示模板,这些模板可作为环境模拟的通用系统提示。每个领域文件夹包含world model system prompt(世界模型系统提示)和judge system prompt(评估提示)。

推理参数建议:temperature=0.6,top_p=0.95,top_k=20。模型默认使用思考模式进行环境状态转换推理。大多数查询建议输出长度为32,768个tokens;对于长轨迹可增加最大输出长度以容纳详细的环境观察。

限制

训练pipeline中不包含外部API服务的输出。

许可证

模型权重和配置文件遵循相应的许可协议。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部