闲社服务运行正常AI智能体自动化平台

WebWorld-14B

Qwen/WebWorld-14B

发布机构阿里云通义千问(Qwen)已核实

下载访问条件国内镜像可用

WebWorld是一个大规模开放网络世界模型系列,用于训练和评估网络代理。它基于100万条以上真实网络交互轨迹进行训练,支持长视野模拟和多格式状态表示。 长视野模拟:支持30步以上的交互轨迹 多格式状态表示:支持A11y Tree、HTML、XML、Markdown和自然语言

文字对话
模型详情

模型介绍

中文整理

WebWorld 模型卡片

模型用途

WebWorld是一个大规模开放网络世界模型系列,用于训练和评估网络代理。它基于100万条以上真实网络交互轨迹进行训练,支持长视野模拟和多格式状态表示。

主要能力

长视野模拟:支持30步以上的交互轨迹

多格式状态表示:支持A11y Tree、HTML、XML、Markdown和自然语言

CoT激活推理:用于转换预测

跨域泛化:支持代码、GUI和游戏环境

模型系列

WebWorld-8B:基于Qwen3-8B

WebWorld-14B:基于Qwen3-14B

WebWorld-32B:基于Qwen3-32B

输入输出

输入:当前页面状态(支持A11y、HTML、XML、Markdown或自然语言格式)+ 动作

输出:预测的下一页面状态

支持最多30步以上的多轮轨迹模拟

运行要求

必需:transformers、torch

可选:accelerate、vllm(用于高效推理)

基本用法

单步预测:根据当前状态和动作预测下一状态

多轮模拟:第一轮提供初始状态和第一个动作,后续每轮使用固定延续提示

动作空间

支持统一的动作空间,包括:

元素操作:click、fill、select_option、hover

鼠标操作:mouse_move、mouse_click、mouse_down、mouse_up

键盘操作:keyboard_press、keyboard_type

浏览器操作:scroll、goto、go_back、go_forward、tab_new、tab_close、tab_focus

元操作:send_msg_to_user、noop、infeasible

性能表现

内在评估(WebWorld-Bench):

WebWorld-8B:事实性得分70.1,图灵得分42.2

WebWorld-14B:事实性得分70.7,图灵得分44.7

WebWorld-32B:事实性得分71.0,图灵得分45.6

外在评估(代理训练):

在MiniWob++上,使用WebWorld训练的Qwen3-8B达到59.3%(提升9.9%)

在WebArena上,使用WebWorld训练的Qwen3-8B达到20.7%(提升10.9%)

跨域泛化:

在API服务、代码、游戏、GUI桌面等环境中均有显著提升

限制

谄媚/乐观偏差:模型可能生成对代理意图动作过于有利的结果

内容生成保真度:长篇、高精度内容(如科学论文)不是主要目标

纯文本:WebWorld不模拟视觉/像素级渲染

许可证

基于Apache 2.0许可证开源

相关资源

数据集:HuggingFace和ModelScope上的Qwen/WebWorldData

模型:HuggingFace和ModelScope上的WebWorld-8B、14B、32B

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部