模型介绍
中文整理WebWorld 模型卡片
模型用途
WebWorld是一个大规模开放网络世界模型系列,用于训练和评估网络代理。它基于100万条以上真实网络交互轨迹进行训练,支持长视野模拟和多格式状态表示。
主要能力
长视野模拟:支持30步以上的交互轨迹
多格式状态表示:支持A11y Tree、HTML、XML、Markdown和自然语言
CoT激活推理:用于转换预测
跨域泛化:支持代码、GUI和游戏环境
模型系列
WebWorld-8B:基于Qwen3-8B
WebWorld-14B:基于Qwen3-14B
WebWorld-32B:基于Qwen3-32B
输入输出
输入:当前页面状态(支持A11y、HTML、XML、Markdown或自然语言格式)+ 动作
输出:预测的下一页面状态
支持最多30步以上的多轮轨迹模拟
运行要求
必需:transformers、torch
可选:accelerate、vllm(用于高效推理)
基本用法
单步预测:根据当前状态和动作预测下一状态
多轮模拟:第一轮提供初始状态和第一个动作,后续每轮使用固定延续提示
动作空间
支持统一的动作空间,包括:
元素操作:click、fill、select_option、hover
鼠标操作:mouse_move、mouse_click、mouse_down、mouse_up
键盘操作:keyboard_press、keyboard_type
浏览器操作:scroll、goto、go_back、go_forward、tab_new、tab_close、tab_focus
元操作:send_msg_to_user、noop、infeasible
性能表现
内在评估(WebWorld-Bench):
WebWorld-8B:事实性得分70.1,图灵得分42.2
WebWorld-14B:事实性得分70.7,图灵得分44.7
WebWorld-32B:事实性得分71.0,图灵得分45.6
外在评估(代理训练):
在MiniWob++上,使用WebWorld训练的Qwen3-8B达到59.3%(提升9.9%)
在WebArena上,使用WebWorld训练的Qwen3-8B达到20.7%(提升10.9%)
跨域泛化:
在API服务、代码、游戏、GUI桌面等环境中均有显著提升
限制
谄媚/乐观偏差:模型可能生成对代理意图动作过于有利的结果
内容生成保真度:长篇、高精度内容(如科学论文)不是主要目标
纯文本:WebWorld不模拟视觉/像素级渲染
许可证
基于Apache 2.0许可证开源
相关资源
数据集:HuggingFace和ModelScope上的Qwen/WebWorldData
模型:HuggingFace和ModelScope上的WebWorld-8B、14B、32B
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
