闲社服务运行正常AI智能体自动化平台

OmniParser-v2.0

microsoft/OmniParser-v2.0

发布机构微软(Microsoft)已核实

下载访问条件国内镜像可用

OmniParser是一个通用的屏幕解析工具,用于将UI截图转换为结构化格式,旨在改进基于大语言模型的UI代理。 将 unstructured 的截图解析为结构化元素列表,包括可交互区域的位置和图标功能描述。V2版本在ScreenSpot Pro基准测试中达到39.6平均准确率。可与OpenAI、DeepSeek、Qwen或Anthropic等多种大语言模型配合构建GUI代理。 输入:UI截图(支持PC和手机截图,以及各类应用程序界面)。输出:结构化元素列表,包含可交互区域的

其他模型
模型详情

模型介绍

中文整理

模型用途

OmniParser是一个通用的屏幕解析工具,用于将UI截图转换为结构化格式,旨在改进基于大语言模型的UI代理。

主要能力

将 unstructured 的截图解析为结构化元素列表,包括可交互区域的位置和图标功能描述。V2版本在ScreenSpot Pro基准测试中达到39.6平均准确率。可与OpenAI、DeepSeek、Qwen或Anthropic等多种大语言模型配合构建GUI代理。

输入输出

输入:UI截图(支持PC和手机截图,以及各类应用程序界面)。输出:结构化元素列表,包含可交互区域的位置坐标和图标功能描述文本。

运行要求

A100 GPU上平均推理延迟约0.6秒/帧,单卡4090上约0.8秒/帧。icon detect v3模型以TorchScript模块形式提供,推理仅需PyTorch,无需ultralytics库。

基本用法

通过OmniTool工具调用OmniParser,配合视觉模型使用。CONF THRESHOLD默认值为0.05,该检测器对小型UI元素有意保持较低置信度,将此值提至0.1以上可能开始遗漏真实元素。

限制

OmniParser仅将截图转换为结构化文本和可交互区域,不检测输入中的有害内容。用户需自行确保输入内容无害。模型输出需要人工判断,开发者需遵循安全标准。

许可证

不同模型采用不同许可证:icon detect基于YOLOv8,采用AGPL-3.0许可证;icon detect v3基于YOLOv9-E,采用MIT许可证;icon caption基于Florence-2,采用MIT许可证。组合使用icon detect v3和icon caption可获得全MIT许可的OmniParser管道。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部