模型介绍
中文整理模型用途
OmniParser是一个通用的屏幕解析工具,用于将UI截图转换为结构化格式,旨在改进基于大语言模型的UI代理。
主要能力
将 unstructured 的截图解析为结构化元素列表,包括可交互区域的位置和图标功能描述。V2版本在ScreenSpot Pro基准测试中达到39.6平均准确率。可与OpenAI、DeepSeek、Qwen或Anthropic等多种大语言模型配合构建GUI代理。
输入输出
输入:UI截图(支持PC和手机截图,以及各类应用程序界面)。输出:结构化元素列表,包含可交互区域的位置坐标和图标功能描述文本。
运行要求
A100 GPU上平均推理延迟约0.6秒/帧,单卡4090上约0.8秒/帧。icon detect v3模型以TorchScript模块形式提供,推理仅需PyTorch,无需ultralytics库。
基本用法
通过OmniTool工具调用OmniParser,配合视觉模型使用。CONF THRESHOLD默认值为0.05,该检测器对小型UI元素有意保持较低置信度,将此值提至0.1以上可能开始遗漏真实元素。
限制
OmniParser仅将截图转换为结构化文本和可交互区域,不检测输入中的有害内容。用户需自行确保输入内容无害。模型输出需要人工判断,开发者需遵循安全标准。
许可证
不同模型采用不同许可证:icon detect基于YOLOv8,采用AGPL-3.0许可证;icon detect v3基于YOLOv9-E,采用MIT许可证;icon caption基于Florence-2,采用MIT许可证。组合使用icon detect v3和icon caption可获得全MIT许可的OmniParser管道。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
