模型介绍
中文整理模型用途
LocateAnything-3B面向开发者和研究人员,用于构建需要根据自然语言指令进行快速精确视觉定位的视觉语言模型和应用。支持的应用场景包括:开放集常见目标和长尾目标检测、密集多目标检测、短语和指代表达式 grounding、自动数据集标注、GUI元素 grounding、机器人和自动驾驶感知、文档理解与布局 grounding、OCR定位、工业检测、监控和遥感、点级定位和细粒度空间推理。
主要能力
该模型实现快速高质量的视觉 grounding,支持精确目标定位、密集检测和点级定位。核心创新为并行框解码(Parallel Box Decoding),在单次并行步骤中预测完整边界框坐标,而非逐 token 自回归解码,效率提升最高达 2.5 倍,同时保持几何一致性。支持指代表达式 grounding、多目标检测、GUI 元素 groundin g和文本定位等多种任务,在复杂和拥挤场景中表现优异。
输入输出
输入为图像和文本。图像为 RGB 格式,原始分辨率,支持最高 2.5K 分辨率。文本为自然语言提示或任务模板,如目标类别、指代表达式、GUI 指令、OCR/布局请求或指向查询,支持最长 24K token。输出为文本,包含语义标签和结构化坐标 token,如边界框坐标(x1, y1, x2, y2)和点坐标(x, y)。输出按固定长度块(长度 6)组织,包含语义块、框块、负样本块和结束块。
运行要求
硬件需 NVIDIA GPU 加速系统,支持 Ampere(如 A100)、Blackwell、Hopper(如 H100)、Lovelace(如 L40、RTX 4090)等架构。软件需 Linux 操作系统、PyTorch、Transformers 库,使用 BF16 精度和 KV cache 进行推理。嵌入式平台(如 Thor)部署需额外模型优化。推理建议使用 max new tokens=8192 和 generation mode="hybrid" 以避免截断并平衡速度与精度。
基本用法
模型通过 Worker 类加载,提供多种任务方法:detect() 用于目标检测,ground_single() 用于单目标短语 grounding,ground_multi() 用于多目标短语 grounding,ground_text() 用于文本 grounding,detect_text() 用于场景文本检测,ground_gui() 用于 GUI grounding,point() 用于点级定位。生成模式包括:fast 模式仅用 MTP,速度最快,适合简单场景;slow 模式纯自回归,速度最慢但最鲁棒;hybrid 模式为默认模式,先用 MTP,检测到不确定框时回退到自回归,平衡速度和准确性。
限制
本模型仅用于研究和开发目的。商业使用不被许可,仅 NVIDIA 及其关联公司除外。模型按"原样"提供,不提供任何明示或暗示的保证,用户需自行承担使用风险。用户应确保对所有输入图像和视频内容拥有适当权利和许可。
许可证
本模型基于 NVIDIA 非商业使用许可证发布,仅允许学术和非营利研究目的的使用和修改。商业使用不被许可(NVIDIA 及其关联公司除外)。再分发必须保留许可证及所有适用的版权和归属声明。模型使用了第三方模型组件:语言模型 Qwen2.5-3B-Instruct(Qwen 研究许可证)和视觉编码器 MoonViT-SO-400M(MIT 许可证)。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
