模型介绍
中文整理# RoboBrain 2.5 模型卡片
模型概述
RoboBrain 2.5 是一款下一代具身AI基础模型,通过在高质量时空数据上的广泛训练,在通用感知、空间推理和时间建模方面实现了显著进化。该模型实现了从2D相对点到带深度信息的3D坐标预测的范式转变,能够理解绝对度量约束,并为具有物理约束的复杂任务生成完整的操作轨迹。
## 主要能力
### 原生3D空间推理
从2D到3D:模型从预测2D图像上的坐标点升级为在3D空间中预测带深度信息的坐标点。
从相对到绝对:模型从理解相对空间关系进化到测量绝对3D空间度量信息,能够理解精确的物理约束指令。
从点到轨迹:模型从预测单个目标点升级为预测描述完整操作过程的一系列关键点,具备基于3D绝对度量的空间规划能力。
### 密集时间价值估计
密集进度预测:能够跨不同任务、视点和具身形态进行多粒度任务进度预测。
执行状态估计:理解任务目标并估计执行过程中的各种状态,包括成功、失败、错误发生等。
赋能VLA强化学习:为视觉语言动作强化学习提供实时、密集的反馈信号和奖励。仅需一个演示,即可在复杂精细操作任务中达到95%以上的成功率。
核心能力
交互式推理:支持长程规划与闭环反馈的交互式推理。
空间感知:从复杂指令中精确预测点位和边界框。
时间感知:估计未来轨迹。
场景推理:通过实时构建和更新结构化记忆进行场景推理。
## 输入输出
输入:视觉信息(图像/视频)和语言指令
输出:3D坐标点、完整操作轨迹、任务进度预测、执行状态估计、密集奖励信号
运行要求
具体运行要求需参考项目文档。
基本用法
该模型支持以下任务类型:
通用视觉问答
视觉定位
可操作性预测
引用预测
导航任务
3D轨迹预测
时间价值估计
详细使用说明请参考Robo-Dopamine项目文档。
限制
模型在复杂精细操作场景中的性能受限于训练数据的质量和多样性。
时间价值估计的准确性可能因任务类型和执行环境的不同而有所差异。
许可证
具体许可证信息需参考项目官方文档。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
