模型介绍
中文整理MiniCPM-RobotManip
更智能、更快速的机器人端侧AI大脑
模型用途
MiniCPM-RobotManip是一个15亿参数的视觉-语言-动作模型,用于具身操作任务。
主要能力
通用操作能力:一个统一的15亿参数通用策略,使用同一套权重处理所有下游任务,在代表性评估中优于更大的模型如π₀.₅和Qwen-VLA。
流式上下文:通过流式推理持续将历史观察纳入模型上下文,将每步计算从125 TFLOPs降至3.3 TFLOPs,同时保留60帧历史记录,支持最长一分钟的视觉记忆。这使视觉语言动作模型超越单帧观察的被动动作生成,转向基于长时序视觉上下文的连续决策。
高效推理:继承MiniCPM-V 4.6的视觉token压缩技术,将每帧从256个视觉token压缩至64个,实现4倍压缩。在H100、BF16、单帧输入条件下,每个决策步骤的模型前向延迟为120毫秒,而π0.5为234毫秒。该测量不包括任务自回归解码。
输入输出
输入:图像序列、文本指令、机器人状态(可选)
输出:动作块,形状为(30,80),即30个时间步、80维状态空间
运行要求
依赖:transformers==5.7.0
硬件:CUDA可用时使用GPU,否则使用CPU
基本用法
- 加载模型和处理器
- 准备输入图像(调整大小至448x448)
- 准备文本指令
- 准备机器人状态(80维向量,可选)
- 调用模型预测获取动作输出
限制
模型规模为15亿参数,具体的性能表现受硬件配置和任务复杂度影响。
许可证
模型权重和代码基于Apache-2.0许可证开源。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
