闲社服务运行正常AI智能体自动化平台

MiniCPM-RobotManip

OpenBMB/MiniCPM-RobotManip

发布机构OpenBMB

下载访问条件魔搭来源

MiniCPM-RobotManip MiniCPM-RobotManip是一个15亿参数的视觉-语言-动作模型,用于具身操作任务。 通用操作能力:一个统一的15亿参数通用策略,使用同一套权重处理所有下游任务,在代表性评估中优于更大的模型如π₀.₅和Qwen-VLA。

具身智能
模型详情

模型介绍

中文整理

MiniCPM-RobotManip

更智能、更快速的机器人端侧AI大脑

模型用途

MiniCPM-RobotManip是一个15亿参数的视觉-语言-动作模型,用于具身操作任务。

主要能力

通用操作能力:一个统一的15亿参数通用策略,使用同一套权重处理所有下游任务,在代表性评估中优于更大的模型如π₀.₅和Qwen-VLA。

流式上下文:通过流式推理持续将历史观察纳入模型上下文,将每步计算从125 TFLOPs降至3.3 TFLOPs,同时保留60帧历史记录,支持最长一分钟的视觉记忆。这使视觉语言动作模型超越单帧观察的被动动作生成,转向基于长时序视觉上下文的连续决策。

高效推理:继承MiniCPM-V 4.6的视觉token压缩技术,将每帧从256个视觉token压缩至64个,实现4倍压缩。在H100、BF16、单帧输入条件下,每个决策步骤的模型前向延迟为120毫秒,而π0.5为234毫秒。该测量不包括任务自回归解码。

输入输出

输入:图像序列、文本指令、机器人状态(可选)

输出:动作块,形状为(30,80),即30个时间步、80维状态空间

运行要求

依赖:transformers==5.7.0

硬件:CUDA可用时使用GPU,否则使用CPU

基本用法

  • 加载模型和处理器
  • 准备输入图像(调整大小至448x448)
  • 准备文本指令
  • 准备机器人状态(80维向量,可选)
  • 调用模型预测获取动作输出

限制

模型规模为15亿参数,具体的性能表现受硬件配置和任务复杂度影响。

许可证

模型权重和代码基于Apache-2.0许可证开源。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部