闲社服务运行正常AI智能体自动化平台

MuseVLA

microsoft/MuseVLA

发布机构微软(Microsoft)已核实

下载访问条件国内镜像可用

MuseVLA:用于机器人操作的自适应多模态传感视觉-语言-动作模型 MuseVLA是一种用于机器人操作的自适应多模态传感视觉-语言-动作模型。基于VITRA构建,MuseVLA将新型传感器视为按需工具,首先选择任务所需的模态,将选定的传感器观测结果与RGB图像对齐,然后生成机器人动作。 支持RGB、热传感、声学传感和mmWave雷达传感等多种传感器模态。在热传感、声学传感和雷达传感引导的机器人操作任务中,平均成功率达到80.6%。在未见过的传感器引导任务中,平均成功率为66

图文理解
模型详情

模型介绍

中文整理

MuseVLA:用于机器人操作的自适应多模态传感视觉-语言-动作模型

模型用途

MuseVLA是一种用于机器人操作的自适应多模态传感视觉-语言-动作模型。基于VITRA构建,MuseVLA将新型传感器视为按需工具,首先选择任务所需的模态,将选定的传感器观测结果与RGB图像对齐,然后生成机器人动作。

主要能力

支持RGB、热传感、声学传感和mmWave雷达传感等多种传感器模态。在热传感、声学传感和雷达传感引导的机器人操作任务中,平均成功率达到80.6%。在未见过的传感器引导任务中,平均成功率为66.7%。

输入输出

输入:多模态传感数据(RGB、热、声、mmWave雷达)以及语言指令。输出:机器人动作。

运行要求

未提供具体运行要求信息。

基本用法

未提供具体用法说明。

限制

仅支持英语。性能数据基于特定测试任务,模型在未见过的传感器引导任务上的成功率相对较低。

许可证

MIT许可证

训练数据

使用MuseVLA-dataset数据集进行训练。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部