模型介绍
中文整理MuseVLA:用于机器人操作的自适应多模态传感视觉-语言-动作模型
模型用途
MuseVLA是一种用于机器人操作的自适应多模态传感视觉-语言-动作模型。基于VITRA构建,MuseVLA将新型传感器视为按需工具,首先选择任务所需的模态,将选定的传感器观测结果与RGB图像对齐,然后生成机器人动作。
主要能力
支持RGB、热传感、声学传感和mmWave雷达传感等多种传感器模态。在热传感、声学传感和雷达传感引导的机器人操作任务中,平均成功率达到80.6%。在未见过的传感器引导任务中,平均成功率为66.7%。
输入输出
输入:多模态传感数据(RGB、热、声、mmWave雷达)以及语言指令。输出:机器人动作。
运行要求
未提供具体运行要求信息。
基本用法
未提供具体用法说明。
限制
仅支持英语。性能数据基于特定测试任务,模型在未见过的传感器引导任务上的成功率相对较低。
许可证
MIT许可证
训练数据
使用MuseVLA-dataset数据集进行训练。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
