模型详情
模型介绍
中文整理# Orca:世界在你的心中
模型用途
Orca 是一个通用世界基础模型,以“下一状态预测”为核心目标。该模型从多模态世界信号中学习统一的世界潜在空间,并通过多模态读出接口呈现所学的潜在表示。
## 主要能力
Orca 采用“下一状态预测”方法,而非分别优化下一个token、下一帧或下一个动作的预测目标。这种统一的状态转换建模路径旨在理解、预测和作用于物理世界。
模型关注两种基本输入信号:
- 视觉信号:用于观察世界演化的密集信息- 语言信号:用于事件描述、任务意图、因果解释和语义约束
模型具备三项下游读出能力:
- 文本生成
- 图像预测
- 动作生成
## 输入输出
- *输入:**
- 视觉信号:来自连续视频的密集自然转换
- 语言信号:在语言描述的事件和视觉问答监督下的稀疏有意义转换
- *输出:**
- 文本:事件描述、因果解释、问答响应
- 图像:未来状态预测
- 动作:机器人操作任务
运行要求
- *架构:** Encoder-Decoder 架构
- *训练流程:**
- Encoder 通过无意识学习和有意识学习从多模态世界信号中学习世界潜在表示
- 预训练后冻结 Encoder,仅训练轻量级模态特定解码器
- 解码器将潜在表示读出到下游模态
- *已发布版本:** Orca-4B 检查点
- *数据规模:**
- 12.5万小时视频数据
- 1.6亿事件标注
- 通用视觉问答数据
基本用法
- 克隆代码仓库
- 安装共享数据集下载工具
- 下载评估数据集至 evaluation/data/ 目录
- 根据任务说明进行模型设置和评估
限制
- 当前仅发布 Orca-4B 检查点
- Orca-0.8B 检查点及下游微调代码尚未发布
许可证
许可证信息未在模型卡中明确说明。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境
运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
