模型介绍
中文整理模型名称:Magenta RealTime 2
作者:Google DeepMind
许可证
代码库采用 Apache 2.0 许可证,模型权重采用 Creative Commons Attribution 4.0 International 许可证。版权所有 2026 Google LLC。请负责任地使用,不得生成侵犯或违反他人权利(包括版权内容权利)的内容。Google 不主张对您使用该模型生成的输出拥有任何权利。您和您的用户对输出及其后续使用承担全部责任。
模型用途
Magenta RealTime 2 是 Google 开发的开源音乐生成模型,专为设备端流式生成和低延迟控制而设计。它是实时音乐模型,是此前 Magenta RealTime 模型和 Lyria RealTime API 的后续版本,支持在设备上生成具有更丰富控制和更低延迟的音乐音频。该模型可通过文本提示、音频示例和 MIDI 持续引导生成音乐音频。
主要能力
该模型由三个组件构成:SpectroStream、MusicCoCa 和一个解码器-only Transformer LLM。SpectroStream 是离散音频编解码器,将立体声 48kHz 音频转换为标记。MusicCoCa 是对比训练模型,能够将音频和文本嵌入到共同的嵌入空间。解码器-only Transformer LLM 根据上下文音频标记、MusicCoCa 嵌入和 MIDI 标记生成音频标记。提供两种配置:基础配置(24亿参数)和小配置(2.3亿参数)。
输入输出
SpectroStream RVQ 编解码器:将高保真音乐音频分词。编码器输入/解码器输出为 48kHz 立体声音乐波形。编码器输出/解码器输入为离散音频标记,25Hz 帧率,64 RVQ 深度,10 位码,16kbps。
MusicCoCa:音乐音频和文本的联合嵌入。输入为 16kHz 单声道音乐波形或音乐风格的文本描述(如"重金属")。输出为 768 维嵌入量化为 12 RVQ 深度,10 位码。
解码器 Transformer LLM:根据上下文、MIDI 和风格生成音频标记。每个时间步(编解码器帧)接收:上下文为 SpectroStream 标记(基础配置每层 25 帧 1秒窗口注意力,20层;小配置每层 41 帧约1.6秒窗口注意力,12层),两种模型均提供 20 秒有效感受野;风格为 12 个 MusicCoCa 标记;MIDI 为 128 维多热向量表示该帧每个 MIDI 音高的状态。输出为 1 个生成帧,12 个 RVQ 标记。
运行要求
该模型设计用于设备端流式生成。实时生成延迟约 200 毫秒。
基本用法
交互式音乐创作:可用于现场表演设置,由表演者操控风格嵌入或音频上下文进行音乐生成。辅助音乐创作与音乐治疗:无法使用传统乐器的人群可参与集体即兴演奏或独立音乐创作。视频游戏:开发者可根据用户行为和环境实时生成定制配乐。研究:研究人员可利用 MusicCoCa 和 Magenta RealTime 2 的表示来识别音乐信息。个性化:音乐人可使用自己的曲目对模型进行微调以定制风格。教育:通过自然语言提示,用户可快速了解和实验音乐概念。
限制
该模型支持实时生成和引导器乐音乐。存在影响音乐经济和文化格局的风险。主要使用器乐数据进行训练。在特定提示下,该模型已被观察到生成一些声音和效果,但这些声音和效果往往是非语言性的。与原始 Magenta RealTime 一样,在音乐流派覆盖和非语言性声音方面存在类似限制。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
