模型介绍
中文整理模型名称:Magenta RealTime
开发者:Google DeepMind
模型用途
Magenta RealTime 是 Google 开发的开源音乐生成模型,基于与 MusicFX DJ 和 Lyria RealTime 相同的研究和技术。该模型能够持续生成音乐音频,支持通过文本提示、音频示例或多个文本提示与音频示例的加权组合来引导生成方向。
主要能力
连续实时音乐生成:模型可实时持续输出音乐音频流。文本与音频引导:支持使用文本描述(如“重金属”)或音频示例来指定音乐风格。多模态控制:可同时使用文本提示和音频上下文来控制生成内容。轻量部署:模型体积较小,适合在资源有限的环境中运行,包括现场表演和免费 Colab TPU。
输入输出
SpectroStream 编解码器:输入为 48kHz 立体声音乐波形,输出为离散音频 token,帧率 25Hz,64 层 RVQ,10 位码,码率 16kbps。
MusicCoCa 嵌入模型:输入为 16kHz 单声道音乐波形或文本风格描述(如“重金属”),输出为 768 维嵌入向量,量化后 12 层 RVQ,10 位码。
Transformer LLM:编码器输入包括 1000 个音频上下文 token(10 秒音频,4 层 RVQ)和 6 个风格 token(量化后的 MusicCoCa 嵌入);解码器输出 800 个 token(2 秒音频,16 层 RVQ)。
运行要求
硬件:需要 TPU 或 GPU 运行。Google Colab 提供免费 TPU 可用。
软件:基于 JAX 框架训练。
基本用法
交互式音乐创作:用于现场表演,可通过操作风格嵌入或音频上下文进行实时控制。
无障碍音乐创作:帮助有技能差距或残疾的用户参与音乐创作。
视频游戏:可根据用户行为和环境实时生成定制配乐。
研究:研究者可利用 MusicCoCa 和 Magenta RT 的表示进行音乐信息识别。
个性化:音乐人可使用自己的音乐目录微调模型(微调支持即将推出)。
教育:通过自然语言提示探索音乐风格、乐器和历史。
获取帮助:可参考 Colab 演示和 GitHub 仓库获取使用示例。
限制
音乐风格覆盖:训练数据主要来自西方器乐音乐,对声乐表演和全球丰富音乐传统的覆盖不完整。
声乐能力:模型可生成非词汇性的声乐和哼唱,但未经歌词训练,不太可能生成实际歌词。不过仍存在生成不当或文化敏感歌词内容的风险。
延迟:由于 LLM 以两秒为单位处理,风格提示的响应可能需要两秒或更长时间才能影响音乐输出。
上下文限制:编码器最大音频上下文窗口为十秒,无法直接引用早于该时间的音乐。虽然上下文足以让模型创作旋律、节奏和和弦进行,但无法自动创建更长的歌曲结构。
许可证
代码库采用 Apache 2.0 许可证,模型权重采用 Creative Commons Attribution 4.0 International 许可证。
使用条款:不得生成侵犯或违反他人权利的内容,包括版权内容。Google 不对用户使用该模型生成的输出主张任何权利。用户需自行负责输出的后续使用。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
