闲社服务运行正常AI智能体自动化平台

magenta-realtime

google/magenta-realtime

发布机构谷歌(Google)已核实

下载访问条件国内镜像可用

Magenta RealTime 是 Google 开发的开源音乐生成模型,基于与 MusicFX DJ 和 Lyria RealTime 相同的研究和技术。该模型能够持续生成音乐音频,支持通过文本提示、音频示例或多个文本提示与音频示例的加权组合来引导生成方向。 连续实时音乐生成:模型可实时持续输出音乐音频流。文本与音频引导:支持使用文本描述(如“重金属”)或音频示例来指定音乐风格。多模态控制:可同时使用文本提示和音频上下文来控制生成内容。轻量部署:模型体积较小,适合在资源有

图文理解语音音频
模型详情

模型介绍

中文整理

模型名称:Magenta RealTime

开发者:Google DeepMind

模型用途

Magenta RealTime 是 Google 开发的开源音乐生成模型,基于与 MusicFX DJ 和 Lyria RealTime 相同的研究和技术。该模型能够持续生成音乐音频,支持通过文本提示、音频示例或多个文本提示与音频示例的加权组合来引导生成方向。

主要能力

连续实时音乐生成:模型可实时持续输出音乐音频流。文本与音频引导:支持使用文本描述(如“重金属”)或音频示例来指定音乐风格。多模态控制:可同时使用文本提示和音频上下文来控制生成内容。轻量部署:模型体积较小,适合在资源有限的环境中运行,包括现场表演和免费 Colab TPU。

输入输出

SpectroStream 编解码器:输入为 48kHz 立体声音乐波形,输出为离散音频 token,帧率 25Hz,64 层 RVQ,10 位码,码率 16kbps。

MusicCoCa 嵌入模型:输入为 16kHz 单声道音乐波形或文本风格描述(如“重金属”),输出为 768 维嵌入向量,量化后 12 层 RVQ,10 位码。

Transformer LLM:编码器输入包括 1000 个音频上下文 token(10 秒音频,4 层 RVQ)和 6 个风格 token(量化后的 MusicCoCa 嵌入);解码器输出 800 个 token(2 秒音频,16 层 RVQ)。

运行要求

硬件:需要 TPU 或 GPU 运行。Google Colab 提供免费 TPU 可用。

软件:基于 JAX 框架训练。

基本用法

交互式音乐创作:用于现场表演,可通过操作风格嵌入或音频上下文进行实时控制。

无障碍音乐创作:帮助有技能差距或残疾的用户参与音乐创作。

视频游戏:可根据用户行为和环境实时生成定制配乐。

研究:研究者可利用 MusicCoCa 和 Magenta RT 的表示进行音乐信息识别。

个性化:音乐人可使用自己的音乐目录微调模型(微调支持即将推出)。

教育:通过自然语言提示探索音乐风格、乐器和历史。

获取帮助:可参考 Colab 演示和 GitHub 仓库获取使用示例。

限制

音乐风格覆盖:训练数据主要来自西方器乐音乐,对声乐表演和全球丰富音乐传统的覆盖不完整。

声乐能力:模型可生成非词汇性的声乐和哼唱,但未经歌词训练,不太可能生成实际歌词。不过仍存在生成不当或文化敏感歌词内容的风险。

延迟:由于 LLM 以两秒为单位处理,风格提示的响应可能需要两秒或更长时间才能影响音乐输出。

上下文限制:编码器最大音频上下文窗口为十秒,无法直接引用早于该时间的音乐。虽然上下文足以让模型创作旋律、节奏和和弦进行,但无法自动创建更长的歌曲结构。

许可证

代码库采用 Apache 2.0 许可证,模型权重采用 Creative Commons Attribution 4.0 International 许可证。

使用条款:不得生成侵犯或违反他人权利的内容,包括版权内容。Google 不对用户使用该模型生成的输出主张任何权利。用户需自行负责输出的后续使用。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部