闲社
标题:
FireRedAudio开放权重:9B模型统一理解、合成与编辑语音
[打印本页]
作者:
bda108
时间:
1 小时前
标题:
FireRedAudio开放权重:9B模型统一理解、合成与编辑语音
【事件概述】
FireRedTeam 公开了通用音频语言模型 FireRedAudio 的代码与权重。它以一个共享的 9B 参数语言模型为核心,把语音识别、音频理解、语音合成和语音编辑放入同一套模型框架,并采用彼此解耦的连续表示路径处理理解与生成。
【模型与开发者】
模型:FireRedAudio
开发者:FireRedTeam
官方发布日期:官方模型卡的 News 栏将代码与模型发布日标记为 2026 年 8 月 21 日。作为补充,Hugging Face 模型仓库创建于 8 月 22 日 10:35 UTC,GitHub 公共仓库创建于 8 月 22 日 11:18 UTC;本文把模型卡标注的 8 月 21 日作为官方事件日期,同时明确公共仓库页面是在 8 月 22 日上线,避免把网页时间戳误当成同一个日期。
【关键能力与改动】
1. 使用共享的 9B 参数语言与推理主干;Audio Encoder 负责理解,RedAE 路径负责生成,两类连续表示相互解耦。
2. 理解侧覆盖自动语音识别、通用音频问答,以及可选的推理模式。
3. 生成侧支持零样本语音合成、按文字描述设计音色,以及基于参考音频的声音复现。
4. 支持语义编辑,例如替换、插入或删除讲话内容;也支持音高、语速和音量等声学编辑。
5. 官方称可处理约一小时的录音,并对内容与时间位置进行对齐,用于带时间戳的整理、摘要和按时间检索内容。
6. 代码和模型采用 Apache 2.0 许可公开;理解任务只需主模型,语音生成与编辑还需要 RedAE 解码器权重。
【适用对象】
适合研究或开发语音识别、音频问答、会议与访谈录音整理、中文或英文 TTS、授权音色复现和语音编辑流程的团队。官方参考环境要求 Python 3.10、CUDA 工具链和 ffmpeg,默认依赖面向 CUDA 12.8。
【实际影响】
FireRedAudio 的价值在于把原本可能由 ASR、音频理解、TTS 和编辑等多个模型组成的流程收拢到同一语言与推理主干中,有利于统一接口和实验。但这不等于所有任务都只需一份组件:生成类任务仍需额外的 RedAE 解码器,声学编辑指令也必须遵循官方训练过的固定模板。官方列出的基准结果属于其测试设置,本文不把这些自报成绩扩展为所有语言、硬件或真实业务场景下的通用结论。
【限制与使用提醒】
除 ASR 外,音频理解、TTS、编辑和音色设计目前只支持中文与英文。零样本 TTS 默认存在随机性,同一输入在不同随机种子下可能产生不同结果;需要复现时应固定种子。约一小时以上的长音频尚未测试,时间与内容对齐可能下降。官方还明确把零样本音色复现限定为学术研究用途;任何涉及他人声音的使用都应取得明确授权,禁止用于冒充、诈骗或其他违法活动。模型输出仍需人工核验,尤其不能直接作为高风险事实或身份判断依据。
【官方来源】
Hugging Face 模型页:https://huggingface.co/FireRedTeam/FireRedAudio
GitHub 代码仓库:https://github.com/FireRedTeam/FireRedAudio
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0