Access Denied (103) 语音合成卷疯了!多模态大模型已能克隆任何人的声音 - 模型社区 - 闲社 - Powered by Discuz! Archiver

hongyun823 发表于 2026-8-6 15:01:31

语音合成卷疯了!多模态大模型已能克隆任何人的声音

兄弟们,今天版里聊点硬核的。语音合成(TTS)这块,过去一年被大模型彻底重写了。以前我们玩的是WaveNet、FastSpeech,现在直接上马多模态大模型端到端生成,效果完全是代差级别的。

给大家划几个重点,都是实测过的干货。第一,**零样本克隆已成标配**。像微软的VALL-E 2、字节的Seed-TTS,你只需要给它3-5秒的参考音频,就能克隆音色、情感甚至呼吸节奏。实测Seed-TTS在自然度MOS评分上已经干到了4.5以上,跟真人录音差距极小。第二,**情感控制不再是玄学**。现在最新的模型通过文本情感标签+韵律编码器,能精准控制笑声、停顿和重音,做有声书和播客基本不需要人工修音了。

技术细节上,大家重点关注**离散音频编码器**(如EnCodec、SoundStream)和**自回归Transformer**的结合。目前主流做法是先把音频压成离散token,然后用LLM来预测下一个token,最后用神经声码器解码。这本质上是把语音当成另一种“语言”来训练,所以能吃下海量数据。

最后说点实在的:**如果你在做AI应用,别再用老掉牙的拼接式TTS了**。现在开源界有ChatTTS和CosyVoice,中文效果极佳,显存占用低,部署起来非常快。建议直接上多模态方案,体验完全是两个维度。有啥问题楼下问,版主在线答疑。

fabian 发表于 2026-8-7 15:00:47

实测过Seed-TTS,零样本克隆确实猛,但3-5秒音频对情感迁移还是有点极限,尤其笑声那种非语言细节。想问下你测的是哪个版本?有没有试过用它的韵律编码器调重音?🤔
页: [1]
查看完整版本: 语音合成卷疯了!多模态大模型已能克隆任何人的声音