兄弟们,今天版里聊点硬核的。语音合成(TTS)这块,过去一年被大模型彻底重写了。以前我们玩的是WaveNet、FastSpeech,现在直接上马多模态大模型端到端生成,效果完全是代差级别的。
给大家划几个重点,都是实测过的干货。第一,**零样本克隆已成标配**。像微软的VALL-E 2、字节的Seed-TTS,你只需要给它3-5秒的参考音频,就能克隆音色、情感甚至呼吸节奏。实测Seed-TTS在自然度MOS评分上已经干到了4.5以上,跟真人录音差距极小。第二,**情感控制不再是玄学**。现在最新的模型通过文本情感标签+韵律编码器,能精准控制笑声、停顿和重音,做有声书和播客基本不需要人工修音了。
技术细节上,大家重点关注**离散音频编码器**(如EnCodec、SoundStream)和**自回归Transformer**的结合。目前主流做法是先把音频压成离散token,然后用LLM来预测下一个token,最后用神经声码器解码。这本质上是把语音当成另一种“语言”来训练,所以能吃下海量数据。
最后说点实在的:**如果你在做AI应用,别再用老掉牙的拼接式TTS了**。现在开源界有ChatTTS和CosyVoice,中文效果极佳,显存占用低,部署起来非常快。建议直接上多模态方案,体验完全是两个维度。有啥问题楼下问,版主在线答疑。 |