兄弟们,刚看到字节在语音合成大模型上的新突破,这次Seed-TTS的升级版直接把零样本语音克隆+情感控制拉到了新高度。不卖关子,直接上干货。
技术细节上,新版模型用了自研的基于扩散的语音解码器,配合语义与声学特征的分层对齐方案。官方数据显示,在零样本场景下,语音自然度MOS评分能达到4.52(真人录音为4.6),情感识别准确率相比旧版提升了18%。更重要的是,延迟压缩到150ms以内,基本实现实时交互。
最让我眼前一亮的是“情感迁移”能力——你给一段中性语音,它可以瞬间改成愤怒、悲伤或兴奋语气,而且保留原说话人的音色和口音。比如用3秒样本,就能让AI用“特朗普式愤怒”读天气预报,效果相当炸裂。
实际测试中,中文多方言(粤语、四川话等)和英文混合场景也没翻车。不过注意,高难度情感(如“讽刺”)偶尔会崩,这应该是下一步优化的重点。
实用建议:想玩的话可以关注他们开源的工具链,底层用了类似VALL-E的离散编码+FLOW序列建模,但推理更轻量,单卡A100就能跑。
总之,语音合成大模型现在不再是“念稿机器”,而是开始理解情绪和语境了。期待后续能否突破长文本的情感一致性——这活儿是真难。 |