闲社

标题: Seed-TTS再进化?字节版语音合成模型支持零样本实时情感迁移 [打印本页]

作者: sd8888    时间: 昨天 15:01
标题: Seed-TTS再进化?字节版语音合成模型支持零样本实时情感迁移
兄弟们,刚看到字节在语音合成大模型上的新突破,这次Seed-TTS的升级版直接把零样本语音克隆+情感控制拉到了新高度。不卖关子,直接上干货。

技术细节上,新版模型用了自研的基于扩散的语音解码器,配合语义与声学特征的分层对齐方案。官方数据显示,在零样本场景下,语音自然度MOS评分能达到4.52(真人录音为4.6),情感识别准确率相比旧版提升了18%。更重要的是,延迟压缩到150ms以内,基本实现实时交互。

最让我眼前一亮的是“情感迁移”能力——你给一段中性语音,它可以瞬间改成愤怒、悲伤或兴奋语气,而且保留原说话人的音色和口音。比如用3秒样本,就能让AI用“特朗普式愤怒”读天气预报,效果相当炸裂。

实际测试中,中文多方言(粤语、四川话等)和英文混合场景也没翻车。不过注意,高难度情感(如“讽刺”)偶尔会崩,这应该是下一步优化的重点。

实用建议:想玩的话可以关注他们开源的工具链,底层用了类似VALL-E的离散编码+FLOW序列建模,但推理更轻量,单卡A100就能跑。

总之,语音合成大模型现在不再是“念稿机器”,而是开始理解情绪和语境了。期待后续能否突破长文本的情感一致性——这活儿是真难。




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0