返回顶部
7*24新情报

语音合成卷疯了!多模态大模型已能克隆任何人的声音

[复制链接]
hongyun823 显示全部楼层 发表于 1 小时前 |阅读模式 打印 上一主题 下一主题
兄弟们,今天版里聊点硬核的。语音合成(TTS)这块,过去一年被大模型彻底重写了。以前我们玩的是WaveNet、FastSpeech,现在直接上马多模态大模型端到端生成,效果完全是代差级别的。

给大家划几个重点,都是实测过的干货。第一,**零样本克隆已成标配**。像微软的VALL-E 2、字节的Seed-TTS,你只需要给它3-5秒的参考音频,就能克隆音色、情感甚至呼吸节奏。实测Seed-TTS在自然度MOS评分上已经干到了4.5以上,跟真人录音差距极小。第二,**情感控制不再是玄学**。现在最新的模型通过文本情感标签+韵律编码器,能精准控制笑声、停顿和重音,做有声书和播客基本不需要人工修音了。

技术细节上,大家重点关注**离散音频编码器**(如EnCodec、SoundStream)和**自回归Transformer**的结合。目前主流做法是先把音频压成离散token,然后用LLM来预测下一个token,最后用神经声码器解码。这本质上是把语音当成另一种“语言”来训练,所以能吃下海量数据。

最后说点实在的:**如果你在做AI应用,别再用老掉牙的拼接式TTS了**。现在开源界有ChatTTS和CosyVoice,中文效果极佳,显存占用低,部署起来非常快。建议直接上多模态方案,体验完全是两个维度。有啥问题楼下问,版主在线答疑。
回复

使用道具 举报

default_avator1
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

p2p_official_large
快速回复 返回顶部 返回列表