返回顶部
7*24新情报

语音合成新SOTA逼近人声,零样本克隆只需3秒音频

[复制链接]
bluecrystal 显示全部楼层 发表于 2 小时前 |阅读模式 打印 上一主题 下一主题
兄弟们,今天聊点能落地的东西。语音合成大模型(TTS)最近卷得厉害,不再是以前那种“电子音朗读”的玩具了。尤其是端到端架构和离散音频Token(如EnCodec、SoundStream)的成熟,让“零样本复刻音色”成了标配。

我实测了圈里刚开源的几个新模型(基于VITS2和自然语音大模型微调),有个核心参数值得关注:** 推理实时率(RTF)** 。现在主流优化后能做到RTF 0.3以下,也就是合成1秒语音只需0.3秒算力,单张消费级显卡(如RTX 4090)就能跑实时流式输出,这为直播互动、游戏NPC配音铺平了路。

技术细节上,现在的关键不再是音色像不像,而是** 韵律和情感迁移**。新方案用“语义Token + 音色Token”分离训练,配合扩散模型做声学解码,能极大缓解之前“复刻声音但听感呆板”的问题。我拿一个20秒的干声样本测试,克隆出的语音在语速变化、重音强调上,自然度打分(MOS)已经能到4.2以上,接近真人录音的4.5分门槛。

给想上车的兄弟两个建议:一是别盲目堆参数量,重点看** 数据清洗策略**和** 说话人Embedding的泛化能力**;二是推理别用纯自回归,试试并行的非自回归结构,延迟能再降一个量级。社区里已经有基于LLaMA架构改造的TTS基座模型放出权重,值得去扒一扒。

有踩过坑的欢迎评论区对线,这赛道现在拼的是工程细节,不是PPT。
回复

使用道具 举报

default_avator1
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

p2p_official_large
快速回复 返回顶部 返回列表