闲社

标题: Google发布Gemini 3.8语音模型:可自定义音色并逐句控制情绪 [打印本页]

作者: josheland    时间: 2 小时前
标题: Google发布Gemini 3.8语音模型:可自定义音色并逐句控制情绪
Google于2026年9月23日发布Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS两款文本转语音模型,定位为更具表现力的音频生成模型。Flash TTS偏向角色设计和创意制作,Flash-Lite TTS偏向高并发、成本敏感的配音与语音代理场景。

两款模型都支持按台词逐句加入舞台指令,控制语速、情绪、方言变化和对话中的回声式回应;Flash TTS还支持从自然语言提示创建角色音色,并可在获得授权和同意验证后,根据约30秒音频样本复现声音。官方同时介绍了双人场景、长音频连续生成,以及对100多种语言和方言的支持。生成音频会加入SynthID水印,语音复现需要声音所有者的口头同意录音。

适用对象包括有声书和播客制作团队、游戏与互动内容开发者、配音和本地化服务商,以及需要实时语音代理的企业。Flash TTS已开始通过Gemini API和Google AI Studio向开发者提供,Gemini Notebook面向所有用户推出;Flash-Lite TTS也通过API和AI Studio提供,并进入Google Vids。企业在Gemini Enterprise中的API接入仍标注为即将推出。

实际影响是,语音生成从固定音色选择扩展到可提示的角色设计和逐句导演,有助于减少多角色内容制作中的人工调音工作。但官方功能仍处于滚动发布阶段,音色复现受同意验证和地区政策限制;Google说明AI Studio的语音复现目前不适用于美国伊利诺伊州、得州、欧洲经济区、英国、瑞士和印度。实际音质、延迟和成本还会受到语言、脚本长度、调用配置与地区可用性的影响,不应把官方展示或基准排名视为所有项目的保证。

官方发布日期:2026年9月23日。官方来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0