谷歌今日发布两款全新文本转语音模型——Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,将语音生成从静态预设升级为动态创意工作室。前者面向深度创意与角色设计,后者主打大容量、高性价比的配音场景。
新模型支持通过自然语言提示从头创建定制语音,覆盖100多种语言和方言,语音库从原有30种扩展至2000多种现成语音,并支持仅需30秒音频样本的语音复制功能。用户还可逐行指导表演,在数小时长篇音频中保持音色稳定,适合播客与有声读物。
性能方面,Gemini 3.8 Flash TTS在Hume AI语音设计基准测试中以71.4分位居第一,口音建模得分60.8分同样领先;两款模型在整体质量指数中分列前两位。在Voice Arena盲测中,其在日语、巴西葡萄牙语等主要语言上均领先竞争对手。
安全层面,语音复制需提供声音所有者的口头同意记录,所有生成音频均嵌入SynthID水印并附带C2PA凭据,以防范错误信息。即日起开发者可在Google AI Studio和Gemini API中使用,企业版即将通过Gemini Enterprise推出,普通用户则可在Gemini Notebook与Google Vids中体验。
