谷歌今日发布两款全新文本转语音模型——Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,将语音生成从静态预设升级为动态创意工具。前者面向深度创意与角色设计,后者主打大容量、高性价比的配音场景。
新模型支持从30种原始语音扩展至无限语音库,可访问2000多种现成语音,覆盖100多种语言和方言。用户仅需30秒音频样本即可复制声音,并内置同意验证、SynthID水印和C2PA凭据保障安全。
两款模型均能精确控制每一行台词的演绎方式,支持逐行表演指导、长篇音频生成、双声音对话编排,以及添加笑声、叹气等非语言提示,适合播客、有声读物和游戏场景。
性能方面,Gemini 3.8 Flash TTS在Hume AI语音设计基准测试中以71.4分位居第一,口音建模同样领先。在Voice Arena盲测中,两款模型在日语、葡萄牙语、印地语等主要语言中表现突出。
即日起,开发者可在Gemini API和Google AI Studio中使用这两款模型,企业版即将登陆Gemini Enterprise。普通用户可在Gemini Notebook和Google Vids中体验。需注意,AI Studio的语音复制功能在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度暂不可用。
