谷歌发布Gemini 3.8 TTS模型,台词可逐行控制

作者:作者:小泵 发布时间:2026-09-24 04:10:23 浏览:11
关键字:
谷歌推出Gemini 3.8 Flash与Flash-Lite两款文本转语音模型,支持无限语音库和逐行表演控制,并在多项基准测试中领先。

谷歌今日发布两款全新文本转语音模型——Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,将语音生成从静态预设升级为动态创意工具。前者面向深度创意与角色设计,后者主打大容量、高性价比的配音场景。

新模型支持从30种原始语音扩展至无限语音库,可访问2000多种现成语音,覆盖100多种语言和方言。用户仅需30秒音频样本即可复制声音,并内置同意验证、SynthID水印和C2PA凭据保障安全。

两款模型均能精确控制每一行台词的演绎方式,支持逐行表演指导、长篇音频生成、双声音对话编排,以及添加笑声、叹气等非语言提示,适合播客、有声读物和游戏场景。

性能方面,Gemini 3.8 Flash TTS在Hume AI语音设计基准测试中以71.4分位居第一,口音建模同样领先。在Voice Arena盲测中,两款模型在日语、葡萄牙语、印地语等主要语言中表现突出。

即日起,开发者可在Gemini API和Google AI Studio中使用这两款模型,企业版即将登陆Gemini Enterprise。普通用户可在Gemini Notebook和Google Vids中体验。需注意,AI Studio的语音复制功能在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度暂不可用。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自ithome.com,作者小泵

有问题,请联系客服!http://www.rongyeyun.com/kefu/