谷歌发布Gemini 3.8系列TTS模型,语音库扩展至2000+

作者:IT之家 发布时间:2026-09-24 04:13:46 浏览:11
关键字:
谷歌推出Gemini 3.8 Flash与Flash-Lite两款文本转语音模型,支持无限语音定制与语音复制,并在多项基准测试中领先。

谷歌今日发布两款全新文本转语音模型——Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,将语音生成从静态预设升级为动态创意工作室。前者面向深度创意与角色设计,后者主打大容量、高性价比的配音场景。

新模型支持通过自然语言提示从头创建定制语音,覆盖100多种语言和方言,语音库从原有30种扩展至2000多种现成语音,并支持仅需30秒音频样本的语音复制功能。用户还可逐行指导表演,在数小时长篇音频中保持音色稳定,适合播客与有声读物。

性能方面,Gemini 3.8 Flash TTS在Hume AI语音设计基准测试中以71.4分位居第一,口音建模得分60.8分同样领先;两款模型在整体质量指数中分列前两位。在Voice Arena盲测中,其在日语、巴西葡萄牙语等主要语言上均领先竞争对手。

安全层面,语音复制需提供声音所有者的口头同意记录,所有生成音频均嵌入SynthID水印并附带C2PA凭据,以防范错误信息。即日起开发者可在Google AI Studio和Gemini API中使用,企业版即将通过Gemini Enterprise推出,普通用户则可在Gemini Notebook与Google Vids中体验。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自m.toutiao.com,作者IT之家

有问题,请联系客服!http://www.rongyeyun.com/kefu/