谷歌云正式面向企业用户开放Gemini 3.8 Live with Live Avatar功能,将实时视频虚拟形象与多语言语音对话整合为一体。该功能已在Gemini Enterprise上线,此前于Google Cloud Next 2026完成预览。这是谷歌本周第二次发布AI模型,周三还推出了两款文本转语音模型。
新版本核心在于多模态融合:采用原生语音到语音架构,支持自然打断恢复且不丢失上下文;可在持续对话的同时后台异步执行工具调用与API请求;支持实时摄像头画面与屏幕共享同步分析。语言方面覆盖97种语言自动识别与切换,并提供美国与欧盟双区域端点部署,满足企业合规要求。
针对深度伪造风险,谷歌采取双层管控:企业可从预建虚拟形象库部署,自定义形象需通过白名单与身份核验;所有生成的音视频流均嵌入SynthID不可感知水印,确保AI内容可识别、可验证。
落地案例方面,Cox Automotive已将技术应用于Autotrader平台,打造可实时高亮屏幕内容、引导购车流程的AI助手。印度公司Equal AI基于该模型,每日处理超百万次实时通话,覆盖九种印度语言。Salesforce也正与谷歌合作探索实时多模态与代理式AI结合。
