Meta推出首个实时音频感知模型Muse Voice Transcribe,开发者可通过Meta Model API调用,定价为每1000分钟音频3美元。该模型整合流式语音识别、说话人分离与端点检测,支持实时输出文字,适用于听写、会议记录和通话字幕等场景。
模型可在20余名说话者中准确分离发言者,训练覆盖70余种语言,其中25种已验证,支持超1小时音频及句内语言切换,并可通过语言、关键词和上下文偏置优化识别效果。
技术上,Meta引入自适应延迟机制,动态调整音频长度以平衡实时性与准确性。截至2026年9月1日,该模型在Artificial Analysis流式语音转文本排行榜中位列第一。
