Meta发布实时音频感知模型,支持20余人分轨转写

作者:作者:故渊 发布时间:2026-09-02 08:40:36 浏览:13
Meta推出首个实时音频感知模型Muse Voice Transcribe,支持20余人分轨转写,定价3美元/千分钟,在流式语音转文本排行榜中位列第一。

Meta推出首个实时音频感知模型Muse Voice Transcribe,开发者可通过Meta Model API调用,定价为每1000分钟音频3美元。该模型整合流式语音识别、说话人分离与端点检测,支持实时输出文字,适用于听写、会议记录和通话字幕等场景。

模型可在20余名说话者中准确分离发言者,训练覆盖70余种语言,其中25种已验证,支持超1小时音频及句内语言切换,并可通过语言、关键词和上下文偏置优化识别效果。

技术上,Meta引入自适应延迟机制,动态调整音频长度以平衡实时性与准确性。截至2026年9月1日,该模型在Artificial Analysis流式语音转文本排行榜中位列第一。

阅读原文