科大讯飞发布Spark-ASR-2.0,全国产算力语音识别听得懂上下文

作者:zhidx.com 发布时间:2026-09-25 04:14:36 浏览:7
关键字:
科大讯飞推出基于全国产算力训练的语音识别大模型Spark-ASR-2.0,支持方言识别与上下文纠错,推理成本较上代仅增10%。

科大讯飞近日发布语音识别大模型Spark-ASR-2.0,基于全国产算力训练的语音基座模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景、上下文理解与文本流畅性。

实测显示,该模型支持202种方言免切换识别,在中英文混合及芯片术语场景下转写准确;地铁噪音、悄悄话等复杂声学环境中也能完整识别关键信息。上下文方面,模型可结合后文修正同音字歧义,并自动删减停顿、重复和改口内容,让转写结果接近可直接使用的成文。

技术层面,Spark-ASR-2.0融合非自回归快速识别与LLM增强的自回归纠错,先并行生成初稿,再判断需修正位置,避免全文重解码,整体推理成本较上代仅增加10%。同时引入动态上下文注入机制,结合个性化热词与历史修改,从万级词库中筛选候选词,基本不增加响应时延。

目前该模型已上线讯飞输入法,并通过讯飞开放平台提供API服务,后续将应用于讯飞AI眼镜、智能办公本和讯飞听见等产品。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自zhidx.com,作者zhidx.com

有问题,请联系客服!http://www.rongyeyun.com/kefu/