讯飞星火全国产语音基座大模型Spark-Audio上线

作者:IT之家 发布时间:2026-09-17 06:13:57 浏览:15
关键字:
科大讯飞发布全国产算力训练的语音基座大模型Spark-Audio-1.0-Preview,可直接理解语音中的语义、情绪与场景,支持99种语言及202种方言识别,已开放体验。

科大讯飞近日宣布,Spark-Audio-1.0-Preview正式上线,这是一款基于全国产化算力训练的语音基座大模型。

传统大模型处理音频多采用级联方案,先转写文字再交给大模型理解,存在信息丢失和链路割裂两大短板:文字会丢掉语气、情绪与背景音,独立模块串联也容易累积错误并带来延迟卡顿。语音基座大模型则直接理解语音,一次性听懂人声、环境音与音乐,并理解其中的语义、情绪和场景。

该模型采用0.65B音频编码器搭配30B-A3B的MoE大语言模型,使用1300万小时音频及大量文本数据,在纯国产算力集群上训练完成。同一模型可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及复杂音频问答等任务,让机器从“听清”走向“听懂”。

官方称,该模型在各项语音评测任务上整体相当、部分超过同类产品,尤其在高噪声、小声说等真实应用场景中明显领先,与尺寸更大的闭源语音基座模型表现也十分接近。它可支持99种语言及202种方言识别,在Fleurs-中文测试集中取得SOTA,得分高于Gemini-3.1 Pro,并在多语言、多方言识别上优于同尺寸的Qwen3.5-omni-flash。

此外,该模型在通用知识、数学与代码等任务上未出现明显降智,指令遵循与音频理解仍有进步空间。目前Spark-Audio-1.0-Preview已开放体验,API后续将上线讯飞开放平台。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自m.toutiao.com,作者IT之家

有问题,请联系客服!http://www.rongyeyun.com/kefu/