讯飞发布全国产语音大模型 支持99种语言识别

作者:观点小知 发布时间:2026-09-17 06:13:59 浏览:15
关键字:
讯飞星火上线全国产语音基座大模型Spark-Audio-1.0-Preview,基于纯国产算力训练,支持99种语言及202种方言识别。

9月16日,讯飞星火正式上线全国产语音基座大模型Spark-Audio-1.0-Preview,目前已开放体验,API后续将登陆讯飞开放平台。

该模型采用0.65B音频编码器搭配30B-A3B的MoE大语言模型,基于1300万小时音频及大量文本数据,在纯国产算力集群上训练完成,实现了从算力到模型的全面国产化。

能力上,模型支持文本与语音双模态输入,可完成语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及复杂音频问答等任务,覆盖99种语言和202种方言。

与传统“先转文字再理解”的级联方案不同,语音基座大模型可直接理解语音,一次性听懂人声、环境音与音乐,并理解其中的语义、情绪和场景。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自m.toutiao.com,作者观点小知

有问题,请联系客服!http://www.rongyeyun.com/kefu/