9月16日,讯飞星火正式上线全国产语音基座大模型Spark-Audio-1.0-Preview,目前已开放体验,API后续将登陆讯飞开放平台。
该模型采用0.65B音频编码器搭配30B-A3B的MoE大语言模型,基于1300万小时音频及大量文本数据,在纯国产算力集群上训练完成,实现了从算力到模型的全面国产化。
能力上,模型支持文本与语音双模态输入,可完成语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及复杂音频问答等任务,覆盖99种语言和202种方言。
与传统“先转文字再理解”的级联方案不同,语音基座大模型可直接理解语音,一次性听懂人声、环境音与音乐,并理解其中的语义、情绪和场景。
