科大讯飞发布 Spark-Audio-1.0-Preview:全国产算力训练,覆盖 99 种语言、202 种方言

讯飞星火语音基座大模型Spark-Audio-1.0-Preview正式上线

9月16日,科大讯飞对外发布语音基座大模型Spark-Audio-1.0-Preview,其最突出的标签为“全国产”——模型基于全国产化算力集群训练完成,从底层规避了供应链风险。

过去业界处理音频大多采用级联方案:先通过语音转写模块将语音转为文字,再交由大模型理解文本内容,该模式存在两大明显短板:一是信息丢失,文字仅能记录表述内容,会丢失语音自带的语气、情绪、背景环境音等关键信息,导致模型场景判断不完整;二是链路割裂,语音转写、声纹识别、语音翻译等能力被拆分为独立模块串联运行,模块间断点容易累积误差,还会出现延迟、卡顿等问题。

Spark-Audio-1.0-Preview则采用单一模型架构,不再局限于语音转文字,可直接理解语音全量信息。该模型专注语音赛道,不涉及图像、视频模态处理,支持文本和语音双模态输入、文本模态输出,可承接的任务包括:

  • 语音转写、多语言翻译、多方言识别
  • 环境音识别、说话人识别、情感分析
  • 复杂音频问答
    实现从“听清”语音内容到“听懂”语义、情绪、场景的跃升。

0.65B编码器搭配30B MoE大模型,纯国产算力完成全流程训练

此次发布的Spark-Audio-1.0-Preview采用0.65B(Dense结构)的音频编码器,搭配30B-A3B(MoE结构)的大语言模型,训练过程中使用了1300万小时音频数据及大量文本数据,训练所用算力集群为纯国产化设备。与讯飞星火大模型的“1+N”体系逻辑一致,该语音基座大模型也支持微调,开发者可基于其开发语音识别、语音同传、语音交互等专用模型或系统,快速落地相关语音业务。

多语言多方言识别性能领先,复杂场景优势突出

在多项语音评测任务中,Spark-Audio-1.0-Preview表现整体处于行业第一梯队,部分任务实现超越。需注意官方提到的“与参数量高一个数量级的Qwen3.5-omni-plus效果接近”仅针对语音识别任务,并非整体模型能力对标。具体评测成绩如下:

  • 与同尺寸的Qwen3.5-omni-flash(35B-A3B)相比,Spark-Audio-1.0-Preview在多语言、多方言语音识别的平均效果上占优;
  • 在Fleurs、Kespeech、LibriSpeech等中英文、多语言、多方言语音识别公开评测中,得分高于Gemini-3.1 Pro,其中Fleurs中文测试集取得SOTA(当前最优成绩);
  • 在高噪声、小声说等偏真实应用的复杂场景下,该模型的识别表现有明显领先优势。

当前版本已开放体验,API即将上线讯飞开放平台

目前Spark-Audio-1.0-Preview已正式开放体验入口,API尚未正式上线,后续将登陆讯飞开放平台面向开发者提供服务。官方同时坦言,当前版本在通用知识、数学与代码等任务上没有出现明显降智,但在指令遵循、对话、音频理解等任务上仍有进步追赶空间,下一步将在巩固优势的同时补齐短板,持续优化模型表现。