基于全国产化算力训练,讯飞星火语音基座大模型 Spark-Audio-1.0-Preview 上线

过去业界处理音频大多采用级联方案,先通过语音转写将语音转为文字,再交由大模型理解内容,这套方案存在明显短板:一方面文字仅能记录语音的表层内容,会丢失语气、情绪、背景环境音等关键信息,导致模型对场景的判断不完整;另一方面语音转写、声纹识别、语音翻译等能力被拆分为独立模块串联运行,模块间存在断点,不仅容易累积错误,还会出现延迟、卡顿等问题,影响使用体验。

基于全国产化算力训练,讯飞星火语音基座大模型 Spark-Audio-1.0-Preview 上线

讯飞星火语音基座大模型Spark-Audio-1.0-Preview正式上线

此次发布的Spark-Audio-1.0-Preview彻底解决了上述痛点,不再局限于“语音转文字”的单一能力,而是可以直接理解语音内容,一次性识别人声、环境音、音乐等各类音频信号,还能解析声音中携带的语义、情绪与场景信息,推动机器从“听清”走向“听懂”。
该模型采用0.65B(Dense结构)音频编码器搭配30B-A3B(MoE结构)大语言模型的架构,训练过程中使用了1300万小时音频数据及大量文本数据,完全基于纯国产算力集群完成训练,是地道的国产语音基座大模型。在各项语音评测任务上效果整体相当、部分超过,尤其在复杂场景高噪声、小声说等偏真实应用类任务上明显领先,与尺寸更大的闭源语音基座模型相比,Spark-Audio-1.0-Preview的表现也十分接近。
模型支持文本、语音双模态输入,可覆盖多项语音相关任务,包括:

  • 语音转写、多语言翻译、多方言识别
  • 环境音识别、说话人识别
  • 情感分析、复杂音频问答

复杂场景多语种识别能力获多项评测领先

Spark-Audio-1.0-Preview可支持99种语言及202种方言的识别,在多语言、多方言语音识别任务上表现出色:与同尺寸的Qwen3.5-omni-flash(35B-A3B)相比,平均效果具备明显优势;与尺寸高一个数量级的Qwen3.5-omni-plus效果接近。
在Fleurs、Kespeech、LibriSpeech等中英文、多语言、多方言语音识别公开评测中,Spark-Audio-1.0-Preview得分高于Gemini-3.1 Pro,其中在Fleurs-中文测试集上取得了SOTA(state-of-the-art)成绩。面向真实应用场景,该模型在高噪声、小音量等复杂条件下的语音识别评测中也有较为明显的领先优势。

模型支持微调适配多元落地场景

与讯飞星火大模型的1+N体系逻辑一致,Spark-Audio-1.0-Preview也支持开发者基于基座模型进行微调,可快速开发出语音识别、语音同传、语音交互等专用模型或系统,目前已可在相关语音业务中落地应用。
目前Spark-Audio-1.0-Preview已正式开放体验,对应API后续将上线讯飞开放平台,为开发者提供更灵活的语音能力接入选择。

业界首个全国产算力训练语音基座大模型落地

讯飞官方表示,Spark-Audio-1.0-Preview是业界首个基于全国产算力训练的语音基座大模型,其训练过程先通过音频编码器预训练逐步扩展音频编码器的表征能力,再通过预训练和后训练提升模型基础能力、