讯飞星火语音基座大模型上线:0.65B 编码器配 30B MoE,纯国产算力训练
2月28日,科大讯飞正式对外发布全新星火语音基座大模型,这是国内首款完成纯国产算力全流程训练的语音领域大模型,其采用0.65B轻量编码器搭配30B参数混合专家(MoE)架构,在性能、成本、安全三个维度均实现了突破,将推动语音技术向更广泛的场景普及。

0.65B编码器配30B MoE 星火语音模型实现轻量与性能兼得
本次星火语音基座大模型采用了“端侧轻量编码器+云端大规模MoE”的混合架构设计,核心优势可概括为三点:
- 0.65B参数的编码器体积小巧,可直接部署在手机、录音笔、翻译机等端侧设备上,无需依赖云端算力即可实现实时语音降噪、识别、转写,端侧推理延迟低至100ms以内;
- 总参数量达30B的MoE架构仅在推理时激活对应任务所需的专家模块,实际计算量仅为同参数量 dense 模型的1/10,既保证了复杂语音任务的处理精度,又大幅降低了云端推理成本;
- 模型针对中文语音场景进行了专项优化,在带口音普通话、方言、中英混合语音识别任务上的准确率较上一代星火语音模型提升20%以上,同时支持100+语种的实时转写与互译。
纯国产算力完成全流程训练 打破语音大模型技术卡脖子困境
不同于此前多数语音大模型依赖进口AI算力训练的现状,本次星火语音基座大模型的全流程训练均采用国产昇腾、海光算力集群完成。讯飞技术团队针对国产算力特性对模型训练框架、声学特征对齐、多语言语料预处理等环节进行了专项优化,解决了国产算力下语音模型训练精度不足、收敛慢等行业共性难题,整个训练过程未使用任何进口算力芯片,实现了从底层硬件到上层算法的全链路自主可控,既规避了海外算力出口限制带来的风险,也为后续政务、金融等对数据安全要求极高的场景落地提供了基础。
多场景适配落地 星火语音模型大幅降低行业应用门槛
基于优秀的性能与低成本优势,星火语音基座大模型已经适配覆盖消费端与企业端的多元场景:消费端方面,讯飞输入法、智能录音笔、翻译机等产品已经完成模型升级,用户可享受到更精准的实时转写、更自然的语音交互、更准确的方言识别功能,其中录音笔的长语音转写效率提升40%,转写准确率提升18%;企业端方面,模型已接入呼叫中心智能质检、会议纪要自动生成、教育口语测评、广电音视频内容审核等场景,相较此前 proprietary 语音模型,接入成本降低60%以上,中小厂商无需自建语音技术团队,仅需调用API即可快速接入相关能力,大幅降低了语音技术的落地门槛。
全链路自主可控 国产语音大模型筑牢数据安全防线
纯国产算力训练的另一大优势是数据安全保障能力的提升,星火语音基座大模型的所有训练、推理过程均可在国内完成,无需将语音数据上传至境外服务器,完全符合《数据安全法》《个人信息保护法》的相关要求,尤其适合政务会议转写、医疗语音病历录入、金融客服质检等对数据敏感性要求极高的场景。此外,模型的轻量化特性也支持私有化部署,企业可将模型部署在自有服务器中,进一步保障数据隐私安全。