阶跃星辰王炸发布 StepAudio 3 系列语音大模型,强势斩获多项全球第一!

今日,阶跃星辰正式对外发布StepAudio 3系列语音大模型,一次性推出五款面向不同核心场景的产品,覆盖实时语音交互、语音识别、语音生成、完整音频内容生成、音乐创作五大方向,目前五款模型已全部上线阶跃星辰开放平台。

阶跃星辰王炸发布 StepAudio 3 系列语音大模型,强势斩获多项全球第一!

阶跃星辰一口气推出五款语音大模型 补齐全场景语音能力拼图

本次发布的五款模型分别为StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music,分别对应实时语音交互、高精度语音识别、真人级语音生成、完整音频内容生成、AI音乐创作五大核心场景,形成了从语音感知到语音生成、从交互理解到创意生产的完整产品矩阵,这也是国内音频大模型领域首次以完整矩阵形态同时推出全链路语音产品。

三款核心模型登顶全球榜单 多项指标斩获Artificial Analysis第一

本次发布的StepAudio 3系列多款模型在权威第三方榜单Artificial Analysis中斩获全球第一的成绩:

  1. StepAudio 3 Realtime在Conversational Dynamics(对话动态)榜单中以98.9%的综合得分排名全球第一,同时在Speech Reasoning(语音推理)榜单中以99.7%的语音推理准确率位列全球第一。该模型支持原生全双工实时对话,可边听边理解语义、语气、情绪与环境声音,自主判断接话时机,支持用户打断,同时可异步执行工具调用与长任务,不阻塞当前语音会话。
  2. StepAudio 3 ASR在非流式语音识别准确性榜单中,词错误率(WER)仅为1.7%,并列全球第一。该模型将高精度语音识别与大语言模型的上下文理解能力结合,支持中文、英文、方言、中英混说、长音频及专业领域识别,可处理低声、快语速、含糊连读、歌声与背景音乐等复杂输入,在医疗、法律、金融、汽车、编程等专业场景下识别准确率表现突出。

全栈语音能力重构内容生产流程 覆盖创作到交互全场景

除登顶榜单的基础能力外,StepAudio 3系列其余模型也在各自垂直场景实现了体验突破:

  • StepAudio 3 TTS面向实时交互场景打造,在音色基底、语调层次、节奏律动、气口停顿等方面高度贴合人类自然口语模式,可还原笑声、迟疑、结巴、重复、改口等副语言表现,结合语义理解自主调整情绪语气,基于流式生成架构实现生成与播放同步,让AI语音从“准确发声”走向“自然表达”。
  • StepAudio 3 Gen可基于自然语言描述和参考音频,统一生成人声、音效、环境音与背景音乐,支持对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制,还可指定对白、音效、环境声和背景音乐的时间与顺序,原本需要多工具协作、多环节处理的音频内容制作流程,可被压缩到一次生成与持续迭代中,适用于影视、动画、游戏、广播剧、有声书、短视频等内容创作场景。
  • StepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作,覆盖歌曲创作、清唱配乐、歌曲翻唱等功能,用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构,模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模,在清唱配乐场景中可理解旋律、节奏与情绪,自动补充和声、乐器与完整编曲,真正进入真实音乐生产流程。

全量上线开放平台 语音AI竞争进入全栈体系化阶段

目前StepAudio 3系列五款模型已全部上线阶跃星辰开放平台,开发者可自行调用相关能力。业内分析指出,当单点语音能力逐渐拉平,决定行业竞争力的上限已变成谁能把理解、生成、交互和创作连成一套完整的体系,阶跃星辰此次推出全栈语音矩阵,也反映出行业正在从单项能力竞赛转向全栈体系化能力的竞争,语音AI的落地场景也将从简单的工具应用向更深度的行业生产环节渗透。