阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一

近日,阶跃星辰正式推出StepAudio 3系列语音大模型,包含TTS(文本转语音)、Gen(音频生成)、Music(音乐生成)三大核心模块,打破了传统语音技术仅能完成基础发声、单环节生成的局限,为行业提供了一站式语音技术解决方案。

阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一

StepAudio 3 TTS实现真人级实时语音交互突破

传统TTS模型仅能完成文字到语音的准确转换,难以还原真实交流中的表达细节。StepAudio 3 TTS作为面向实时交互场景的真人级语音生成模型,在音色基底、语调层次、节奏律动、气口停顿等维度高度贴合人类自然口语模式,不仅能够生成对应文字的语音,还可还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现,让合成语音接近真人说话效果。同时模型可结合语义内容理解表达意图,自主调整情绪与语气变化,基于流式生成架构实现生成与播放同步进行,可满足实时语音交互需求。性能层面,该模型中文字符错误率(CER)仅为1.7%,并列全球第一,对话质量评分StepEval-Audio-360达4.11分,超过同类主流模型。

StepAudio 3 Gen打通全链路音频内容生产闭环

传统音频内容生产链路冗长,角色配音、环境音、音效、背景音乐需要分别制作,再经过剪辑、对齐、混音才能形成最终作品,成本高、周期长。StepAudio 3 Gen尝试将分散的生产环节统一到一个模型中,支持基于自然语言描述和参考音频,一次性生成人声、音效、环境音和背景音乐,用户仅需描述角色、场景和剧情,无需针对特定角色或场景进行额外训练,即可直接生成具有完整声音层次的音频内容。更重要的是,模型支持对多个角色的音色、说话方式、语气、情绪、方言口音,以及笑声、喘息、停顿等副语言特征进行精细控制,也可进一步指定对白、音效、环境声和背景音乐出现的时间与顺序,不仅承担声音生成功能,还可参与整段内容的声音设计与时序编排,有望将影视、动画、游戏、广播剧、有声书、短视频领域的声音制作流程压缩到一次生成和持续迭代中。

StepAudio 3 Music推动AI音乐生成进入创作辅助阶段

当前多数音乐生成模型仅能完成“一句话生成一首歌”的简单功能,难以适配专业创作场景中基于已有片段完善作品的需求。StepAudio 3 Music不仅支持从零生成音乐,还支持基于ABC记谱法控制的多轮交互创作,覆盖歌曲创作、清唱配乐、歌曲翻唱等多种功能,用户可提供歌词、清唱、参考歌曲、ABC记谱法等多种输入,让模型围绕已有创作片段继续生成和完善作品,真正成为音乐创作者的辅助工具,而非简单的“抽卡式”生成工具。

StepAudio 3系列开源落地加速多行业场景渗透

阶跃星辰持续推动语音技术开源与多场景落地,此前开源的Step-Audio-R1.1曾登顶全球权威语音模型榜,本次StepAudio 3系列进一步拓展了能力边界。配套推出的StepAudio 2.5 ASR自动语音识别模型,基于4B参数与Multi-Token Prediction(MTP)架构,推理速度较传统模型提升400%,定价较上代骤减90%,5分钟音频可在1秒内完成转写,中文CER低至1.31%,远低于Whisper Large-v3的2.19%。目前Step系列大模型已落地多个行业场景:

  • 与吉利汽车集团联合研发的Step AOS将应用于智能汽车;
  • KTC推出的内置阶跃Step大模型的“闺蜜机”A25Q5已正式展出;