阶跃星辰|发布StepAudio 3系列五款语音大模型

PromptTree|阅读 0
2026/09/16 07:49
阶跃星辰StepAudio 3语音大模型开放平台
9月15日阶跃星辰发布StepAudio 3系列五款模型(Realtime、ASR、TTS、Gen、Music)并上线开放平台。公开称Realtime在Artificial Analysis多项榜单居全球第一档,ASR非流式词错误率约1.7%。

语音大模型若只卷「识别准」或「音色像」,很难支撑实时对话、任务执行与音频创作同一条产品线。9月15日,阶跃星辰发布新一代语音大模型StepAudio 3系列,一次性推出Realtime、ASR、TTS、Gen与Music五款,并称均已上线阶跃星辰开放平台。公开叙事把能力从单项听写/合成,延伸到实时交互、语音推理、完整音频生成与音乐创作——让AI不仅能「听」和「说」,也能理解声音背后的语义与情绪,并参与更完整的交互与内容生产。

阶跃星辰是国内主要大模型公司之一,音频与多模态是其长期产品线。此轮发布的意义,不在再堆一个旗舰对话音色,而在把「听、说、想、做、创作」写成可分别调用、又可组合的模型矩阵。对开发者,这意味着可以按场景选Realtime做通话、选ASR做转写、选TTS做人声、选Gen/Music做内容生产,而不是强迫一个万能模型包打天下。

矩阵与评测要点(公司/评测公开口径):

  1. Realtime:实时语音交互;Artificial Analysis Conversational Dynamics综合得分约98.9%;Speech Reasoning准确率约99.7%(公开称全球第一档)
  2. ASR:语音识别;非流式词错误率(WER)约1.7%(公开称并列全球第一档)
  3. TTS:真人级语音生成
  4. Gen:完整音频生成
  5. Music:歌词成歌、纯音乐、干声智能配乐等路径;支持歌词、干声、哼唱、参考音频等输入
  6. 开放:五款均已上线阶跃星辰开放平台

所谓词错误率,白话是「听错了多少字」的比例,越低通常越好。所谓语音推理,白话是不只转写成文字,还能根据语音内容做判断与回答。Music路径则把创作从「生成一段旋律」推进到「在已有素材上继续写」——对短视频与音乐工具链更实用。

放在近窗语音Agent与内容生产上下文里,实时性、推理准确率与创作可控性开始被放在同一张评测表上。竞品若只有单一TTS样音、给不出Realtime与ASR同协议对照,产品完整度会显得单薄;若阶跃长期只有榜单、缺少延迟与稳定性公开SLA,开发者仍会观望。

产业影响上,矩阵式上架有利于开放平台拉新与场景渗透;真正考验仍是商用版权、可控编辑与高峰并发。需要把边界读清楚:榜单为特定协议与时间点结果;价格、限流与可用性以官方文档为准。下一观察点是开发者实际接入延迟与稳定性,以及Music/Gen在商用版权场景下的合规与可控编辑能力。