↑

Suno|上线Speech公测,语音与配乐同轨生成

PromptTree|阅读 0
2026/10/04 06:30
SunoSpeechAI语音AI音乐音频生成
AI音乐平台Suno推出Speech公测,可在一次生成中同时产出口播语音与原创背景音乐,也可关闭配乐只要干净人声;支持简单描述或自定义脚本,时长约最长八分钟,已登陆网页与移动端。

Suno先让人「会唱歌」,现在让同一条轨道「会说话」。音频模型的产品边界继续外扩,从歌曲走向口播与有声叙事。

据Suno官方博客与The Verge报道,Speech于2026年10月1日进入公开公测,覆盖Web、iOS与Android。产品叙事是:首个把语音与配乐作为连贯音轨共同生成的音频模型。用户可在Create中选择Speech:Simple模式用自然语言描述场景(例如海盗船长动员船员),Advanced模式粘贴完整脚本,并调节音色性别、说话风格与多样性;最长约八分钟。配乐可一键关闭,只保留口播。

首席产品官Jack Brody称,音乐仍是公司核心,但表达形式要覆盖更多人类表达;并坦承公测期口音漂移、停顿夸张等问题仍在——「Beta真的就是Beta」。相较「先TTS再找BGM再混音」的传统流程,同轨生成缩短了有声书草稿、励志口播、助眠故事与短视频旁白的试错周期。

对创作者与平台,观察点有三:长脚本发音稳定性、人声与配乐响度平衡,以及版权与人格权边界——尤其在「AI声优」相关司法讨论升温的背景下。把旁白与配乐捏在一次推理里,能加速草稿,也可能让风格匹配与响度控制变成新的调参战场。

Suno另有基于用户录音的Voices能力,与Speech定位不同,且对未成年人使用有额外限制。公测阶段更适合当作创作草稿工具,而不是直接替代专业配音流水线。事实以Suno公告为准。