字节阿里|Seed Audio 1.0与Qwen-Audio-3.0-TTS语音大模型同日亮剑

PromptTree|阅读 0
2026/07/25 15:09
Seed AudioQwen-AudioTTS字节跳动通义千问
7月25日,字节Seed Audio 1.0与阿里Qwen-Audio-3.0-TTS同日发布。Seed Audio在客服、播客等五大场景可用率超过90%;Qwen-Audio-3.0-TTS首包响应约300毫秒,自然度MOS达4.72分。

语音模型在同一天打了个照面。字节强调场景里能不能用,阿里强调听起来像不像人、开口快不快。

7月25日,字节跳动Seed团队发布Seed Audio 1.0,阿里通义千问团队发布Qwen-Audio-3.0-TTS。TTS是把文字转成语音。两家都不是第一次做声音,但同一天发布,把中国厂商在音频模态上的节奏摊开了。

Seed Audio 1.0主打多场景可用率超过90%,覆盖客服、播客、有声书、智能助手和视频配音。这个水平和行业平均约65%被放在一起对比。它支持40种语言、20种情感风格、5种方言,单次合成最长60分钟。可用率超过90%,指的是这些场景里达到可用标准的比例,不是实验室里的单一听感分数。

Qwen-Audio-3.0-TTS基于Qwen3.7基座。首包响应时间约300毫秒,也就是用户发出请求后,大约三分之一秒开始听到声音。国际榜单上的自然度MOS达到4.72分,被写成刷新纪录,并在情感表现力和多语种上取得领先。MOS是平均意见分,由人给声音的自然程度打分,满分通常是5分。4.72已经很靠近满分,仍是听感评分,不是业务转化率。

同日发布,折射的是文本、图像、视频、音频、三维一起铺的做法。和海外部分头部公司更偏单点突破相比,中国厂商在多模态上的发布更密。语音模型一旦在客服和有声内容里可用,直接碰到的是人工客服和内容生产的成本。可用率超过90%,被用来说明部分人工环节已经具备被规模替代的条件,是否替代仍取决于出错时谁负责。

下一观察点是两套指标会不会被客户放在同一张采购表上:一边是五大场景的可用率,一边是300毫秒和4.72分。只赢其中一张表,不一定赢合同。

Seed Audio的覆盖面是40种语言、20种情感风格、5种方言,单次最长60分钟。可用率超过90%,对照的是行业平均约65%,比的是客服、播客、有声书、助手和视频配音能不能交付。阿里这边的300毫秒和MOS 4.72分,比的是开口速度和听感。4.72分靠近满分5分,仍是人的主观评分,不是业务转化率。

两套指标会进同一张采购表,但权重不同。车载和智能家居更在意首包延迟,内容生产更在意能不能一次合成很长。同日发布把选择压进同一周。谁先被写成默认语音,谁就更可能把「部分人工可被替代」从判断变成合同条款。