语音大模型也打起了“同日亮剑”——字节拼场景可用率,阿里拼自然度与响应速度。
7月25日,字节跳动Seed团队与阿里通义千问团队同日发布语音大模型。字节Seed Audio 1.0主打多场景可用率90%以上,覆盖客服、播客、有声书、智能助手、视频配音等五大场景,高于行业平均约65%的水平;支持40种语言、20种情感风格、5种方言,单次合成最长可达60分钟。阿里Qwen-Audio-3.0-TTS基于Qwen3.7基座,首包响应时间约300ms,国际榜单自然度MOS达4.72分,刷新历史记录,并在情感表现力、多语种等指标取得领先。
同日发布折射出中国厂商在多模态赛道的密集布局:文本、图像、视频、音频、3D齐头并进,与海外部分头部更偏“单点突破”的路径形成对照。语音模型成熟后,直接受益的是AI助手、智能客服、有声内容、车载与智能家居——“可用率90%”意味着部分人工客服与内容生产,已具备被规模替代的条件。