语音正在从「转写工具」收成「听、说、创」一体入口——阿里把语音模型能力收进了一个可下载的平台产品。
阿里巴巴长期投入语音识别、合成与多模态理解。Qwen-Audio是其自研语音模型;CosyVoice Studio则是把模型能力第一次以聚合产品形态对外开放的一站式平台:企业可先在界面体验再调API,个人也可直接下载使用。平台方称该模型在Artificial Analysis评测中于语音识别(ASR)、实时交互(RealTime)与语音合成(TTS)赛道位居前列——评测名次属第三方榜单口径,实际效果仍应以业务场景验收为准。
8月7日,CosyVoice Studio正式推出,产品侧拆成三条主线。
三条产品线可这样读:
所谓ASR/TTS,白话就是「听写成字」和「字读成声」;实时交互则要求边听边说、低延迟。CosyVoice Studio的野心是把这三件事和「整理成可用文档」「搭成可打电话的Agent」绑在同一工作台,而不是让用户在五六个工具间来回导出。
即日起可在iOS、Android、Mac与Windows应用商店搜索「CosyVoice」下载,平台称不限量免费使用;CosyAgent与CosyCreative目前以白名单邀请制面向企业测试,计划近期全面开放,详情见CosyVoice Studio官网。
对产业观察者,这条信息的价值在于「模型能力产品化」:语音不再只卖API计费点,而是以键盘、纪要、创作与Agent搭建组成完整工作台。下一观察点是企业白名单何时转全量,以及声纹分离、长录音转写在嘈杂会议室里的稳定性——免费下载换来的是习惯,还是只换来一波试用截图,要看企业功能开放之后的留存与误识别投诉。