纯文本榜单之外,阿里正用更密集的多模态发布改写「只会聊天」的外部印象。对云厂商而言,多模态不是海报上的能力清单,而是会议纪要、车载助手、广告素材、电商内容等可计费场景的入口——模型发得越密,与收入表的耦合就越紧。
阿里巴巴集团旗下的通义千问(Qwen)系列,覆盖大语言、多模态与开源权重路线;阿里云则把算力、模型API与行业方案打包成商业化产品。所谓多模态迭代,白话是不止让模型能对话,还要能听、能看、能生成图音视频,并尽量在同一套云账单里交付;所谓ARR,白话是年度经常性收入,用来衡量订阅型AI产品的可持续规模,而不是单次项目收入。
公开材料显示,过去约一个月,团队在语音、图像、视频、音乐与世界模型等方向连续迭代。大语言侧,8月发布的Qwen3.8-Max总参约2.4万亿,公开报道称在Artificial Analysis Agentic榜单曾登顶全球第一;Qwen3.8-27B开源后下载量迅速破百万。多模态侧,7—8月连续推出Qwen-Image-3.0、Qwen-Audio 3.0系列、Wan 3.0(单次生成时长约30秒并支持文档输入)、HappyShrimp端到端音乐模型,以及可互动数字世界模型HappyOyster 1.0等。
财报与商业化侧可核对口径:
产业坐标上,多模态不再只是「能力补齐」。公开报道称,Pinterest的AI购物助手采用Qwen,其CEO在财报会上称开源模型成本不到部分闭源对手的约八分之一——若属实,说明多模态与开源正在改写部分内容平台的模型采购账。对观察者,要把模型发布频率与ARR突破放在同一张表里看,而不是只看单一语言模型海报。
可以把它想成:以前卖云像卖发电机,客户问「瓦数够不够」;现在更像卖「能直接进产线的多模态工位」——榜单第一可以换注意力,按秒计费、按客户留存才算生意。
需要把边界读清楚。财报与ARR为集团披露,不等于每个多模态SKU已规模化盈利。下一观察点是Wan、Audio等在垂直行业的SLA与出海合规——能上榜是信号,能在客户产线里按秒计费才是验收。