阿里把「旗舰」从闭源API又往开源权重推进了一格——这次不只是又一张参数海报,而是把长程编程与办公Agent能力押进同一底座。
阿里通义千问(Qwen)是其大模型产品线,面向开发者与企业提供API、云上调用与开源权重,近年在开源社区下载量与第三方调用榜上持续居前。Qwen3.8-Max定位为千问系列迄今尺寸最大、能力最强的旗舰,官方称总参数约2.4万亿、激活约950亿,支持约100万tokens上下文,并具备原生视觉等多模态理解能力。所谓MoE(混合专家),白话就是总参数很大、每次只激活一部分专家干活:容量用来装知识,激活参数决定单次算力账单——这也是厂商敢把参数量推到「万亿级」同时仍谈推理成本的关键机制。
8月3日,阿里正式发布Qwen3.8-Max。官方披露,模型基于稀疏MoE与混合注意力机制,在维持大规模参数容量的同时压低推理成本与延迟;API已上线阿里云百炼(Model Studio)等通道,全球开发者可调用。公司同步宣布,模型权重计划于下周发布,并另有轻量档Qwen3.8-27B一并开源安排——这将是千问首次把Max级旗舰权重推向可自托管部署的关键节点。公开信息还称,模型可在千问办公等产品入口体验,形成「旗舰模型—职场Agent—云API」同日对齐的产品包。
可核验的规格与公开口径:
所谓Agent(智能体),不是只会一问一答的聊天机器人,而是能调工具、改仓库、操作桌面、把多步任务串起来执行的系统。OSWorld一类评测盯的正是「能不能在真实操作系统里点来点去把活干完」,而不只是答对选择题。PaperBench则偏科研复现与长程代码工程——这两类分数一起出现,说明阿里在对外叙事上把「会聊天」让位给了「能收尾」。
需要把边界读清楚。长程自主编程、十余日工程闭环等演示多为公司侧公布,仍待更广独立复现;开源许可证条款亦尚未完全摊开——权重「会放出」与「能否宽松商用、二次分发」不是同一件事。对标表上的海外闭源旗舰名称与分数会随版本快速变动,采购与选型应以可复现任务集与真实工作流回归为准,而不是把单次榜单截图当成合同附件。
把时间线放进行业节奏里看,过去一年竞争从「参数谁更大」转向「谁能在Agent工作流里少翻车、谁的推理账单扛得住」。月之暗面等对手已把超大参数开源权重推到台前;DeepSeek继续用高性价比Agent档抢开发者默认调用;腾讯混元等则把开源与产品嵌入并行。阿里选择在同日放出旗舰规格、云API、下周开源承诺与办公Agent入口,等于同时打「峰值能力」「可下载」与「可进企业门户」三张牌。对价格敏感的长程Agent场景,每百万tokens差几美元,乘上百万级token消耗后会变成真实预算线。
对开发者,眼前可先在云API与产品入口验证行为分布:接口名新上线,不代表输出习惯与旧版一致,回归测试仍要做。对企业采购与私有化团队,下一观察点是下周权重与许可证落地后,私有化部署、二次微调与合规审计能否真正打通——旗舰开源若兑现,行业比拼会从「谁分数更高」进一步转向「谁能在真实工作流里被下下来、跑得起、改得动」。