阿里|发布Qwen3.8-Max:2.4万亿参数旗舰,下周开源权重

PromptTree|阅读 0
2026/08/04 08:34
阿里Qwen3.8-MaxMoEAgent开源
8月3日阿里正式发布Qwen3.8-Max,总参数约2.4万亿、激活约950亿,支持约100万tokens上下文;API已上线阿里云百炼,权重计划下周发布并另有Qwen3.8-27B;公开基准含OSWorld-Verified约86.1、PaperBench约93.0,API定价约2/6美元每百万tokens。

阿里把「旗舰」从闭源API又往开源权重推进了一格——这次不只是又一张参数海报,而是把长程编程与办公Agent能力押进同一底座。

阿里通义千问(Qwen)是其大模型产品线,面向开发者与企业提供API、云上调用与开源权重,近年在开源社区下载量与第三方调用榜上持续居前。Qwen3.8-Max定位为千问系列迄今尺寸最大、能力最强的旗舰,官方称总参数约2.4万亿、激活约950亿,支持约100万tokens上下文,并具备原生视觉等多模态理解能力。所谓MoE(混合专家),白话就是总参数很大、每次只激活一部分专家干活:容量用来装知识,激活参数决定单次算力账单——这也是厂商敢把参数量推到「万亿级」同时仍谈推理成本的关键机制。

8月3日,阿里正式发布Qwen3.8-Max。官方披露,模型基于稀疏MoE与混合注意力机制,在维持大规模参数容量的同时压低推理成本与延迟;API已上线阿里云百炼(Model Studio)等通道,全球开发者可调用。公司同步宣布,模型权重计划于下周发布,并另有轻量档Qwen3.8-27B一并开源安排——这将是千问首次把Max级旗舰权重推向可自托管部署的关键节点。公开信息还称,模型可在千问办公等产品入口体验,形成「旗舰模型—职场Agent—云API」同日对齐的产品包。

可核验的规格与公开口径:

  1. 架构:稀疏MoE + 混合注意力;总参约2.4T,激活约95B;上下文约1M tokens;原生多模态/视觉理解。
  2. 分发:阿里云百炼等API已可用;权重计划下周放出,另有Qwen3.8-27B;许可证条款尚未完全摊开。
  3. 公开基准(公司及第三方报道援引):OSWorld-Verified约86.1;PaperBench约93.0;Terminal Bench 2.1约86.6;Arena文本榜约第五、视觉榜约第二。
  4. 定价:API公开口径约每百万输入tokens 2美元、输出6美元。
  5. 能力叙事:强调长程自主编程、科研复现、电脑操作与多模态反馈闭环;公司侧称内部测试中曾自主推进十余日级软件工程项目。

所谓Agent(智能体),不是只会一问一答的聊天机器人,而是能调工具、改仓库、操作桌面、把多步任务串起来执行的系统。OSWorld一类评测盯的正是「能不能在真实操作系统里点来点去把活干完」,而不只是答对选择题。PaperBench则偏科研复现与长程代码工程——这两类分数一起出现,说明阿里在对外叙事上把「会聊天」让位给了「能收尾」。

需要把边界读清楚。长程自主编程、十余日工程闭环等演示多为公司侧公布,仍待更广独立复现;开源许可证条款亦尚未完全摊开——权重「会放出」与「能否宽松商用、二次分发」不是同一件事。对标表上的海外闭源旗舰名称与分数会随版本快速变动,采购与选型应以可复现任务集与真实工作流回归为准,而不是把单次榜单截图当成合同附件。

把时间线放进行业节奏里看,过去一年竞争从「参数谁更大」转向「谁能在Agent工作流里少翻车、谁的推理账单扛得住」。月之暗面等对手已把超大参数开源权重推到台前;DeepSeek继续用高性价比Agent档抢开发者默认调用;腾讯混元等则把开源与产品嵌入并行。阿里选择在同日放出旗舰规格、云API、下周开源承诺与办公Agent入口,等于同时打「峰值能力」「可下载」与「可进企业门户」三张牌。对价格敏感的长程Agent场景,每百万tokens差几美元,乘上百万级token消耗后会变成真实预算线。

对开发者,眼前可先在云API与产品入口验证行为分布:接口名新上线,不代表输出习惯与旧版一致,回归测试仍要做。对企业采购与私有化团队,下一观察点是下周权重与许可证落地后,私有化部署、二次微调与合规审计能否真正打通——旗舰开源若兑现,行业比拼会从「谁分数更高」进一步转向「谁能在真实工作流里被下下来、跑得起、改得动」。