阿里千问|Qwen3.8-Max-0902发布,CodeArena前端编程总榜夺冠

PromptTree|阅读 0
2026/09/03 08:34
阿里千问Qwen3.8-MaxCodeArenaAgent编程
9月2日阿里千问将Qwen3.8-Max升级至0902版本,围绕编程与专业办公后训练。CodeArena前端编程总榜提升22分至1691分夺冠,性价比榜综合均价约5美元/百万Tokens;模型约2.4万亿参数、约100万上下文,已接入API与千问办公、Qoder等产品。

大模型旗舰若只堆参数,却在「真能写完一个前端应用」上掉链子,企业采购仍会回到能交付的那一家。9月2日,阿里千问宣布将旗舰模型Qwen3.8-Max升级至0902版本,并把后训练火力集中到编程与专业办公两条线上——这不是换一张海报参数,而是把评测与产品入口一起往Agent工作流挪。

阿里千问是阿里巴巴面向大模型与开发者生态的核心品牌,产品矩阵覆盖基座模型、开放平台API以及千问办公、Qoder等应用。Qwen3.8-Max被定位为迄今最强旗舰语言模型之一:公开口径总参数约2.4万亿,支持约100万上下文Tokens,面向企业复杂任务、科研与长周期Agent场景。过去一年,千问系列在开源与闭源两端同时加压;0902更像一次「把旗舰钉进编程默认入口」的产品动作。

0902版本可核对要点:

  1. 训练重心:针对Coding与Cowork做进一步后训练,强调多步推理、工具调用与端到端应用生成
  2. CodeArena:前端编程总榜提升22分至1691分,位居总榜第一,并领先Claude Opus 5、Kimi K3等对照模型
  3. 性价比:CodeArena帕累托前沿口径显示,新版本每百万Tokens综合平均约5美元,低于性能位次相近、单价更高的部分竞品
  4. 其他编程基准:公开转述称TerminalBench 3.0、DeepSWE、QwenSWEbench等亦有抬升,部分项目超过Claude Opus 5;多模态分数呈小幅提升
  5. 可用性:已上线千问AI平台API,并接入千问办公、Qoder、千问App

所谓后训练加码编程与办公,白话是把模型从「会答编程题」推向「能多步调用工具、把应用真正跑起来」;所谓性价比榜,白话是在可比能力附近比谁更便宜,而不是只比绝对分数。对开发者而言,验收应落在真实仓库修复、前端交付物可运行性与长上下文稳定性,而不是单一榜单截图。

放在行业上下文里,国产旗舰与海外前沿模型的对照,正在从通用聊天滑向Agent编程与办公工作流。DeepSeek、Kimi、智谱等同行同样在压Coding与工具调用;千问此轮用「分数 + 价格 + 产品入口」打包,等于主动把讨论拉到企业采购清单能核对的维度。对竞品,这会抬高「端到端交付」的门槛;对企业客户,则要把延迟、限流、安全审计与价格曲线写进同一份验收表。

产业影响上,若0902在真实工作流中站得住,会强化「国产旗舰也能当默认编程Agent」的叙事;若榜单热度不能转成可复购API账单,市场仍会迅速回到稳定性与生态插件质量。需要把边界读清楚:榜单为第三方或厂商对照口径,会随评测集更新波动;价格以官方API公示为准。下一观察点是企业合同中的SLA与安全合规条款,以及Qoder、千问办公的真实调用转化。