智谱|发布GLM-5.3:后训练拉升编程与长程任务上限

PromptTree|阅读 0
2026/08/14 07:18
智谱GLM-5.3后训练Coding Agent开源
8月14日智谱正式发布GLM-5.3:基座相对GLM-5.2未换代,靠后训练抬升长程任务上限;公司称Terminal Bench 3.0、Agents' Last Exam(CLI)等基准开源第一,CyberGym约84.5%;API随后上线,并计划开放完整权重。

基座参数表不再是唯一海报——智谱把本轮叙事压在「后训练能不能把复杂任务跑完」。

智谱(Z.ai)是国内头部大模型公司之一,产品线覆盖通用对话、编程智能体与开放权重生态,面向开发者与企业同时提供API与可部署权重。赛道对手并不抽象:海外有Anthropic、OpenAI等以闭源旗舰吃企业编程Agent;国内则在开源可复现与成本可控两条线上并行竞争。所谓后训练(post-training),白话就是预训练把「知识装进模型」之后,再用强化学习、工具交互与真实任务环境继续「练干活」——比拼的不只是参数量,而是复杂链路里能不能规划、纠错、交卷。

8月14日,公司正式发布新一代基座模型GLM-5.3。公开口径写明:相对GLM-5.2,基座本身未换代,但通过后训练Scaling抬高智能上界,具体表现为更长的长程任务环境、更丰富的环境类型,以及更长的后训练时间。这一定位把竞争从「再堆一层参数」挪到「同一底座能在真实软件工程里跑多久」。

官方技术报告与产品侧可核验口径:

  1. 编程与Agent基准:公司称在Terminal Bench 3.0、Agents' Last Exam(CLI)等公开基准上取得开源第一叙事。
  2. 安全向能力:网络安全评测CyberGym上,公司称得分约84.5%,高于GLM-5.2约77.2%。
  3. 实测流程:发布前联合安全团队开展测试,发现大量潜在漏洞线索——属厂商自测与专业工作流试验,外部复现与责任边界仍需独立核验,本文不展开攻击细节。
  4. 接入与开放:将接入ZCode、Trae、WorkBuddy、Qoder、CawPaw、OpenCode等平台;API随后上线;计划开放完整模型权重(另有口径称发布约两周后开放)。

把「网络安全」写进同一条发布,本质是把代码能力往上推一层:不仅要会改仓库,还要理解程序逻辑、协议规则与权限边界。对开发者,这意味着编程Agent从「补全几行」走向「能不能进生产」;对企业采购,则要看正式权重许可证、安全审查栈与真实仓库一次通过率,而不是单次基准海报。

行业坐标也很清楚。过去一年,开源阵营习惯用参数与综合榜抢注意力;真正卡住落地的,往往是长程任务中途工具失败后能否自检重试、以及账单会不会先于产品市场契合度爆掉。GLM-5.3选择「基座不动、后训练加码」,等于承认:下一阶段比的是任务环境与训练配方,而不只是预训练规模。

需要把边界读清楚。开源第一、漏洞发现数量等均为公司技术报告与自测口径;第三方复现协议未齐之前,不宜直接写成行业终局成绩。下一观察点是权重开放时间表、API价目,以及真实软件工程任务的一次通过率——编程不是写几行snippet,是把长链路任务交出去还能验收。