智谱|GLM-5.3 Flash正式认领「牛来」:5系首个原生多模态并开源

PromptTree|阅读 0
2026/08/27 19:11
智谱GLM-5.3 Flash多模态开源模型
8月26日前后,智谱正式认领匿名代号Ox Alpha并发布即开源GLM-5.3 Flash,为GLM-5系列首个原生多模态版本。模型约320B总参、18B激活,匿名测试流量由国产加速芯片承接;强调Visual Coding与约1M上下文。权重与API已上线Hugging Face、BigModel与Z.ai。

匿名榜上的「牛来」终于亮明身份——智谱把GLM-5.3 Flash端了出来,还顺手开源。对开发者而言,这不只是又一款多模态模型,而是把「前沿能力能不能跑在国产算力上、价格能不能打到日常消耗」这两道题,摆到了同一张验收表里。

智谱(Z.ai)是国内大模型与AI应用公司,GLM系列覆盖文本、代码、视觉与Agent等方向。8月26日前后,公司正式认领此前在OpenRouter、OpenCode等平台以匿名代号「Ox Alpha」流传的模型,并发布即开源GLM-5.3 Flash——GLM-5系列首个原生多模态版本。公开材料称,匿名测试期间该模型曾刷新OpenRouter单日tokens用量纪录,并在OpenCode终结DeepSeek连续约56天霸榜;测试流量均由国产加速芯片承接,而非依赖进口GPU集群。

架构与性能可核对要点:

  1. 规模:总参数约320B、激活约18B;层数由GLM-4.5时期约92层压缩至45层,公开对比称能力全面超越体量更大的GLM-5.2(约753B)。
  2. 注意力:线性注意力与稀疏注意力混合架构,引入IndexPool把索引器缓存向量从4个压至1个;相较GLM-5.3,注意力计算量约降3.01倍,KV Cache约缩小4.44倍。
  3. 评测与定价:Artificial Analysis(AA)榜单得分约57,与Claude Opus 4.8持平;定价约为后者的1/40,约为GLM-5.3的1/10,限时折扣口径更低。
  4. 多模态能力:Visual Coding流水线——生成网页、3D场景与长视频任务中可基于视觉反馈迭代修改;支持约1M上下文、多说话人视频字幕、电影解说等长程任务。
  5. 开放入口:Hugging Face(zai-org/GLM-5.3-Flash)、BigModel开放平台、Z.ai文档与GLM Coding Plan。

训练与Serving路径:

  1. 数据:约30T Token多模态预训练语料。
  2. Visual Coding:专门数据合成流水线,让模型在执行中「看见」最终页面与场景并据此修改,而非只靠文本自我纠错。
  3. 国产部署:Encode-Prefill-Decode分离式架构,多模态编码、提示预填充与逐Token解码可独立调度扩缩;公开材料称相较同硬件初始基线,端到端服务性能约提升3倍,单Token成本与主流英伟达GPU相当。

所谓原生多模态,白话是「看懂、生成、改图、写代码」在同一套模型里完成,而不是先调用一个识图模型再调用一个生图模型手工拼接。所谓KV Cache,白话是模型生成每个新token时都要回头看前面所有内容的「备忘录」——上下文越长备忘录越大;IndexPool与线性注意力是在「备忘录」体积与计算量上动刀。

「牛来」爆火期间,海外开发者用同一套Prompt手搓SpaceX Raptor 3D交互网页,对比显示正式版在细节与稳定性上更进一步;官方亦展示多人对话视频自动分说话人配字幕、整部电影解说剪辑等长任务。产业含义是:匿名测试把榜分与真实调用量先验出来,正式认领再把权重、API与国产算力叙事一并放出,降低「只会跑分不会交付」的质疑。

产业观察上,320B总参、18B激活配合国产芯片Serving,是在回答「前沿多模态是否必须绑死进口GPU」——若长任务Visual Coding能在生产环境稳定,部分Agent工作流可不再把敏感素材送上云端。可以把它想成:模型厂商从卖「智商」转向卖「智商×每Token成本×数据不出境」的组合拳。对采购方,应抽检同一角色跨镜头一致性、失败重试成本与国产集群SLA,而不是只看AA分数与限时折扣价。

需要把边界读清楚。与闭源头部的对比多来自厂商自述与选定基准;1M上下文与12小时级自主任务在真实工单中的成功率仍待第三方复现。下一观察点是企业私有化部署案例、视觉编辑在广告与电商工作流中的返工率。