匿名榜上的「牛来」终于亮明身份——智谱把GLM-5.3 Flash端了出来,还顺手开源。对开发者而言,这不只是又一款多模态模型,而是把「前沿能力能不能跑在国产算力上、价格能不能打到日常消耗」这两道题,摆到了同一张验收表里。
智谱(Z.ai)是国内大模型与AI应用公司,GLM系列覆盖文本、代码、视觉与Agent等方向。8月26日前后,公司正式认领此前在OpenRouter、OpenCode等平台以匿名代号「Ox Alpha」流传的模型,并发布即开源GLM-5.3 Flash——GLM-5系列首个原生多模态版本。公开材料称,匿名测试期间该模型曾刷新OpenRouter单日tokens用量纪录,并在OpenCode终结DeepSeek连续约56天霸榜;测试流量均由国产加速芯片承接,而非依赖进口GPU集群。
架构与性能可核对要点:
训练与Serving路径:
所谓原生多模态,白话是「看懂、生成、改图、写代码」在同一套模型里完成,而不是先调用一个识图模型再调用一个生图模型手工拼接。所谓KV Cache,白话是模型生成每个新token时都要回头看前面所有内容的「备忘录」——上下文越长备忘录越大;IndexPool与线性注意力是在「备忘录」体积与计算量上动刀。
「牛来」爆火期间,海外开发者用同一套Prompt手搓SpaceX Raptor 3D交互网页,对比显示正式版在细节与稳定性上更进一步;官方亦展示多人对话视频自动分说话人配字幕、整部电影解说剪辑等长任务。产业含义是:匿名测试把榜分与真实调用量先验出来,正式认领再把权重、API与国产算力叙事一并放出,降低「只会跑分不会交付」的质疑。
产业观察上,320B总参、18B激活配合国产芯片Serving,是在回答「前沿多模态是否必须绑死进口GPU」——若长任务Visual Coding能在生产环境稳定,部分Agent工作流可不再把敏感素材送上云端。可以把它想成:模型厂商从卖「智商」转向卖「智商×每Token成本×数据不出境」的组合拳。对采购方,应抽检同一角色跨镜头一致性、失败重试成本与国产集群SLA,而不是只看AA分数与限时折扣价。
需要把边界读清楚。与闭源头部的对比多来自厂商自述与选定基准;1M上下文与12小时级自主任务在真实工单中的成功率仍待第三方复现。下一观察点是企业私有化部署案例、视觉编辑在广告与电商工作流中的返工率。