开源模型赛道里,参数海报越来越不够看——真正决定能不能进生产的,往往是「激活多少、上下文多长、Agent工作流能不能闭环」。蚂蚁把新一代高效语言模型系列定名为Ling-3.0,并把权重与推理配方放到了可下载的公开渠道。
蚂蚁集团旗下百灵(inclusionAI)长期做大模型与智能体相关能力,对外以开源权重、部署配方与评测叙事同时发力。所谓稀疏MoE,白话是把「会很多本事的大模型」拆成许多专家子网络,每次只叫醒其中一小撮干活;所谓激活参数,白话是推理时真正点亮的计算量——总参决定「装得下多少知识」,激活参更接近「每次回答烧多少算力」。
Hugging Face、ModelScope等渠道显示,旗舰路线Ling-3.0-flash采用混合线性注意力加稀疏MoE:总参数约124B(仓库元数据亦写作约127B量级),每个token仅激活约5.1B参数。公开材料称,相对此前约万亿参数量级旗舰Ring-2.6-1T,flash在总参与激活参上分别只占约百分之十二点四与约百分之八点一量级,但在多项关键评测上可对标或超过前代。
架构与规格上可核对的要点:
Agent侧叙事同样写进模型卡:团队称模型面向编码、通用与深度研究等闭环任务,引入逾一万个交互式训练环境;并原生整合SGLang HiCache与Mooncake分层缓存,公开口径称长输入场景下首token时延可下降约百分之六十至百分之八十。可以把它想成:以前长对话像每次重读整本笔记,分层缓存则尽量只翻「还没看过的那几页」。
部署侧给出可复现路径:SGLang预构建镜像、vLLM分支示例,推荐采样温度约0.6、top_p约0.95、top_k约20;同时提供BF16/FP8/INT4等量化路径。更轻量的Ling-3.0-tiny总参约7.9B、激活约1.4B,公开材料称可在消费级本机与边缘设备上跑推理与部分Agent负载,与flash共享训练配方叙事,方便「先在小模型上试,再放大到flash」。
把这条放进国产开源坐标:一边是「更大总参」换榜单,一边是「更低激活」换账单。Ling-3.0的公开增量,是把稀疏MoE、长上下文与Agent工作流写成同一张可下载的模型卡,而不是只发一段评测截图。对开发者,价值是可私有化、可量化、可换推理引擎;对企业采购,则提示「开源」之后仍要验收长上下文稳定性、工具调用失败恢复与许可证合规。
需要把边界读清楚。厂商自报评测不等于第三方盲测全胜;长上下文与缓存收益仍须按真实业务复测。下一观察点是社区二次量化与企业私有化部署的稳定性,以及tiny与flash之间能否形成可迁移的训练配方——能开源是入场券,能在真实Agent外壳里稳定跑通才是验收。