蚂蚁|Ling-3.0-flash开源:124B总参激活5.1B,主打Agent与长上下文

PromptTree|阅读 0
2026/08/05 08:19
蚂蚁Ling-3.0-flashMoEAgent开源
蚂蚁集团旗下inclusionAI近日在Hugging Face、ModelScope与OpenRouter等平台放出Ling-3.0-flash,总参约124B、激活约5.1B,MIT许可;采用KDA与MLA交替架构及稀疏MoE,强调Agent闭环与长输入首Token延迟下降,面向生产环境复杂智能体工作流。

旗舰不必人人扛满血——蚂蚁把「智效比」写成可下载的MIT权重,押注的是Agent长链路里那张真实账单。

蚂蚁集团旗下inclusionAI(蚂蚁百灵相关模型线)面向开发者与企业提供大模型权重与调用通道,赛道落在高性价比推理与智能体底座。Ling-3.0-flash是其新一代原生混合推理模型:公开规格显示总参数约124B(约1240亿),单次激活约5.1B(约51亿),分别约为前代旗舰Ring-2.6-1T的约12.4%与约8.1%。所谓混合推理与稀疏MoE(混合专家),白话就是总参谋部很大,但每次只叫醒少数专家出诊——容量用来装能力,激活参数决定单次算力账单。对要在生产环境里跑长Agent的团队,这比「又一张万亿海报」更贴近机房与财务现实。

近日,该模型权重与调用入口出现在Hugging Face、ModelScope与OpenRouter等公开平台,采用MIT许可。架构侧,官方口径称从预训练起即采用约5:1交替堆叠的Kimi Delta Attention(KDA)与MLA结构,并升级细粒度对角门控与约1/64稀疏MoE;公开描述包含约35层KDA、约7层门控MLA、2个稠密层、512个路由专家与1个共享专家,每次激活8个专家。工程上则强调与SGLang HiCache、Mooncake分层缓存等组合,通过物理双池与集群共享L3缓存压低长交互中的冗余重计算,官方称长输入场景下首Token延迟(TTFT)可降约60%至80%以上。

可核验的规格与能力主张:

  1. 分发:MIT许可;Hugging Face、ModelScope、OpenRouter等通道已可见。
  2. 上下文:训练计划覆盖约8K至256K长度;默认开启思考模式。
  3. 采样默认:temperature=0.6、top_p=0.95、top_k=20。
  4. 训练侧公开口径:整合超过一万个交互式训练环境,服务编码、通用与深度研究等Agent任务合成。
  5. 基准叙事:官方提及SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AA、MCP-Atlas、SkillsBench等代码与Agent相关集合;并称在Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw等框架中可获得可用体验(具体以各框架实际接入为准)。

所谓Agent(智能体),不是只会一问一答的聊天机器人,而是能调工具、改仓库、跑检索、把多步任务串起来执行的系统。TTFT则是用户按下回车后「第一个字何时冒出来」的延迟——长上下文场景里,缓存若失效,账单和等待会一起爆炸。蚂蚁把极低激活参数、分层缓存与Agent评测叙事叠在一起,等于公开承认:2026年的竞争不止比峰值智商,还比「长任务能不能跑完、跑完还付不付得起」。

需要把边界读清楚。基准分数与框架体验多为公司侧公布,仍待更广独立复现;MIT宽松不等于私有化部署零摩擦——缓存栈、推理框架与机位适配仍要团队自己验收。对标表上的海外闭源旗舰名称会随版本快速变动,采购应以可复现任务集与真实工作流回归为准。

把时间线放进国内开源节奏:DeepSeek继续用高性价比Agent档抢默认调用;阿里把Max级旗舰推向下周开源窗口;月之暗面等则用超大开源权重卡位。蚂蚁选择另一条路——用极低激活参数换「能跑长任务、账单还扛得住」的中间档,并用宽松MIT降低二次分发与商用摩擦。对企业采购,观察点很快从参数表转向真实工作流:长会话是否真降延迟、工具调用是否稳、私有化与缓存栈是否可复现。

对开发者,MIT加多平台上架意味着可以先本地试、再按任务路由到云API。下一观察点是社区复现报告能否把官方基准翻译成可对比的生产延迟与失败率,而不是停在发布页截图——权重落地只是起点,生态是否长出可复制的部署手册,才决定Ling-3.0-flash会不会变成默认中间档。