万亿级MoE能不能「跑得起又跑得快」,瓶颈经常不在峰值算力,而在数据搬运与kernel碎片。海内外近乎同时交出两份答卷:一边是本土超节点加超级算子,一边是TPU上的巨内核。
公开报道称,Kimi K3总参数约2.8万亿、激活约104B,刷新开源大参数量上限,但也把普通AI服务器压到极限:官方推荐大规模多卡才能装下,有业内人士称未经优化时初始性能可能仅约10 tokens/s量级。SemiAnalysis等分析指出,一次前向对HBM带宽与跨芯片All-to-All通信的压力极大;Decode阶段每生成一个Token都要持续读权重,传统推理框架频繁启动大量细粒度Kernel,中间停靠形成「空泡」,成为理论峰值与实测吞吐的鸿沟。
浪潮信息在AICC 2026发布元脑SD200 Ultra,通过紧耦合约128芯本土AI芯片单机承载K3,并公布Token生成时延约5.85毫秒等指标。技术路径上,团队把KDA、Gated MLA、MoE中大量基础算子融合成计算与通信协同的「超级算子」,称算子数量可降约一个数量级、推理性能提升数倍;进一步用「超级算子智能体」让K3参与自身推理优化,形成「用K3优化K3」的迭代。系统侧强调3D Hyper Mesh、统一编址显存与对称内存等,把显存统一寻址视为超节点与「松散集群」的分界。
同期,海外TPU推理优化团队Inferact开源tpu-megakernels,用约16颗Google TPU v7把整个K3装进一个kernel,并配合投机解码公布低并发Decode吞吐等数据。两条路线共同指向:打破「一Op一Kernel」的碎片停靠,让计算、通信与搬运流水化。对本土算力,系统级紧耦合与软件栈优化,是在单芯片差距仍在时更确定的追赶路径。浪潮信息亦提出能力型智算与容量型智算并进:前者用超节点把前沿大模型「跑进第一梯队」,后者用多元算力机组按Prefill/Decode/FFN负载匹配芯片,追求同等投资下的Token产能。Agent时代Token消耗上升,使这类系统工程叙事更容易被云与政企采购听懂。具体吞吐、时延与对比口径以厂商发布与开源项目README为准,跨平台数字不宜直接横比。