各家都在说超节点,直到一份白皮书把「什么叫超节点」写成共同标尺。标尺的核心不是柜数,而是内存能不能跨机器当成一块来用。
世界人工智能大会期间,鹏城实验室和全球计算联盟联合牵头的《超节点定义与实践白皮书》发布。这是行业里第一份系统性定义超节点的文件。白皮书写明:跨物理节点的统一内存编址是核心架构特征。另外两项技术特征是超低时延、超大带宽。内存语义与统一编址被放在一起讲。白话就是:很多台物理机器上的芯片,在程序看来像共享同一块内存,可以直接读写,而不是每次都打包成网络消息。
传统集群里,每台服务器更像孤岛。图形处理器跨卡通信要经过CPU、网卡和交换机,带宽大约25至64GB/s,时延在2微秒以上,集群算力利用率常常只有40%至60%。超节点让卡与卡直接访问对方内存,利用率可到75%至85%。利用率是买来的算力里真正在干活的比例。从六成到八成,省下的是已采购芯片的闲置,不是再买一倍的卡。
为何集中在现在。一是万亿参数的混合专家模型单卡放不下,跨卡通信极频繁。混合专家是把大模型拆成许多子网络、每次只激活一部分。二是智能体要实时响应,推理延迟很敏感,多一跳网络就多一截等待。三是日均token调用从千亿级升到百万亿级,超节点被描述为把token生产效率翻倍,从而压推理成本。三件事都指向同一瓶颈:通信,而不是单卡峰值。
几条路线: 英伟达GB200 NVL72以72颗图形处理器加36颗CPU、130TB/s的NVLink带宽作为标杆。华为昇腾950以1024卡灵衢互联、256TB统一内存、1 EFLOPS的FP8算力推进;上一代384超节点已在20多个行业落地750多套。阿里云磐久AL128是128卡单柜、正交无缆,面向推理。中兴OEX走开放解耦,兼容壁仞、沐曦、燧原等多家国产图形处理器,正交无背板、零线缆,互联成本可降约80%。白皮书不取代这些产品,它让「超节点」四个字不再各说各话。规模商用要看的是:利用率有没有从40%至60%的旧区间里出来,以及不同路线能不能按同一套定义互认。
白皮书解决的是命名。GB200、昇腾950、AL128和OEX的数字仍然各算各的:72颗对1024卡,130TB/s对256TB统一内存,不能因为有了定义就把它们写成同一性能。定义的用处是采购和招标时,先问有没有统一内存编址、时延和带宽是否进了同一张表。没有这张表,超节点会继续等于「很多卡加一个新名字」。有了这张表,75%至85%的利用率才有同一套算法可对。