风冷的上限,被写在机柜功耗上。7月9日,字节跳动在OCP开放计算中国峰会发布兆瓦级算力系统AI Rack 3.0。
字节跳动是互联网公司,也是大规模自建算力的一方。这次是国内互联网大厂首次公开确认:整机柜搭载800V高压直流供电,并配100%全液冷。HVDC就是高压直流,相对传统交流供电,少几次交直流转换。全液冷则是用液体把芯片的热带走,而不是只靠风扇。
硬件是双柜。单柜功率500千瓦,一套总功率突破1兆瓦,最高576颗XPU。算力密度和集群带宽较上代翻倍。机柜里有54伏液冷母线、进出液分集水歧管,搭配36台1U或18台2U液冷节点,以及16台高速交换机,面向3000瓦以上、多芯片封装的XPU。XPU在这里是算力芯片的统称,不单指某一家的GPU。
液冷从可选项变成必选项,有三条已经摆在桌上的对照。6月21日,英伟达宣布Vera Rubin平台采用100%全液冷,计划2026年秋季量产。TrendForce的数据是,AI数据中心液冷渗透率从2024年的15%升到2025年的54%。政策侧,7月9日国务院印发“十五五”碳达峰行动方案,推动算力设施节能降碳;北京对PUE超过1.35的数据中心征收差别电价;上海、天津对新建大型数据中心的PUE要求更严。PUE越低,同样算力花的电越少。
7月9日,冰轮环境、大元泵业涨停,同飞股份、飞荣达、依米康涨超5%。10只液冷概念股年内获得融资净买入超过1亿元。股价反映的是“必选”这个判断,不是字节已经把订单交给这些公司。
3000瓦以上的多芯片封装,靠风扇很难稳定带走热量,所以100%全液冷被写成配套。54伏液冷母线、进出液歧管、36台1U或18台2U节点、16台交换机,是双柜内部的构成,不是外加配件。单柜500千瓦、总功率超过1兆瓦、最高576颗,都是这套设计的上限口径。液冷渗透率从15%到54%,以及北京对PUE超过1.35征收差别电价,解释了概念股为什么在发布当天上涨。
AI Rack 3.0把字节从买机柜的人,写成定规格的人:800伏直流、全液冷、自研XPU放在同一套柜子里,用来对照英伟达Vera Rubin。它也是世界人工智能大会期间,看国产算力栈的一个样本。576颗和1兆瓦是这套设计的上限口径。下一步看有没有机房按这个规格上电,而不只是峰会上的机柜。