当超大规模云开始自研加速卡,市场一度用「GPU不再唯一」质疑英伟达护城河。据TechCrunch梳理,英伟达财报后的新叙事是:AI算力进入吉瓦级后,真正变难的是整机编排——把数据在正确时间送到正确计算单元;公司在GPU之外的系统件上同样堆了专用硬件。公开材料中的Vera Rubin架构,把Rubin GPU与Vera CPU、Groq 3 LPX推理加速以及存储、网络机柜等放在同一套系统叙事里。
英伟达是全球AI加速芯片与系统方案的主要供应商,长期以CUDA生态与GPU性能建立优势。近年竞争从「谁做出更快的训练卡」,扩展到「谁能把机柜当作一辆整车来调教」——引擎仍重要,变速箱、线束与油耗管理同样决定最终Token成本。
英伟达存储技术副总裁Jason Hardy对TechCrunch表示,单机或单平台内存有限,Vera的重点是数据编排;在相关操作上可见约3倍量级改善,使闪存性能不被瓶颈吃掉。文章把OpenAI Jalapeño芯片「尽量减少数据搬运」的设计,理解为同一逻辑的另一条解法:要么少搬数据,要么把搬运本身做成专用加速。两种路线都在承认——峰值算力海报之外,移动数据的开销正在吃掉效率。
叙事对照要点:
所谓数据编排,白话是保证该计算的数据在该出现的时钟周期出现在GPU门口,而不是堵在内存与网络半路上;所谓吉瓦级园区,白话是整座「算力工厂」的功耗与调度已经接近一座小型电厂的管理难度。内存厂商在这一波基础设施行情中受益,正是因为「算得动」之后「存得下、搬得快」变成新瓶颈。
产业影响上,自研芯片与超大规模云会被迫在系统层继续加码;只卷单卡参数的挑战者更难讲完整故事。对采购方,招标书应把互连、存储路径与整机利用率写进验收,而不是只比TFLOPS。边界:报道含分析与访谈,具体倍数与竞品对照需以官方规格与第三方实测为准。下一观察点是Rubin机柜出货节奏,以及客户是否愿意为「非GPU专用件」单独付溢价。