写GPU推理引擎成名的人,转头把TPU跑得比同卡数的GB200还快——Inferact交出的不是口号,是开源仓库与对照表。
Inferact由vLLM核心维护者创办,CEO Simon Mo、联合创始人Woosuk Kwon等为社区熟知人物;公司今年完成约1.5亿美元种子轮,估值约8亿美元,a16z与Lightspeed等参投。团队为TPU写出megakernel:把模型前向里原本数百个小kernel焊成一个大程序,消除切换空档,并在层间做权重预取。公开材料称,与Google Cloud联合工程合作,目标让TPU成为vLLM一流后端,成果回馈开源。
基准方面,Inferact在相同条件下用16块TPU v7 Ironwood对阵16块英伟达GB200,均跑Kimi K3、均用vLLM:TPU约709 token/s,GB200约452 token/s,快约57%。配合DeepSeek提出的DSpark推测解码,acceptance length约6、单步decode约8.5毫秒;关闭推测解码后batch=1时TPU约249对GB200约127。精度上,greedy解码下Kimi K3在TPU的GPQA-Diamond约94.4%、GSM8K约97.2%,与GPU一致。另披露4块TPU v7跑Qwen 3.8 27B约1515 token/s,对同配GB200约695。硬件上TPU v7 HBM带宽约7380 GB/s,低于GB200约8000 GB/s,差距被归因于软件编排与片上VMEM可软件管理。megakernel目前针对Kimi K3结构定制,换架构需再适配。对云厂与开源社区,这意味着TPU推理栈从「能跑」走向「可对标」;对客户,仍需看多模型覆盖与生产稳定性。