英伟达|Groq 3 LPX全面投产:10万tokens上下文实测约3431 tokens/s

PromptTree|阅读 0
2026/08/26 18:48
英伟达GroqVera Rubin推理加速
英伟达宣布Groq 3 LPX面向Vera Rubin全面投产,为收购Groq技术后首款机架级专用交互推理系统,与NVL72协同服务长上下文Agent。第三方测试Gemma 4-31B在约10万tokens上下文下中位约3431 tokens/s;强调确定性执行与计算通信重叠。Nebius为首家采用客户。

长上下文Agent最怕的不是模型读不懂,而是读得太慢——用户每多发一轮,历史全量重算一遍,延迟像滚雪球。Groq 3 LPX把「交互式解码」做成机架级产品,专门啃这块硬骨头。

英伟达在2024–2025年收购Groq相关LPU(语言处理单元)技术后,将其纳入Vera Rubin平台生态。8月25日前后,公司宣布面向Vera Rubin的Groq 3 LPX交互式推理机架全面投产,定位为收购后首款商业化落地的机架级专用推理系统,面向小批量、低延迟、长上下文Agent场景;云厂商Nebius被列首家采用方。开发者博客披露与Vera Rubin NVL72的软硬件协同,以及第三方Artificial Analysis基准结果。

技术与测试要点:

  1. 痛点:Agent多轮对话上下文可达数十万tokens;传统张量并行在小批量高交互场景下通信启动开销占比过高,越长越慢。
  2. 路径:确定性执行——编译期排定芯片间传输时刻表,减少运行时仲裁;细粒度(约320字节)计算—通信重叠,缓解「算完再传」的尾部等待。
  3. 基准:选用已适配英伟达硬件的Gemma 4-31B;约10万tokens上下文中位输出约3431 tokens/s,约为当时公开最快端点约870 tokens/s的近4倍;约1万tokens约3382 tokens/s,速度几乎不随上下文显著衰减;SPEED-Bench编程基准中位约4767 tokens/s。
  4. 协同:与NVL72可做预填充—解码分离、注意力—FFN分离、投机解码等模式;官方称可支撑约2万亿参数级多智能体系统。

所谓预填充—解码分离,白话是让擅长大批量读提示的机架先「吃透」上下文,再由擅长度token的机架快速吐字,像餐厅分工:一人备菜,一人炒菜。Groq路线历史上以确定性时序著称,收购后纳入Rubin全家桶,避免「快芯片进不了主流云」的孤岛命运。

产业观察上,HBM与通用GPU仍在抢产能,专用解码机架是在存量集群旁路加一条「快车道」。可以把它想成:NVL72负责把书读完,LPX负责用极快速度念出来——Agent用户体验往往卡在「念」的速度。对云采购,应问跨机架KV流转成本、故障切换与软件栈成熟度,而不是只看单次benchmark峰值。

需要把边界读清楚。测试模型与配置由英伟达与第三方机构合作完成,生产环境多租户干扰可能拉低表现;Groq品牌整合与长期路线图仍处早期。下一观察点是除Nebius外首批公开客户名单与季度出货指引。