长上下文Agent最怕的不是模型读不懂,而是读得太慢——用户每多发一轮,历史全量重算一遍,延迟像滚雪球。Groq 3 LPX把「交互式解码」做成机架级产品,专门啃这块硬骨头。
英伟达在2024–2025年收购Groq相关LPU(语言处理单元)技术后,将其纳入Vera Rubin平台生态。8月25日前后,公司宣布面向Vera Rubin的Groq 3 LPX交互式推理机架全面投产,定位为收购后首款商业化落地的机架级专用推理系统,面向小批量、低延迟、长上下文Agent场景;云厂商Nebius被列首家采用方。开发者博客披露与Vera Rubin NVL72的软硬件协同,以及第三方Artificial Analysis基准结果。
技术与测试要点:
所谓预填充—解码分离,白话是让擅长大批量读提示的机架先「吃透」上下文,再由擅长度token的机架快速吐字,像餐厅分工:一人备菜,一人炒菜。Groq路线历史上以确定性时序著称,收购后纳入Rubin全家桶,避免「快芯片进不了主流云」的孤岛命运。
产业观察上,HBM与通用GPU仍在抢产能,专用解码机架是在存量集群旁路加一条「快车道」。可以把它想成:NVL72负责把书读完,LPX负责用极快速度念出来——Agent用户体验往往卡在「念」的速度。对云采购,应问跨机架KV流转成本、故障切换与软件栈成熟度,而不是只看单次benchmark峰值。
需要把边界读清楚。测试模型与配置由英伟达与第三方机构合作完成,生产环境多租户干扰可能拉低表现;Groq品牌整合与长期路线图仍处早期。下一观察点是除Nebius外首批公开客户名单与季度出货指引。