OpenAI|Jalapeño首批推理基准:更高能效与更低延迟同台兑现

PromptTree|阅读 0
2026/08/27 08:15
OpenAIJalapeño推理芯片英伟达
8月25日,OpenAI公布自研推理芯片Jalapeño首批实测:InferenceX上测GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T,峰值约1.5–1.9倍每瓦工作量、端到端延迟约低1.7–3.6倍,高交互负载约高2.1–4.1倍。计划2026年底前部署自有基础设施,Gen 2在研;仍将继续采购英伟达等伙伴加速器。

推理芯片的争论长期是「吞吐」还是「延迟」二选一——OpenAI用Jalapeño第一批数字声称两者可以同时往上推。对Agent场景而言,真正值钱的是多步任务里延迟会不会一步步叠成「等不起」,以及每瓦多跑多少有用请求。

OpenAI是前沿大模型与AI应用公司,Jalapeño为其与Broadcom等合作开发的首款自研推理芯片,此前于2026年6月对外宣布,8月25日在官网发布首批硅片实测结果。测试基于SemiAnalysis公开基准InferenceX,覆盖GPT-OSS 120B、DeepSeek R1 670B与Kimi K2.5 1T三类模型——既有开源权重,也有外部超大模型,意在证明架构不只服务自家闭源模型。公司称,峰值吞吐下Jalapeño可提供约1.5–1.9倍每瓦AI工作量,端到端延迟约低1.7–3.6倍;高交互负载下性能约高2.1–4.1倍。芯片封装额定约700W,测试工况持续功耗不超过约550W。

架构与开发要点:

  1. 设计目标:面向语言模型服务与Agent多步延迟累积,减少数据搬移与通信等待;KV缓存可显式就近放置,在prefill(读提示)与decode(吐token)之间保持可伸缩平衡。
  2. 开发节奏:从初设到tapeout约九个月;早期模型参与设计与bring-up,Codex与GPT-Astra等加速内核优化;部分GPT-OSS注意力与MoE块AI生成实现较人工专家版约快1.5–1.8倍(仅限选定块,非整模)。
  3. 路线:2026年底前在OpenAI自有算力基础设施开始部署;Gen 2深度开发、Gen 3成形;继续广泛部署英伟达及其他伙伴加速器用于训练与推理。

所谓KV缓存,白话是模型生成每个新token时都要回头看前面所有token的「备忘录」,上下文越长备忘录越大,带宽与调度越容易成为瓶颈;Jalapeño叙事是把这些状态尽量留在离计算最近的地方,少在机架间来回搬运。所谓Agent多步延迟,白话是一个任务要连续调用模型十几次,每次多等半秒,用户体感就是「卡死」——推理芯片若只能优化单次聊天,对Agent帮助有限。

据SemiAnalysis等第三方技术评论,对比对象包括英伟达Blackwell、GB300等商用系统;在部分口径下,Jalapeño在每兆瓦输出token吞吐上可与Vera Rubin平台公开数据同台比较,但双方软件成熟度、量产阶段与测试配置未必完全等同,读者应区分「实验室bring-up」与「全年稳定SLA」。

产业观察上,OpenAI把「全栈」从模型、产品延伸到硅片,是在应对推理成本随Agent常驻化而指数抬升的压力。可以把它想成:不只造发动机,还要造适合自家车队的变速箱——仍会去别家买车,但关键里程想握在自己手里。对云厂商与芯片厂,短期未必是零和:OpenAI仍承诺继续采购英伟达;长期则多一个既懂工作负载又自研硅片的超级买方,定价权博弈会更有趣。

需要把边界读清楚。数字来自OpenAI发布与InferenceX设定,对比系统型号与软件版本会显著影响结果;对外销售与通用云供货尚未宣布。下一观察点是2026年底首批上线机架的可用率、支持模型列表与外部客户能否租用。