推理芯片的争论长期是「吞吐」还是「延迟」二选一——OpenAI用Jalapeño第一批数字声称两者可以同时往上推。对Agent场景而言,真正值钱的是多步任务里延迟会不会一步步叠成「等不起」,以及每瓦多跑多少有用请求。
OpenAI是前沿大模型与AI应用公司,Jalapeño为其与Broadcom等合作开发的首款自研推理芯片,此前于2026年6月对外宣布,8月25日在官网发布首批硅片实测结果。测试基于SemiAnalysis公开基准InferenceX,覆盖GPT-OSS 120B、DeepSeek R1 670B与Kimi K2.5 1T三类模型——既有开源权重,也有外部超大模型,意在证明架构不只服务自家闭源模型。公司称,峰值吞吐下Jalapeño可提供约1.5–1.9倍每瓦AI工作量,端到端延迟约低1.7–3.6倍;高交互负载下性能约高2.1–4.1倍。芯片封装额定约700W,测试工况持续功耗不超过约550W。
架构与开发要点:
所谓KV缓存,白话是模型生成每个新token时都要回头看前面所有token的「备忘录」,上下文越长备忘录越大,带宽与调度越容易成为瓶颈;Jalapeño叙事是把这些状态尽量留在离计算最近的地方,少在机架间来回搬运。所谓Agent多步延迟,白话是一个任务要连续调用模型十几次,每次多等半秒,用户体感就是「卡死」——推理芯片若只能优化单次聊天,对Agent帮助有限。
据SemiAnalysis等第三方技术评论,对比对象包括英伟达Blackwell、GB300等商用系统;在部分口径下,Jalapeño在每兆瓦输出token吞吐上可与Vera Rubin平台公开数据同台比较,但双方软件成熟度、量产阶段与测试配置未必完全等同,读者应区分「实验室bring-up」与「全年稳定SLA」。
产业观察上,OpenAI把「全栈」从模型、产品延伸到硅片,是在应对推理成本随Agent常驻化而指数抬升的压力。可以把它想成:不只造发动机,还要造适合自家车队的变速箱——仍会去别家买车,但关键里程想握在自己手里。对云厂商与芯片厂,短期未必是零和:OpenAI仍承诺继续采购英伟达;长期则多一个既懂工作负载又自研硅片的超级买方,定价权博弈会更有趣。
需要把边界读清楚。数字来自OpenAI发布与InferenceX设定,对比系统型号与软件版本会显著影响结果;对外销售与通用云供货尚未宣布。下一观察点是2026年底首批上线机架的可用率、支持模型列表与外部客户能否租用。