OpenAI把「快」单独做成了一个档位。OpenAI开发者团队官宣在API、Codex与ChatGPT Work中推出GPT-6.1 Sol的Ultrafast版本:运行速度最高达Sol标准版的8倍,定价为标准版的6倍,每百万输入词元12美元。定位很清晰——为对延迟敏感的交互式Agent与实时应用,提供接近旗舰智能水平的高吞吐选项。
先梳理型号脉络。GPT-6.1 Sol是OpenAI在9月29日DevDay上发布的升级版本,定位为高性价比产品:智能水平接近旗舰GPT-6 Astra,而标准输入输出价格约为其五分之一,标准版API定价为每百万输入词元2美元、输出10美元,在真实代码库长流程软件工程任务DeepSWE v1.1上已能匹配Astra。Ultrafast在此基础上叠加速度维度,输入价格抬升至12美元,仍是Astra的五分之一上下。
速度为什么值得单独立档?在Agent场景里,等待成本是真金白银。一个客服Agent每轮对话多等两秒,用户流失率就会肉眼可见地上抬;编码Agent的循环次数以百计,单步延迟直接决定任务总时长。过去开发者的办法是用小模型换速度,代价是智能下降;Ultrafast提供的第三条路是「同档智能、数倍吞吐」,官方给出的选型逻辑出自开发者关系工程师Dominik Kundel:接近Astra级别的智能、8倍于Sol的速度、成本仍低于旗舰。
从行业横向看,这条产品线是当前大模型定价演化的缩影:一味压低标准价已经不是主战场,分层定价——标准档卷性价比、高速档卷时延、思考档卷深度——成了各家共同的选择。低延迟推理背后通常是推理栈的深度优化,比如更激进的投机解码、缓存策略和硬件调度,工程含金量不低。
对开发者,实际影响是选型空间变宽了:交互式产品可以试探性地把主模型换成Ultrafast档,用A/B数据验证「快」带来的转化提升能否覆盖6倍成本;后台批处理则继续留在标准档。下一个值得跟踪的信号是竞品的跟进速度——低延迟档一旦成为标配,推理基础设施的效率竞争将比模型能力竞争更早分出胜负。