实时性不再等于「换小模型」——OpenAI把旗舰智能直接接到高速档。
OpenAI是闭源大模型与ChatGPT产品线的主要供应方之一,GPT-5.6 Sol被定位为该世代中偏旗舰、偏强推理的一档。过去行业默认:要低延迟,就得接受更小或更专的模型,牺牲一部分智能。所谓Ultrafast,白话是在同一旗舰智商上叠加「单位时间吐出更多有用Token」的服务层级,让事故响应、语音客服、盘中研究这类「晚一秒就变贵」的场景,不必先降智。
OpenAI官方博客宣布预览Ultrafast:在API上让GPT-5.6 Sol相对标准处理最高提速约14倍,输出可达约750 tokens/秒,由与芯片公司Cerebras的合作提供算力支撑。场景叙事覆盖事故响应与可靠性、金融研究与风控、客服与语音、电商转化,以及把「隔夜实验」压成工作日内多轮迭代。当前仅对少量客户开放预览,容量提升后扩大准入;官网提供扩容通知登记入口。
早期反馈与内部用法(公开口径):
对采购方,这意味着推理竞争从「谁更聪明」扩展到「谁能在单位时间内交付更多有用工作」。要同时看价目、配额与延迟SLA,而不能只看峰值tokens/秒海报。对产品方,语音与实时工具链将最先受益,也最先暴露容量与排队问题。
需要把边界读清楚。Ultrafast为有限预览,不等于全面开放或固定价目;14倍为相对标准处理的官方口径,真实业务延迟还取决于网络、工具调用与提示长度。下一观察点是预览扩容节奏与正式价目——14倍是能力海报,账单与可用性才是能否进生产的闸门。