OpenAI用一篇官方技术说明提醒行业:基准分数量的不只是模型,还有脚手架怎么接API。
OpenAI是美国前沿人工智能实验室,GPT系列与ChatGPT、Codex等产品覆盖消费与开发者市场。ARC-AGI-3由ARC Prize团队推出,要求智能体在缺少明确说明书的前提下探索二维谜题游戏并推断规则,被广泛视为严苛的交互式推理评测——它考的不是背题,而是「到了陌生环境还能不能自己摸清玩法」。
OpenAI于近日发布文章,解释GPT-5.6 Sol在ARC-AGI-3上的表现差异。官方称,在评测方通用harness(评测脚手架/运行框架)下,GPT-5.6 Sol公开任务集得分约为13.3%;另有口径提及更低的官方榜单分数。团队排查后发现,问题很大程度出在设置,而不只是「模型不会玩游戏」。
两个关键瓶颈:
OpenAI改用自家Responses API,并开启两项在ChatGPT与Codex中已使用的设置:推理保留(retained reasoning)与上下文压缩(compaction)。前者通过传递前一次response ID,在工具调用与多轮交互中自动保留推理轨迹;后者用摘要压缩替代简单截断,以在长任务中保存关键信息。官方披露,启用后GPT-5.6 Sol在公开任务集得分达到约38.3%,输出Token量约为原来的六分之一;文章还估算人类测试者平均约48%。得分口径采用相对人类行动效率(RHAE)一类指标,用于把模型表现映射到人类基线。
所谓推理保留,白话就是让模型「记得自己上一秒在想什么」,而不是每走一步就失忆重来;上下文压缩则像给长对话做会议纪要,而不是把最早几页直接撕掉。对长程Agent来说,这两件事决定它能不能学习、能不能少费Token地把任务做完。OpenAI据此建议开发者优先使用Responses API、保留推理并启用压缩;在模型对比时,也应关注评测是否采用贴近真实产品部署的设置。
ARC Prize方面有公开讨论指出:专为刷榜定制、内含基准先验知识的harness应被限制;但对所有API用户开放、并非针对该基准开发的通用设置,在充分披露前提下可被接受。这意味着「分数争议」本身正在变成评测治理议题——大家争论的不只是谁更强,而是「什么叫公平的测法」。
对Agent工程的启发很直接:长程任务里,「记不记得自己刚想过什么」可能比单步智商更能决定上限。下一观察点是其他厂商是否公布对等的保留推理/压缩能力,以及ARC等基准会否更新官方harness以对齐主流生产API——否则排行榜与真实产品体验之间,还会继续隔着一层脚手架落差。