Agent赛道里,「换更强的模型」未必是长程任务的第一解法。同一张底片,换不同冲洗流程,成片可能差很远——Nvidia用ARC-AGI-3上的对照实验,把「外壳」从配角推到前台。
Nvidia是全球GPU与AI基础设施巨头,Nemo是其面向企业Agent与模型的开放组件品牌。所谓Agent外壳(Harness),白话是把模型、工具、运行时、技能库与记忆策略叠成可编排的工作流,而不是只调一个聊天API;所谓AVO(Agentic Variation Operators),白话是Nvidia在这项研究里提出的一套外壳变体与记忆优化配方,本身不是独立商业SKU,而是研究结论与开放组件叙事的一部分。
8月21日,公司发布研究,称自定义Agent外壳AVO配合记忆优化与「监管者」子Agent后,Claude Opus 5在交互推理基准ARC-AGI-3上获100%得分;无此外壳时同模型约30%,为当时测试模型中的最高裸分。
ARC-AGI-3要求模型在无说明的2D游戏中自行摸索规则并取胜——考验的是交互式推理,而不是静态题库。Nvidia方案引入监管者组件:主Agent卡住或走死胡同时,由上级Agent纠偏,类似「CEO催进度」。产品副总裁Adel El Hallak强调,Agent不等于模型API,而是模型、工具、运行时与技能库的叠加;长程任务上Harness对记忆与反馈的处理往往比换底座更决定性。
研究脉络与产业对照:
可以把它想成:同样的大脑,配不同办公室流程,年终考核可能差三倍——AVO研究试图把「流程差异」量化成可复现实验,而不是留在口头经验里。
需要把边界读清楚。100%为特定基准与特定Harness配置下的结果;外推到所有Agent任务需谨慎。下一观察点是AVO组件在企业私有化栈中的集成成本与监管者误纠偏率。