Nvidia|AVO Harness助Claude Opus 5在ARC-AGI-3交互推理获满分

PromptTree|阅读 0
2026/08/21 17:17
NvidiaAVOAgent HarnessNemo
Nvidia于8月21日发布研究,称自定义Agent外壳AVO配合记忆优化与监管者子Agent后,Claude Opus 5在交互推理基准ARC-AGI-3上获100%得分;无此外壳时同模型约30%。研究强调长程任务上Harness对记忆与反馈的处理往往比换底座更决定性。

Agent赛道里,「换更强的模型」未必是长程任务的第一解法。同一张底片,换不同冲洗流程,成片可能差很远——Nvidia用ARC-AGI-3上的对照实验,把「外壳」从配角推到前台。

Nvidia是全球GPU与AI基础设施巨头,Nemo是其面向企业Agent与模型的开放组件品牌。所谓Agent外壳(Harness),白话是把模型、工具、运行时、技能库与记忆策略叠成可编排的工作流,而不是只调一个聊天API;所谓AVO(Agentic Variation Operators),白话是Nvidia在这项研究里提出的一套外壳变体与记忆优化配方,本身不是独立商业SKU,而是研究结论与开放组件叙事的一部分。

8月21日,公司发布研究,称自定义Agent外壳AVO配合记忆优化与「监管者」子Agent后,Claude Opus 5在交互推理基准ARC-AGI-3上获100%得分;无此外壳时同模型约30%,为当时测试模型中的最高裸分。

ARC-AGI-3要求模型在无说明的2D游戏中自行摸索规则并取胜——考验的是交互式推理,而不是静态题库。Nvidia方案引入监管者组件:主Agent卡住或走死胡同时,由上级Agent纠偏,类似「CEO催进度」。产品副总裁Adel El Hallak强调,Agent不等于模型API,而是模型、工具、运行时与技能库的叠加;长程任务上Harness对记忆与反馈的处理往往比换底座更决定性。

研究脉络与产业对照:

  1. 成本:同一模型换不同Harness,公开研究称成本可相差约2倍——榜单比模型,生产比编排。
  2. 安全:研究联系到前沿实验室因安全顾虑放缓部分训练节奏的行业背景,可控外壳被视为安全部署的一环。
  3. 坐标:与DeepSeek Harness、Cursor Origin等形成「外壳战争」坐标;采购验收应从「模型名」扩展到「监管者是否可审计、失败能否回放」。

可以把它想成:同样的大脑,配不同办公室流程,年终考核可能差三倍——AVO研究试图把「流程差异」量化成可复现实验,而不是留在口头经验里。

需要把边界读清楚。100%为特定基准与特定Harness配置下的结果;外推到所有Agent任务需谨慎。下一观察点是AVO组件在企业私有化栈中的集成成本与监管者误纠偏率。