↑

何恺明团队|提出VISTA视觉Harness,助Opus通关ARC-AGI-3

PromptTree|阅读 0
2026/10/04 06:30
何恺明VISTAARC-AGI-3Harness多模态Agent
MIT何恺明团队提出视觉Harness方案VISTA,为通用多模态模型提供长程视觉与无损视觉记忆;以Claude Opus 5.0为底座时,在ARC-AGI-3全部二十五款公开游戏上取得满分相对人类行动效率,动作数约少于首次人类参与者五成七。

模型「看得懂图」不等于「玩得过陌生世界」。VISTA把缺口补在Harness层,而不是再换一个更大的底座。

论文《VISTA: A Visual Harness for Reasoning in an Interactive World》于2026年10月1日挂到arXiv(2610.02200),作者包括Qiushi Han、Keya Hu、Linlu Qiu、Cathy Wu与Kaiming He,单位为麻省理工学院。团队指出:多模态模型已具备强推理能力,但需要合适的视觉编排,才能在交互环境中长程发挥作用。早期博客版本曾于2026年8月5日发布,本次为正式技术报告;代码仓库公开为github.com/joshhhhhan/VISTA。

VISTA的核心设计很克制:让模型直接以自然高维视觉观测感知环境(如原始PNG),用语言做推理,并维护以原始形式保存的无损视觉记忆;模型可在推理过程中主动检索过去观测、重组视觉输入。它刻意避免复杂任务特化工程,强调「最小主义Harness」也能释放通用多模态模型潜力。

评测: 在ARC-AGI-3(需通过交互发现陌生世界规则与目标的视觉游戏套件)上,VISTA将Claude Opus 5.0的相对人类行动效率(RHAE)从约40.68提升至满分100,完成全部二十五款公开游戏,动作数约比首次人类参与者少57.4%。同一底座、极简Harness的基线显著落后;方案亦扩展到另外三个视觉游戏与解谜基准,并宣称对感官输入变化具有稳健性。

对产业,这与「模型越强越好」并行的另一条路是:用可复用Harness释放已有多模态能力,类似编码Agent生态里「底座+编排」的分工。边界在于基准不等于真实物理具身,跨环境迁移与成本(多轮视觉检索)仍需验证。事实以arXiv与项目页为准。