模型「看得懂图」不等于「玩得过陌生世界」。VISTA把缺口补在Harness层,而不是再换一个更大的底座。
论文《VISTA: A Visual Harness for Reasoning in an Interactive World》于2026年10月1日挂到arXiv(2610.02200),作者包括Qiushi Han、Keya Hu、Linlu Qiu、Cathy Wu与Kaiming He,单位为麻省理工学院。团队指出:多模态模型已具备强推理能力,但需要合适的视觉编排,才能在交互环境中长程发挥作用。早期博客版本曾于2026年8月5日发布,本次为正式技术报告;代码仓库公开为github.com/joshhhhhan/VISTA。
VISTA的核心设计很克制:让模型直接以自然高维视觉观测感知环境(如原始PNG),用语言做推理,并维护以原始形式保存的无损视觉记忆;模型可在推理过程中主动检索过去观测、重组视觉输入。它刻意避免复杂任务特化工程,强调「最小主义Harness」也能释放通用多模态模型潜力。
评测: 在ARC-AGI-3(需通过交互发现陌生世界规则与目标的视觉游戏套件)上,VISTA将Claude Opus 5.0的相对人类行动效率(RHAE)从约40.68提升至满分100,完成全部二十五款公开游戏,动作数约比首次人类参与者少57.4%。同一底座、极简Harness的基线显著落后;方案亦扩展到另外三个视觉游戏与解谜基准,并宣称对感官输入变化具有稳健性。
对产业,这与「模型越强越好」并行的另一条路是:用可复用Harness释放已有多模态能力,类似编码Agent生态里「底座+编排」的分工。边界在于基准不等于真实物理具身,跨环境迁移与成本(多轮视觉检索)仍需验证。事实以arXiv与项目页为准。