抽象推理题最难的地方,常常不是「算力不够」,而是模型有没有带进任务的「视觉常识」。何恺明团队最新工作给出一个反直觉答案:先用ImageNet上的猫狗花草做掩码自编码预训练,再去解ARC格子题,纯视觉路线也能逼近专用大语言模型系统。
ARC(Abstraction and Reasoning Corpus)由François Chollet于2019年提出,是公认最难的AI视觉智力测验之一。题目格式统一:一块最大约30×30的二维格子、最多十种颜色,给2到5组输入输出示范,挑战者必须从示范里归纳隐藏变换规则,再应用到全新输入上。对人类儿童像「看图找规律」,对AI却极难——每道题规则不同、示范极少,无法靠背模板过关。这也使ARC成为测量抽象推理能力的标杆。
过去主流解法几乎清一色把格子翻译成文本或符号,交给大语言模型。视觉路线后来才崛起:不把格子改成文字,而用视觉模型直接处理格子图像。同团队此前提出的VARC把ARC重定义为条件图生图翻译,约19M参数做到约54%;LoopViT加入循环推理后约18M参数达到约65.8%;Loop-OWM用视频预训练做few-shot,约10.6M参数达到约68.5%。参数量比LLM方案小几个数量级,成绩却开始追平,但多数视觉方案仍从随机初始化起步,吃不到大规模预训练红利。
NAT-ARC的目标,正是给视觉路线补上预训练。它在VARC流程前插入一步ImageNet上的MAE(Masked Autoencoder)预训练:把图片大部分区域遮住,让编码器从碎片复原原图,从而学习形状、结构与空间关系。MAE是何恺明在FAIR时期于2022年提出的自监督方法。NAT-ARC直接使用公开MAE checkpoint初始化encoder,decoder仍随机初始化;随后在ARC训练集离线训练整套编解码器,测试时对每道题单独做LoRA微调。由于ARC格子分辨率远小于ImageNet原图,团队丢弃原始patch embedding与位置编码,只保留backbone,并换用2D RoPE,让模型带走的是特征提取能力,而非绑定原图尺寸的空间先验。
为什么「看猫」能帮到抽象格子?论文用注意力可视化给出线索:在尚未训练ARC时,随机初始化模型注意力近乎均匀;ImageNet预训练模型已能区分前景与背景,自动聚焦有意义图案。任务拆解显示,显著受益的题目多落在「匹配并复制」与「连通区域推理」两类——与自然图像里的物体分组、区域分割先验高度同构。表现最好的huge尺度单模型约0.6B参数,ARC-1上pass@2约63.4±0.7%;把无预训练、ImageNet MAE与ARC风格格子MAE三种策略训出的模型做多数投票,集成约2B参数可达约70.2±0.6%,对照专用微调的The ARChitects约71.6%(约8B语言模型)。更关键的是scaling曲线:无预训练时模型从large到huge反而掉点;加上ImageNet预训练后,base→large→huge一路向上,预训练被证明打通了视觉路线的规模化瓶颈。
一作Xiaoman Delores Ding来自MIT CSAIL何恺明组,亦是VARC一作;VARC已被CVPR 2026接收,NAT-ARC是其直接后续。对产业观察,这意味着「抽象规则」与「视觉表征」可能共享底层操作,纯视觉小模型在数据极少的推理基准上仍有空间。事实以论文与团队公开材料为准。