物界前沿 · 资讯情报卡(量子位 · 2026/10/1)
何恺明团队用ImageNet预训练视觉模型解ARC题
核心事实
- 何恺明团队提出NAT-ARC,用纯视觉方案解ARC抽象推理题,不依赖大语言模型。
- 该方法先用ImageNet的MAE预训练编码器,再在ARC训练集上训练,测试时对每题做LoRA微调。
- NAT-ARC单模型在ARC-1上pass@2得分为63.4%,集成后达到70.2%。
- 对比专用LLM方案The ARChitects的71.6%,NAT-ARC参数量约为其四分之一。
- 论文发现预训练后模型scaling曲线转正,此前无预训练时模型变大反而性能下降。
关键数据
63.4%单模型ARC-1 pass@2
70.2%集成后ARC-1 pass@2
0.6B单模型参数量
约2B集成总参数量
物界观察
纯视觉路线用预训练补上了scaling短板,参数量远小于LLM却逼近专用系统,说明抽象推理未必依赖语言。对行业而言,这提示视觉先验可迁移到符号任务,ARC的解法可能不再被LLM垄断,小模型加预训练值得重新评估。
来源:量子位原文 ↗
物界前沿