何恺明团队最新论文VISTA在ARC-AGI-3测试中把模型输入的数字表换成图片,仅此一项就让GPT-5.6 Sol分数从13.33跃升至47.32,且Token消耗从7190万降至3070万。
针对多模态模型“看一遍就忘”的毛病,VISTA用一本无损视觉记忆“相册”按编号存档每帧画面,模型可随时调取对比且不计步数。
论文发现上下文从200K拉到780K成绩反降,图片放大16倍分数也下滑,而VISTA零训练、提示词仅四句话,就让Claude Opus 5通关25个游戏全部183关、总步数仅为人类的0.43倍。
相比动辄写4000行代码造模拟器的方案,VISTA仅靠自然语言笔记搞定规则,套上开源模型也能从1.89分暴涨至66.93分,证明智能的进步不一定发生在模型权重之内。
