人类轻松、模型吃力
Scale Labs发布Humanity's Sixth Sense直觉视觉推理基准,包含522项图像与视频任务,专门探测空间、因果与社会理解等人类近乎本能的能力。结果显示人类平均通过率93.1%,而表现最强的GPT-6-astra仅53.6%,参评模型中位数只有30.9%。
直觉推理是硬骨头
这一近40个百分点的鸿沟说明:语言与知识型任务上模型已逼近或超越人类,但人类依赖直觉的视觉推理——一眼判断物体会往哪倒、谁在撒谎、下一步会发生什么——仍是当前架构的系统性短板。多模态模型的「看」很多时候仍是模式匹配,而非真正的物理与社会直觉。
基准设计的用意
该基准刻意避开可通过记忆与检索解决的知识题,聚焦「第一眼」判断,因而更难被训练集污染。对行业而言,这类人类轻松而模型吃力的任务清单,恰好标出了下一轮能力突破的方向;对采购者而言,则是识别「演示很强、实战很虚」的多模态产品的有力工具。
