Scale Labs发布「人类第六感」视觉直觉基准:人类93.1%,最强AI模型仅53.6%

作者:Scale Labs / HeadsUpAI 发布时间:2026-10-11 18:36:32 浏览:4
关键字:
Scale Labs推出Humanity's Sixth Sense基准,用522项图像与视频任务测试直觉视觉推理,人类通过率93.1%,而最强模型GPT-6-astra仅53.6%、中位数模型30.9%,暴露出AI在空间、因果与社会理解上的巨大鸿沟。

人类轻松、模型吃力

Scale Labs发布Humanity's Sixth Sense直觉视觉推理基准,包含522项图像与视频任务,专门探测空间、因果与社会理解等人类近乎本能的能力。结果显示人类平均通过率93.1%,而表现最强的GPT-6-astra仅53.6%,参评模型中位数只有30.9%。

直觉推理是硬骨头

这一近40个百分点的鸿沟说明:语言与知识型任务上模型已逼近或超越人类,但人类依赖直觉的视觉推理——一眼判断物体会往哪倒、谁在撒谎、下一步会发生什么——仍是当前架构的系统性短板。多模态模型的「看」很多时候仍是模式匹配,而非真正的物理与社会直觉。

基准设计的用意

该基准刻意避开可通过记忆与检索解决的知识题,聚焦「第一眼」判断,因而更难被训练集污染。对行业而言,这类人类轻松而模型吃力的任务清单,恰好标出了下一轮能力突破的方向;对采购者而言,则是识别「演示很强、实战很虚」的多模态产品的有力工具。

阅读原文

本文由AI融业云采集并编辑,仅供学习使用!

本文来自headsupai.io,作者Scale Labs / HeadsUpAI

关于AI融业云:一站式AI应用服务平台,了解创始人 | 联系我们

有问题,请联系客服!http://www.rongyeyun.com/kefu/