AI学会挑刺:GPT-6 Astra识别家具装错准确率80%

作者:作者:问舟 发布时间:2026-09-27 04:19:12 浏览:2
关键字:
Epoch AI的家具组装基准测试显示,OpenAI GPT-6 Astra识别宜家家具组装错误的准确率达80%,较去年提升近三倍。

Epoch AI近日发布家具组装基准测试(FAB),专门评估多模态AI理解现实装配过程的能力。测试用60张宜家家具组装照片,要求AI将照片与官方PDF说明书比对,找出故意装错的位置并说明问题。

OpenAI GPT-6 Astra以80%准确率位居榜首,Anthropic Claude Fable 5.1和Claude Opus 5分别为70%和61%。而2025年11月领先模型Claude Opus 4.5准确率仅28%,前沿模型约10个月内实现显著跃升。

GPT-6 Astra的推理效率同样突出,单张照片分析中位耗时约3分钟,是研究中速度最快的模型,比此前领先模型快约2至10倍,但距真正实时识别仍有差距。

研究还发现不同模型的错误模式:谷歌Gemini和阿里Qwen系列几乎总是先假设存在错误再去找;早期Anthropic和OpenAI模型则相反,经常完全找不到错误。错误隐蔽性、视角及错误后继续组装的程度,对难度影响更大。

中国模型中,表现最好的开源权重模型Kimi K3相比国际前沿约落后7个月,视觉推理仍是部分中国模型的薄弱方向。研究团队认为,这类能力与汽车维修、家电检修等场景高度相关,未来AI有望在安装、维修指导中提供实时辅助。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自ithome.com,作者问舟

有问题,请联系客服!http://www.rongyeyun.com/kefu/