Epoch AI近日发布家具组装基准测试(FAB),专门评估多模态AI理解现实装配过程的能力。测试用60张宜家家具组装照片,要求AI将照片与官方PDF说明书比对,找出故意装错的位置并说明问题。
OpenAI GPT-6 Astra以80%准确率位居榜首,Anthropic Claude Fable 5.1和Claude Opus 5分别为70%和61%。而2025年11月领先模型Claude Opus 4.5准确率仅28%,前沿模型约10个月内实现显著跃升。
GPT-6 Astra的推理效率同样突出,单张照片分析中位耗时约3分钟,是研究中速度最快的模型,比此前领先模型快约2至10倍,但距真正实时识别仍有差距。
研究还发现不同模型的错误模式:谷歌Gemini和阿里Qwen系列几乎总是先假设存在错误再去找;早期Anthropic和OpenAI模型则相反,经常完全找不到错误。错误隐蔽性、视角及错误后继续组装的程度,对难度影响更大。
中国模型中,表现最好的开源权重模型Kimi K3相比国际前沿约落后7个月,视觉推理仍是部分中国模型的薄弱方向。研究团队认为,这类能力与汽车维修、家电检修等场景高度相关,未来AI有望在安装、维修指导中提供实时辅助。
