GPT-6 Astra识别宜家组装错误准确率达80%
The Decoder··作者 Manuel Uth
关键信息
FAB使用来自三件宜家家具组装过程的60张照片,这些照片包含故意设置的错误,要求模型将图像与相关说明进行比较、定位错误并描述问题。GPT-6 Astra据报道每张照片需要约三分钟;中国开放权重模型至少落后领先系统七个月,而且由于这些说法涉及未来日期并通过较为煽动性的报道呈现,因此应谨慎看待。
资讯摘要
Epoch AI的家具组装基准测试(FAB)用于评估人工智能模型能否根据图像诊断家具组装错误。该测试拍摄三件宜家家具的组装过程,并在其中故意设置错误。模型需要将照片与组装说明进行比较,找出问题所在,并解释具体错在哪里。2025年11月,Claude Opus 4.5据报道以28%的成绩排名第一。十个月后,据报道OpenAI的GPT-6 Astra将成绩提高到80%,每张照片的处理时间约为三分钟。
Claude Fable 5.1得分70%,Claude Opus 5得分61%,而中国开放权重模型与领先系统至少相差七个月。考虑到多模态系统不久前在更简单的视觉任务上也经常表现不佳,这一进步尤其引人注目。不过,当前的处理延迟仍然过高,Astra还无法成为实用的实时组装助手。研究人员认为,更强的视觉和空间推理能力未来也可能用于诊断汽车维修和家电故障等现实问题。报道还将Astra的表现与视觉机器人任务联系起来,但FAB实际测试的是根据照片进行错误诊断,而不是直接控制机器人。

资讯正文
OpenAI 的 GPT-6 Astra 现在能准确告诉你 IKEA 货架究竟装错在哪里
AI 现在已经能发现你是否把 IKEA 家具装错了。Epoch AI 的家具组装基准测试(Furniture Assembly Benchmark,FAB)会在组装过程中拍摄三件 IKEA 家具,并故意设置错误。模型将照片与说明书进行比对,找出错误并描述具体哪里出了问题。2025 年 11 月,表现最好的模型 Claude Opus 4.5 得分为 28%。十个月后,OpenAI 的 GPT-6 Astra 在每张照片用时三分钟的情况下,得分达到 80%。Claude Fable 5.1 以 70% 紧随其后,Claude Opus 5 则为 61%。Kimi K3 等中国开源权重模型至少落后领先模型七个月。
研究人员表示,这项技术目前对于实时协助组装来说仍然太慢,但未来可能会帮助人们维修汽车或修理家用电器。不久前,模型在更简单得多的视觉任务上还频频失败,如今整体进展,尤其是 Astra 的表现,值得关注。Astra 在视觉机器人任务方面同样表现出色。
来源与参考
收录于 2026-09-27