GPT-6 Astra家具组装测试准确率80%

AI 驱动中国 顾川 404次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

Epoch AI发布家具组装基准测试结果,OpenAI GPT-6 Astra在识别宜家家具安装错误任务中达到80%准确率,较2025年底提升近三倍,单图分析中位耗时约3分钟,研究认为该能力与设备检修等场景相关。

驱动中国9月26日消息,Epoch AI于当地时间9月23日完成一组家具组装基准测试(FAB)。测试结果显示,多模态AI在识别宜家家具组装错误方面取得明显进展。OpenAI最新模型GPT-6 Astra达到80%准确率,较2025年底提升近三倍。

FAB用于评估AI理解现实世界装配过程的能力。测试使用60张宜家家具组装过程照片,考察模型视觉与空间推理能力。测试人员选取三款宜家家具故意错误组装,并拍摄不同阶段照片,要求AI将照片与官方安装说明书比对,找出错误位置并说明具体问题。

研究团队认为,这类能力与汽车维修、家电检修等需要结合图像和技术说明进行判断的任务具有较高相关性,因此具有一定实际应用价值。测试中,AI不仅获得组装照片,还获得官方PDF说明书、图片放大工具和Python解释器,需要判断是否存在错误,并指出具体出错步骤和问题描述。评分采用多阶段验证,模型只要正确定位错误步骤并大致说明问题,即可获得相应分数。

该测试并非考察AI是否会背诵说明书,而是更接近真实使用场景:用户拍摄组装中的家具后,AI需要判断零件是否装反、安装顺序是否错误,或是否遗漏关键部件。Epoch AI认为,这类任务结合图像理解、空间推理以及多步骤指令匹配能力,能够较好反映多模态模型处理现实问题的水平。随着相关能力提升,未来AI有望在家具组装、设备安装、维修指导等场景中提供更具针对性的实时辅助。

测试结果显示,OpenAI GPT-6 Astra以80%准确率位居榜首;Anthropic Claude Fable 5.1和Claude Opus 5分别达到70%和61%。作为对比,2025年11月时的领先模型Claude Opus 4.5准确率仅为28%,显示前沿模型在约10个月内实现显著提升。

除准确率提升外,GPT-6 Astra推理效率也明显改善。其完成单张照片分析的中位耗时约为3分钟,是研究中速度最快的模型,比此前领先模型快约2至10倍。不过,研究团队认为,这一速度距离真正意义上的实时识别仍有一定差距。

研究还分析了不同模型的错误类型。谷歌Gemini和阿里Qwen系列模型几乎总是先假设存在错误再寻找错误;早期Anthropic和OpenAI模型则相反,经常完全找不到错误。研究者认为,不同家具对模型难度的影响与宜家复杂度指数无明显关联,错误隐蔽性、视角及错误后继续组装的程度影响更大。

在中国模型中,目前表现最好的开源权重模型Kimi K3相比国际前沿模型约落后7个月,这一差距比其在综合能力评估中的约4.4个月差距更大。研究认为,视觉推理能力仍是当前部分中国模型相对薄弱的方向,而DeepSeek V4 Pro、GLM 5.3等热门模型暂未提供图像支持。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
本文价值 ★★★★★ 5 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
✎ 我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友