LEGO-Anything揭示AI三维场景重建的局限
The Decoder··作者 Jonathan Kemper
关键信息
LEGO-Bench包含来自104个室内和室外场景的208张渲染图像以及443个已注册资产,并从有效性、可见几何重建和像素级外观相似度三个方面评分。测试中表现最好的GPT-6 Astra在室内场景得分为53.4%,在室外场景得分为39.6%;LEGO-Plugin则让较弱模型的表现最多提升62.7%。
资讯摘要
LEGO-Anything研究了编码代理能否仅凭一张照片,将三维场景重建为可执行的Blender程序。代理首先编写代码并渲染场景,然后检查结果,通过多轮迭代修改程序。这种形式会明确记录物体、几何结构、布局和摄像机位置,因此用户可以像处理普通代码一样检查、编辑、重新运行和查询场景。为了评估这一方法,研究人员创建了LEGO-Bench,其中包含来自104个专业制作的室内和室外模拟器场景的208张图像,以及443个已注册资产。
该基准保留了隐藏的几何、深度和物体分配真值,同时让输入图像看起来更自然,并评估场景有效性、几何重建和视觉外观。测试的六种GPT配置几乎总能交付可用场景,但场景越复杂,准确率下降越明显,室外场景也比室内场景更困难。增加推理预算能够提升表现,但代理经常出现初始尝试较差、修改过程抵消此前进展,以及无法可靠判断哪个版本几何上更好的问题。为此,研究人员开发了LEGO-Plugin,用客观测量替代不可靠的自我判断,将初始场景锚定到参考图像,并保护已经正确的进展不被回退修改破坏;该插件提升了所有模型的表现,但最强模型只提高了约两个百分点。

资讯正文
AI 智能体可以根据照片构建 3D 场景,但完全不知道自己做得对不对
编码智能体可以通过逐步编写和改进代码,根据单张照片构建出可编辑的 3D 场景。这项工作配套的基准测试揭示了这一流程仍然存在问题的地方:自我评估和几何准确性。
根据单张照片进行的 3D 重建,只有在其以可执行程序的形式存在时才最有用,因为你可以检查、编辑并查询这个程序。这正是 LEGO-Anything 背后的理念。该项目由马里兰大学和 AWS 的研究人员共同开展。
这种方法被称为“Image-to-Code”。编码智能体接收一张图像,然后为广泛使用的 3D 软件 Blender 编写代码。智能体不会一次性生成整个场景,而是采用迭代方式工作:编写代码、运行代码、查看结果,然后不断修改,直到场景与原始图像相匹配。
由于输出的是一个程序,它能够明确记录物体、几何结构、布局和摄像机位置。你可以像运行、检查和修改其他代码一样运行、检查和修改这个场景。
模拟器场景提供精确的真实基准
为了衡量智能体的表现,研究团队推出了 LEGO-Bench。该基准包含来自 104 个室内和室外场景的 208 张图像,并使用了 443 个已注册资产。
研究人员表示,真实照片无法提供精确的 3D 真实基准来进行比较。简单的合成场景又显得不够真实。因此,LEGO-Bench 采取了折中方案:从专业制作的模拟器场景中渲染出图像。输入图像看起来很自然,而精确的几何结构、深度和物体分配则被隐藏起来,作为自动评分的标准答案。在不改变光照或摄像机设置的情况下,还可以提高场景的复杂度。
该基准从三个维度为每个场景评分:有效性用于检查是否最终交付了一个可用的场景文件;重建度量可见几何结构的准确程度;外观则通过重新渲染提交的场景,并将其与参考图像逐像素比较,来衡量外观与原图的接近程度。
智能体能够交付可用文件,但在几何结构方面表现吃力
测试的六种 GPT 配置几乎每次都能交付一个可运行的场景。不过,准确率差异极大。表现最佳的测试模型 GPT-6 Astra 在室内场景中的得分为 53.4%,在室外场景中的得分为 39.6%。较弱配置的得分约为 15%。
场景越复杂,准确率下降得越明显,而且室外场景比室内场景更难。当研究人员提高模型的推理预算后,GPT-6 系列的表现大幅提升。在办公室测试子集上,Astra 的得分从 32.3% 跃升至 61.8%。
为了理解其中的原因,研究人员分析了智能体的工作步骤。他们发现,最常见的问题包括初次尝试质量不佳、修改操作反而抵消了此前取得的进展,以及不可靠的自我评估。
最后这一点最能说明问题。当模型必须从两个版本中选出与原始版本更匹配的一个时,它们对几何结构的判断接近随机水平,甚至低于随机水平。换句话说,智能体基本无法判断自己的场景是否变得更好。研究人员据此得出结论:场景优化应依赖具体测量结果,而不是智能体自身的判断。
这一发现促使作者开发了 LEGO-Plugin,这是一款无需额外训练的扩展工具。它以参考图像为依据固定起始场景,用具体测量结果取代不可靠的自我判断,并保护已经取得的正确进展不被退化性编辑破坏。该插件提升了全部六个模型的表现。能力较弱的智能体收获最大,提升幅度最高达到62.7%。表现本已很强的顶尖模型则只提升了约两个百分点。
重建出的场景目前还不够准确
最后,研究团队测试了重建出的场景能否作为标准视觉任务的基础。由于每个场景都是一个可执行程序,因此可以直接从中提取目标检测、分割和深度估计结果。
在没有任何额外训练的情况下,这些场景在三项任务中都取得了可用但并不出色的结果。目标检测的表现最好,重建场景达到专业模型 DINO 大约一半的性能。在分割和深度估计方面,与 SAM 3 和 Depth Anything 3 等专业模型之间的差距更大。作者表示,当前编码智能体生成的可执行场景程序展现出了潜力,但准确度还不够。可正常运行的结果与忠实重建之间仍存在很大差距。
GPT-6 Astra 在 LEGO-Bench 中的明显领先,与其他观察结果相吻合。AI 研究员 Yoav Artzi 认为,这款模型在空间理解方面实现了重大飞跃,并怀疑它接受了大量 3D 数据训练,例如 Blender 场景。3D 软件厂商已经在为这类智能体做准备。Unity 已经为 Claude Code 和 Codex 发布了官方插件。另一些方法则完全跳过代码,直接在模型内部重建场景,例如 World Labs 的 Atlas 世界模型。Google DeepMind 采取了另一条路线,推出 GenCeption,利用视频模型进行深度估计和分割,其表现可与专业模型相媲美。
来源与参考
收录于 2026-10-04