World Labs 的 Atlas 可将照片转为 3D 世界

The Decoder··作者 Jonathan Kemper

关键信息

World Labs 表示,Atlas 会把每个输入锚定到 3D 空间中的特定位置,并称之为“空间上下文”,而不是把数据当作平面序列处理。它可以仅凭一张图像重建场景,支持点云和 3D Gaussian splats,并面向机器人真实到仿真的工作流,例如更换物体、光照或相机路径。

资讯摘要

World Labs 由 AI 研究者 Fei-Fei Li 联合创立,此次发布了 Atlas,这是一种世界模型,旨在仅凭少量照片就能生成、重建并模拟 3D 场景。公司把 Atlas 描述为迈向“空间智能”的一步,也就是让 AI 像人类一样理解 3D 空间。与输出平面图像或短视频的模型不同,Atlas 的目标是从任意视角表示场景,并跟踪场景随时间的变化。World Labs 表示,Atlas 是从零开始训练的统一模型,训练数据包括文本、图像、视频和 3D 数据。它的一个核心设计是将每个输入都锚定到 3D 空间中的特定位置,World Labs 将这种能力称为“空间上下文”。

公司认为,这一点让 Atlas 区别于把数据当作 1 维或 2 维序列处理的语言模型或视频模型。对于受相机控制的生成,用户提供图像和直接的几何相机输入,Atlas 可以生成最长 1 分钟、分辨率达到 1440p 的视频。对于重建任务,Atlas 可以只用 1 张到几十张图片重建真实场景,而公司称在仅有 2 到 3 个视角时效果尤其出色。World Labs 还表示,Atlas 在重建质量上优于专门的 3D 模型,并且能够处理超过 100 张输入。该模型还能输出点云和 3D Gaussian splats 等原生 3D 结果,并可用于时空联合模拟,例如“bullet time”式视角以及机器人训练数据生成。

World Labs 的 Atlas 可将照片转为 3D 世界

资讯正文

World Labs发布Atlas:一款仅凭几张照片就能生成、重建并模拟3D世界的单一AI模型

由AI研究员Fei-Fei Li联合创立的World Labs宣布推出Atlas,这是一种世界模型,只需几张图片就能生成、重建并模拟3D场景。该公司声称,Atlas在各自擅长的任务上击败了专门模型,这可能使其中许多模型变得不再必要。

自成立以来,World Labs一直致力于“空间智能”这一目标,即AI应像人类一样理解三维空间。Atlas是该公司首个为大规模实现这一目标而构建的模型。它并不是生成平面图像或视频片段,而是能够理解一个场景从任何角度看起来是什么样,以及它如何随时间变化。

World Labs将Atlas描述为一款从零开始训练的全能模型,训练数据包括文本、图像、视频和3D数据。每个输入都会锚定到3D空间中的特定位置,而不是作为平面序列来处理。该公司将这种共享的空间理解称为“空间上下文”,而模型正是利用它来生成每一帧新画面或每一个新视角。World Labs表示,这种锚定方式将Atlas与纯语言模型或视频模型区分开来。

Fei-Fei Li在2025年11月的一篇文章中提出了这一确切问题。她认为,当下的多模态语言模型和视频扩散模型会把数据拆成一维或二维序列,这让即便是简单的空间任务也变得不必要地困难。所需要的是能够以3D或4D感知方式组织分词、上下文和记忆的架构。

1440p下可生成一分钟视频

对于受相机控制的生成,Atlas会接收一张或多张图片,并在用户自由选择的相机位置和角度下生成新的视角。相机运动被作为直接的几何输入传递,而不是像许多视频模型那样通过文本提示来描述。

该模型最多可输出1440p、时长一分钟的视频。用户可以自行控制每一个镜头,而不是像World Labs所说的那样“拉下老虎机的拉杆”,从而在可控生成与随机输出之间划清界线。

在空间重建方面,Atlas无需特殊采集设备,只要一张到几十张输入图像,就能重建真实场景。它接收到的图像越多,就越不需要依赖自身知识去补全缺失部分。

据World Labs称,仅凭两三张图像,Atlas就能给出忠实结果,并且优于专门的3D模型。它也可以处理超过一百个输入。在一个演示中,该模型从两张到25张地面照片逐步拼建斯坦福大学主四方院,并生成远在校园上空的俯视视角。

这正是现有模型往往崩掉的地方。在OpenWorldLib框架内的一项对比中,VGGT和InfiniteVGGT等系统在相机发生明显移动后不久就出现了几何不一致和模糊纹理。

原生3D输出与机器人模拟

Atlas 可以输出实际的 3D 数据,而不仅仅是图像或视频,因为它在处理 RGB 的同时也处理深度信息。支持的格式包括点云和 3D Gaussian splats;后者通过许多微小的空间数据点构建场景,并且可以从任何角度平滑查看。这与该公司现有产品 Marble 所使用的表示方式一致。

作为一个模拟器,Atlas 将空间和时间一起建模。仅凭少数几台摄像机拍摄的素材,它就能生成“bullet time”效果,让场景冻结,并允许用户从原本不可能的角度观看。演示视频是用少量智能手机和运动相机拍摄的,而不是专业设备。

在机器人领域,Atlas 充当 real-to-sim 工具。它会重建一个房间,并生成模拟机器人传感器沿路径前进时会看到的图像和深度数据。仅凭几张照片,用户就可以通过替换物体、位置、光照或背景来模拟并变化抓取和移动任务。其目标是在不采集现实世界中每一种情况的前提下,为机器人生成多样化的训练数据。

World Labs 表示,公司在 2026 年 8 月以独立产品的形式展示了这一 real-to-sim-to-real 引擎。该引擎可从一个真实世界任务生成数千种变体,并完全在仿真中训练控制模型。公司称,在五个机器人平台上,这些模型每个都能在没有人工干预的情况下运行一小时。该技术来自 SceniX,这是一家 World Labs 于 7 月收购的初创公司。

公司表示,文本到图像生成并非重点,但 Atlas 也可以遵循复杂提示、渲染文字、生成不同的视觉风格,并创建 360 度全景图。

语言模型的速度,扩散模型的质量

Atlas 结合了语言模型和视频模型的思路。它像语言模型一样逐步生成输出,因此可以使用相同的加速技术,例如 KV 缓存。但它也使用了图像和视频模型中的扩散原理,逐步从噪声中过滤输出。这一侧让它可以使用缩短去噪过程或提升图像质量的方法。

World Labs 表示,没有单一基准能够全面体现 Atlas 的能力,但公司列举了两组测试。在由外部人工评估者判断的相机控制生成任务,以及少视角 3D 重建任务中,Atlas 的表现都优于更专门化的模型。

公司称,Atlas 的性能会随着训练算力增加而提升,并预计随着规模扩大这一趋势还会持续。Atlas 将为 Marble 的未来版本及其他产品提供动力,目前正通过早期访问计划向部分合作伙伴开放。

从可行走照片到 omni-model

World Labs 由 Fei-Fei Li 于 2024 年创立。她创建了 ImageNet,并在 2017 年至 2018 年期间领导了 Google Cloud 的 AI 部门。该公司在成立时获得了 Andreessen Horowitz、AMD、Intel 和 Nvidia 的投资。

到2024年末,首个系统已经出现,不过用户只能在虚拟空间里移动几米,就会撞上不可见的边界。Marble 随后于2025年11月发布。2026年2月,Autodesk、Andreessen Horowitz、Nvidia 和 AMD 参与了一轮10亿美元融资。此前,彭博社曾报道称相关谈判的估值为50亿美元。

研究人员对“什么才算世界模型”仍存在争议。2026年4月,由北京大学牵头的一个国际团队通过 OpenWorldLib 提出了一套统一定义,将纯文本转视频模型排除在外,因为它们缺乏与现实世界的反馈循环。在这一框架中,像 Atlas 这样的3D重建和模拟器可被视为核心构件,因为它们提供了可验证物理规则的环境。

来源与参考

  1. 原始链接
  2. World Labs unveils Atlas, a single AI model that generates, reconstructs, and simulates 3D worlds from just a few photos

收录于 2026-09-03