DeepMind将视频生成器转为视觉模型

The Decoder··作者 Jonathan Kemper

关键信息

GenCeption 通过单次前向传播直接生成预测,而不是采用视频生成里常见的多步扩散过程,因此更适合视觉任务。研究者只用 7,500 个合成视频和少量真实视频来做训练,并把多种输出统一表示为三通道 RGB 图像,从而让同一套架构覆盖多个任务。

资讯摘要

谷歌 DeepMind 的研究人员认为,GenCeption 说明视频生成器可能已经包含了计算机视觉长期缺失的“世界模型”。他们没有从零开始设计新的视觉架构,而是把阿里巴巴开源的 Wan2.1 视频模型改造成了深度估计、分割、表面法线估计和 3D 姿态估计等任务的基础。该模型通过文本提示来指定要执行的任务,方式有点像聊天机器人接受指令。为了让不同任务共用同一套架构,研究团队把深度图、分割掩码等多种输出都统一表示为标准的三通道 RGB 图像。对于 3D 关键点预测这类不直接输出图像的任务,团队再加入可训练模块来补足。

训练数据主要来自合成数据,总共只用了 7,500 个生成视频,这些视频由 800 个数字人模型和 200 段动作捕捉序列组合而成,并在 Blender 中用不同背景和相机角度渲染。真实视频只用于语言引导分割任务。根据文章摘要,GenCeption 在多个基准上与甚至超过了专门模型,包括在深度估计上接近 DepthAnything 3,在表面法线上超过 NormalCrafter 和 Lotus-2,在 3D 姿态识别上优于 Genmo 和 TRAM,并且在复杂的语言引导分割上与 Meta 的 SAM 3 加 Gemini 3.5 Flash 组合表现相当。作者据此认为,视频生成预训练可能成为计算机视觉通用基础模型的一条可行路径。

DeepMind将视频生成器转为视觉模型

资讯正文

谷歌 DeepMind 认为,视频生成器其实已经包含了计算机视觉一直缺失的“世界模型”

要点

- 谷歌 DeepMind 的研究人员开发了 GenCeption,这是一种将预训练视频生成器重新用于传统计算机视觉任务的模型,例如深度估计和分割。

- 该系统建立在阿里巴巴的一个开源视频模型之上,借助文本提示即可在单次前向传播中给出结果。它只用少量合成视频就完成训练,所需数据远少于竞争方法。

- 在基准测试中,GenCeption 的表现可与成熟的专用模型相媲美,并且能将能力迁移到真实世界的视频素材以及未训练过的类别,例如动物。作者表示,这支持了一个颇具争议的观点:视频生成器可以作为计算机视觉中通用世界模型的基础。

谷歌 DeepMind 推出的新模型 GenCeption,以一个预训练的视频生成模型为基础来处理经典计算机视觉任务。它在深度估计、分割和 3D 姿态估计方面达到了最先进的性能,同时只需要极少的训练数据。

语言模型之所以变得用途广泛,几乎可以说是因为它们在学习预测下一个词的过程中顺带学会了这些能力。这个任务似乎要求模型在训练过程中吸收语法、世界知识以及上下文关系。这也是当前对大型语言模型涌现能力的主流解释。

而计算机视觉仍然缺少一种对应的训练方法。该领域目前由专用模型主导,例如用于分割的 Segment Anything 和用于深度估计的 Depth Anything。每个模型都采用各自的架构。

在一篇新论文中,DeepMind 研究人员认为,大型文生视频模型或许可以弥补这一缺口。要生成逼真的视频,模型必须理解场景的空间几何、物体如何运动以及基本物理规律。这些模型在训练中还会使用文本描述,这将语言与视觉内容联系起来。由于数据标注成本相对较低,它们可以在海量数据集上进行训练。

GenCeption 将视频生成器重新用于视觉任务

GenCeption 建立在阿里巴巴开源的 Wan2.1 视频模型之上。主要变化在于架构更简单。扩散模型通常会通过许多小步骤从噪声中生成视频,而 GenCeption 则是在一次前向传播中给出预测,因此速度足以用于实际的计算机视觉任务。

研究人员采用了一种简单方法,让一个模型能够处理多种任务。无论结果是深度图、表面法线图还是分割掩码,GenCeption 都会将每种输出表示为标准的三通道 RGB 图像。它还会把相机运动转换为图像表示。

文本提示会告诉模型要执行哪项任务,类似于给聊天机器人下达指令。对于那些不生成图像的任务,例如 3D 关键点预测,团队则加入了可训练模块。

训练时,所有任务共用同一个损失函数。研究人员没有为每个任务修改架构,而是通过处理训练数据来满足各项任务的特定要求。

以极少的数据匹配专用模型

大部分训练数据来自一个仅包含7,500个视频的合成数据集。研究团队将800个数字人类模型与来自动作捕捉数据集的200段运动序列相结合,然后在 Blender 中使用不同背景和摄像机角度渲染出结果。真实视频仅用于语言引导的分割任务。

根据这项研究,尽管对每项任务都只使用一种架构,GenCeption 在许多基准测试中的表现仍与当前最先进结果相当,甚至更好。它的深度估计结果可与 DepthAnything 3 等专用模型相媲美。GenCeption 在表面法线估计方面击败了 NormalCrafter 和 Lotus-2;在 3D 姿态识别方面也优于 Genmo 和 TRAM。在复杂的语言引导分割任务上,它的表现与 Meta 的 SAM 3 结合 Gemini 3.5 Flash 的方案持平。

D4RT 和 VGGT Omega 等模型是在数百万个视频上训练的。GenCeption 仅使用少 7 到 500 倍的数据,就达到了相近的结果。在相同条件下测试时,基于视频生成的预训练也优于 V-JEPA 和 VideoMAE V2 等方法。作者将这些结果归因于生成任务本身,而不只是数据量。他们认为,视频生成有助于模型学习有关空间和运动的有用表示。

尽管与训练数据相比具有很强的泛化能力,但也存在明显局限。

GenCeption 几乎完全在展示单个人物的合成视频上训练,但它仍然能处理真实视频中画面里有多个人物的情况,也能处理动物和类人机器人等无关类别。根据研究,部分输出比训练时使用的 Blender 渲染结果包含更多细节。结果可以保留猫的胡须以及单根头发边缘的细节。

在所有任务上联合训练会损害 3D 关键点估计。研究人员怀疑,为了完成这项任务而额外加入的组件,会干扰基础模型在预训练期间学到的机制。

他们的结论是,应尽可能少地改变原始模型的架构。处理速度也仍需改进。较小的模型处理一个 81 帧视频大约需要 6 秒,较大的模型有 140 亿个参数,处理时间约为 10 秒。

视频生成器可能在不理解物理规律的情况下,已经包含有用的世界模型。

作者否定了视频生成器只是娱乐工具的看法。他们认为,这些模型已经包含一种通用的“世界模型”,可以支撑一个用于计算机视觉的基础模型。这类系统在图像处理中的作用,可能与大型语言模型在文本处理中的作用相同。

这种表述是否成立仍有争议。一个国际研究团队最近借助 OpenWorldLib 提出了一种统一定义,并明确排除了文本到视频模型,因为它们缺少来自真实世界的反馈。

前 Meta 首席 AI 科学家 Yann LeCun 进一步主张,生成式视频模型是一条死胡同。Meta 的 V-JEPA 2 走的是他一直倡导的另一条路线:预测抽象概念,而不是像素。清华大学的一项基准测试则揭示了像素预测的局限性。即便输出看起来很逼真,Sora 2、Seedance 2.0 和 Veo 3.1 仍在基本物理和逻辑测试中屡屡失败。

GenCeption 将视频生成用于一个更窄的目的。研究人员并不要求 Wan2.1 去预测世界将如何演变,而是用它为深度估计和分割等特定任务提取特征,在这些任务中,所学到的特征有时能优于专门系统。Google Deepmind 也在通过 Genie 3 探索另一种方法,该系统构建交互式 3D 环境,用于训练 AI 智能体。

来源与参考

  1. 原始链接
  2. Google Deepmind argues video generators already contain the world models computer vision has been missing

收录于 2026-07-20