Runway探索实时可控的AI视频生成
The Decoder··作者 Jonathan Kemper
关键信息
GWM-1构建于Gen-4.5之上,以自回归方式逐帧生成内容,并接受摄像机运动、机器人指令和音频等控制。核心技术难题是在多会话共享硬件的情况下,以足够快的速度生成画面,同时避免逐帧误差累积成严重变形;Runway尚未公布上线时间。
资讯摘要
Runway展示了一项研究,目标是把AI视频生成变成用户可以边观看边控制的实时视频流。现有视频系统通常要求用户提交提示,等待几秒或几分钟,检查完成的视频,如果结果不理想就重新开始。Runway表示,反复生成和修改占用了用户大量时间,因此希望缩短生成首帧的等待时间,并在用户继续输入提示时持续输出视频。这项工作延续了公司此前在Runway Characters上的探索,并使用了Runway于2025年12月推出的首个通用世界模型GWM-1。
GWM-1构建于Gen-4.5之上,能够逐帧生成视频,并响应摄像机姿态、机器人指令和音频等控制;Runway还展示过名为Solaris的逐帧界面系统,它可以对点击或语音输入作出反应。Runway认为,更快的生成速度能够减少GPU使用时间,从而让更多交互式应用具备经济可行性,但系统必须解决连续帧中的误差不断累积这一问题。公司称,它会让模型在训练中接触自身生成的不完美输出,使模型学会纠正偏差;Runway还认为,实时世界模型可用于生成机器人训练数据,并在模拟环境中测试自动驾驶系统面对罕见情形时的表现。Runway曾与Nvidia合作,在Vera Rubin平台上展示一个目标为首帧延迟低于100毫秒的研究预览,但尚未公布产品发布时间表。

资讯正文
Runway 希望将 AI 视频生成变成由你实时控制的直播流
Runway 分享了其对实时视频生成技术研究成果的一些介绍。用户无需输入提示词后等待,而是可以一边描述视频内容,一边串流生成视频。
如今的视频模型通常分为彼此独立的步骤。用户输入提示词,等待几秒钟或几分钟,然后得到一段完成的视频。如果结果不理想,就只能重新开始。Runway 表示,用户反复反馈称,生成和修改视频耗费了最多时间,因此公司希望缩短生成第一帧所需的时间,并在用户输入提示词的过程中持续串流生成视频。
Runway 于 3 月首次在 Runway Characters 中讨论了这一思路。该系统使用 GWM-1——Runway 的首个“通用世界模型”(General World Model),公司于 2025 年 12 月推出了这一模型。GWM-1 建立在 Gen-4.5 之上,逐帧生成视频,并接受摄像机运动、机器人指令或音频作为控制信号。就在几周前,Runway 还展示了 Solaris:这是一个利用 Gen-4.5 逐帧生成用户界面的系统,并能响应点击或语音输入。
实时生成可以减少等待时间和 GPU 成本
Runway 认为,实时生成能够缩小创意与执行之间的差距。有了即时反馈,用户大部分时间都可以用来主动引导视频,而不是等待。
Runway 还指出,实时生成可以降低成本。速度更快的模型占用的 GPU 时间更少,因此成本效益更高。Runway 表示,在特定质量水平下,单次输出的成本决定了哪些应用在经济上可行。即时生成会降低这一成本门槛,使此前无利可图的应用变得可行。
微小的视觉错误可能逐渐演变成严重失真
文本模型可以在句子中途自我修正,但视频模型会在前一帧的基础上生成每一帧,因此微小的错误可能随着时间累积,最终演变成严重失真。Runway 称,这是基于 LLM 的方法面临的核心问题。为此,Runway 不仅使用无错误的输入训练模型,还让模型使用自身的输出进行训练,教会它修正自身的偏差,而不是将偏差不断放大。
初创公司 Decart 也为其实时模型 MirageLSD 采用了类似方法,在训练过程中有意让模型接触存在缺陷或失真的图像。Google DeepMind 表示,其世界模型 Genie 3 可以在 720p 分辨率下,以每秒 24 帧的速度,让交互式世界在数分钟内保持一致。
Runway 表示,实时生成会将计算负载从训练阶段转移到使用阶段。模型必须以足够快的速度生成每一帧,以跟上播放进度,同时还要在由多个会话共享的硬件上运行。
世界模型将用于训练机器人和机器人出租车
Runway 认为,交互式应用是 AI 生成媒体最重要的长期应用场景。该公司表示,教育、游戏和机器人技术都需要视频以不亚于观看者反应速度的速度做出响应。评估机器人或自动驾驶车辆在现实世界中的行为,也需要能够实时生成环境并即时响应极端情况。Runway 此前推出了 GWM Robotics,这是 GWM-1 的一个变体,用于为机器人生成合成训练数据。
Waymo 也在采取类似的方法,推出了基于 Genie 3 并针对道路交通进行适配的 Waymo World Model。它可以让 Waymo 模拟其车队从未遇到过的情况,例如遭遇大象、龙卷风,或驶入被洪水淹没的居民区。据 Waymo 介绍,Waymo Driver 会先在虚拟世界中行驶数十亿英里,然后才会在公共道路上遇到相关场景。
今年 3 月,Runway 还在芯片制造商 Nvidia 的 GTC 大会上展示了与 Nvidia 共同开发的实时模型研究预览版。该模型运行在 Vera Rubin 平台上,旨在将首帧生成时间控制在 100 毫秒以内。Runway 尚未公布该模型的上线时间表。
来源与参考
收录于 2026-09-21