字节跳动 Seedance 2.5 支持30秒视频与音频

The Decoder··作者 Gregor Kobsik

关键信息

该模型目前已在即梦 AI 和豆包 Pro 上线,后续才会通过 BytePlus ModelArk 提供 API 访问。字节跳动表示,纹理、光照和皮肤细节都有改进,并用一部完全由 Seedance 2.5 制作的短片来展示能力。

资讯摘要

字节跳动发布了 Seedance 2.5,这是其 AI 视频模型的新版本。该模型可以在一次生成中同时输出视频和音频,因此比起先生成画面、再补充声音的工作流更完整。文章称,它支持最长 30 秒的视频片段,而且还可以多次延长。除此之外,Seedance 2.5 还支持大量参考输入,用户最多可以上传 30 张图片、10 个视频片段和 10 个音频文件来引导生成结果。这样的输入方式主要是为了生成包含多个角色和不同镜头角度的复杂场景。

字节跳动还表示,新版本在纹理、光照和皮肤细节方面都有提升。公司用一部名为《The Missing Pair》的短片展示了该模型的能力,这部短片完全由 Seedance 2.5 制作完成。文章指出,对于广告和视觉内容制作来说,这种能力有望让团队在一个流水线里完成整套生产,而不必把多个片段再拼接起来。目前,Seedance 2.5 已经在即梦 AI 和豆包 Pro 上线,而通过 BytePlus ModelArk 提供 API 访问则要等到之后。文章还补充说,Seedance 2.0 在 Artificial Analysis 的带音频图生视频榜单上处于领先位置,并且《第九区》导演 Neill Blomkamp 也曾用 Seedance 2.0 制作过 AI 短片《Nightborne》。

字节跳动 Seedance 2.5 支持30秒视频与音频

资讯正文

字节跳动的 Seedance 2.5 可生成带内置音频的 30 秒视频片段

字节跳动发布了 Seedance 2.5,这是其 AI 视频模型的一个新版本。它可一次性生成视频和音频,输出最长 30 秒、且可多次续接延长的片段。相比之下,Google 的 Gemini Omni Flash 上限大约为 10 秒。用户最多可以上传 30 张图片、10 段视频和 10 个音频文件作为参考,以创建包含多个角色和不同机位角度的场景。纹理、光照和皮肤细节也有所改进。

字节跳动通过一部完全使用 Seedance 2.5 制作的短片展示了该模型的能力。对于广告和视觉内容而言,这使团队能够在一条工作流中完成完整制作,而不必将单独的片段拼接起来。

短片《The Missing Pair》完全由 Seedance 2.5 创作 | 视频:字节跳动

Seedance 2.5 已在即梦 AI 和豆包 Pro 上线,API 访问则将通过 BytePlus ModelArk 在后续开放。根据 Artificial Analysis 的数据,上一版本 Seedance 2.0 在带音频模型的图生视频排行榜上领先。“第九区”导演尼尔·布洛姆坎普曾使用该版本创作《Nightborne》,这是一部完全由 AI 生成的 13 分钟短片。

来源与参考

  1. 原始链接
  2. ByteDance's Seedance 2.5 generates 30-second video clips with built-in audio

收录于 2026-08-02