Black Forest Labs 的 Flux 3 加入原生音频视频生成
The Decoder··作者 Matthias Bastian
关键信息
BFL 表示,Flux 3 支持文本生成视频、图片生成视频、视频到视频、基于关键帧的过渡、多语言对话,以及把多个片段串联成更长的多镜头序列。公司基于 10 秒、720p 片段的早期内部测试显示,它在偏好评估中领先多款竞品,但 BFL 也强调这些结果仍属初步,尚无独立测试。
资讯摘要
Black Forest Labs 是一家德国 AI 公司,它发布了 Flux 3,这是一款同时学习图像、视频和音频的多模态基础模型。公司把它描述为迈向“真实世界视觉智能”的一步,也就是让模型能够在物理和数字环境中感知、预测并采取行动。BFL 认为,单一模态无法完整表达现实,因此把多种模态一起训练,可以让模型在视觉结构、时间变化和声音之间互相补足信息。借助 Flux 3,BFL 首次实现了带原生音频的视频生成,最长可达 20 秒。
该模型还支持文本生成视频、图片生成视频、视频到视频、基于关键帧的过渡、多语言对话,以及把多个片段串联成更长的多镜头序列。BFL 表示,这个模型在人脸表情和声音与物理事件的匹配方面表现尤其好。公司在 10 秒、720p 片段上的早期测试中称,它在偏好评估里优于 Luma Ray 3.2、Runway Gen-4.5 和 Grok Imagine Video,但面对 Kling v3 Pro、Happy Horse、Seedance 2.0 和 Gemini Omni Flash 等更强对手时,优势则明显缩小。BFL 还强调,这些结果只是初步数据,目前还没有独立评测。

资讯正文
Flux 3 可生成最长 20 秒、带原生音频的视频,这也是 Black Forest Labs 的首创
要点
- 德国 AI 公司 Black Forest Labs 发布了 Flux 3,这是一款多模态基础模型,可同时从图像、视频和音频中学习。
- 该模型可生成最长 20 秒、带原生音频的视频,并提供文本生成视频以及将单个片段串联起来等功能。
- 此外,该公司还开发了 Flux-mimic,这是一款面向机器人应用的视频动作模型,目前已在奥迪进行测试。
德国 AI 公司 Black Forest Labs(BFL)发布了 Flux 3,这是一款多模态基础模型,可同时从图像、视频和音频中学习。根据 BFL 的早期测试,它在视频生成方面击败了多家竞争对手。
BFL 将 Flux 3 描述为迈向“现实世界视觉智能”的一步,并将其定义为能够“在物理和数字环境中感知、预测并采取行动”的模型。该公司是构建所谓世界模型的更大趋势的一部分。
BFL 认为,没有任何单一模态能够完整捕捉现实。图像展示空间结构,视频捕捉其随时间的变化,而音频则可以揭示机械事件与其产生声音之间的联系。将三者结合进行训练,可以让它们彼此补足,从而为模型提供比单独训练每种模态更多的信息。
Flux 3 为最长 20 秒的视频加入了原生音频
Flux 3 现在首次可以生成带原生音频的视频,片长最长可达 20 秒。它支持文本生成视频、图像生成视频、视频生成视频、基于关键帧的过渡、多语言对话,以及通过智能体驱动将片段连接起来,以形成更长的多镜头序列。BFL 表示,该模型在人物面部表情以及将声音与物理事件相匹配方面尤其出色。
BFL 表示,这些结果只是初步结果,目前还没有独立测试。若能与 Seedance 和 Gemini Omni Flash 等已领先的系统看齐,Flux 3 将跻身顶级视频模型之列;其中 Seedance 已进入好莱坞。
BFL 还预计 Flux 3 将提升图像生成能力,尤其是在处理复杂提示词和多种语言的准确文本渲染方面。公司计划在未来几周内推出 Flux 3 Image 的早期访问版本。
BFL 表示,该模型还能够基于其对世界的理解来预测动作。公司与 Mimic Robotics 合作开发了 Flux-mimic,这是一款视频动作模型,目前正在奥迪的生产任务中进行测试。
Flux 3 基于 Self-Flow,这是 BFL 教授一个模型同时生成并理解内容的方法。一个多模态 transformer 使用专门组件将图像、视频和音频转换为共享的内部表示,然后再将其转换回输出结果。
一个用于动作的组件为机器人应用奠定了基础。BFL 表示,这种统一的学习过程在生成质量以及模型对物理世界的理解方面,都比此前标准的 flow-matching 方法带来了更好的结果。
BFL 计划分阶段推出,并开放权重访问
BFL 正分阶段推出全部能力,早期访问阶段将用于收集反馈和进行安全测试。Flux 3 Video 已经可用,Flux 3 Image 预计将在未来几周内跟进。动作预测最初将通过精选合作伙伴提供。
BFL 还计划以“Flux 3 Dev”的名称向外发布多模态骨干网络的开放权重版本。长期来看,公司正在研发下一代模型,目标是在单一模型中结合感知、动作和语言预测。
来源与参考
收录于 2026-07-24