MiniMax H3登顶AI视频榜单
The Decoder··作者 Maximilian Schreiner
关键信息
H3是一个330亿参数模型,能够同时处理文本、图像、视频和音频,并生成4到15秒、带立体声音效的片段。不过,2K分辨率模块和H3-Context-IR仍未开源,因此在ComfyUI中本地运行时最高只能到768p,用户还需要按照MiniMax发布的提示指南自行准备上下文。
资讯摘要
MiniMax发布了H3视频模型的权重,Artificial Analysis称它是首个登顶其AI视频排行榜的开源模型。在该榜单中,H3在视频编辑项目中排名第一,在文本生成视频中排名第二,在图像生成视频中排名第三。根据模型卡,H3是一个330亿参数的多模态系统,可以同时处理文本、图像、视频和音频。它能够生成4到15秒的短片,并带有立体声音效。单个提示词最多可以包含九张参考图、三个视频片段和三个音频片段。
尽管如此,并不是所有组件都开放:2K分辨率模块和H3-Context-IR仍然是闭源的,而H3-Context-IR负责把上下文转换为H3-Base可接受的结构化中间表示。由于这些限制,H3在ComfyUI本地运行时最高只能输出768p,用户还需要借助MiniMax发布的提示指南自己准备上下文。开源权重仍然允许用户针对自有素材、角色或特定视觉风格进行微调。许可方面也有商业限制,只有年收入低于2000万美元的公司才能商用。文章还提到,字节跳动在同一天发布了闭源的Seedance 2.5,支持生成30秒视频并内置音频。

资讯正文
中国的 MiniMax H3 是首个登上 AI 视频排行榜首位的开放模型
MiniMax 发布了 H3 视频模型权重,使开放模型首次登上视频排行榜榜首。Artificial Analysis 将 H3 评为视频编辑第一、文生视频第二、图生视频第三。这款拥有 330 亿参数的模型可同时处理文本、图像、视频和音频,生成时长 4 到 15 秒、带立体声音效的片段。根据模型卡,单个提示词最多可包含 9 张参考图像、3 段视频和 3 段音频。
MiniMax H3 视频
不过,仍有两部分保持闭源。2K 分辨率模块以及 H3-Context-IR——它会把提示词和参考素材翻译成结构化中间格式——都没有包含在内。在 ComfyUI 中本地运行 H3 的上限是 768p,用户还需要按照 MiniMax 发布的提示指南自行处理上下文准备。开放权重确实允许针对自有素材、角色或特定视觉风格进行微调。许可证方面有一个限制:只有年收入低于 2000 万美元的公司才被允许商用。
字节跳动同一天发布了其闭源的 Seedance 2.5,可生成带内置音频的 30 秒片段。
来源与参考
收录于 2026-08-04