xAI 的 Imagine Image 2.0 紧随 GPT-Image-2
The Decoder··作者 Matthias Bastian
关键信息
截至 2026 年 8 月 7 日,速度更快的 low 变体在 Image Edit Arena 和 Text-to-Image Arena 中都位列全球第二,Elo 分别为 1,439 和 1,320。xAI 还强调了 Magic Wand 局部编辑、分割选区、背景移除、最多五张输入图像的 Multi-Ref Editing,以及用于调整长宽比的 Smart Resize。
资讯摘要
xAI 发布了 Imagine Image 2.0,并将其作为 Grok 中新的“质量模式”上线,用户可以在 grok.com/imagine 以及 Grok 的 iOS 和 Android 应用中使用。公司同时表示,API 访问也会在稍后开放,但尚未公布面向开发者的具体时间。xAI 介绍称,这一模型在精确执行指令、在复杂画面中保持清晰的字体与版式,以及在多次生成之间维持一致性方面都有提升。根据 2026 年 8 月 7 日的 Arena 排行榜,Imagine Image 2.0 的速度更快的 low 变体在 Image Edit Arena 和 Text-to-Image Arena 中都排到了全球第二。它在图像编辑榜上的 Elo 为 1,439,落后于 OpenAI 的 GPT-Image-2(1,463);在文生图榜上的 Elo 为 1,320,也低于 GPT-Image-2 的 1,380。Reve 2.1、Meta 的 Muse-Image、Alibaba 的 Qwen-Image-3.0-Pro、Google 的 Gemini 以及 ByteDance 的 SeedDream 在这些对比中排名更靠后。
文章还指出,新模型在这些测试中大幅超过了 xAI 前一代的 Quality 版本。除了基准成绩之外,xAI 还围绕工作流推出了多项编辑功能。Magic Wand 可以只修改选定区域,分割功能可以精确选择局部,背景移除可以导出透明背景的主体。Multi-Ref Editing 支持最多五张输入图像合成为一次生成,Smart Resize 则能把已有图片转换为任意长宽比,并由模型自动补全额外空间。xAI 还提供了模板,覆盖照片编辑、产品摄影、营销物料、设计工具、游戏素材和直播表情等常见场景。公司另外展示了一项功能,可以分别生成角色、地点和道具,同时保持整体视觉风格一致,并将其定位为通向完整视频制作流程的一步。

资讯正文
xAI 的 Imagine Image 2.0 在 Arena 基准测试中紧随 OpenAI 的 GPT-Image-2 之后
xAI 发布了带有编辑工具和预设模板的 Imagine Image 2.0。该模型在 Arena 基准测试中的表现仅次于 OpenAI 的 GPT-Image-2。
据 xAI 介绍,Imagine Image 2.0 现已作为 grok.com/imagine 以及 Grok 的 iOS 和 Android 应用中的全新“Quality Mode”上线。Imagine Image 2.0 的 API 访问即将到来。
xAI 表示,Imagine 2.0 旨在以细致入微的准确度遵循指令,在复杂视觉内容中保持排版和布局整洁,并在多次生成之间保持一致性。
截至 2026 年 8 月 7 日的 Arena 排行榜上,该模型更快的“low”变体在两个类别中都位居全球第二。在 Image Edit Arena 中,它的 Elo 评分为 1,439,落后于 OpenAI 的 GPT-Image-2 的 1,463。在 Text-to-Image Arena 中,它得分为 1,320,同样不及 GPT-Image-2 的 1,380。
Reve 2.1、Meta 的 Muse-Image、阿里巴巴的 Qwen-Image-3.0-Pro、Google 的 Gemini 以及字节跳动的 SeedDream 都排在更靠后的位置。新模型在这些测试中也以明显优势击败了其前代的“Quality”变体。
面向迭代工作流构建的编辑工具
Imagine Image 2.0 附带了多项编辑功能。xAI 表示,一项名为“Magic Wand”的工具只会修改图像中选中的区域。分割功能允许用户选择精确区域,而背景移除工具则可导出带透明背景的主体。
Multi-Ref Editing 允许用户将最多五张输入图片合成为一次生成。“Smart Resize” 可将现有图像转换为任意宽高比,模型会自行补全额外空间。
模板与视频前期制作规划
xAI 还在加入模板功能,把常见的图像工作流打包成预配置的起点。类别涵盖照片编辑、产品摄影、营销素材、设计工具、游戏资产以及流媒体表情符号。
xAI 还展示了一项功能:它能分别生成角色、地点和道具,同时让所有图像保持统一的视觉风格。公司将其定位为迈向完整视频制作工作流的垫脚石。
来源与参考
收录于 2026-08-09