Qwen-Image-2.1以70亿参数挑战闭源模型

The Decoder··作者 Matthias Bastian

关键信息

Qwen-Image-2.1能够生成和编辑透明RGBA图像,并可通过圆圈、蒙版或手绘标记引导局部修改;它还可处理最多十张参考图像,用于合影、虚拟试穿和房间设计等任务。性能结论目前来自Qwen自有基准测试,仍需独立验证;商业用户还必须向Qwen申请单独许可证。

资讯摘要

Alibaba的Qwen AI团队发布了Qwen-Image-2.1,这是一款同时用于图像生成和编辑的开放权重模型。它的视觉生成模块仅包含70亿个参数,而Qwen称该模型在团队自有的内部基准测试中超过了大多数闭源模型。由于这一比较尚未经过独立确认,因此相关排名目前应被视为团队声明,而不是已经确立的行业结论。该模型原生支持透明RGBA图像,用户可以分离对象,或在透明图层上修改文字。

它最多可以接收十张参考图像,可用于合影、虚拟试穿以及室内或房间设计等场景。用户还可以使用圆圈、蒙版或手绘标记引导局部编辑;架构调整和KV缓存复用则旨在提升推理速度,尤其是在输入多张参考图像时。Qwen已通过Hugging Face、GitHub和Model Scope发布该模型,并提供Hugging Face演示页面,但其研究许可证禁止商业使用,商业用户需要另行申请许可证。

Qwen-Image-2.1以70亿参数挑战闭源模型

资讯正文

阿里巴巴的 Qwen AI 团队发布了用于图像生成和编辑的开放权重模型 Qwen-Image-2.1。团队称,其视觉生成组件仅有 70 亿个参数,但在 Qwen 自己的基准测试中胜过了大多数闭源模型,不过独立基准测试结果仍有待公布。该模型可在 RTX 3090 等性能较强的消费级 GPU 上运行。

该模型原生支持生成和编辑透明图像(RGBA),用户可以借此分离对象,或修改透明图层上的文字。它一次最多可处理 10 张参考图像,适用于集体肖像、虚拟试穿或房间设计;同时,用户可通过圆圈、蒙版或涂画标记引导局部编辑。Qwen 表示,架构调整和 KV 缓存复用加快了推理速度,在使用多张参考图像时尤为明显。

Qwen-Image-2.1 已在 Hugging Face、GitHub 和 ModelScope 上发布,并提供 Hugging Face 演示。其研究许可证禁止商业使用,因此企业用户必须向 Qwen 申请单独的许可证。

来源与参考

  1. 原始链接
  2. Alibaba's open-weight Qwen-Image-2.1 claims to beat closed models in image generation with just 7 billion parameters

收录于 2026-09-21