Qwen-Image-3.0提升文字型图像生成
The Decoder··作者 Jonathan Kemper
关键信息
Qwen表示,该模型最多可接受4,500个token的提示词,并能生成小至10像素的可读文字以及LaTeX风格的数学公式。示例还展示了它对12种语言、嵌套式界面原型、基于实时数据的输出,以及保留或修复细节结构的图像编辑任务的支持。
资讯摘要
阿里巴巴Qwen团队发布了Qwen-Image-3.0,这是其图像生成器的第三个版本。官方表示,前两代分别更强调“精确”,以及“精确、多样、完整、美观、真实”,而这一代则把目标概括为一个词:“Real”。这款模型被定位为面向实际工作的工具,例如报纸排版、分镜脚本、试卷和其他信息密集型视觉内容,而不仅仅是生成好看的图片。Qwen-Image-3.0支持最长4,500个token的提示词,团队认为这使它能够一次性生成复杂版式,而不是拆成多张图再拼接。演示中,一个3×3网格里同时放入了九张独立信息图,每一格都包含自己的文字、公式和插图。示例主题包括隧道附近的跟车安全距离、垂线、关于情与理的儒家内容、旋转圆柱体上投射物的脱离速度,以及肝吸虫生命周期、右侧胸痛、72阶群的Sylow定理、银行内部控制和动植物细胞中的DNA等。
团队还展示了嵌套界面能力:先是一个VSCode窗口,里面嵌着Qwen Chat界面,而该界面里又包含一段微信对话,最终对话中还嵌入了一张讲解手冲咖啡的海报。Qwen还强调了渲染保真度的提升,称模型可以生成低至10像素的可读文字,并写出包含上下标、括号、分数、求和和乘积的多行LaTeX公式。其他示例还包括模拟报纸版面、教师批注风格的红色手写评论、修复受损的水墨鹰图,以及把昆虫照片做成包含分类、特征标注、局部放大和比例尺的鉴定图。该模型原生支持12种语言,并可结合实时互联网数据生成内容,例如杭州天气预报。当前它仅通过邀请制API开放,文章还指出它大概率不会像最初的Qwen-Image那样以开放许可方式发布权重。

资讯正文
阿里巴巴的 Qwen-Image-3.0 能一次性生成完整信息图网格和可读的 10 像素文本
阿里巴巴的 Qwen 团队发布了 Qwen-Image-3.0,这是一款面向报纸版面、复杂信息图以及其他信息密集型视觉内容等实际应用而打造的图像生成器。
该模型可处理最多 4,500 个 token 的输入,并能在一次生成中以清晰可读的方式呈现小至 10 像素的文字、数学公式以及 12 种语言。
目前,Qwen-Image-3.0 仅通过邀请制 API 开放使用,团队也计划很快将其整合到 Qwen Chat 等第一方应用中。与最初的 Qwen-Image 不同,这一模型的权重不太可能以开源许可证的形式发布。
Qwen-Image-3.0 可以一次生成多面板信息图,生成小至 10 像素的可读文字,并以 12 种语言进行书写。不过,AI 生成的学术论文和报纸页面以静态图像形式是否真的有用,仍然是一个开放问题。
阿里巴巴的 Qwen 团队发布了其图像生成器的第三个版本 Qwen-Image-3.0。根据团队说法,第一版聚焦于“precision(精度)”,第二版则面向“precision, variety, completeness, beauty, and authenticity(精度、多样性、完整性、美感和真实性)”。这一次,Qwen 用一个词概括目标:“Real(真实)”。该模型旨在处理报纸版面、分镜脚本、试卷等实用工作,而不仅仅是生成好看的图像。
更长的提示词让模型能够一次生成复杂版面
Qwen-Image-3.0 支持最长 4,500 个 token 的提示词。团队表示,这为模型在一次生成中创建密集版面提供了足够空间,而不必把它们拆成多张图像再拼接。
其中一个演示把 9 个独立的信息图放进了一个 3 x 3 网格里,每个信息图都有自己的文字、公式和插图。这些面板分别涵盖了隧道附近的安全跟车距离、垂线、关于情感与理性的儒家教诲,以及抛射体从旋转圆柱上脱离的速度。其他面板则解释了肝吸虫的生命周期、右侧胸痛、72 阶群的 Sylow 定理、银行内部控制,以及动物和植物细胞中的 DNA。
团队还展示了该模型如何处理嵌套界面。一个例子从一个包含 Qwen Chat 界面的 VSCode 窗口开始。在那个界面里又嵌着一段微信对话,而对话中还包含一张解释如何制作手冲咖啡的海报。
10 像素文本和 LaTeX 公式进一步挑战了渲染保真度
Qwen 表示,该模型可以生成小至 10 像素的清晰可读文本。其示例包括一张塞满文字的鲸鲨信息图,以及一篇虚构的代数几何论文的完整页面。论文中包含多行 LaTeX 公式,带有下标、上标、花括号、分数、求和和乘积。其他演示还展示了一张模拟报纸页面,以及类似老师批注的红色手写评论。
Qwen-Image-3.0 还力求在肖像和物体中呈现照片级细节,包括可见的毛孔、皮肤纹理以及一根根独立的头发。在另一段编辑演示中,这款模型修复了一幅受损的传统水墨斗鹰图。它在补全缺失区域的同时,还能匹配原有的笔触和墨色层次。
语言支持和 UI 原型图拓展了模型的能力范围
Qwen 将第三个重点领域描述为“深度知识”。该模型原生支持十二种语言,包括日语、韩语和西班牙语。已公布的示例还显示,它能够重现来自网站、游戏和直播的界面。在一段编辑演示中,这款模型把一张昆虫照片变成了一张完整的鉴定图版,其中包含分类信息、身体特征标签、放大的细节视图以及比例尺。
据 Qwen 介绍,这款模型还可以接入实时互联网数据,并利用这些数据生成诸如杭州天气预报之类的内容。另一个示例则把中国水墨画家齐白石和文森特·梵高放进了一个模拟直播间里。
阿里巴巴就在今年 5 月发布了直接前代产品 Qwen-Image-2.0。其技术报告重点介绍了训练和推理效率的提升,包括一个更快的变体——每张图像只需要 4 步,而不是 40 步。在阿里巴巴自家的竞技平台测试中,Qwen-Image-2.0 的表现仅次于 OpenAI 的 GPT-Image-2 和 Google 的 Nano Banana Pro。
目前,Qwen-Image-3.0 似乎只能通过邀请制 API 访问。该模型很快也应会出现在 Qwen Chat 等第一方应用中。该模型的权重不太可能像最初的 Qwen-Image 那样以开源许可证发布。
技术很惊艳,但这些用例并不总是说得通
其中一些演示的实际价值仍不明确。研究人员通常会用 LaTeX 撰写和排版论文,而不是把论文渲染成图像,因此,包含公式的 AI 生成页面可能更适合作为原型图和视觉草稿,而不是最终论文。
报纸版面和复杂信息图也面临类似的问题。现代图像模型可以编辑单独的文本元素,但可搜索、可编辑的格式在制作流程中仍然提供更多灵活性。即便如此,这些示例展示了文本渲染技术已经进步到了什么程度,并且或许指向了本文所展示演示之外更有用的应用场景。
来源与参考
收录于 2026-07-22