# 通义千问 Qwen-Image 3.0：图像 AI 的下一站不是「好看」，而是「有用」

> 阿里第三代图像模型主打信息密集、文字繁多的版面——支持 4.5k token 提示词、10px 小字清晰可读、12 种语言一次生成——但目前所有说法都来自厂商演示，而非基准测试。

_Source: Qwen (Alibaba) vendor blog — self-reported · 2026-07-21 · 6 min read_

Canonical: https://iyu.app/zh/e/qwen-image-3

## 60 秒版本

阿里 Qwen-Image 3.0 把图像生成重新定义为生产力工具——密集、文字多、版面准确、为真实工作而生，而不只是好看。

**要点**

- 核心主题是「实」= 有用；三大支柱：内容丰富、细节真实、知识深厚。
- 头号说法：4.5k token 提示词、一次生成 3×3 信息图网格、10px 小字清晰、12 语言原生、联网取实时信息。
- 面向报纸 PDF、分镜、复杂界面、教育与电商。
- 所有数据均为自测并配精选演示——目前没有独立基准。

**结论.** 一次大胆押注：图像 AI 的下一站是「有用」胜过「好看」。规格可核查，质量类说法不可——等外部实测再信那份惊艳。

## 全文

> **⚑ Caveat:** 下文所有数据与示例均为**千问官方自测**，且配以精挑细选的演示。目前没有独立基准或第三方对比，请将质量类说法视为宣传，而非实测。


### 核心主张 — 从「好看」到「有用」

阿里通义千问团队发布了 **Qwen-Image 3.0**，第三代图像生成模型。千问给每一代定关键词：1.0 是「精准」；2.0 是「精准、多样、完整、美观、真实」；3.0 则归结为一个字——**「实」**。这里的「实」不是光鲜，而是*有用*：图要密集、准确到能当真正的工作成果——幻灯片、分镜、界面稿。

一句话概括这场押注：多数图像模型比的是「画得多漂亮」，而千问认为，下一个前沿是你能在一张图里塞进多少*正确的信息*——文字、版面、公式、界面——而不糊成一团。


### 官方框架 — 三大支柱

千问把这次发布围绕三项宣称的能力展开，各自回答一个问题：

- **支柱:** 回答的问题
- **内容丰富:** 能画多少？
- **细节真实:** 能画多精细？
- **知识深厚:** 能画多广？


### 支柱一 — 内容丰富——宽度与深度

核心演示是一个 **3×3 网格**，每格都是一张不同的复杂信息图——几何课、物理抛体图、生物讲解、银行内控图表等——各自带中英文字、公式和人物。千问称，描述整张图用了约 **3.7k token**，且是*一次生成*，而非把九张图拼接而成。

除了这种「一张画布能容纳多少并列元素」的横向能力，他们还展示了纵深：一个**画中画中画**演示，把代码编辑器嵌进聊天应用、再嵌进即时通讯、再嵌进海报——每层都保留各自真实的观感。

- **4.5k** — 可接受的最长提示词 token 数
- **3.7k** — 描述 3×3 网格演示所用 token
- **10px** — 宣称仍可读的最小字号
- **12** — 原生渲染的语言数


### 支柱二 — 细节真实——小字测试

最尖锐的说法是小字可读性。千问用一整页**学术论文**做压力测试——LaTeX 公式、上下标、希腊字母、多行方程——以及一张信息密集的**鲸鲨科普图**。质感方面，他们强调毛孔、发丝与接近照片级的皮肤。编辑演示包括在书页上叠加逼真手写批注、以及在保留原始笔法的前提下修复受损水墨画。

*Figure: 千问官方演示：一张信息密集的鲸鲨科普图，用于展示小字清晰渲染。由厂商精选。*

> **🔎** 文字渲染恰恰是精选演示最容易「美化」模型的地方——展示里完美无缺，换成你的提示就出乱码。在有「未见提示」的错误率之前，「10px 清晰」只是最佳情况，而非保证。


### 支柱三 — 知识深厚——语言、界面、实时信息

千问称原生渲染 **12 种语言**（演示了日语、韩语、西班牙语），支持 100+ 艺术风格，以及网页、游戏、直播等真实界面版式。模型调用世界知识，值得注意的是还能**联网**——一个演示生成了某城某天的天气预报卡片。

> token 上限可核查，质量则不行——至少现在还不行。


### 问题所在 — 很惊艳，但全是自测

这是一份配以精选示例的厂商公告。**没有独立基准、没有第三方对比、也没有公开错误率**。具体可核查的只有规格——4.5k token 上限和 12 种语言。那些惊艳之处——完美小字、一次成网格——你目前无法用自己的提示去验证。这确实是一次有意思的战略押注；能否经得起真实使用，演示回答不了。

> **⚡** 关注：独立的文字渲染基准、在真实杂乱提示上的上手实测，以及模型是开源权重（像早期 Qwen-Image 那样）还是仅提供 API。


## Primary sources

- [Qwen-Image-3.0 announcement (Qwen / Alibaba)](https://qwen.ai/blog?id=qwen-image-3.0)
- [Qwen-Image-2.0 announcement (for comparison)](https://qwen.ai/blog?id=qwen-image-2.0)

---
_Published by iyu (https://iyu.app) — the day's AI news, checked against primary sources and rewritten in plain language. Free to quote with attribution and a link to the canonical URL._
