通义千问 Qwen-Image 3.0:图像 AI 的下一站不是「好看」,而是「有用」

阿里第三代图像模型主打信息密集、文字繁多的版面——支持 4.5k token 提示词、10px 小字清晰可读、12 种语言一次生成——但目前所有说法都来自厂商演示,而非基准测试。

未核实 来源 Qwen (Alibaba) vendor blog — self-reported ⚑ 模型发布

60 秒版本

阿里 Qwen-Image 3.0 把图像生成重新定义为生产力工具——密集、文字多、版面准确、为真实工作而生,而不只是好看。

要点

  • 核心主题是「实」= 有用;三大支柱:内容丰富、细节真实、知识深厚。
  • 头号说法:4.5k token 提示词、一次生成 3×3 信息图网格、10px 小字清晰、12 语言原生、联网取实时信息。
  • 面向报纸 PDF、分镜、复杂界面、教育与电商。
  • 所有数据均为自测并配精选演示——目前没有独立基准。

结论. 一次大胆押注:图像 AI 的下一站是「有用」胜过「好看」。规格可核查,质量类说法不可——等外部实测再信那份惊艳。

核心主张从「好看」到「有用」

阿里通义千问团队发布了 Qwen-Image 3.0,第三代图像生成模型。千问给每一代定关键词:1.0 是「精准」;2.0 是「精准、多样、完整、美观、真实」;3.0 则归结为一个字——「实」。这里的「实」不是光鲜,而是*有用*:图要密集、准确到能当真正的工作成果——幻灯片、分镜、界面稿。

一句话概括这场押注:多数图像模型比的是「画得多漂亮」,而千问认为,下一个前沿是你能在一张图里塞进多少*正确的信息*——文字、版面、公式、界面——而不糊成一团。

官方框架三大支柱

千问把这次发布围绕三项宣称的能力展开,各自回答一个问题:

支柱回答的问题
内容丰富能画多少?
细节真实能画多精细?
知识深厚能画多广?

支柱一内容丰富——宽度与深度

核心演示是一个 3×3 网格,每格都是一张不同的复杂信息图——几何课、物理抛体图、生物讲解、银行内控图表等——各自带中英文字、公式和人物。千问称,描述整张图用了约 3.7k token,且是*一次生成*,而非把九张图拼接而成。

除了这种「一张画布能容纳多少并列元素」的横向能力,他们还展示了纵深:一个画中画中画演示,把代码编辑器嵌进聊天应用、再嵌进即时通讯、再嵌进海报——每层都保留各自真实的观感。

4.5k可接受的最长提示词 token 数
3.7k描述 3×3 网格演示所用 token
10px宣称仍可读的最小字号
12原生渲染的语言数

支柱二细节真实——小字测试

最尖锐的说法是小字可读性。千问用一整页学术论文做压力测试——LaTeX 公式、上下标、希腊字母、多行方程——以及一张信息密集的鲸鲨科普图。质感方面,他们强调毛孔、发丝与接近照片级的皮肤。编辑演示包括在书页上叠加逼真手写批注、以及在保留原始笔法的前提下修复受损水墨画。

千问官方演示:一张信息密集的鲸鲨科普图,用于展示小字清晰渲染。由厂商精选。
千问官方演示:一张信息密集的鲸鲨科普图,用于展示小字清晰渲染。由厂商精选。 · 千问 / 阿里

支柱三知识深厚——语言、界面、实时信息

千问称原生渲染 12 种语言(演示了日语、韩语、西班牙语),支持 100+ 艺术风格,以及网页、游戏、直播等真实界面版式。模型调用世界知识,值得注意的是还能联网——一个演示生成了某城某天的天气预报卡片。

token 上限可核查,质量则不行——至少现在还不行。

问题所在很惊艳,但全是自测

这是一份配以精选示例的厂商公告。没有独立基准、没有第三方对比、也没有公开错误率。具体可核查的只有规格——4.5k token 上限和 12 种语言。那些惊艳之处——完美小字、一次成网格——你目前无法用自己的提示去验证。这确实是一次有意思的战略押注;能否经得起真实使用,演示回答不了。