7月21日,阿里正式发布新一代图像生成基础模型Qwen-Image-3.0。作为千问图像生成与编辑系列的第三代基础模型,新模型的核心主线只有一个字——“实”。
从“好看”到“好用”:一张图的进化逻辑
AI图像生成模型在过去几年进步神速——画面越来越精致,风格越来越多元。但当需求从“生成一张好看的图”转向“完成一项实际工作”时,局限随之显现。模型能生成一张惊艳的写实人像,却难以渲染一份排版精确的数学试卷、一页公式复杂的学术论文。
Qwen-Image-3.0的目标,正是让图像生成从“好看”走向“好用”——让AI真正成为可落地的生产力工具。
如果说Qwen-Image-1.0的关键词是“准”,Qwen-Image-2.0的关键词是“准多齐美真”,那么Qwen-Image-3.0的核心主线只有一个字——“实”。
这个“实”体现在三个维度:
内容丰实: 支持最大4.5k token输入,可轻松生成报纸、分镜、试卷等复杂版面。
细节真实: 支持10px小字精准渲染,毛孔、发丝细节生动还原。
知识厚实: 支持12国语言原生渲染,主流网页、游戏、直播等界面仿真。
4.5K Token超长输入:像写需求文档一样画图
Qwen-Image-3.0最核心的升级在于文本输入能力。新模型将可接受的指令长度提升至4.5k token,较前代实现了4.5倍的跃升。
这意味着什么?在影视短剧分镜、复杂信息图、产品说明页等需要超长提示词输入的场景中,用户不再需要将需求压缩成一句话。而是可以像给设计师撰写需求文档一样,完整描述画面结构、文字内容、视觉风格和排版细节,从而让模型更精准地生成图文内容,减少反复生成和人工调试成本。
九宫格知识图解:一次生成9张复杂信息图
Qwen-Image-3.0可一次性生成涵盖9种不同领域的九宫格知识图解,字字清晰,幅幅准确。这张九宫格的每一格都是一张复杂信息图——隧道安全漫画、空间几何教学、《出师表》文体分析、物理抛体运动、生物寄生虫科普、右胸疼痛医学图解、群论Sylow定理、银行内控管理信息图、细胞DNA结构对比。每一格都包含精确的中英文文字、公式、图表和漫画人物。
要精准描述完整的九宫格,整整需要3.7k token。而Qwen-Image-3.0的上限是4.5k token。
界面嵌套:理解多层UI的逻辑关系
除了横向扩展能力,Qwen-Image-3.0还具备强大的纵深能力——理解复杂指令和画面的逻辑嵌套关系。
一个典型场景:当用户输入“在VSCode编程界面中,通过千问App生成一张发布在聊天界面里的手冲咖啡海报”时,模型能够准确理解其中的多层UI嵌套关系,并依次生成VSCode编程界面、千问App界面、社交媒体聊天界面和咖啡海报。在保持各层界面结构、风格准确的同时,甚至连手机截图里的时间数字——低至10像素的小字——都清晰可辨。
12国语言+20款字体:商业素材一键生成
Qwen-Image-3.0支持12国语言和20多款字体原生渲染。无论是多语言产品海报、影视/漫画分镜,还是跨国品牌宣传物料,都能大幅降低生产成本。
编辑能力同步升级:古画修复、草图转PPT一键完成
新模型在文生图中积累的文字渲染能力、细节质感和世界知识也迁移到了编辑场景。古画修复、全景图生成、手绘草图转PPT、多镜头机位生成等复杂编辑任务,均可一键完成。用户无需在生成与编辑之间反复切换工具,也无需担心风格、文字、细节在二次处理时出现偏差。
可用性:API邀测已开启,免费体验即将上线
目前,阿里云百炼和千问AI平台已开通API邀测。Qwen Studio和千问APP也即将上线,供用户免费体验。
随着生成式AI逐步进入专业设计和商业内容生产环节,图像模型的竞争正从基础画质转向复杂信息表达、可读性和工程化能力。Qwen-Image-3.0的发布,标志着阿里在图像生成领域向真实生产力场景迈出了关键一步。

