摘要:千问 9 月 20 日开源 Qwen-Image-2.1,视觉生成部分 7B 参数,原生 2K 与 RGBA 透明图,最多 10 张参考图、圈选涂画等局部修改,首日支持 ComfyUI 与 Diffusers,采用研究许可。

图像生成这条线,今天被千问用一记开源补了一刀。Qwen-Image-2.1 把"文生图"和"图像编辑"统一进同一个模型,视觉生成部分只有 7B 参数,却原生支持 2K 分辨率、RGBA 透明通道、最多 10 张参考图,以及圈选、涂画、Mask 这类局部修改方式;发布首日就接上了 ComfyUI 和 Diffusers,对 AIGC 创作者相当友好。架构上它用单流 DiT 配 Qwen3-VL 8B 文本编码器和一个 64 通道的 RGBA VAE,原生输出 2048×2048,约 40 步出图。

08-千问开源Qwen-Image-2.1生图编辑.jpg

小参数、大能耐,是这次发布最抓人的点。7B 意味着消费级显卡有望跑起来——有说法称 INT4 版本能在 4GB 显存里运转,这对个人创作者和中小企业是实打实的门槛下降。把"生图+编辑+透明底+多参考图"塞进一个开源模型,等于把过去要串好几个工具(生图、去背、局部重绘、垫图)的活儿,收进了一条流水线。对做电商主图、海报、素材二创的人来说,这种"一个模型全包"的范式比单纯堆画质更有用。

我的判断:要泼一点冷水——早期实测对它的评价是分化的。有测试者说艺术风格"可接受",但写实(photorealism)"差到不愿发出来"。换句话说,Qwen-Image-2.1 在实用性和可控性上进步明显,但在"像照片"这件事上还没追上第一梯队。另外它的许可惹了"最差许可"的吐槽,研究许可限制了商用。对国内创作者,今天该做的是:把它当"可控编辑的免费瑞士军刀"用,而不是当"替代 Midjourney 的写实神器"。开源的价值本就不只是参数,而是你能 audit、能改、能接进自己的工作流——这点上 7B + ComfyUI 的组合,含金量不低。