9 月 20 日,阿里通义千问团队开源 Qwen-Image-2.1:一个仅 7B 参数的视觉生成模型,把文生图和图像编辑塞进同一个权重里,权重开放下载,ComfyUI 适配同步上线。它最值得记住的能力不是"又能画图了",而是原生支持透明图像——生成和编辑都直接覆盖 RGBA 通道,抠图和透明图层可以一步出图,不用再靠后期蒙版去抠。

图像生成赛道已经卷了两年,但当开源 7B 模型开始认真处理"透明通道"这种工程细节,说明竞争进入了新的层次。

7B 做成了什么

Qwen-Image-2.1 用单流 DiT(扩散 Transformer)架构,32 层,参数量压在 7B。在 Qwen-Image-Bench 上拿到 60.28 分。几个能力点值得展开:

原生透明图(RGBA)。这是它和前代、也和多数开源图像模型最不一样的点。传统文生图出的是不带透明度的位图,要做 logo、贴纸、商品图、图层合成,得另跑抠图模型或手动蒙版。Qwen-Image-2.1 把 Alpha 通道当作一等公民,prompt 里带"透明背景""霓虹招牌"这类关键词,直接出带透明度的 PNG。对设计工作流来说,这一刀切掉的是整个抠图环节。

最多 10 张参考图的指令编辑。官方演示用 10 张家居图生成室内布置,人像与商品的保真度稳定。这意味着它不是"以图生图"的单参考,而是能同时吸收多张素材的风格与结构,按自然语言指令重组——更接近"给设计师一叠参考,让他出方案"。

局部编辑的多种蒙版。圆形、涂鸦、独立蒙版三种方式指定修改区域,配合混合粒度注意力架构与 KV cache 复用提升推理效率。文字渲染和人像光照也有明显改进,覆盖全景图、信息图、分镜等任务,支持原生 2K 生成。

为什么"小"反而重要

7B 这个数字的意义,在于它能在消费级显卡上跑。对比闭源图像模型动辄几十亿、上百亿的体量,7B 意味着个人开发者、小工作室、甚至本地部署都够得着。质量对尺寸的性价比,被拿来和 GPT-Image-2 类比——虽然绝对上限未必追平,但"够用且跑得起"本身就是一种产品力。

一个细节:有 HN 评论者注意到它对 CJK(中日韩)字符的渲染比某些系统自带工具还稳。文字渲染一直是图像生成的老大难,能把招牌、标签上的汉字写对,直接决定了它能不能进真实设计流水线,而不是只产"看着漂亮但字是乱码"的图。

对设计工具生态,既是弹药也是警告

Qwen-Image-2.1 开源当天,ComfyUI、Diffusers、vLLM-Omni 同日上线支持。这条适配链的速度本身就在释放信号:国产开源图像模型已经具备"发布即可用"的节奏,开发者不用等第三方移植。

对做设计工具、电商图、营销物料的创业公司,这是双刃剑。一方面,7B 开源权重等于白送的引擎,创业公司可以把精力放在工作流、模板、协作这些真正产生差异的地方;另一方面,当"透明图""参考图编辑"变成开源模型的标配能力,靠单点功能堆砌的产品壁垒会被快速削平——你做的"一键抠图",模型原生就带了。

需要留意的是许可证变动。据外媒梳理,Qwen-Image 系列从更宽松的 Apache 协议转向了限制性更强的许可,这和商业使用条款直接相关。任何打算把它塞进产品的团队,第一步不是跑 demo,而是把 license 读明白——开源不等于随便商用。

冷静的判断

透明图、参考图编辑、文字渲染,这些能力在官方演示里很漂亮,但真实业务的刁钻需求(复杂光影下的商品保真、长文本排版、品牌字体一致性)仍要靠自己的数据去验。7B 的天花板也摆在那里:超精细写实、强约束版式,大概率还是闭源大模型的领地。

但方向很清楚:图像生成的"基础能力"正在快速商品化、开源化。下一个阶段比的不是"模型能不能出图",而是谁把模型包成了普通人愿意天天用的那个工具。Qwen-Image-2.1 把门槛又往下压了一截。