Qwen-Image-2.1 开源:7B 统一生图与编辑、原生透明通道,商用要先过许可关(2026年9月)
Qwen-Image-2.1 于 9 月 20 日开源:7B 视觉组件统一生图与编辑,原生 RGBA 透明通道、10 张参考图、2K 输出,ComfyUI 与 Diffusers 首日适配,RTX 3090 可跑。本文讲清部署门槛、商用许可红线,以及它与 Qwen Image 3.0 的定位差异。
9 月 20 日,阿里通义千问团队开源图像生成与编辑模型 Qwen-Image-2.1:文生图和图像编辑收进同一个 7B 视觉生成组件(32 层单流 DiT),原生支持 RGBA 透明通道,单次最多吃 10 张参考图,RTX 3090 级消费显卡即可本地部署,ComfyUI 与 Diffusers 首日适配。先把结论放在最前面:权重确实开放下载,但默认许可(Qwen Research License)只覆盖非商用研究评估,要接进生产环境得先向 Qwen 单独申请授权。
一个 7B 模型同时管生图和编辑
开源图像模型大多是「生图归生图、编辑归编辑」,两套权重两套工作流。Qwen-Image-2.1 把两件事收敛进单一模型,官方模型卡确认视觉生成部分仅 7B 参数,并称其在自家评测中超过多数被对比的闭源模型。注意「自家评测」四个字:第三方独立榜单还没跟上,这个排名目前只能当厂商口径看。
原生 RGBA:抠图工作流的刚需
多数模型输出不带 alpha 通道,要透明底得再跑一遍抠图。Qwen-Image-2.1 原生生成和编辑带透明通道的图像,可以直接产出贴纸、印章、合成素材这类透明底资产,也能在透明图层上改文字。做电商详情页和素材包的人,这一项省掉的是整条抠图流水线。
10 张参考图加局部编辑:群像与虚拟试穿
编辑模式一次最多 10 张参考图:官方演示里,合影中每张脸来自不同单人照,模型负责合成并保持身份一致;虚拟试穿、房间改造同理。局部修改用圈选、涂抹或外部 Mask 指定区域;配合混合粒度注意力与前缀 KV 缓存复用,多参考图场景不必每次全量重编码,交互速度才有实际意义。原生 2K 输出,默认 2048×2048,16:9 与 9:16 长边可到 2752。
部署门槛:3090 能跑,量化再往下探
权重挂在 Hugging Face 与 ModelScope,未设下载门槛;ComfyUI 首日提供 BF16 与 INT8 文件和现成工作流,Diffusers 走 QwenImage21Pipeline,vLLM-Omni、SGLang 也有 day-0 支持。24GB 显存的 ComfyUI 用户可以直接套用官方工作流;从 Stable Diffusion 时代攒下来的本地部署经验同样适用。
商用红线:开源权重不等于随便用
模型页上 License: qwen-research 是这次发布最容易被忽略的一行。研究、评估随便跑;要接进产品、给客户出图、做成付费服务,必须先向 Qwen 申请商用授权。别沿用「千问旧模型都是 Apache 2.0」的印象——这次不是。
和 Qwen Image 3.0 什么关系
容易混淆:Qwen Image 3.0 是 7 月发布的云端模型,主打 4.5K token 长提示词、小字号文字与报纸、分镜类复杂排版;2.1 是 9 月开源的可下载权重路线,主打透明通道与多参考编辑。两者是并行定位,不是简单的新旧替代。
下面这张信息图对比了 Qwen-Image-2.1、Qwen Image 3.0 与 Midjourney 三条路线在部署、透明通道与商用许可上的关键差异。
谁该上手,谁先观望
本地部署党、ComfyUI 工作流玩家、做透明素材和参考图合成的创作者:值得直接上手。要商用出图的公司:先申请授权,或在即梦AI、Seedream、Midjourney、Recraft 这类云服务里过渡。想先在网页上试效果:HF 模型页有在线 Demo,Qwen 聊天入口也可关注后续是否上线生图能力。
❓ 常见问题
默认不可以。它采用 Qwen Research License,仅授权研究与评估用途;商用必须向 Qwen 团队单独申请授权,不能沿用以往千问模型 Apache 2.0 许可的印象。
官方与多家媒体报道 RTX 3090 级 24GB 显存消费显卡即可运行;ComfyUI 提供 BF16 与 INT8 模型文件,社区量化版可进一步降低显存门槛。
不是新旧替代。Qwen Image 3.0 是 7 月发布的云端信息密集生成模型;2.1 是 9 月开源的可下载权重路线,主打透明通道与多参考图编辑,两者并行定位。
这是 Qwen 自家评测榜单的结论,第三方独立评测尚未跟上,建议先当厂商口径看待,等独立复现结果再下判断。