Qwen-Image-2.1是一款由阿里通义千问于2026年9月推出的一体化图像生成与编辑模型,主要把文生图与图像编辑放进同一个模型完成,原生支持透明图像生成、透明图层编辑与抠图,最多可输入 10 张参考图,适用于电商视觉设计、平面素材制作与人像后期等场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 一体化图像生成与编辑模型 |
| 出品方 | 阿里通义千问(Qwen) |
| 发布时间 | 2026年9月20日 |
| 参数规模 | 7B(视觉生成部分) |
| 核心架构 | 32 层 Single-Stream DiT |
| 注意力机制 | 混合粒度注意力(文本 Token 级/图像 Chunk 级掩码) |
| 透明图像 | 原生生成透明图像、透明图层编辑与抠图 |
| 参考图上限 | 10 张 |
| 局部编辑 | 圈选、涂抹、独立掩码 |
| 评测表现 | Qwen-Image-Bench 60.28 分,为该榜单开源模型最高分 |
| 开源平台 | GitHub、Hugging Face、ModelScope |
| 许可协议 | 研究许可,禁止商业使用 |

Qwen-Image-2.1 的核心能力
这一代改动集中在一条主线上:把「生成」与「改图」收进同一套参数,同时把透明通道变成一等公民。官方同步给出 Qwen-Image-Bench 的公开评测对比,把它与同代闭源模型放在同一张榜上逐项打分;这类生成与编辑一体化的路线,也是 AIGC 从出图工具走向生产环节的关键一步,评测口径可参考站内整理的 Qwen-Image-Bench 说明。
7B 视觉生成模块与混合粒度注意力
视觉生成部分只有 7B 参数、32 层 Single-Stream DiT,规模压缩后仍要保住生成质量,靠的是推理侧的优化:文本部分(系统前缀与编辑指令)走 Token 级因果掩码,图像生成部分走 Chunk 级掩码,两者混在同一套注意力里;输入图像与编辑指令被当作静态上下文,在首步预计算并写入 KV Cache。参考图越多,这套复用带来的显存与耗时收益越明显。
原生透明图像生成与图层编辑
透明图像的生成与编辑被合并进统一模型,模型会依提示词自行判断输出普通图像还是带透明通道的图像,不再需要单独的抠图链路。输入一张普通 RGB 照片,也能提取指定主体并输出带透明通道的 RGBA 图层;透明图层内的文字同样可以直接改字。此前这项能力由 2025 年 12 月的 Qwen-Image-Layered 单独承担,本代将其并入统一模型。
最多 10 张参考图的多图编辑
模型最多接受 10 张参考图,可综合多个主体与素材生成协调画面。实测场景里包括把 6 张人像整合进同一张合照、用模特与服装鞋包共 5 张图生成整套搭配、以及参考 10 张家居图输出完整室内布置效果。
圈选、涂抹与独立掩码的显式控制
局部编辑提供三种显式指定范围的方式:圈选可直接在图上圈出多个区域并分别下达指令,涂抹以笔刷划定改动范围,独立掩码则把原图与掩码作为两张图片输入,避免覆盖原始信息。相比纯自然语言描述位置,显式范围在多次迭代编辑中更不易漂移。
人像与商品一致性增强
编辑任务里最容易失手的是「改完不像本人」和「改完商品变了样」。本代强化了面部细节还原,并尽量保持商品的文字、纹理与形态一致,同时把能力扩展到全景图、信息图与分镜图生成。
Qwen-Image-2.1 与同类图像生成模型的对比
图像模型近一年的取舍集中在三件事:能不能同时生成与改图、显存吃得下多少、以及透明素材要不要另跑一条链路。以下对比数值取自千问官方发布材料的 Qwen-Image-Bench 公开评测图表,逐格列出。
| 对比维度 | Qwen-Image-2.1 | Nano Banana 2.0 |
|---|---|---|
| 开发方 | 阿里通义千问 | 谷歌 |
| 开放程度 | 权重全量开源,研究许可 | 闭源,仅 API 调用 |
| 生成与编辑 | 文生图与图像编辑统一在同一模型 | 生成与编辑为分离接口 |
| Qwen-Image-Bench 总分 | 60.28 | 59.82 |
| 透明图像 | 原生生成、图层编辑与抠图 | 未在对比项内 |
| 参考图上限 | 10 张 | 未在对比项内 |
| 局部编辑 | 圈选、涂抹、独立掩码 | 以自然语言指令编辑为主 |
把官方分值放在一起看,Qwen-Image-2.1 的 60.28 分与 Nano Banana 2.0 的 59.82 分只差 0.46 分,而前者是 7B 的可自部署模型、后者为闭源 API;榜单里同样在 55 分上下的 Seedream 4.5 与 FLUX 2 Max,参数量分别是 32B 与 20B。这一代把「开源模型追平闭源旗舰」的差距压到了半分以内,而参数量只有同分闭源模型的四分之一左右。表中「未在对比项内」指该模型未参与官方该项对比,未作推测填充。
如果想先看同门上一代在复杂版式与中文文字渲染上的表现,可参考 Qwen-Image-3.0(阿里通义千问推出的图像生成模型,主打约 4.5K token 复杂提示词与多语言文字排版)。两者的差别在分工:它侧重复杂版面与商业设计产出,本代把透明图层与多图编辑收进了统一模型。
Qwen-Image-2.1 的应用场景与适用人群
模型的能力边界决定它更适合需要反复改图、且对素材合规与成本敏感的生产场景:
- 电商视觉设计:商品编辑保持文字、纹理与形态一致,模特换装、多品穿搭上身与商品图精修可在一套流程里完成。
- 平面设计与素材制作:透明图直接生成,免去抠图环节,图层内文字可改,海报、Banner 与 Logo 初稿可直接产出并二次加工。
- 人像摄影后期:面部细节还原能力支持修图不改脸、换表情、换衣服,以及把多张人像合成合照。
- 室内设计与软装预览:参考最多 10 张家居图片,输入户型即可生成完整布置效果图,便于在装修前与客户对齐方案。
适用人群:需要把出图能力自建部署、对素材版权与数据出域有要求的电商与品牌设计团队;负责落地推理成本的产品与算法工程师;以及需要透明素材与批量改图能力的平面设计与影楼后期从业者。
Qwen-Image-2.1 的使用方法
模型提供在线体验与本地部署两条路径,生产环境以自建推理为主:
- 查看官方示例:从 Qwen-Image-2.1 官方发布页 进入,先看透明图像、多图编辑与局部编辑的输入输出对照,确认能力边界。
- 取回权重:从 GitHub 仓库
QwenLM/Qwen-Image-2.1或 Hugging Face 仓库Qwen/Qwen-Image-2.1下载权重,ModelScope 同步提供国内镜像。 - 搭建推理:按仓库说明安装依赖并载入权重,文本侧走 Token 级因果掩码、图像侧走 Chunk 级掩码,静态上下文在首步预计算并缓存。
- 接入生产:多图场景把参考图控制在 10 张以内,人像与商品类任务建议同时传入独立掩码,减少主体漂移后再批量跑图。
Qwen-Image-2.1 的价格与开源情况
Qwen-Image-2.1 未提供官方云端接口,也未见按量计费的公开价目,成本主要落在自建推理的显存与算力上:视觉生成部分 7B 参数,单卡即可承载,配合混合粒度注意力与 KV Cache 复用,多图输入场景的开销增长比同规模模型更平缓。
权重层面,Qwen-Image-2.1 已在 GitHub、Hugging Face 与 ModelScope 三处同步开放下载,模型结构、推理代码与权重均可自取。但许可为研究许可、明确禁止商业使用,需要商用授权或私有化交付的团队须另行申请;这点与同门前代 Qwen-Image-2.0 的授权口径一致,若项目必须落到宽松商用许可,需另选开源协议更宽的一档。
Qwen-Image-2.1 的常见问题
Qwen-Image-2.1 有多少参数?
视觉生成部分为 7B 参数,采用 32 层 Single-Stream DiT 结构,文生图与图像编辑共用这套参数。官方对比图表里,同为 55 分档的 Seedream 4.5 与 FLUX 2 Max 参数量分别为 32B 与 20B。
Qwen-Image-2.1 支持生成透明图像吗?
支持,且是这一代的重点能力。模型会依提示词自行判断输出普通图像还是带透明通道的图像,并支持透明图层编辑与抠图;输入普通 RGB 照片也能提取主体并输出 RGBA 图层,图层内文字同样可编辑。
Qwen-Image-2.1 可以商用吗?
当前权重的许可为研究许可,禁止商业使用,商用需另行申请授权。若项目必须落到宽松商用许可,选型时需把授权成本与替代方案的协议一并比较。
Qwen-Image-2.1 能本地部署吗?
可以。权重已在 GitHub、Hugging Face 与 ModelScope 开放下载,视觉生成部分 7B 参数,单卡即可部署,并通过混合粒度注意力与 KV Cache 复用降低多图输入时的显存开销。
浙公网安备33010202004812号