阿里千问发布Qwen-Image-2.1,将图像生成与编辑整合进同一模型。其视觉生成部分仅7B参数,却在Qwen-Image-Bench评测中以60.28分登顶开源,超过闭源的Nano Banana 2.0和GPT Image 1.5,被官方定位为当前最平衡、高性价比的开源生图模型。
模型采用32层Single-Stream DiT,原生支持2K分辨率输出,含文本编码器总参数量约16.22B。推理侧引入混合粒度注意力,配合KV Cache复用,将输入图像与编辑指令预计算缓存,多图场景下推理速度与显存开销明显优化。
最实用的更新是原生RGBA透明图:模型可根据提示词自动决定是否输出透明通道,无需额外抠图,还能生成多元素组合的复杂结构图,透明图层中的文字与表情均可直接编辑。输入一张真实照片,即可提取主体输出带Alpha通道的图层,绕开毛发边缘等传统抠图痛点。
编辑能力同步升级:参考图上限提至10张,可合成多人合照、生成完整穿搭或输出家装方案;局部编辑支持圈选、涂抹和独立掩码三种方式,可一次指定多个区域分别修改。人像与商品保真增强,修图后脸部特征高度一致,商品文字纹理不走样。
