7B小模型登顶开源!千问Qwen-Image-2.1发布

作者:快科技 发布时间:2026-09-22 05:14:13 浏览:18
关键字:
阿里发布Qwen-Image-2.1开源生图模型,视觉生成仅7B参数却在公开评测中超越闭源对手,并原生支持透明图与10张参考图编辑。

阿里千问发布Qwen-Image-2.1,将图像生成与编辑整合进同一模型。其视觉生成部分仅7B参数,却在Qwen-Image-Bench评测中以60.28分登顶开源,超过闭源的Nano Banana 2.0和GPT Image 1.5,被官方定位为当前最平衡、高性价比的开源生图模型。

模型采用32层Single-Stream DiT,原生支持2K分辨率输出,含文本编码器总参数量约16.22B。推理侧引入混合粒度注意力,配合KV Cache复用,将输入图像与编辑指令预计算缓存,多图场景下推理速度与显存开销明显优化。

最实用的更新是原生RGBA透明图:模型可根据提示词自动决定是否输出透明通道,无需额外抠图,还能生成多元素组合的复杂结构图,透明图层中的文字与表情均可直接编辑。输入一张真实照片,即可提取主体输出带Alpha通道的图层,绕开毛发边缘等传统抠图痛点。

编辑能力同步升级:参考图上限提至10张,可合成多人合照、生成完整穿搭或输出家装方案;局部编辑支持圈选、涂抹和独立掩码三种方式,可一次指定多个区域分别修改。人像与商品保真增强,修图后脸部特征高度一致,商品文字纹理不走样。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自chinaz.com,作者快科技

有问题,请联系客服!http://www.rongyeyun.com/kefu/