2026-09-21
拿下开源生图第一,千问Qwen-Image-2.1把生图卷出新高度
编辑|泽南 AI 写代码的能力经常能让开发者「双手离开键盘」,但对于设计师而言,AI 生成的图片距离能交稿总是差了好几步。 在图像设计的工作流中,人物需要抠图、素材需要改字、各种商品的摆放要时不时调整,但包装上的字、瓶身的形状不能跟着变。如果需求不停调整,还得继续修改局部,让整张图保持协调。 这些细节决定了 AI 生图能否进入真正的创作流程。对设计师、电商运营和内容创作者来说,如今图像模型的瓶颈,在于每一次提出的修改指令能否准确完成。 本周日,阿里千问 正式开源图片生成模型 Qwen-Image-2.1 ,以小模型的体量解决了大部分生产力难题:它实现了文生图与图像编辑一体化,原生支持透明图生成,最高可以接收 10 张参考图,还进一步强化了局部编辑、人像与商品保真。 它成为了千问图像系列当前最平衡、性价比最高开源生图模型。公开评测结果显示,Qwen-Image-2.1 取得开源模型第一,得分甚至超过了 Nano Banana 2.0。要知道,这个模型的视觉生成部分参数量仅为 7B。 在 X 等平台上,已经有提前获得体验资格的用户放出了生成结果,大家一阵好评。有包含大量文字内容的效果图: 生成出真实照片质感图片的: 也有尝试各种不同滤镜、打光风格的: 人们认为 Qwen-Image-2.1 在指令遵循、抽卡成功率以及实际效果上都令人印象深刻。基于新模型的能力,我们已经可以串起素材生成、组合与修改的工作流,用 AI 来解决很多复杂的修图问题。 能力与效率 据介绍, Qwen-Image-2.1 的视觉生成部分采用 20 层 Single-Stream DiT,参数量为 7B,原生支持 2K 。该模型在评测基准中实现了超越体量的水平:Qwen-Image-2.1 的总分为 60.28。相比之下,Nano Banana 2.0 为 59.82,GPT Image 1.5 为 59.65。它已经能够与多款闭源图像模型同场竞争。 Qwen-Image-Bench 评测图表。 视觉生成部分仅有 7B 参数,也让这样的能力水平更值得关注:其在较小的生成模块中同时容纳了生图、透明素材生成与多图编辑能力(生成和编辑统一管线),为开发者部署和定制图像工具提供了更轻量的起点。 性能不错的同时,Qwen-Image-2.1 还对模型的推理过程进行了优化,核心思路是减少不必要的重复计算。 在一次图像编辑中,输入的参考图和编辑指令不会随着每一步生成而改变。因此,新模型使用混合粒度注意力结构,文本部分(系统前缀、编辑指令)遵循传统 Token 级因果掩码,逐词进行严格的序列计算以保证语义逻辑理解的连贯性,图像生成部分则采用 Chunk 级掩码,并通过 KV Cache 的机制在首步计算后缓存这些静态上下文,供后续生成步骤复用。 这意味着 AI 现在会先处理好参考材料,在逐步生成目标图片时重复利用已有结果,这种优化在多图片输入时效果更为明显,有助于提升推理效率、降低显存开销。 因为现在 Qwen-Image-2.1 最多支持 10 张参考图了,这项优化就显得至关重要。输入内容越丰富,如何处理参考信息、控制重复计算就越值得关注。至于具体能节省多少时间和显存,还需要结合硬件、精度、分辨率与输入数量来判断。 直接生成可用透明素材 要说新版本 Qwen-Image 最贴近设计需求的能力,那就是透明图生成了。 常规的图片素材通常带有完整背景。要把其中的主体用到海报、商品详情页或另一张图片里,往往需要先抠图,处理轮廓、缝隙和边缘。透明图片则包含额外的透明度信息,能让背景从主体周围或部分区域透出来,方便后续叠放和组合。 Qwen-Image-2.1 原生支持透明图生成 ,可以依据提示词自动决定生成的是普通图片还是透明图,用户在描述素材时就能提出透明背景的要求。目前展示的样例包括节庆插画、人物素材、装饰元素,以及由多个对象构成的复杂组合,对应的都是设计工作里常见的素材需求。我们也尝试了一下: 对于创作者来说这是个好消息,现在我们可以得到直接可用的素材了,工作直接少了几道工序。 当然,这些透明素材生成之后也能继续修改。比如同一个插画人物可以调整表情,图片中的文字可以修改内容。编辑对象既可以是人物的视觉细节,也可以是素材中的文字。 这与设计时的真实修改需求很接近:活动名称换了,图案仍然需要保留;表情要更轻松一些,人物仍然要能被识别为同一个角色。生成与编辑被放进同一模型后,这些后续要求也有了统一的处理入口。 当然,Qwen-Image-2.1 支持对已有照片进行处理。 官方给出了从真实照片中提取所需内容、得到 RGBA 透明图的案例。其中的 A 代表透明度通道,用来描述图片各处的透明程度。 可见,这项能力既服务于从零开始生成,也覆盖了已有图片的再利用。创作者可以先提供照片,再要求模型