阿里开源 Qwen-Image-2.1:7B 图像模型把生成与编辑合成一个,还原生支持透明通道
阿里通义 9 月 20 日开源 Qwen-Image-2.1,把文生图与图像编辑合进同一个模型:视觉生成部分为 32 层单流 DiT、7B 参数,官方称在 Qwen-Image-Bench 上与开源及闭源模型同场比较仍有竞争力。它带来一个此前需要专用模型的能力——原生透明通道:输入提示词后由模型自行判断输出普通图像还是带 alpha 的 RGBA,并能直接编辑透明图层、替换图内文字,或从一张普通照片里抽出带透明的素材层。作为对照,透明生成此前由 2025 年 12 月的 Qwen-Image-Layered 单独承担,这次被并进统一模型。
效率侧的改动是面向多图编辑场景的:文本(含系统前缀与编辑指令)走 token 级因果掩码,图像生成走 chunk 级掩码,配合 KV cache 复用把输入图与编辑指令当作静态上下文,只在第一步算一次。编辑能力同时扩到最多 10 张参考图——官方示例里 6 张人像合成合影、5 张素材拼整套穿搭、10 张家具图生成整间室内;局部编辑支持画圈、涂鸦和单独 mask 三种指定方式,并在提示词层面要求保留人物与商品一致性。权重按 Apache 之外的自定义许可在 Hugging Face、ModelScope、GitHub 三处同步放出。
原文链接:Alibaba Qwen 官方博客
核验记录
qwen.ai 是 JS 渲染站,裸 curl 只回 SPA 壳(92KB、0 命中),经 r.jina.ai 直读官方博客头部 Published Time 2026-09-20T20:00:00+08:00。三个仓库时间早于博客:HF Qwen/Qwen-Image-2.1 createdAt 2026-09-14T03:47Z、ModelScope CreatedTime 2026-09-15T16:33+08:00、GitHub QwenLM/Qwen-Image-2.1 initial commit 2026-09-14(README 与许可到 9-20 才提交)——仓库创建日不等于发布日,本条取官方博客日 9/20。能力与架构描述全部来自官方博客与 README 自述,基准对比图未逐项复核。