通义千问开源 Qwen-Image-2.1:7B 把生图、修图、抠图装进一个模型

9 月 20 日,阿里巴巴通义千问团队正式开源图像模型 Qwen-Image-2.1。它把文生图与图像编辑整合进同一个框架,视觉生成部分仅 7B 参数,并原生支持透明图像生成与编辑。

事件背景

过去想用 Qwen 系列做图像工作,需要按任务挑选不同模型:生图用 Qwen-Image,修图用 Qwen-Image-Edit,透明图层用 Qwen-Image-Layered。三条产品线、三套流程、占三份显存。Qwen-Image-2.1 直接把这三摊活合并为一个模型,靠提示词决定“这回干哪样”。

核心内容

  • 紧凑高效:视觉生成部分为 32 层 Single-Stream DiT 架构、7B 参数;通过混合粒度注意力结构与 KV Cache 复用,多图输入场景推理效率显著提升、显存开销下降。默认采样步数由 50 步压到 40 步。
  • 原生透明:根据提示词自动判断输出普通图或带透明通道的 RGBA 图像,并支持在保留透明背景的前提下修改主体表情、文字。
  • 全能编辑:最多支持 10 张参考图输入,可圈选、涂抹或独立掩码三种方式做局部编辑,并重点提升人像与商品一致性。

影响与解读

在 Qwen-Image-Bench 公开评测中,Qwen-Image-2.1 以 7B 视觉生成模块取得 60.28 分,位列开源第一,超过 NanoBanana 2.0、GPT Image 1.5 等闭源模型。发布当天即获 HuggingFace Diffusers、vLLM-Omni、SGLang、ComfyUI、LightX2V 等框架原生支持。

7B 的轻量档位意味着台式机显卡即可承载,透明图与多图编辑又能显著减少抠图、合成与反复修改的步骤,对设计、电商与内容制作场景友好。

相关动态 / 展望

成都智算中心已基于昇腾 910A 国产算力完成 Qwen-Image-2.1 全链路适配验证,为国产算力部署开源图像模型提供参考。模型权重已在 GitHub、ModelScope 与 HuggingFace 同步开放。

信息来源:Qwen 官方博客、智东西报道

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。