Qwen Image 2.1:7B取代20B,換原生透明生成
QwenLM/Qwen-Image-2.1 (GitHub) · 2026.09.20
Qwen Image 2.1 把視覺生成主幹從上一代 Qwen-Image 的兩百億參數砍到七十億,卻換來原生透明(RGBA)圖層生成、最多十張參考圖的統一編輯能力,同時把授權從寬鬆的 Apache 2.0 換成限制商用的 Qwen Research License Agreement。這是一次「變小、變全能、變限制」同時發生的改版,Qwen 團隊於 2026.09.20 發布,權重同步上架 Hugging Face 與 ModelScope。
規格細節
舊版 Qwen-Image 用 200 億參數的單一 DiT 硬做生成品質,代價是推論吃顯存、多步驟去噪也重複算了很多次同樣的鍵值,自架成本一直偏高。2.1 版把生成主幹換成單串流(single-stream)DiT,共 32 層、70 億參數,搭配混合粒度(mixed-granularity)注意力機制與 block-causal attention,讓模型在同一次前向傳播裡分別處理不同粒度的圖像區塊;文字理解則交給 Qwen3-VL 8B 視覺語言模型負責,不再只是純文字編碼器,理論上能更準確理解提示詞裡的空間關係與版面指令。
VAE 換成 64 通道的 RGBA 自編碼器、16 倍空間壓縮,這是原生透明生成能省掉額外去背步驟的關鍵:以往要產生去背素材,得先生成整張圖再跑一次摳圖模型,現在 VAE 本身就吃得下 alpha 通道。原生解析度支援到 2K,官方列出的比例包含 1:1 的 2048×2048、4:3 的 2400×1792、16:9 的 2752×1536、9:16 的 1536×2752 等七種預設尺寸。效能面則靠前綴 KV 快取重用(prefix KV cache reuse):多步驟去噪時,前面步驟已經算過的鍵值向量直接重複利用,不用每一步都重新算一次,這是 7B 版本能在低算力下維持生成品質的另一個關鍵設計。
編輯能力是另一個重點:舊版把生成與編輯拆成 Qwen-Image 與 Qwen-Image-Edit 兩個模型,2.1 版合併成單一模型,同時支援最多十張參考圖、可用圓圈標註、手繪塗抹或獨立遮罩指定局部編輯,並保留人物與商品的身分一致性。授權則是唯一往回退的地方:舊版 Apache 2.0 允許任意商用,2.1 版的 Qwen Research License Agreement 明文寫著僅供非商業用途,條款原文為「You shall not use the Materials for any commercial purpose without obtaining a separate commercial license from us」,商用需另外去信 model-business@notice.qwencloud.com 申請授權。
| 項目 | Qwen-Image(2.0) | Qwen-Image-2.1 |
|---|---|---|
| 視覺生成參數量 | 20B | 7B |
| 授權 | Apache 2.0 | Qwen Research License Agreement(限非商用) |
| 生成/編輯 | 兩個獨立模型 | 單一模型,含最多10張參考圖編輯 |
| 透明度支援 | 未支援原生 RGBA | 原生 RGBA 透明生成 |
| 原生解析度 | 未公布 | 2K(如2048×2048、2752×1536) |
基準測試方面,官方 GitHub 與 Hugging Face 頁面都未公布與 SDXL、FLUX、Midjourney 等模型的對照分數,也沒有附上技術報告或 arXiv 論文連結,僅有 官方部落格的功能敘述。
影響範圍
自架推論選型的人首先要重新算成本:七十億參數的顯存與算力需求遠低於兩百億參數的舊版,配合 diffusers 的 QwenImage21Pipeline、ComfyUI、vLLM-Omni、SGLang、LightX2V 從 Day 0 就支援,換模型的工程成本不高,社群也已經在 Hugging Face 上放出 GGUF 量化版本,方便在消費級顯卡跑。但正在商用產品裡跑 Qwen-Image 的團隊要先停下來檢查授權:直接把 pipeline 換成 2.1 版卻沒申請商用授權,會違反新條款,這對原本靠 Apache 2.0 免費商用的自架服務是實質的政策風險,需要評估要不要去信 model-business@notice.qwencloud.com 談商用授權,或是暫時留在舊版 Qwen-Image 上。
另外,原本分別呼叫 Qwen-Image 與 Qwen-Image-Edit 兩支 pipeline 的整合方,可以合併成呼叫單一模型,簡化服務架構、減少要維護的推論管線數量;原本要靠去背或摳圖前處理才能產生透明素材的流程,也能直接用原生 RGBA 輸出取代,省下一段後製步驟。用電商商品圖、UI 素材產線在做批量去背的團隊,值得優先評估這條路徑能不能取代現有工具鏈。
原始來源:GitHub - QwenLM/Qwen-Image-2.1、Hugging Face - Qwen/Qwen-Image-2.1、Qwen 官方部落格