阿里巴巴 Tongyi Lab 開源的 Qwen-Image 是一款擁有 200 億參數(20B)的 MMDiT(多模態擴散變換器)架構模型,採用 Apache 2.0 授權。這款模型在多國語言文字渲染(包含中、英、日、韓)以及圖像編輯的精準度上表現出色,解決了開源模型在處理複雜文字時經常出現亂碼或拼錯字的痛點。
對於 ComfyUI 使用者來說,運行 20B 參數的模型通常意味著極高的 VRAM 門檻。透過 LightX2V 加速 LoRA 與 GGUF 量化技術,目前消費級顯卡也能實現高效能生成。我認為這次更新最核心的價值在於「可用性」的下放,讓原本需要企業級顯卡的模型,在經過量化與蒸餾後,能進入個人開發者的工作流。
LightX2V 與三種模型版本的生成效能分析
在 ComfyUI 中部署 Qwen-Image 時,使用者可以選擇原始 fp8 版本、蒸餾(Distilled)版本,以及搭配 LightX2V LoRA 的加速版本。LightX2V 是一個專為加速設計的 LoRA,能將預設的 20 步生成過程縮減至 8 步,顯著降低等待時間。
根據 RTX 4090D (24GB VRAM) 的數據,不同版本的生成速度差異明顯:
| 模型版本 | VRAM 佔用 | 首圖生成時間 | 後續生成時間 | 建議步數 |
|---|---|---|---|---|
| 原始 fp8_e4m3fn | 86% | 94s | 71s | 20 步 |
| fp8 + LightX2V LoRA | 86% | 55s | 34s | 8 步 |
| 蒸餾版 (Distilled) fp8 | 86% | 69s | 36s | 10-15 步 |
| GGUF (Q4_K_S) | 56% | 135s | 77s | 20 步 |
| GGUF + LightX2V LoRA | 56% | 100s | 45s | 8 步 |
LightX2V LoRA 幾乎將生成速度提升了一倍。對於追求效率的創作者,搭配 LightX2V 是首選;而蒸餾版本則在不使用額外 LoRA 的情況下提供平衡,原作者建議使用 15 步搭配 CFG 1.0,但實測在 10 步時依然能維持良好品質。
GGUF 量化部署:讓 8GB VRAM 設備運行 20B 模型
對於沒有 24GB VRAM 顯卡的用戶,GGUF 版本是最佳方案。透過 ComfyUI-GGUF 插件,Qwen-Image 的權重被量化(將高精度的浮點數壓縮為較低位元),使得 VRAM 需求大幅下降。在特定權重配置下,僅需約 8GB VRAM 即可運行。
GGUF 部署關鍵設定
- 安裝插件:必須安裝並更新
ComfyUI-GGUF節點。 - 模型放置:將下載的
.gguf權重(如qwen-image-Q4_K_S.gguf)放入ComfyUI/models/diffusion_models/資料夾。 - 節點配置:使用
Unet Loader (GGUF)節點載入模型,而非標準的 Unet Loader。 - 加速設定:若要使用 LightX2V 8-step LoRA,需在節點中選中該 LoRA 並按下
Ctrl + B啟用,同時將 KSampler 的步數從 20 調整為 8。
我建議 VRAM 在 12GB 以下的使用者直接選擇 GGUF 版本。雖然首圖生成時間較長(約 135 秒),但後續生成能穩定在 77 秒左右,能有效避免記憶體溢出(OOM)導致的系統崩潰。
DiffSynth 模型補丁與 Union ControlNet 的精準控制
Qwen-Image 的強大不僅在於生成,還在於其控制能力。目前社群提供了兩種主要的控制方案:DiffSynth 模型補丁(Model Patches)與 Union ControlNet LoRA。
DiffSynth 模型補丁 (Model Patches)
這類模型並非傳統的 ControlNet,而是直接對模型進行修改的補丁,存放在 ComfyUI/models/model_patches 中。它將控制功能拆分為三個獨立模型:
- Canny 補丁:處理線稿與輪廓,適合需要精確結構控制的場景。
- Depth 補丁:處理深度圖,用以定義空間層次感。
- Inpaint 補丁:配合 Mask 遮罩進行局部重繪,能維持整體視覺一致性。
在使用 Inpaint 補丁時,必須使用 Mask Editor 繪製遮罩,並將 Load Image 節點的 mask 輸出連接至 QwenImageDiffsynthControlnet 節點。
Union ControlNet LoRA
若需要更靈活的控制,qwen_image_union_diffsynth_lora.safetensors 提供了一站式解決方案。這是一個統一的 LoRA 模型,支援 Canny, Depth, Pose, Lineart, Softedge, Normal, Openpose 等多種控制模式。
由於原生節點對部分預處理支援不足,建議搭配 comfyui_controlnet_aux 插件完成圖像預處理(例如將照片轉為 Openpose 骨架圖),再將結果輸入至 LoraLoaderModelOnly 節點。
Qwen-Image 完整路徑配置清單
為了確保工作流能正確運行,模型文件的存放路徑必須嚴格遵守以下結構:
- 擴散模型 (Diffusion Models)
ComfyUI/models/diffusion_models/qwen_image_fp8_e4m3fn.safetensorsComfyUI/models/diffusion_models/qwen_image_distill_full_fp8_e4m3fn.safetensors(蒸餾版) - 量化模型 (GGUF)
ComfyUI/models/diffusion_models/qwen-image-Q4_K_S.gguf - 加速 LoRA (LoRAs)
ComfyUI/models/loras/Qwen-Image-Lightning-8steps-V1.0.safetensors - 文本編碼器 (Text Encoders)
ComfyUI/models/text_encoders/qwen_2.5_vl_7b_fp8_scaled.safetensors - VAE
ComfyUI/models/vae/qwen_image_vae.safetensors - 控制補丁 (Model Patches)
ComfyUI/models/model_patches/qwen_image_canny_diffsynth_controlnet.safetensors
部署方案建議與技術取捨
在實際部署 Qwen-Image 時,我建議根據硬體條件與需求在以下三種方案中選擇:
方案 A:極速產出(RTX 3090/4090 使用者)
選擇 fp8 模型 + LightX2V 8-step LoRA。這是目前最快且品質極高的組合,適合需要大量快速迭代草圖的設計工作流。
方案 B:低顯存部署(RTX 3060/4060 或 8GB-12GB VRAM 使用者)
選擇 GGUF (Q4_K_S) + LightX2V 8-step LoRA。雖然速度較慢,但能確保模型在消費級顯卡上穩定運行,且 VRAM 佔用僅約 56%。
方案 C:精準編輯與局部修改
使用 DiffSynth Inpaint 補丁。這對於需要修改圖片局部細節、更換物件但保留背景的人來說是最有效的工具。
需要注意的是,目前蒸餾版本(Distilled)與 LightX2V LoRA 似乎無法同時有效使用。如果你選擇了蒸餾模型,請直接將步數設為 10-15 步,不要嘗試疊加 8-step LoRA,否則可能會導致圖像崩壞或出現異常偽影。
文章轉載或引用,請先告知並保留原文出處與連結!!(單純分享或非營利的只需保留原文出處,不用告知)
原文連結:
https://blog.aidec.tw/post/qwen-image-comfyui-lightx2v-gguf-0zrqz
若有業務合作需求,可寫信至: [email protected]
創業、網站經營相關內容未來將發布在 小易創業筆記