阿里巴巴 Tongyi Lab 開源的 Qwen-Image 是一款擁有 200 億參數(20B)的 MMDiT(多模態擴散變換器)架構模型,採用 Apache 2.0 授權。這款模型在多國語言文字渲染(包含中、英、日、韓)以及圖像編輯的精準度上表現出色,解決了開源模型在處理複雜文字時經常出現亂碼或拼錯字的痛點。

對於 ComfyUI 使用者來說,運行 20B 參數的模型通常意味著極高的 VRAM 門檻。透過 LightX2V 加速 LoRA 與 GGUF 量化技術,目前消費級顯卡也能實現高效能生成。我認為這次更新最核心的價值在於「可用性」的下放,讓原本需要企業級顯卡的模型,在經過量化與蒸餾後,能進入個人開發者的工作流。

LightX2V 與三種模型版本的生成效能分析

在 ComfyUI 中部署 Qwen-Image 時,使用者可以選擇原始 fp8 版本、蒸餾(Distilled)版本,以及搭配 LightX2V LoRA 的加速版本。LightX2V 是一個專為加速設計的 LoRA,能將預設的 20 步生成過程縮減至 8 步,顯著降低等待時間。

根據 RTX 4090D (24GB VRAM) 的數據,不同版本的生成速度差異明顯:

模型版本 VRAM 佔用 首圖生成時間 後續生成時間 建議步數
原始 fp8_e4m3fn 86% 94s 71s 20 步
fp8 + LightX2V LoRA 86% 55s 34s 8 步
蒸餾版 (Distilled) fp8 86% 69s 36s 10-15 步
GGUF (Q4_K_S) 56% 135s 77s 20 步
GGUF + LightX2V LoRA 56% 100s 45s 8 步

LightX2V LoRA 幾乎將生成速度提升了一倍。對於追求效率的創作者,搭配 LightX2V 是首選;而蒸餾版本則在不使用額外 LoRA 的情況下提供平衡,原作者建議使用 15 步搭配 CFG 1.0,但實測在 10 步時依然能維持良好品質。

GGUF 量化部署:讓 8GB VRAM 設備運行 20B 模型

對於沒有 24GB VRAM 顯卡的用戶,GGUF 版本是最佳方案。透過 ComfyUI-GGUF 插件,Qwen-Image 的權重被量化(將高精度的浮點數壓縮為較低位元),使得 VRAM 需求大幅下降。在特定權重配置下,僅需約 8GB VRAM 即可運行。

GGUF 部署關鍵設定

  1. 安裝插件:必須安裝並更新 ComfyUI-GGUF 節點。
  2. 模型放置:將下載的 .gguf 權重(如 qwen-image-Q4_K_S.gguf)放入 ComfyUI/models/diffusion_models/ 資料夾。
  3. 節點配置:使用 Unet Loader (GGUF) 節點載入模型,而非標準的 Unet Loader。
  4. 加速設定:若要使用 LightX2V 8-step LoRA,需在節點中選中該 LoRA 並按下 Ctrl + B 啟用,同時將 KSampler 的步數從 20 調整為 8。

我建議 VRAM 在 12GB 以下的使用者直接選擇 GGUF 版本。雖然首圖生成時間較長(約 135 秒),但後續生成能穩定在 77 秒左右,能有效避免記憶體溢出(OOM)導致的系統崩潰。

DiffSynth 模型補丁與 Union ControlNet 的精準控制

Qwen-Image 的強大不僅在於生成,還在於其控制能力。目前社群提供了兩種主要的控制方案:DiffSynth 模型補丁(Model Patches)與 Union ControlNet LoRA。

DiffSynth 模型補丁 (Model Patches)

這類模型並非傳統的 ControlNet,而是直接對模型進行修改的補丁,存放在 ComfyUI/models/model_patches 中。它將控制功能拆分為三個獨立模型:

  • Canny 補丁:處理線稿與輪廓,適合需要精確結構控制的場景。
  • Depth 補丁:處理深度圖,用以定義空間層次感。
  • Inpaint 補丁:配合 Mask 遮罩進行局部重繪,能維持整體視覺一致性。

在使用 Inpaint 補丁時,必須使用 Mask Editor 繪製遮罩,並將 Load Image 節點的 mask 輸出連接至 QwenImageDiffsynthControlnet 節點。

Union ControlNet LoRA

若需要更靈活的控制,qwen_image_union_diffsynth_lora.safetensors 提供了一站式解決方案。這是一個統一的 LoRA 模型,支援 Canny, Depth, Pose, Lineart, Softedge, Normal, Openpose 等多種控制模式。

由於原生節點對部分預處理支援不足,建議搭配 comfyui_controlnet_aux 插件完成圖像預處理(例如將照片轉為 Openpose 骨架圖),再將結果輸入至 LoraLoaderModelOnly 節點。

Qwen-Image 完整路徑配置清單

為了確保工作流能正確運行,模型文件的存放路徑必須嚴格遵守以下結構:

  • 擴散模型 (Diffusion Models) ComfyUI/models/diffusion_models/qwen_image_fp8_e4m3fn.safetensors ComfyUI/models/diffusion_models/qwen_image_distill_full_fp8_e4m3fn.safetensors (蒸餾版)
  • 量化模型 (GGUF) ComfyUI/models/diffusion_models/qwen-image-Q4_K_S.gguf
  • 加速 LoRA (LoRAs) ComfyUI/models/loras/Qwen-Image-Lightning-8steps-V1.0.safetensors
  • 文本編碼器 (Text Encoders) ComfyUI/models/text_encoders/qwen_2.5_vl_7b_fp8_scaled.safetensors
  • VAE ComfyUI/models/vae/qwen_image_vae.safetensors
  • 控制補丁 (Model Patches) ComfyUI/models/model_patches/qwen_image_canny_diffsynth_controlnet.safetensors

部署方案建議與技術取捨

在實際部署 Qwen-Image 時,我建議根據硬體條件與需求在以下三種方案中選擇:

方案 A:極速產出(RTX 3090/4090 使用者) 選擇 fp8 模型 + LightX2V 8-step LoRA。這是目前最快且品質極高的組合,適合需要大量快速迭代草圖的設計工作流。

方案 B:低顯存部署(RTX 3060/4060 或 8GB-12GB VRAM 使用者) 選擇 GGUF (Q4_K_S) + LightX2V 8-step LoRA。雖然速度較慢,但能確保模型在消費級顯卡上穩定運行,且 VRAM 佔用僅約 56%。

方案 C:精準編輯與局部修改 使用 DiffSynth Inpaint 補丁。這對於需要修改圖片局部細節、更換物件但保留背景的人來說是最有效的工具。

需要注意的是,目前蒸餾版本(Distilled)與 LightX2V LoRA 似乎無法同時有效使用。如果你選擇了蒸餾模型,請直接將步數設為 10-15 步,不要嘗試疊加 8-step LoRA,否則可能會導致圖像崩壞或出現異常偽影。


文章轉載或引用,請先告知並保留原文出處與連結!!(單純分享或非營利的只需保留原文出處,不用告知)

原文連結:
https://blog.aidec.tw/post/qwen-image-comfyui-lightx2v-gguf-0zrqz
若有業務合作需求,可寫信至: [email protected]
創業、網站經營相關內容未來將發布在 小易創業筆記