首頁

目前文章總數:248 篇

  

最後更新:2026年 09月 05日

0010. 超越單圖 Edit!Qwen-Image-Edit-2509 在 ComfyUI 的多圖融合與 4 步極速實戰教學

日期:2026年 09月 05日

標籤: Linux Ubuntu Docker Docker-Compose Container ComfyUI WSL 2.2 Qwen-Image Qwen-Image-Edit-2509 Image Editing Multi-Image Editing LoRA

摘要:生成式AI


應用所需:1. 已安裝 Windows 的 Docker Desktop (Use WSL 2 instead of Hyper-V)
     2. 已安裝並可正常執行 ComfyUI
     3. 建議使用 NVIDIA 顯示卡;本篇實測規格為 RTX 5070 + 12 GB VRAM
     4. ComfyUI 至少更新至原生支援 Qwen-Image-Edit-2509 的版本
解決問題:1. 傳統單圖 Edit 只能針對一張參考圖修改,人物、商品與場景難以同時控制
     2. 使用 Qwen-Image-Edit-2509 將 1~3 張參考圖放進同一次編輯,完成「場景 + 人物 + 衣服」融合
     3. 使用 Qwen-Image-Edit-2509 專用 Lightning 4-step LoRA,縮短反覆抽圖與調整 Prompt 的等待時間
官方參考:Qwen / Qwen-Image-Edit-2509
本篇工作流載點:點擊下載
注意事項:官方建議多圖輸入以 1~3 張效果最佳;圖片越多不代表控制力越強,反而可能增加主體混淆與顯存壓力
本篇分為 4 大部分。
第一部分:問題描述
第二部分:Qwen-Image-Edit ComfyUI工作流
第三部分:驗證成果
第四部分:分析、遺留問題探討






第一部分:問題描述

Step 1:單圖 Edit 的核心限制

一般 Image Edit 工作流會將一張原始圖與文字指令送進模型,例如替換背景、改變服裝、移除物件或修改海報文字。
這種作法在 修改同一張圖 時很直覺,但遇到下列需求就會開始吃力:

保留圖片 A 的人物長相
套用圖片 B 的服裝或商品
放進圖片 C 的場景與構圖
最後仍要像同一張自然拍攝的照片



如果先用影像軟體把三張圖粗略拼貼,再交給單圖模型修改,模型可能有以下問題:

- 整體邊界、錯誤比例
- 不一致光線陰影
- 難以精準保留外觀


huggingface 的 Qwen-Image-Edit-2509 人物 + 場景 參考圖


Step 2:Qwen-Image-Edit-2509 解決了什麼?

Qwen-Image-Edit-2509 是 2025 年 9 月推出的 Qwen-Image-Edit 版本。
相較最初版本,2509 的重點不是單純提高畫質,而是增加 多圖編輯能力,並強化人物、商品與圖片文字的一致性

能力 說明
1. 多圖編輯 可同時輸入多張參考圖,支援人物 + 人物、人物 + 商品、人物 + 場景等組合
2. 人物一致性 改姿勢、風格與場景時,更努力保留臉部與人物特徵
3.商品一致性 以商品白底圖製作廣告圖時,較能保留包裝、輪廓與識別特徵
4. 文字編輯 除了替換文字,也能描述字型、顏色與材質
5. ControlNet 條件 官方模型支援深度圖、邊緣圖與關鍵點圖等條件輸入


官方表示 1~3 張輸入圖目前能得到較理想的結果。因此本篇會實做展示合併的效果。

Step 3:為什麼要加入 Lightning 4-step LoRA?

Qwen-Image-Edit-2509 是 20B 規模的模型,原始推理需要較多採樣步數。
完整模式適合最終成品,但在調整 Prompt、圖片順序與 Seed 的階段,每次都等待完整推理會拖慢實驗速度。
LightX2V / Qwen-Image-Lightning 提供 2509 專用的 4-step LoRA,將工作流變成兩階段:

快速草稿:Lightning LoRA + 4 steps
    └─ 找構圖、Prompt、圖片順序與 Seed

最終精修:停用 Lightning LoRA + 較高 steps
    └─ 比較細節、一致性與文字品質


4-step 的價值是提高迭代速度,不是保證四步結果在每一種任務都超越完整採樣。
※若顯示卡很頂尖 & 高規,基本上可以跳過引入 Lightning 4-Step

Step 4:本篇說明 - 對應規格

以下是本次預計測試的環境:

項目 本次環境
GPU NVIDIA GeForce RTX 5070(12 GB VRAM)
CPU Intel(R) Core(TM) i7-8700 CPU @ 3.20GHz,3192 Mhz,6 個核心,12 個邏輯處理器
RAM 48 GB
OS Microsoft Windows 10 專業版
主模型 qwen_image_edit_2509_fp8_e4m3fn.safetensors
加速模型 Qwen-Image-Edit-2509-Lightning-4steps-V1.0-bf16.safetensors


※20B 模型即使採 FP8,載入時仍需要大量 VRAM 與系統 RAM。 <br/※>12 GB VRAM 的環境預期會依賴 ComfyUI 的模型卸載,實際速度請以本機測試為準。

第二部分:Qwen-Image-Edit ComfyUI工作流

Step 1:快速上手 - 使用模板

開啟 ComfyUI 後,左側選擇模板 (Template)
或者可下載官方的預設工作流範本 image_qwen_image_edit_2509.json


預設使用模板後,只會有 1 個 Image 輸入,還需要手動調整才能正確使用 Qwen-Image-Edit


Step 2:完整工作流 - 大綱

官方工作流可整理成以下6個區塊:
第二部分是以官方的模板,來做說明如何順利使用 Qwen-Edit-Image。
其中 Markdown 的地方我們也已經調整,可直接使用本篇說明後調整過的完整工作流: image_qwen_image_edit_2509.json

工作流區塊 功能
Model links 補充下載模型、存放位置、教學說明
Image Edit(Qwen 2509) 放入主要圖片與最多兩張額外參考圖,並實現合成、變化
Step 1 - Load models 載入 2509 Diffusion Model、Qwen 2.5-VL Text Encoder 與加載VAE
Step 2 - Scale Image 圖像調整、VAE 編碼輸出
Step 4 - Prompt 說明每一張圖要保留與融合的內容
採樣算法、KSampling KSampler 依完整模式或 4-step 模式生成 Latent





Step 3:Model links - 下載模型

為了效能我們採用 Lightning 4-Step Lora 模型,對應的載點如下:
※相關說明可參考此篇:0006. 從 V1 升級!Wan + LightX2V V2 雙 LoRA 控噪工作流:4步極速打造超高穩定度 AI 影片

模型名稱 載點
Qwen-Image-Edit-2509-Q4_K_M.gguf huggingface載點
Qwen-Image-Lightning-4steps-V1.0.safetensors huggingface載點
qwen_image_vae.safetensors huggingface載點
qwen_2.5_vl_7b_fp8_scaled.safetensors huggingface載點
請特別確認 LoRA 檔名包含 `Image-Edit-2509`,
不要誤用一般 Qwen-Image 文生圖版本,
或 Qwen-Image-Edit-2511 的 Lightning LoRA。




Step 4:Image Edit(Qwen 2509) - 增加輸入源

預設只有1個輸入源,因此我們要添加節點 -> 輸入 load image -> 加載圖像 -> 增加 2 個節點



增加後,對新增的 2 個 load image 綁定到 Image Edit 的 輸入源 image 2 與 image 3


綁定後,可以對 image 2 或 image 3 的加載圖像,按下 Ctrl + B 將期關閉
可以讓每次合成時動態決定 image 1 + image 2 或 image 1 + image 3 或 image 1 + image 2 + image 3
但必須以 image 1 為主體,image 2、image 3圖是可選參考。

Load Image 1 → 主體 (通常場景或構圖)
Load Image 2 → 可選參考(人物、商品或服裝等)
Load Image 3 → 可選參考(人物、商品或服裝等)




Step 5:Step 1 - Load models

主模型使用 Qwen-Image-Edit-2509-Q4_K_M.gguf ,必須要更換原本的節點,才能使用 GGUF
接著如下圖片步驟:

1. 點擊展開
2. 將原本的 UNet加載器 替換成 UNet加載器(GGUF)
3. 選擇模型 Qwen-Image-Edit-2509-Q4_K_M.gguf





Step 6:Scale Image

在工作流中負責準備 latent 基底,包含兩個節點:
此面板一般不需要動它,因為範本已經接好

1. 图像缩放为FluxKon… 此節點把所有輸入圖(image1 ~ 3)縮放到模型最適合的解析度,統一輸入尺寸
2. VAE編碼(VAE Encode) 把縮放後的圖片編碼成 latent,送給 KSampler




Step 7: Step 4 - Prompt

Prompt 可以拆成「主體、來源、動作、場景、保留條件、禁止改動」六個部分:

Create a realistic commercial poster.
Use the person from Image 1 as the main subject.
Keep the face, hairstyle, and identity of the person from Image 1.
The person is holding the product from Image 2 with the label facing the camera.
Place the person in the environment from Image 3 and match its warm sunset lighting.
Preserve the exact product shape, logo placement, and package colors.
Do not add extra people, duplicate products, or unrelated text.


Qwen 是阿里實驗室 訓練的模型,原生就是中英雙語訓練,因此中文 Prompt 也能使用
注意避免一次塞入大量互相衝突的形容詞,例如同時要求「完全保留原構圖」與「改成完全不同的俯視廣角構圖」。
此時模型只能在這些限制之間自行取捨。

Step 8: 採樣算法、KSampling

三個節點是 Qwen-Image-Edit 官方範本專門加的「調參三件套」:

1. 采样算法(AuraFlow) 取樣過程中噪聲排程的偏移量,用來控制模型在不同步數下對「大結構」和「細節」的分配比重。
  移位(shift)值 3.00 是 Qwen-Image-Edit 官方建議預設值,不太需要動
  數值越高,模型會把更多運算資源留給早期步驟(整體構圖)。
2. CFG歸一化 Lightning LoRA 後 CFG 被壓到 1.0
  強度 1.00 是官方預設,一般不需要更動
  如果生成結果對 prompt 的遵循度不夠,可以調高一些(如 1.1~1.3)
3. K采樣器 編輯任務通常設接近 1.0(完全重繪),如果結果和原圖偏差過大(構圖跑掉),可降到 0.9
  步數 4 + cfg 1.0 + euler + simple:這組是標準的 Lightning 4steps 搭配


這三個節點是專門為了讓「加速 LoRA + 低步數」這套快速生成方案還能維持品質


第三部分:驗證成果

Step 1:測試一 - 場景 + 人物融合準備

第一組測試先只使用兩張圖片,來驗證效果:

Image 1:男女 2 人爬山照
Image 2:一名穿著休閒服的女性
輸出目標:將休閒服的女性添加到爬山風景圖


Image 1:


Image 2:


Step 2:測試一 - 場景 + 人物融合結果

Prompt:

使用 Image1 當主體。
Image2 的人加入到 Image1,一起爬山


4-step 執行結果:該女性合併到該爬山中,3人在同一個場景


Step 3:測試二 - 場景 + 人物 + 衣服融合準備

第二組使用三張圖片,測試 2509 最有特色的「場景 + 人物 + 衣服」組合。

Image 1:男女 2 人爬山照
Image 2:一名穿著休閒服的女性
Image 3:一件 T-Shirt 
輸出目標:將休閒服的女性添加到爬山風景圖,並替換衣服成 T-Shirt


Image 3:



三張圖最好都先裁掉無關資訊。物件圖保留完整,場景圖避免出現其他搶眼人物,才能減少模型錯誤複製主體。


Step 4:測試二 - 人物 + 商品 + 場景結果

Prompt:

使用 Image1 當主體。
Image2 的人加入到 Image1,一起爬山
image1 的左邊女人的衣服替換成 image3 的衣服樣式


生成結果:三人自然地一起爬山,並且 image 2 的女性換了件 T-Shirt 一起爬山


第四部分:分析、遺留問題探討

Step 1:多圖輸入順序會改變結果

多圖模型不是將每張圖賦予完全相同的權重。Image 1 通常是主要編輯來源,Image 2、Image 3 作為額外條件
交換圖片順序後,即使 Prompt 不變,也可能得到不同構圖與主體保留程度。
建議固定一套規則:

Image 1 = 最不能被改變的主體
Image 2 = 要被拿取、穿戴或融合的物件
Image 3 = 場景、姿勢或風格條件


若物件比人物更重要,例如產品主視覺,就可以將商品放到 Image 1,再用 Prompt 指定人物只是陪襯。
應以「誰是主要輸出主體」決定第一張圖。

Step 2:一致性不是像素級複製

官方所說的人物與商品一致性,是模型更能保留識別特徵,不代表每個像素、每個 Logo 筆畫與每條衣服縫線都完全相同。

容易保留 容易漂移
臉型、髮型、主要配色 細小文字、條碼、產品成分表
商品大輪廓 精密機構、接口與按鍵數量
場景色調與空間感 背景中的小人物與遠處招牌
大型 Logo 位置 Logo 的細筆畫與特殊字型
服裝款式與顏色 圖案細節、首飾與手指接觸處


商業商品圖若要求包裝百分之百正確,較可靠的流程仍是讓模型生成構圖、人物與光線,再把原始商品圖以遮罩、合成或 Inpaint 方式精準放回。

Step 3:圖片越多,Prompt 越需要像規格書

三張圖片同時輸入時,只寫「把它們融合」會把決策全部交給模型。更穩定的 Prompt 應回答:

誰是主角?
哪一張圖提供臉部?
哪一張圖提供商品?
哪一張圖提供場景?
人物要做什麼動作?
哪些特徵絕對不能改?
哪些原圖元素必須刪除?
輸出是照片、海報、插畫還是商品主視覺?


但 Prompt 不是越長越好。相同指令重複多次、互相矛盾或加入與任務無關的畫質詞,都可能稀釋最重要的編輯目標。

Step 4:ControlNet 是下一步,不是本篇必要條件

Qwen-Image-Edit-2509 原生支援深度圖、邊緣圖與關鍵點圖等控制條件,但本篇先完成原生多圖融合與 4-step 流程
沒有將 ControlNet Preprocessor、姿勢估計與額外條件全部混在同一個基礎工作流。
下一階段可以測試:

人物圖 + OpenPose 關鍵點 → 保留身分並改變姿勢
商品圖 + Canny 邊緣 → 降低產品輪廓漂移
場景圖 + Depth → 保留空間與鏡頭結構
人物 + 商品 + Control Image → 同時控制主體與構圖


每加入一種條件,都應做單獨 A/B 測試,否則失敗時很難判斷是多圖 Prompt、ControlNet 還是採樣參數造成。

Step 5:2509 不是最新版本,為什麼仍值得整理?

Qwen-Image-Edit 系列後續仍有更新版本,但 2509 是多圖編輯正式進入工作流的重要節點
ComfyUI 也提供成熟的原生範本與對應 Lightning LoRA。
本篇 刻意鎖定 2509 的原因

模型、LoRA 與 ComfyUI 範本版本能明確配對
多圖輸入 1~3 張的行為容易理解
適合比較單圖 Edit 與多圖 Edit 的差異
能建立之後升級新版本時的固定測試基準


升級其他版本時,不要只替換主模型檔案。
應重新核對 Text Encoder、VAE、編碼節點、Lightning LoRA、Sampler 與官方 Workflow 是否相容。