首頁

目前文章總數:242 篇

  

最後更新:2026年 07月 25日

0006. 從 V1 升級!Wan + LightX2V V2 雙 LoRA 控噪工作流:4步極速打造超高穩定度 AI 影片

日期:2026年 07月 25日

標籤: Linux Ubuntu Docker Docker-Compose Container Stable Diffusion ComfyUI WSL 2.2 GGUF LoRA LightX2V LoRA

摘要:生成式AI


應用所需:1. 已安裝 Windows 的 Docker Desktop (Use WSL 2 instead of Hyper-V)
     2. 已安裝 Hyper-V + ComfyUI(容器化)
     3. 顯示卡使用 RTX 5070 以上 + 12G VRAM
     4. Windows 10 以上作業系統
解決問題:1. 上一篇文章採用的是 LightX2V V1單階段作法,此篇採用更近一步的 V2 雙階段(高噪音 + 低噪音),解決影片生成穩定度的問題(成果接近 95% 高穩定度)
     2. 說明完整創建一個 ComfyUI 工作流 (整合高噪音 + 低噪音模型 LightX2V LoRA + GGUF)
相關參考:改進此篇文章0113. 追求極致速度:Wan 2.1 影片生成「GGUF + LightX2V 4步蒸餾」最佳優化速度方案
工作流載點:點擊下載
基本介紹:本篇分為四大部分。
第一部分:問題描述
第二部分:LightX2V LoRA V2 ComfyUI工作流
第三部分:驗證成果
第四部分:效能總結分析






第一部分:問題描述

Step 1:GGUF + LoRA 單階段不穩定說明

延續上篇文章,雖然 GGUF + LoRA LightX2V 成功提高了效能,並且兼顧輸出影片品質
但穩定度變差了,上篇文章的作法會有 20% 的影片會導致異常(閃爍、變臉、發呆等等)
因此優化的改良方案式最終提出的雙階段高低噪音處理的 V2 優化

V2 提供全加速和半加速兩種模式:
1. 全加速將 LoRA 同時套用在高噪音和低噪音兩個階段,強度 1.0,達到最大速度;
2. 半加速只將 LoRA 套用在低噪音修飾階段,提供更好的 Prompt 控制。

雜訊 →(高噪音階段 4~7步)→ 粗略結構
     →(低噪音階段 4~7步)→ 細節修飾 → 完成

速度的優點被放大了,但是調教的精準度的誤差也相對應提高


穩定度 取決於參數、提示詞複雜度等因素。

Step 2:本篇說明 - 對應規格

若硬體設備遠高於此,基本上 VRAM 不足的問題應不容易發生,可不用檢閱此篇內容

項目 規格
GPU 名稱 NVIDIA GeForce RTX 5070 (12G VRAM)
CPU Intel(R) Core(TM) i7-8700 CPU @ 3.20GHz,3192 Mhz,6 個核心,12 個邏輯處理器
RAM 48 GB
OS Microsoft Windows 10 專業版





第二部分:LightX2V LoRA V2 ComfyUI工作流

Step 1:高低噪音目的 & 影響

在 LightX2V V1 中進行整合,現在為了讓生成的影片 動態靜態 有更穩定的效果,因此 V2 要拆出來

項目 目的
High Noise(高雜訊/基礎階段) 負責生成影片的宏觀結構、運鏡與肢體大動作。
Low Noise(低雜訊/精細階段) 負責還原極高清晰度、消除畫面閃爍、細化皮膚與衣物紋理。



解決影片出現不合理的症狀對應說明:

症狀 原因 調整方向
閃爍、變臉 High Noise 太強 High Noise 的 K採樣器 CFG 降低
人物靜止不動 High Noise 太弱 High Noise 的 K採樣器 CFG 提高
後半段崩潰 Low Noise 降噪太高 Low Noise 的 K採樣器 降噪 降低
畫面模糊 Low Noise 太弱 Low Noise 的 K採樣器 降噪 提高



Step 2:降噪順序重要性

High Noise 一定要先然後在執行 Low Noise,AI 生成影片的過程,本質上是從「完全混亂的雜訊」逐步變成「清晰影片」:

純雜訊(High Noise)→ 半清晰 → 清晰影片(Low Noise)


因此,混亂程度 100 % -> 50% -> 0 % 的影片生成就是高低噪音模型各自的任務範疇

  High Noise Low Noise 模型
訓練目標 學會從「高度混亂」→「中度清晰」 學會從「中度清晰」→「完全清晰」
擅長處理 雜訊程度 100% → 50% 雜訊程度 50% → 0%


結論: 如果Low Noise -> High Noise 的錯誤順序,Low Noise 收到 100% 雜訊,它根本沒有被訓練過處理這種輸入,就會完全失控。

Step 3:完整工作流 - 大綱

工作主要節點分成 6 個區塊

項目 說明
Markdown Note 補充下載模型、存放位置、教學說明
Step1 - Load models 載入模型,VAE (編碼/解碼器),CLIP (文字特徵向量模型),類型使用 Wan
Step2 - Load LoRA - High noise 載入 LoRA 模型,處理高噪音 High Noise、K採樣器參數調整
Step3 - Upload start_image 上傳圖片,這邊用蒙娜麗莎的圖片演示
Step4 - Prompt 文字提示詞,正面、負面
Step5 - Video size 影像的長寬,預設 512 * 512
Step6 - Load LoRA - Low Noise 載入 LoRA 模型,處理低噪音 Low Noise、K採樣器參數調整


完整的工作流與節點間的連接可參考完整圖:
※工作流載點:點擊下載


Step 4:Markdown Note - 下載模型

檔案下載的模型都記錄於 Markdown Note 中,對應載點跟出處也可以參考

模型名稱 載點
umt5_xxl_fp8_e4m3fn_scaled.safetensors huggingface載點
clip_vision_h.safetensors huggingface載點
wan2.1-i2v-14b-480p-Q5_K_M.gguf huggingface載點
high_noise_model_rank64.safetensors huggingface載點
low_noise_model_rank64.safetensors huggingface載點
wan_2.1_vae.safetensors huggingface載點



所有模型的存放位置也需放到正確位置下:

📂 ComfyUI/
├── 📂 models/
│   ├── 📂 text_encoders/
│   │      └── umt5_xxl_fp8_e4m3fn_scaled.safetensors
│   ├── 📂 clip_vision/
│   │      └── clip_vision_h.safetensors
│   ├── 📂 diffusion_models/
│   │      └── wan2.1-i2v-14b-480p-Q5_K_M.gguf
│   ├── 📂 loras/
│   │      └── high_noise_model_rank64.safetensors
│   │      └── low_noise_model_rank64.safetensors
│   └── 📂 vae/
│          └── wan_2.1_vae.safetensors




Step 5:工作流 Step1 - Load models

主模型使用 GGUF (wan2.1-i2v-14b-480p-Q5_K_M.gguf),可以有效地節省 VRAM 的消費,並提升速度
此節點連結如下:

UNET 加載器 (GGUF)
    └─ 模型 ──→ 加載LoRA (高噪音 模型 輸入)

加載CLIP
    └─ CLIP ──→ 加載LoRA (高噪音 CLIP 輸入)
            └─→ 加載LoRA (低噪音 CLIP 輸入)
加載VAE
    └─ VAE ──→ VAE解碼 (vae 輸入)
        └────→ 圖像到視頻(Wan) (vae 輸入)    

加載CLIP視覺
    └─ CLIP視覺 ──→ CLIP視覺編碼 (CLIP視覺 輸入)




Step 6:工作流 Step2 - Load LoRA - High noise

加載LoRA 的高噪音模型使用 LightX2V 蒸餾4步模型 (high_noise_model_rank64.safetensors)
此區節點連結如下:

加載LoRA
    └─ 模型 ──→ 採樣算法(SD3) (模型 輸入)
    └─ CLIP ──→ CLIP Text Encode (Positive Prompt) 的 CLIP 輸入
            └─→ CLIP Text Encode (Negative Prompt) 的 CLIP 輸入

採樣算法(SD3)
    └─ 模型 ──→ K採樣器 (模型 輸入)
            └─→ Load LoRA (低噪音 CLIP 輸入)
K採樣器
    └─ Latent ──→ K採樣器 (低噪音的 K採樣器 Latent 圖像輸入)


關鍵在於 高噪音 K 採樣器 的結果要變成 低噪音 K 採樣器模型輸入

參數部分,高噪音階段負責建立動作結構,因此動態框架可以較大些(需留意自己的需求,參數仍可調整):

High Noise 階段任務: 決定影片的運鏡、肢體動作、人物骨架
因此 SD3 Shift 設定: 8.0 ~ 12.0(這裡預設的 8.0 命中率已良好)。
CFG 設定:5 (CFG 太低會讓動作保守)
邏輯: 迫使採樣步數全部往前衝,集中在最高雜訊的起點,確保動態邏輯不崩潰。




Step 7:工作流 Step3 - Upload start_image

上傳圖片節點,使用蒙娜麗莎的微笑當圖片
此區節點連結如下:

加載圖像
    └─ 圖像 ──→ CLIP視覺編碼 (圖像 輸入)
           └──→ 圖像到視頻(Wan) (開始圖像 輸入) 

CLIP視覺編碼 
    └─  CLIP視覺輸出 ──→ 圖像到視頻 (開始圖像 輸入)




Step 8:工作流 Step4 - Prompt

上傳圖片節點,使用蒙娜麗莎的微笑當圖片
此區節點連結如下:

CLIP Text Encode (Positive Prompt) 
    └─ 條件 ──→ 圖像到視頻 (正面 輸入)

CLIP Text Encode (Negative Prompt) 
    └─ 條件 ──→  圖像到視頻 (負面 輸入)




Step 9:工作流 Step5 - Video size

影片的生成,正面、負面文字詞高低噪音保持一致,並且為了實現 高噪音 -> 低噪音 的順序
先經過道 **高噪音 K 採樣器的 Latent 作為數據的抽象特徵 **
此區節點連結如下:

圖像到視頻
    └─ 正面 ──→ K採樣器 (高噪音的 正面條件 輸入)
           └──→ K採樣器 (低噪音的 正面條件 輸入)
    └─ 負面 ──→ K採樣器 (高噪音的 負面條件 輸入)
           └──→ K採樣器 (低噪音的 負面條件 輸入)
    └─ 潛在 ──→ K採樣器 (高噪音的 Latent圖像)




Step 10:工作流 Step6 - Load LoRA - Low Noise

加載LoRA 的低噪音模型使用 LightX2V 蒸餾4步模型 (Low_noise_model_rank64.safetensors)
此區節點連結如下:

UNET 加載器 (GGUF)
    └─ 模型 ──→ 加載LoRA (低噪音 模型 輸入)

加載LoRA 2
    └─ 模型 ──→ 採樣算法(SD3) (模型 輸入)
    └─ CLIP ──→ CLIP Text Encode (Positive Prompt) 的 CLIP 輸入
            └─→ CLIP Text Encode (Negative Prompt) 的 CLIP 輸入

採樣算法(SD3)
    └─ 模型 ──→ K採樣器 2(低噪音 模型 輸入)

K採樣器 2
    └─ VAE ──→ VAE解碼 (Latent 輸入)

VAE解碼 
    └─ 圖像 ──→ 創建視頻 (圖像 輸入)

創建視頻 
    └─ 視頻 ──→ 保存視頻 (視頻 輸入)

保存視頻
    └─ 最終生成結果


參數可以留意下自己的需求,這邊 Low Noise 設定為 3.0:

Low Noise 階段任務: 消除畫面閃爍、還原 4K 級別的毛孔、髮絲、衣物材質。
因此 SD3 Shift 設定: 1.0 ~ 3.0(嘗試調低,不採用預設的 8.0)。
邏輯: 將這階段有限的步數(例如 4~6 步)均勻地平鋪在低雜訊區間。這樣模型才有足夠的「採樣密度」去一筆一筆雕刻出高畫質的細節。




第三部分:驗證成果

Step 1:開始執行 ITV - DEMO結果

高噪音 4 步 + 低噪音 4 步,平均耗時約 340 秒左右(生成約 200次影片,平均秒數 321 ~ 388 間),完成生成 5 秒影片
影片的品質穩定度提升很高,每50個影片中,只會出現 1~2 個整個跑掉的狀況。
基本上徹底解決影片變化太大不穩定的問題,但時間效能 V2 比 V1 耗費多些時間 :

範例影片1:高噪音處理大幅度轉向左邊,並凝視遠方,低噪音處理眨眼跟轉向:



範例影片2:高噪音處理大幅度轉向右邊,並凝視遠方,低噪音處理眨眼與微笑:




第四部分:效能總結分析

Step 1:總結與應用

為了克服 RTX 5070 12G VRAM 的問題,我們克服以下問題,最後整理總結與應用分析,便於未來需要使用的時候可快速參考:


0002. ComfyUI容器化執行 Wan 2.1(2.2) 生成影……
0003. 動態與速度兼得:如何用 LightX2V LoRA 替……
0004. 動態與速度兼得:打破顯示卡 12GB 顯存限制……
0005. 追求極致速度:Wan 2.1 影片生成「GGUF……



以下皆以 RTX 5070 12G VRAM 顯示卡 + RAM 48 GB 基準評測考量

模型組合 平均時間 注意事項 應用場景
WAN 2.1/2.2 原生 25 分鐘 適合 24G VRAM 影片有「商業級」需求
LightX2V LoRA 6 分鐘 主模型未優化,仍需約 11G VRAM 適合有更高階顯卡時,用於批量測試影片
GGUF 12 分鐘 - 12G VRAM 以下救星,任何情況下都建議導入
GGUF+LoRA(單階段V1) 2分鐘 參數基本失效,有時會不穩定 效率最高,快速生成
GGUF+LORA(雙階段V2) 5分鐘 耗費時間變大 穩定度提高,並且品質不錯