分享程式代碼相關筆記
目前文章總數:242 篇
最後更新:2026年 07月 25日
延續上篇文章,雖然 GGUF + LoRA LightX2V 成功提高了效能,並且兼顧輸出影片品質
但穩定度變差了,上篇文章的作法會有 20% 的影片會導致異常(閃爍、變臉、發呆等等)
因此優化的改良方案式最終提出的雙階段高低噪音處理的 V2 優化
V2 提供全加速和半加速兩種模式:
1. 全加速將 LoRA 同時套用在高噪音和低噪音兩個階段,強度 1.0,達到最大速度;
2. 半加速只將 LoRA 套用在低噪音修飾階段,提供更好的 Prompt 控制。
雜訊 →(高噪音階段 4~7步)→ 粗略結構
→(低噪音階段 4~7步)→ 細節修飾 → 完成
速度的優點被放大了,但是調教的精準度的誤差也相對應提高
※ 穩定度 取決於參數、提示詞複雜度等因素。
若硬體設備遠高於此,基本上 VRAM 不足的問題應不容易發生,可不用檢閱此篇內容
| 項目 | 規格 |
|---|---|
| GPU | 名稱 NVIDIA GeForce RTX 5070 (12G VRAM) |
| CPU | Intel(R) Core(TM) i7-8700 CPU @ 3.20GHz,3192 Mhz,6 個核心,12 個邏輯處理器 |
| RAM | 48 GB |
| OS | Microsoft Windows 10 專業版 |
在 LightX2V V1 中進行整合,現在為了讓生成的影片 動態 跟 靜態 有更穩定的效果,因此 V2 要拆出來
| 項目 | 目的 |
|---|---|
| High Noise(高雜訊/基礎階段) | 負責生成影片的宏觀結構、運鏡與肢體大動作。 |
| Low Noise(低雜訊/精細階段) | 負責還原極高清晰度、消除畫面閃爍、細化皮膚與衣物紋理。 |
解決影片出現不合理的症狀對應說明:
| 症狀 | 原因 | 調整方向 |
|---|---|---|
| 閃爍、變臉 | High Noise 太強 | High Noise 的 K採樣器 CFG 降低 |
| 人物靜止不動 | High Noise 太弱 | High Noise 的 K採樣器 CFG 提高 |
| 後半段崩潰 | Low Noise 降噪太高 | Low Noise 的 K採樣器 降噪 降低 |
| 畫面模糊 | Low Noise 太弱 | Low Noise 的 K採樣器 降噪 提高 |
High Noise 一定要先然後在執行 Low Noise,AI 生成影片的過程,本質上是從「完全混亂的雜訊」逐步變成「清晰影片」:
純雜訊(High Noise)→ 半清晰 → 清晰影片(Low Noise)
因此,混亂程度 100 % -> 50% -> 0 % 的影片生成就是高低噪音模型各自的任務範疇
| High Noise | Low Noise 模型 | |
|---|---|---|
| 訓練目標 | 學會從「高度混亂」→「中度清晰」 | 學會從「中度清晰」→「完全清晰」 |
| 擅長處理 | 雜訊程度 100% → 50% | 雜訊程度 50% → 0% |
結論: 如果Low Noise -> High Noise 的錯誤順序,Low Noise 收到 100% 雜訊,它根本沒有被訓練過處理這種輸入,就會完全失控。
工作主要節點分成 6 個區塊
| 項目 | 說明 |
|---|---|
| Markdown Note | 補充下載模型、存放位置、教學說明 |
| Step1 - Load models | 載入模型,VAE (編碼/解碼器),CLIP (文字特徵向量模型),類型使用 Wan |
| Step2 - Load LoRA - High noise | 載入 LoRA 模型,處理高噪音 High Noise、K採樣器參數調整 |
| Step3 - Upload start_image | 上傳圖片,這邊用蒙娜麗莎的圖片演示 |
| Step4 - Prompt | 文字提示詞,正面、負面 |
| Step5 - Video size | 影像的長寬,預設 512 * 512 |
| Step6 - Load LoRA - Low Noise | 載入 LoRA 模型,處理低噪音 Low Noise、K採樣器參數調整 |
完整的工作流與節點間的連接可參考完整圖:
※工作流載點:點擊下載
檔案下載的模型都記錄於 Markdown Note 中,對應載點跟出處也可以參考
| 模型名稱 | 載點 |
|---|---|
| umt5_xxl_fp8_e4m3fn_scaled.safetensors | huggingface載點 |
| clip_vision_h.safetensors | huggingface載點 |
| wan2.1-i2v-14b-480p-Q5_K_M.gguf | huggingface載點 |
| high_noise_model_rank64.safetensors | huggingface載點 |
| low_noise_model_rank64.safetensors | huggingface載點 |
| wan_2.1_vae.safetensors | huggingface載點 |
所有模型的存放位置也需放到正確位置下:
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 text_encoders/
│ │ └── umt5_xxl_fp8_e4m3fn_scaled.safetensors
│ ├── 📂 clip_vision/
│ │ └── clip_vision_h.safetensors
│ ├── 📂 diffusion_models/
│ │ └── wan2.1-i2v-14b-480p-Q5_K_M.gguf
│ ├── 📂 loras/
│ │ └── high_noise_model_rank64.safetensors
│ │ └── low_noise_model_rank64.safetensors
│ └── 📂 vae/
│ └── wan_2.1_vae.safetensors
主模型使用 GGUF (wan2.1-i2v-14b-480p-Q5_K_M.gguf),可以有效地節省 VRAM 的消費,並提升速度
此節點連結如下:
UNET 加載器 (GGUF)
└─ 模型 ──→ 加載LoRA (高噪音 模型 輸入)
加載CLIP
└─ CLIP ──→ 加載LoRA (高噪音 CLIP 輸入)
└─→ 加載LoRA (低噪音 CLIP 輸入)
加載VAE
└─ VAE ──→ VAE解碼 (vae 輸入)
└────→ 圖像到視頻(Wan) (vae 輸入)
加載CLIP視覺
└─ CLIP視覺 ──→ CLIP視覺編碼 (CLIP視覺 輸入)
加載LoRA 的高噪音模型使用 LightX2V 蒸餾4步模型 (high_noise_model_rank64.safetensors)
此區節點連結如下:
加載LoRA
└─ 模型 ──→ 採樣算法(SD3) (模型 輸入)
└─ CLIP ──→ CLIP Text Encode (Positive Prompt) 的 CLIP 輸入
└─→ CLIP Text Encode (Negative Prompt) 的 CLIP 輸入
採樣算法(SD3)
└─ 模型 ──→ K採樣器 (模型 輸入)
└─→ Load LoRA (低噪音 CLIP 輸入)
K採樣器
└─ Latent ──→ K採樣器 (低噪音的 K採樣器 Latent 圖像輸入)
關鍵在於 高噪音 K 採樣器 的結果要變成 低噪音 K 採樣器 的 模型輸入
參數部分,高噪音階段負責建立動作結構,因此動態框架可以較大些(需留意自己的需求,參數仍可調整):
High Noise 階段任務: 決定影片的運鏡、肢體動作、人物骨架
因此 SD3 Shift 設定: 8.0 ~ 12.0(這裡預設的 8.0 命中率已良好)。
CFG 設定:5 (CFG 太低會讓動作保守)
邏輯: 迫使採樣步數全部往前衝,集中在最高雜訊的起點,確保動態邏輯不崩潰。
上傳圖片節點,使用蒙娜麗莎的微笑當圖片
此區節點連結如下:
加載圖像
└─ 圖像 ──→ CLIP視覺編碼 (圖像 輸入)
└──→ 圖像到視頻(Wan) (開始圖像 輸入)
CLIP視覺編碼
└─ CLIP視覺輸出 ──→ 圖像到視頻 (開始圖像 輸入)
上傳圖片節點,使用蒙娜麗莎的微笑當圖片
此區節點連結如下:
CLIP Text Encode (Positive Prompt)
└─ 條件 ──→ 圖像到視頻 (正面 輸入)
CLIP Text Encode (Negative Prompt)
└─ 條件 ──→ 圖像到視頻 (負面 輸入)
影片的生成,正面、負面文字詞高低噪音保持一致,並且為了實現 高噪音 -> 低噪音 的順序
先經過道 **高噪音 K 採樣器的 Latent 作為數據的抽象特徵 **
此區節點連結如下:
圖像到視頻
└─ 正面 ──→ K採樣器 (高噪音的 正面條件 輸入)
└──→ K採樣器 (低噪音的 正面條件 輸入)
└─ 負面 ──→ K採樣器 (高噪音的 負面條件 輸入)
└──→ K採樣器 (低噪音的 負面條件 輸入)
└─ 潛在 ──→ K採樣器 (高噪音的 Latent圖像)
加載LoRA 的低噪音模型使用 LightX2V 蒸餾4步模型 (Low_noise_model_rank64.safetensors)
此區節點連結如下:
UNET 加載器 (GGUF)
└─ 模型 ──→ 加載LoRA (低噪音 模型 輸入)
加載LoRA 2
└─ 模型 ──→ 採樣算法(SD3) (模型 輸入)
└─ CLIP ──→ CLIP Text Encode (Positive Prompt) 的 CLIP 輸入
└─→ CLIP Text Encode (Negative Prompt) 的 CLIP 輸入
採樣算法(SD3)
└─ 模型 ──→ K採樣器 2(低噪音 模型 輸入)
K採樣器 2
└─ VAE ──→ VAE解碼 (Latent 輸入)
VAE解碼
└─ 圖像 ──→ 創建視頻 (圖像 輸入)
創建視頻
└─ 視頻 ──→ 保存視頻 (視頻 輸入)
保存視頻
└─ 最終生成結果
參數可以留意下自己的需求,這邊 Low Noise 設定為 3.0:
Low Noise 階段任務: 消除畫面閃爍、還原 4K 級別的毛孔、髮絲、衣物材質。
因此 SD3 Shift 設定: 1.0 ~ 3.0(嘗試調低,不採用預設的 8.0)。
邏輯: 將這階段有限的步數(例如 4~6 步)均勻地平鋪在低雜訊區間。這樣模型才有足夠的「採樣密度」去一筆一筆雕刻出高畫質的細節。
高噪音 4 步 + 低噪音 4 步,平均耗時約 340 秒左右(生成約 200次影片,平均秒數 321 ~ 388 間),完成生成 5 秒影片
影片的品質穩定度提升很高,每50個影片中,只會出現 1~2 個整個跑掉的狀況。
基本上徹底解決影片變化太大不穩定的問題,但時間效能 V2 比 V1 耗費多些時間 :
範例影片1:高噪音處理大幅度轉向左邊,並凝視遠方,低噪音處理眨眼跟轉向:
範例影片2:高噪音處理大幅度轉向右邊,並凝視遠方,低噪音處理眨眼與微笑:
為了克服 RTX 5070 12G VRAM 的問題,我們克服以下問題,最後整理總結與應用分析,便於未來需要使用的時候可快速參考:
0002. ComfyUI容器化執行 Wan 2.1(2.2) 生成影……
0003. 動態與速度兼得:如何用 LightX2V LoRA 替……
0004. 動態與速度兼得:打破顯示卡 12GB 顯存限制……
0005. 追求極致速度:Wan 2.1 影片生成「GGUF……
以下皆以 RTX 5070 12G VRAM 顯示卡 + RAM 48 GB 基準評測考量
| 模型組合 | 平均時間 | 注意事項 | 應用場景 |
|---|---|---|---|
| WAN 2.1/2.2 原生 | 25 分鐘 | 適合 24G VRAM | 影片有「商業級」需求 |
| LightX2V LoRA | 6 分鐘 | 主模型未優化,仍需約 11G VRAM | 適合有更高階顯卡時,用於批量測試影片 |
| GGUF | 12 分鐘 | - | 12G VRAM 以下救星,任何情況下都建議導入 |
| GGUF+LoRA(單階段V1) | 2分鐘 | 參數基本失效,有時會不穩定 | 效率最高,快速生成 |
| GGUF+LORA(雙階段V2) | 5分鐘 | 耗費時間變大 | 穩定度提高,並且品質不錯 |