模型訓練與開源工具
Fizgig 5.0 以輪替訓練視窗,讓 33B 影片模型在 16GB 顯卡做全參數微調
Fizgig 5.0 逐段更新 MiniMax H3 與 Krea 2 的全部權重,僅為目前切片保留梯度和最佳化器狀態。開發者實測最低峰值顯存低於 13GB,但系統記憶體、訓練速度與獨立品質驗證仍是主要限制。

Fizgig 5.0 將原本的 LoRA 工作台擴充為全參數微調器,可在單張 NVIDIA 消費級顯卡上訓練 33B 參數的 MiniMax H3 影片模型與 12.9B 的 Krea 2。這裡的「全參數」並非同時為整個模型配置梯度:系統每個 epoch 只啟用一段權重,並輪替訓練視窗;其餘區塊以 4-bit NF4 凍結在顯卡,梯度與最佳化器狀態也只屬於當前切片。通常四個 epoch 才相當於完整模型走過一次更新週期。
為避免輸出權重永久承受量化誤差,Fizgig 在主記憶體保存 bf16 master copy,訓練後直接由這份副本寫出 checkpoint。維護者在 16GB 顯卡量得 H3 峰值顯存 8.8 至 12.3GB、Krea 2 為 8.4 至 11.0GB;H3 的 2.3 秒、56 影格影片訓練已在各顯存層級實跑。內建工具還能比較微調前後 checkpoint,抽取一般 LoRA 供 ComfyUI 載入。
這種切片式方法把顯存門檻從「同時容納模型、梯度與最佳化器」改成「容納單一活動視窗」,但沒有消除總運算量、PCIe 傳輸或儲存需求。Krea 2 實際建議至少 48GB 系統記憶體;H3 記憶體不足時會把 master copy 溢寫至磁碟,可能明顯拖慢訓練。AMD/ROCm 尚未測試,較長影片的部分數字仍是推算值,rank 64 LoRA 與完整 checkpoint「感知上無差異」也只來自作者測試。下一步應觀察社群能否重現收斂品質、量測每個完整週期耗時,並比較它與 QLoRA、分散式全量微調的實際成本。