GitHub Repo
vLLM 社群回報 LoRA 逐層縮放遭忽略,微調成果部署後可能衰減
vLLM 0.30.0 被回報未套用 PEFT 的逐層 rank 與 alpha 設定,可能在無警告下改變適配器效果。社群已提供重現程式與權重轉換對照,正式修補及影響範圍仍待確認。

10 月 2 日,vLLM 社群提出一項 LoRA 相容性回報:以 Hugging Face PEFT 訓練的適配器,若透過 rank_pattern 或 alpha_pattern 設定個別模組,部署到 vLLM 0.30.0 後可能使用錯誤縮放。回報指出,載入流程只讀取全域 r 與 lora_alpha,逐層設定則被忽略,且沒有警告。截至查核時,議題仍開啟,未列出關聯修補。問題回報
PEFT 官方文件確認,這兩個欄位可依模組名稱或正規表示式覆寫設定;一般 LoRA 的更新量按 alpha/r 縮放。因此,即使權重成功載入,縮放語意不一致仍會改變模型計算。以全域 rank 16、alpha 32 為例,某層若改用 rank 4,其倍率應為 8;沿用全域倍率則只有 2。這也表示,單憑欄位非空不能判定錯誤,關鍵是逐層比例是否改變。PEFT 文件
回報者以 OLMoE-1B-7B 在 wikitext-2 微調 200 步測試,得到 PEFT 困惑度 10.06、vLLM 11.28;困惑度越低越好。把各模組縮放折入 lora_B 並移除 pattern 後,vLLM 回到 10.06。另一個小型隨機模型案例也附上程式,供比對 token 對數機率。這些數字仍是作者自測,尚不能推廣為所有 LoRA 的品質損失。測試與重現程式
此事對 MoE 微調尤其值得追蹤:PEFT 文件示範降低專家層 rank,以控制適配器參數預算,並指向 vLLM 加速推論。工程上的含意是,訓練與服務端除了核對檔案格式,也應比較實際更新量。MoE 設定範例
部署者可先檢查適配器設定,使用相同 token 輸入比較 PEFT 與服務端的對數機率,再評估權重轉換。後續應關注逐模組縮放支援、pattern 中最大 rank 的容量檢查,以及上游跨模型驗證;目前公開資料尚未證實正式修補版本。修補方向