返回首頁

模型微調/可控適應

分層 LoRA 實驗顯示:模型要學詞彙、事實與行為政策,最佳更新位置並不相同

新研究把 LoRA 限制在 Transformer 的前、中、後段,發現不同學習目標呈現可重現的「適應幾何」。結果把 adapter 放置位置從實作細節提升為控制知識轉移與副作用的設計變數。

VamosSandor · CC BY-SA 4.0 · Image source
zh-Hant

耶魯大學研究人員於 7 月 28 日公開一項受控實驗,檢驗 LoRA 應該插在 Transformer 哪些層。一般微調會在多數甚至全部層配置 adapter,研究則分別只更新前段、中段或後段,並與全層及參數量配對的設定比較,測量模型能否學會新內容、把能力轉移至未見樣本,以及把改變限制在目標範圍內。

測試涵蓋五種目標:詞彙綁定、事實關聯、行為政策、因果映射與程序推理。結果顯示它們沒有共同的最佳位置。詞彙綁定在前層較容易取得且較能限制副作用,但若要廣泛轉移仍需要更全面的更新;事實關聯在局部 adapter 中偏好後層;行為學習則把「取得動作」與「依條件啟動政策」分開,前者偏後層、後者偏中層。因果與程序任務的轉移效果,多由中層或全層更新取得。

作者把每個目標在取得、轉移及邊界控制三個維度上的曲線稱為 adaptation geometry。相同方向的差異大多在五個模型家族重現,而且參數量配對後仍存在,意味結果不只是某組 LoRA 使用較多權重造成。這對企業微調尤其重要:若只用單一驗證集挑 rank、learning rate 與 target modules,可能得到表面準確、卻過度泛化或無法跨措辭轉移的 adapter。

程式與資料已公開,工程師可把分層 adapter 當成額外的超參數搜尋軸,並同時建立 acquisition、transfer 與 boundedness 測試。不過論文使用的是受控且相對窄的目標,尚不能直接推論大型指令微調、跨語言適應或長程代理訓練也會有相同分層規律。下一步應觀察結果能否在更大模型、MoE、量化 LoRA,以及多個 adapter 疊加時維持。

來源

  1. Localized Adaptation Reveals Distinct Learning Signatures in Transformers
  2. adaptation-geometries: Code and data