返回首頁

電腦視覺

合成臉孔微調 CLIP 的競賽結果:完整訓練與低資料 LoRA 各有勝出方案

IJCB-AFMFR 2026 以同一套合成身分資料測試四支團隊如何把 CLIP ViT-L/14 改造成臉部辨識模型。完整資料組由 Sub-Center ArcFace 全量微調領先,受限資料組則由 rank-stabilized LoRA 勝出,但參賽規模與資料來源仍限制結論。

Max Gruber · CC BY 4.0 · Image source
zh-Hant

IJCB-AFMFR 2026 競賽報告於 7 月 27 日公開,試圖回答一個具體問題:不使用真實人臉訓練資料時,通用視覺—語言基礎模型能否有效轉成臉部辨識器。主辦方固定採用 CLIP ViT-L/14 作為骨幹,所有訓練影像均由 IDPERTURB 生成,再分成完整資料與低資料兩條賽道,藉此比較全量微調與參數高效率適配方法。

競賽收到四支團隊共八個有效提交。完整資料組中,DMSTI-Neurotechnology 使用 Sub-Center ArcFace 損失函數進行完整微調,取得綜合排名第一;低資料組則由 Idiap-BSP 的 rank-stabilized LoRA 方法領先。後者透過調整低秩適配矩陣的尺度,減少小資料微調的不穩定性,也顯示在合成資料受限時,凍結大部分骨幹參數未必會犧牲最佳綜合表現。

評測並非只看單一驗證集。主辦方以 Borda count 彙整 LFW、CFP-FP、AgeDB-30、CALFW、CPLFW、IJB-B、IJB-C 與 TinyFace 的驗證、辨識結果,另在 RFW 的四個人口群組檢查公平性。多項提交明顯優於未適配的 CLIP,部分也超過主辦方基線,說明合成身分資料可以把通用表徵推向專用生物辨識任務。

但「合成資料」不等於自動消除隱私或偏差:生成器仍可能繼承來源模型的表徵缺口,公開測試集也可能與實際攝影機、年齡及族群分布不同。競賽只有四支團隊,排名又由多個資料集彙整,不能據此宣布某種微調技術普遍最佳。工程上接下來應關注跨感測器測試、未知族群公平性、模型校準,以及生成資料與基礎模型訓練來源能否接受獨立稽核。

來源

  1. IJCB-AFMFR 2026: Competition on Adapting Foundation Models for Face Recognition Using Synthetic Training Data
  2. IJCB-AFMFR-2026 Competition Website