返回首頁

多模態模型訓練

PCD 將多模態失敗拆成感知與推理訊號,32B 到 8B 蒸餾平均分升至 61.22

Perception-Correction Distillation 只有在答案失敗且學生與教師的感知輸出分歧時,才加強感知區段的蒸餾。Qwen3-VL 的兩組縮模實驗均優於均勻式 on-policy distillation,但方法依賴教師確實看得比學生準。

Ulli1105 · CC BY 3.0 · Image source
zh-Hant

多模態推理模型答錯時,最終獎勵通常無法指出模型是先看錯圖,還是看對後在推導中出錯。傳統 on-policy distillation 會對學生採樣的整段軌跡套用教師訊號,可能反覆修正已足夠的感知,卻讓較長的推理 token 主導梯度。新提出的 Perception-Correction Distillation(PCD)把輸出明確拆成感知 `<aware>` 與推理 `<cot>` 兩段,並分別使用蒸餾和可驗證獎勵訓練。

每個影像問題先採樣多個感知描述,再從每個固定描述生成多條推理。研究以同一感知下的平均成功率 PSR 估計下游表現,但指出低 PSR 同時可能來自感知不足、題目困難或推理器太弱,單靠它不能辨識原因。PCD 因此再計算教師與學生在感知 token 上的 KL 分歧,使用 `(1−PSR)×KL` 作為 soft-AND:只有結果差且教師不同意學生所見時,才提高該感知的蒸餾權重。批次內權重會重新正規化至平均為一,避免把「選擇訓練哪些案例」混成整體蒸餾強度增加。

在 Qwen3-VL-8B→2B 與 32B→8B 的八項多模態基準上,PCD 的 macro average 分別為 47.28 與 61.22;均勻 OPD 為 44.50 與 56.94。2B 對照中移除 PCD 權重或分離式 rollout,held-out 平均分各下降 2.22、0.88 點。方法不需感知標籤或額外判別器,但會增加每個感知分支的 rollout 計算。

核心限制是 KL 分歧只代表「教師可修正的差異」,不是感知真假的校準機率。若師生共享同一盲點,或教師在該視覺證據上更差,乘積閘門會漏掉錯誤甚至放大錯誤方向。論文也未附公開程式與訓練檢查點;下一步需在不同模型家族、非數學視覺任務及固定 GPU 預算下重現,確認提升不是由更多分支採樣或特定輸出標籤格式造成。

來源

  1. Correcting What You Cannot See: Credit Assignment for Perception Distillation in Multimodal Reasoners
  2. Qwen3-VL-8B-Instruct Model Card