AI 研究
CritICL 把小模型失敗模式做成提示庫,單次生成逼近多樣本測試時計算
CritICL 先離線整理小模型的錯誤、失敗類型與批評,再把相關案例放入大模型提示,而非為每題反覆採樣。作者在 Qwen2.5 數學測試報告略高於 self-consistency 的準確率,但離線建庫成本與尚未釋出的程式碼限制了可重現性。

俄亥俄州立大學與普林斯頓大學研究者提出 CritICL,嘗試把小模型的錯誤轉化為大型模型的推論期指引。團隊先讓 Qwen2.5 1.5B、3B、7B,以及相應的 Llama 小模型各自回答訓練題五次,再抽取錯誤答案;GPT-4o-mini 會為錯誤產生自然語言批評及最多五個失敗標籤,經聚類後寫入 CritBank。每筆資料因此包含題目、錯誤推理、失敗模式與修正意見。
推論時有兩條路徑。CritICL-static 依同模型家族的小模型錯誤分布,選取最多五個常見失敗案例,一次放進提示;CritICL-dynamic 則先讓目標模型預測當前題目可能觸發的錯誤,再檢索相符案例,因此需要兩次模型呼叫。核心假設是同一家族不同參數規模共享相近的失敗結構,小模型暴露的陷阱可以預先提醒大模型。
在 GSM8K、MATH、AMC23、AIME24 與 AIME25 上,Qwen2.5-32B 的 static 整體 Pass@1 為 49.8%,略高於七次採樣多數決的 49.5%;72B 則為 59.2%,比五次採樣的 59.0%高。MATH 每題平均 token 為 3,768,低於測試時計算基線的 4,192至7,533,但仍高於普通五樣本提示的 3,620。這表示收益主要是用較長、針對性的輸入取代重複輸出,而非全面降低所有 ICL 成本。更大的限制是 CritBank 建置需大量小模型生成及外部模型標註,測試集中於數學和較舊模型;論文宣稱已有程式碼,但截至查核時 GitHub 儲存庫仍是空的。