返回首頁

評測與可靠性

代理先前完成稽核與修復後,下一次驗證的誤報率最多下降 11.5 個百分點

新研究顯示,即使待驗內容完全相同,留在上下文中的舊稽核與修復經歷仍會令多款開放模型較少報錯。訊號偵測分析未發現辨別力同步提升,表示代理管線改變了驗證門檻,而不只是令模型判斷得更準。

Dietmar Rabich · CC BY-SA 4.0 · Image source
zh-Hant

把同一個模型先用作審核者、再要求它修正問題,看似只是代理工作流的編排選擇;新研究指出,這段經歷會改變模型下一次審核的判定門檻。研究者先讓模型對另一筆 ProcessBench 推理軌跡完成「稽核→修復」,再交付位元完全相同的目標題目。Qwen3.6-27B、Qwen3.6-35B-A3B 與 Ministral-3-14B 在五種語義相近措辭下,15/15 組合的誤報率均低於等長、非稽核上下文,降幅為 2.8 至 11.5 個百分點。

實驗不只觀察正確軌跡。研究同時以 929 筆標記為錯誤的軌跡估算偵測率,再用訊號偵測理論拆分辨別力 `d′` 與判定準則 `c`。判定準則在 15 組中全部向較少報錯移動,13 組通過多重比較校正;`d′` 則沒有任何一組顯示可辨識的顯著改善。換言之,模型主要是變得寬鬆,而非更能區分正確與錯誤。該操作點的 balanced accuracy 確有上升,但原因是原始誤報很多,不能推論寬鬆化在其他錯誤分布下仍有利。

為排除單純上下文長度或答案極性,作者加入等長填充、只有稽核、惰性重述,以及實際發現並修復錯誤等控制。結果亦非簡單複誦前文結論:在效果最乾淨的 Ministral 測試中,先前稽核若真的發現錯誤,後續反而更寬鬆,方向與一般負面訊息促使更多報錯的預測相反。啟用推理模式後,兩款 Qwen 的絕對誤報率大幅降低,但相對門檻偏移仍存在;代價是輸出 token 約增至 18 倍,且截斷與格式失敗並非隨機。

這對程式碼審查、自動證明檢查及 critic–repair 代理很實際:不能只追蹤「被標記項目的修復成功率」,還應同時量測乾淨樣本誤報率、錯誤樣本偵測率與上下文歷史。可考慮讓驗證器使用獨立工作階段,或在修復後以清潔上下文重新驗證。限制是研究只涵蓋一個推理資料集與三款開放模型;另有兩款候選模型未通過預設敏感度篩選,其中一款效果顯著反向,因此現階段不能把寬鬆化視為所有 LLM 驗證器的普遍定律。

來源

  1. Prior Audit–Repair Context Shifts LLM Verifier Thresholds Toward Leniency
  2. parsa-mz/crtitxer