評測與可靠性
LLM 裁判先判斷、再搜尋或棄權,以校準門檻控制錯誤裁決率
新框架以預測熵決定 LLM 裁判是否直接接受判決、搜尋網路證據或棄權,並用 Clopper–Pearson 上界校準兩道門檻。32 組開放問答實驗均維持指定錯誤率,但保證依賴同分布校準資料及可靠標籤。

Dalhousie University、NYU Abu Dhabi 與 Emory University 研究者把 reference-free LLM-as-a-judge 改寫成三段式決策:裁判先憑參數知識判斷;若 verdict token 的預測熵高於第一門檻,才搜尋網路並帶入前三筆結果重判;第二次仍不確定便棄權,交由人工處理。這避免每題一律搜尋,也不把低信心判決硬塞進評測結果。
關鍵不是手動設定 confidence threshold,而是在持有真實標籤的校準集上計算已接受判決的錯誤數,再用單側 Clopper–Pearson 區間取得 false discovery rate(FDR)上界。系統搜尋兩個門檻,使接受覆蓋率最高,同時要求上界不超過使用者指定的 α。對任何固定門檻組合,作者證明在樣本獨立同分布下,兩階段路由後的錯誤指標仍可視為 Bernoulli 變數,因此有限樣本保證可沿用;針對門檻搜尋造成的多重比較,論文另報告 Bonferroni 校正版。
實驗從 TriviaQA、Natural Questions、HotpotQA、PopQA 各取 2,000 題,以 Qwen3-8B 或 Llama-3.1-70B 產生答案,再由四款 4B 至 14B/8B 模型裁決。100 次校準/測試切分、共 32 種候選模型—裁判—資料集配置中,實測 FDR 均未超過 α;在 α=0.20 時,Qwen3-14B 裁判評估 Qwen3-8B 答案,在 HotpotQA 的覆蓋率達 86%,而 Qwen3-4B 僅 14%。TriviaQA 上約 45% 題目可由 Qwen3-14B 直接裁決,不需搜尋。
這項設計適合資料清理、離線評測及自動驗收,但統計保證不是永續安全憑證:題型、搜尋品質或模型版本漂移後必須重新校準。實驗的「真實」答案還包含由另一個 Qwen 模型判斷語意等價的設定,並非全部人工標註;搜尋片段也可能遭遇過時資訊或提示注入。工程團隊接下來應關注分布漂移偵測、可信來源過濾,以及棄權轉人工後的總成本。