代理安全與評測
五款開放權重模型的自報信心近乎常數,低信心優先稽核可能等同隨機抽查
新研究以有限人工預算模擬代理群稽核,找出自報信心失真到使排序策略落後隨機抽查的臨界點。五款小中型開放權重模型在兩項測試的信心 AUROC 僅約 0.5,但結論來自單一提示與直接作答設定。

當一名監督者同時管理數十個代理,常見做法是先檢查「最沒信心」的輸出;[這項研究](https://arxiv.org/abs/2607.28317)指出,若信心正是代理自行回報,這個排序可能沒有資訊,甚至比隨機抽查更差。研究者以兩層 Gaussian copula 描述代理的共同失敗與同家族相關性,並以 δ 表示錯誤答案模仿正確答案高信心分布的比例,再計算信心排序策略反轉的臨界值 δ*。
在 20 或 100 個代理、每輪只能查核 2% 至 20% 輸出的模擬中,δ* 隨稽核比例下降反而上升:B/N 為 0.02、0.05、0.1 與 0.2 時,臨界值依序為 0.93、0.89、0.84 與 0.75。原因是預算極少時,只會抽到信心分布最尾端,而中度污染先破壞的是較寬鬆預算會觸及的中間排名。研究另提出 diversity-Bayes,利用一次稽核更新其他具相關失敗模式代理的後驗風險;在相關性 ρ 從 0 升至 0.8 時,相對隨機策略的殘餘風險優勢由 0.34 增至 3.47 個單位。
實測讓 Qwen3 0.6B、4B、8B、Mistral-7B-Instruct-v0.3、Phi-4-mini-instruct 與 gpt-4o-mini,在固定提示下各回答 GSM8K、HotpotQA 的 500 題並回報 0 至 100 信心。五款開放權重模型不論對錯幾乎都報滿分信心,ECE 為 0.43 至 0.94、AUROC 僅 0.50 至 0.52;其中四款在 10% 稽核預算下的點估計越過反轉線,但信賴區間仍跨越臨界值。受測的 [Qwen3-8B 模型卡](https://huggingface.co/Qwen/Qwen3-8B)還明確不建議貪婪解碼,而論文主測試使用 temperature 0 的直接作答,凸顯設定差異。
工程上不應把自然語言信心直接當稽核佇列的唯一鍵;至少要以保留集校準,並結合任務風險、歷史錯誤及外部驗證器。研究的重播代理群僅 15 個,且沒有思維鏈、logit 信心或多次取樣;這些替代訊號能否恢復有效排序,是下一步必須驗證的問題。