返回首頁

代理安全/校準

偽造的專業儀表板令 LLM 代理更敢下注,12 款模型行動承諾率升至 36.8%

新研究發現,無法預測的問題只要配上權威感十足的數據面板,LLM 代理便更容易作出方向性決策,即使全部數字都是捏造。以 540 筆合成案例微調可暫時修正行動閘門,但強制輸出格式會令效果失效。

Ralf Manteufel · GFDL 1.2 · Image source
zh-Hant

一項涵蓋 12 款前沿模型的研究,把「模型知道自己不知道」與「模型是否仍會採取行動」拆成兩個問題。作者設計可證明無法從現有資訊預測的金融、體育、天氣等題目,再逐步加入專業風格的指標面板。只有裸問題時,代理作出方向性承諾的比例為 6.5%;證據外觀逐步增強後升至 54.0%。

關鍵控制實驗把面板內容完全偽造,僅保留問題本身為真。即使如此,承諾率仍由 24.5%升至 36.8%,與使用真實市場資料時的 37.6%在統計上無法區分。這表示觸發行動的可能不是資訊量,而是數字、圖表及專業介面的權威包裝。問題也不等同一般能力不足:在相同面板搭配的可回答題目上,模型幾乎都能答對;模型自報機率的 AUROC 僅 0.346,甚至呈反向預測。

研究進一步要求模型先判斷問題是否「原理上不可知」。模型有九成機會正確辨識,一旦明確完成這個步驟,後續仍下注的比例只剩 0.4%,因而把故障定位在 belief 與 action 之間的閘門。作者以骰子、硬幣、罐子和計時器等 540 筆合成案例微調一款 3B 模型,使原測試的承諾率降至零,並轉移至三個未見領域。

但這項修正高度依賴介面:當回應格式允許模型先推理時才有效,要求直接輸出固定欄位或單一選項便可能再次自信犯錯。研究只有一名作者,部分模型亦出現大量不可解析輸出。部署金融、醫療或維運代理時,工程師應把「是否應行動」做成可獨立測試、可拒答的政策層,並測試偽造儀表板、結構化輸出和工具資料污染,而不能只校準答案機率。

來源

  1. Calibrated Enough to Know, Not Calibrated to Act
  2. confidence-calibration-evaluation:程式、資料、預註冊與快取輸出