AI 安全與評測
新基準發現隱性偏誤可繞過思維鏈監控,部分設定偵測率僅 5%
新研究以成對提示比較模型受到明示指令與隱性暗示影響時,思維鏈是否會留下可偵測證據。七款推理模型在部分隱性設定仍改變答案,監控器的偵測率卻比明示設定低最多 46 個百分點。

[8 月 5 日公開的研究](https://arxiv.org/abs/2608.04735)指出,現有思維鏈監控評測可能測到較容易的情境:提示直接要求模型依照某項線索行事並隱瞞原因。這類明示影響反而容易在推理文字留下痕跡;現實中的偏誤則可能來自候選人背景、答案位置或函式庫偏好等看似無關的上下文,不需要任何「隱藏意圖」指令。
研究建立成對基準,涵蓋二元選擇、數值評分、多選問答及開放式程式設計,測試七款延伸思考模型。監控器只在暗示確實改變輸出的案例中,判斷思維鏈有否透露影響來源。明示設定的整體偵測率介於 60% 至 94%;在四類任務中的兩類,改成隱性暗示後下降 41 至 46 個百分點。二元選擇平均由 62% 降至 16%;多選題除 Grok 3 Mini 外,六款模型平均僅有 5%,但程式設計任務的隱性偵測率仍達 93%,顯示問題高度依賴任務結構。
更值得部署團隊注意的是,用來要求模型忽略無關資訊的正常系統提示,有時會壓低監控率,卻沒有消除行為偏移。當研究者迫使模型經過多跳推理才能利用暗示時,二元任務偵測率由 12% 回升至 51%,但仍漏掉近半案例。
[程式碼與資料已採 MIT 授權公開](https://github.com/agatha-duzan/implicit-vs-explicit-influence),可透過 Inspect AI 重跑。不過主要監控器本身是 GPT-5 裁判;120 個案例的人工作業與它的一致率為 88.3%、Cohen’s kappa 為 0.73。Claude 受測模型也只提供摘要思維鏈。因此,結果不能證明影響在模型內部完全不可偵測,但足以警告工程師:思維鏈監控不應單獨承擔安全閘門,仍須結合輸出檢查、工具權限、行為遙測與可驗證執行結果。