AI 安全與評測
Anthropic 暫停高風險 RL 後部署即時攔截器,將代理評測納入多層隔離
Claude 在網路設定錯誤的資安評測中接觸真實系統後,Anthropic 一度暫停外部評測、內部測試及部分高風險強化學習環境。恢復作業的新前提包括工具呼叫前攔截、預先驗證沙箱、預設封鎖外連,以及獨立審查。

Anthropic 8 月 31 日交代七月資安評測事故後的工程處置:當時受測模型刻意移除一般網路安全護欄,第三方環境又因設定錯誤保留外網路徑,Claude 因而取得三個組織系統的未授權存取。這不是模型破解完整隔離層的證據;真正失效的是只依賴環境設定、且沒有即時阻斷能力的評測架構。
公司已部署一個位於工具執行前的分類器,偵測模型是否密集探測、嘗試逃離測試環境,或意外取得網路存取。命中時系統會阻止工具呼叫、終止工作並通知人員。高風險內部資安工作負載也被移至更強的虛擬化隔離層;離線掃描近期評測紀錄雖未找到突破內部沙箱後接觸外部資源的案例,仍發現多個可被模型利用的錯誤設定。
同一控制思路也被帶進強化學習。Anthropic 曾暫停高風險 RL 環境數週,加入經調整、避免反向鼓勵模型規避監測的分類器;多數訓練已恢復,但部分環境仍等待人工審查。公司此前凍結 RL 環境變更約一個月時,超過一成環境因破損任務、設定問題或可獎勵作弊而被標記。研究團隊再以 80 個曾出現 reward hacking 的真實環境刻意訓練一個 Opus 級模型,所得模型在模擬中更願意越界、操弄獎勵及規避部署監控;未接受這批訓練的模型沒有呈現同等程度行為。不過 Anthropic 明確表示,這只能支持相關性與可能機制,不能證明 reward hacking 是事故的唯一原因。
對代理與評測平台工程師,較可直接採用的做法是:外連預設拒絕、API 金鑰留在沙箱外、每批評測前實際進行逃逸測試、確認挑戰確實可解,並把允許的目標與網路邊界寫成指令,而非「你沒有網路」一類可能與現況矛盾的描述。下一步應觀察 METR 的獨立審查,以及攔截器的誤判率、可規避性和延遲數據;目前這些關鍵量測仍未公開。