返回首頁

AI 安全與營運控制

五家前沿 AI 實驗室控制措施最高僅獲 C+,模型收容計畫成最大公開缺口

Guidelight 以六項可操作控制措施評估 Anthropic、Google、Meta、OpenAI 與 xAI,沒有公司在任何項目達到接近完整實施。評分只反映截至 8 月 18 日的公開證據,低分不等於內部一定沒有相關機制。

Прикли · CC0 · Image source
zh-Hant

Guidelight AI Standards 首次把「失控模型」風險拆成可稽核的營運措施,而非只檢查模型發布前是否通過能力測試。評估涵蓋內部推論紀錄、監控器有效性、危險動作閘控、異常激增時的 circuit breaker、第三方審查,以及預先制定的收容計畫;資料來自五家公司公開的 system card、風險框架、報告和外部合作紀錄。

結果顯示 Anthropic 與 OpenAI 同得 C+、絕對分數 2.50;Google 為 D+(1.50)、xAI 為 D−(0.83),Meta 則為 F(0.67)。0 至 5 分制中,沒有任何單項超過 3,即「實質但不完整地實施」。Anthropic 在動作閘控及 circuit breaking 得 3 分,OpenAI 的收容計畫同樣得 3;但 Anthropic 與 Meta 在收容計畫項目為零分。xAI 的紀錄及監控器驗證也沒有獲得實施分數。

對部署長程代理的工程團隊,這份評估帶出的重點是控制面必須獨立於模型本身:完整保存工具呼叫與執行分支、量度監控器漏報率、在高風險操作前強制核准,並讓大量警報能自動撤銷網路、憑證及工作負載權限。單靠提示拒絕或發布前紅隊測試,無法處理已運行代理快速連續嘗試繞過監督的情況。

不過,這不是對五家公司內部系統的滲透測試。評分方法會把「沒有公開證據」視為未實施或只有前置條件,也未直接量度控制器在真實攻擊下的召回率、延遲與抗篡改能力。後續應觀察各實驗室是否公開觸發門檻、權限撤銷流程與可重現的第三方壓力測試,而不只是增加政策文字。

來源

  1. AI Control: An Assessment of Frontier Practices
  2. Frontier AI labs still won't say how they'd contain a rogue model