模型安全評估
Anthropic 更新 RSP 3.4:重定義自動化研發門檻並調整風險報告機制
Anthropic 的 Responsible Scaling Policy 3.4 修改自動化研發能力門檻、內部未刪節報告分享範圍與外部審查方式。更新看似偏治理,實際會影響模型能力評估、部署閘門與安全報告的工程流程。

Anthropic 在 7 月 8 日生效的 Responsible Scaling Policy 3.4,重新描述自動化研發能力的觸發門檻,使評估更貼近其關注的威脅模型。新版也調整未刪節風險報告的內部分發規則:不再要求所有具一般權限的員工都可讀,而是至少向 200 名員工提供;公開報告必須標示刪節位置,外部審查則可由多位審查者分別覆核不同區段,只要每個未刪節部分至少被一人檢視。
這些條款對技術團隊的影響,在於「模型能否自動化 AI 研發」必須被轉換成可重複的測試,而不是模糊印象。評估需要涵蓋長時間自主執行、提出並驗證實驗、修改訓練程式、使用叢集與從失敗中恢復;若只測單輪程式題,可能低估整體能力。允許風險報告採 coverage date,能避免新變化迫使分析倉促重做,但也可能使公開文件與實際部署模型之間存在時間差。
外界應關注新版門檻是否對應明確的量化指標,以及觸發後會採取哪些可驗證的保護措施。Future of Life Institute 的同期安全指數對多家公司的治理框架仍提出透明度與可執行性疑慮,提醒讀者不要把政策文字本身視為安全證明。RSP 3.4 是公司自願框架,不是獨立標準;其評估資料、紅隊覆蓋率與例外決策若未充分公開,外部研究者仍難以驗證部署閘門是否一致執行。