返回首頁

AI 安全

OpenAI 暫停部分 Astra 開發:初測無法排除模型已達「Critical」網攻能力

OpenAI 表示 Astra 的代理編碼與網路攻防能力進展,使其無法排除模型已跨入最高風險門檻。公司已隔離測試環境、限制工具與網路存取,並讓監控器檢查代理的推理軌跡與高風險行動。

European Commission - Photographer: Aurore Martignoni · CC BY 4.0 · Image source
zh-Hant

OpenAI 8 月 7 日披露,尚未發布的 Astra 在近期內部評測中展現顯著提升的代理編碼與網路攻防能力;結合專家判斷後,公司目前「無法排除」它已達《Preparedness Framework》的 Critical 門檻。這不是正式能力認證,也沒有公開各項評測分數,但已足以觸發更嚴格的開發控制。OpenAI 特別澄清,Astra 並未參與先前入侵 Hugging Face 的事件。

依框架定義,Critical 並非泛指模型很會寫漏洞利用程式,而是工具增強模型能在無人介入下,為多種已強化的真實關鍵系統找出並完成各嚴重度的零時差漏洞利用,或只憑高階目標便規劃、執行新型端到端網攻。相較之下,GPT‑5.6 Sol 被評為 High;該級別著重自動化既有攻擊流程或發現具實務價值的漏洞,兩者的威脅模型差異很大。

OpenAI 因此暫停所有尚未符合新控制要求的 Astra 內部活動,並加入隔離測試環境、受限網路及工具權限、權重加密、沙箱與額外偵測。所有 Astra 代理應用,包括訓練及評測,亦套用高風險與失準行為監控;官方稱監控器會檢查模型的 Chain of Thought,必要時中斷工作。這項設計值得工程團隊注意,因為它把模型推理監測提升為部署安全控制,而不只是輸入、輸出過濾。

目前最大的限制是證據仍由廠商掌握:外界不知道測試環境、成功率、人工協助程度,也不能由「無法排除」推論 Astra 已穩定完成零時差攻擊。接下來應觀察第三方與政府測試是否公布方法、誤報率及可重現結果,以及推理監控在加密、混淆或非文字代理狀態下是否仍有效。

來源

  1. Responding to the next frontier of critical cyber capabilities
  2. Preparedness Framework v2