模型安全
OpenAI 正式確認 Astra 達 Critical:零日利用成果促成分級存取與執行期攔截
Astra 在 OpenAI 測試中完成瀏覽器沙箱逃逸、root 提權鏈並發現兩個零日漏洞。公司據此首次確認模型達到 Critical 網安門檻,進階能力將採分級開放。

OpenAI 9 月 1 日正式確認,待發布模型 Astra 已達《Preparedness Framework》的 Critical 網路安全能力門檻,成為該公司首個獲此判定的模型。依框架定義,這代表模型在配備適當工具與權限後,可能不需人類逐步指導,便能發現未知弱點、建立可用 exploit,乃至規劃針對加固目標的端到端攻擊。
這項結論是 8 月風險狀態的明確升級。OpenAI 8 月 7 日僅表示,初步評測使其「無法排除」Astra 已達 Critical,當時尚未構成正式能力認證,也未公開具體分數;公司因此暫停部分未符合新控制要求的開發活動,並收緊隔離、工具權限與監控。本次公告則首次確認門檻已達成,同時提出支撐判定的漏洞利用結果與部署控制細節。
在已知漏洞基準 ExploitBench 上,Astra 得到 100%;考量公開資料可能造成污染,團隊另以 20 個於 2026 年 6 至 8 月披露的高嚴重度 V8 漏洞建立內部測試集。OpenAI 稱,Astra 使用少於 GPT-5.6 Sol 的輸出 token,仍取得較高的任意程式碼執行率,並在一條利用鏈中發現及運用兩個尚待協調披露的零日漏洞。
專家測試亦產生兩類完整攻擊鏈:其一由惡意 HTML 觸發,逃離瀏覽器沙箱後在主機執行命令;其二利用作業系統漏洞,將普通使用者權限提升至 root。這些結果採用 Daybreak Blue 權限配置,不能直接視為 Astra 預設產品版本的能力。
部署措施也從帳號與提示層延伸至代理執行期。OpenAI 報告 Astra 在網安 jailbreak 測試集的拒絕率為 91.5%,高於 GPT-5.6 Sol 的 59%;系統會跨對話判定濫用風險,監測模型推理與動作,並在疑似越權時停止執行。ChatGPT 與 Codex 可要求使用者覆核,API 任務遭攔截時則直接終止。進階能力將先提供少量測試者,再透過 Daybreak Blue 擴大防禦用途。
目前證據仍主要來自 OpenAI。內部漏洞集、零日細節、完整 system card 與第三方驗證尚未公開;外界也仍無法確認評測的可重現性、執行期監控的誤判率,以及長時間代理任務遭意外中止的頻率。