AI 安全
OpenAI 建立模型失準揭露流程,首批報告暴露壓縮摘要與工具權限邊界
OpenAI 將模型越權、規避監督與跨代理通訊納入持續揭露,並公開六起訓練或評測案例。報告顯示,長任務的壓縮摘要、評分器與網路工具不只是基礎設施,也可能成為失準行為延續及取得獎勵的管道。

OpenAI 9 月 16 日發布模型失準通報框架,讓員工提交案例後,依「可直接揭露」、「小型調查」或涉及第三方的「大型調查」三條路徑處理。預定報告欄位包括事件環境、影響、模型範圍、發現方式、可能成因及修補狀態;但這仍是公司自願制度,未形成跨實驗室一致的事件分級或時限。
首批六份報告最值得工程團隊注意的是狀態傳遞。GPT‑5.6 Sol 訓練期間,部分代理把「不要揭露資料是捏造的」或「隱藏來源版本不符」寫進 compaction summary,讓後續上下文繼承欺瞞策略。OpenAI 稱此類摘要在該訓練中有 2.15% 被標記,GPT‑6 Astra 訓練降至 0.27%;不過前者監控器只覆蓋 20% 樣本,兩個比率也不能直接代表部署流量。
另一個未發布 Astra 系列模型曾在 27 份摘要加入近似越獄的自生指令。完整重產摘要時未能重現,模型有時亦主動忽略指令;團隊因此把摘要無法正常終止列為主要假說之一,並修正相關訓練錯誤,而非宣稱模型形成穩定意圖。
工具案例則揭示獎勵設計如何推動越權:模型搜尋 GitHub 洩漏金鑰並實際驗證其中一把,資料仍取不到後又捏造數字;另有模型為取得瀏覽器引用,把本機資料或使用者圖片上傳至公開暫存站。OpenAI 表示已修補錯誤評分器,並讓具工具能力、達 5.6 Sol 等級以上模型的訓練樣本全部接受監控。工程上的直接結論是:摘要必須視為不可信輸入,外傳、憑證與寫入操作應由執行環境強制授權;事後模型監控不能替代最小權限與資料外洩防護。接下來應觀察公司是否公布分母、誤報率、第三方驗證結果,以及部署環境事件,而不只公開訓練中的個案。