AI 安全與私隱
八款閉源模型的正常回覆可暗藏上下文祕密,四位數精確還原率達 82%
新研究顯示,即使模型拒絕直接洩密,回覆長度、格式與詞彙等統計特徵仍可能攜帶上下文資訊。自適應黑箱攻擊可近乎完整還原兩位數祕密,四位數精確命中率則達 82%。

AI 代理通常把行事曆、醫療紀錄、憑證或長期記憶放入模型上下文;現有防護多半只檢查輸出有否直接複述敏感內容。[最新預印本](https://arxiv.org/abs/2608.19857)指出,即使八款受測閉源模型面對直接索取祕密的請求全部正確拒絕,其正常回覆仍會因祕密不同而出現可測量的 token、長度、標點、格式及選詞差異。
研究者把問題形式化為 predicate inference:攻擊者僅需黑箱查詢目標 API,先估計不同祕密對輸出分布的影響,再逐位更新後驗機率。自適應提示在 Claude Opus 4.6 上將四位數還原率由靜態方法的 44% 提高至 82%;兩位數則接近全數還原。不過模型差異明顯,至少兩款在祕密長度達四位數後接近隨機猜測。另一組實驗以小型 Qwen 解碼器分析日常文字,對健康或財務記憶等隱藏屬性的推斷優勢達 0.319;主動攻擊更可讓代理以驚嘆號數量編碼完整美國社會安全號碼。
這意味著「模型沒有說出祕密」並不等同零資訊洩漏;輸出過濾器及拒答測試也無法覆蓋統計型隱蔽通道。工程團隊應縮短敏感上下文的存活時間、隔離工具憑證與生成模型,並把跨多次查詢的屬性推斷納入紅隊測試。[柏克萊技術報告](https://www2.eecs.berkeley.edu/Pubs/TechRpts/2026/EECS-2026-126.html)亦將此現象描述為可能隨模型能力增強的內在風險。不過結果仍屬受控實驗,依賴已知模型及一次性估計成本,不能直接推論任意生產資料都能以相同比率被還原。