返回首頁

AI 安全與評測

K‑Bench 擴大機器遺忘的觀測面:最終答案不洩密,不代表代理真的忘記

K‑Bench 把評測從模型的最終回答擴至推理、工具呼叫、檢索結果等六條代理通道。實驗顯示,既有基準判定無洩漏時,部署中的代理仍可能在 22% 至 86% 查詢中暴露目標資料。

Jack Delano · Public domain · Image source
zh-Hant

機器遺忘通常以 TOFU、MUSE 等基準檢查模型的最終答案:若目標知識不再出現在回答裡,就視為已被移除。9 月 14 日進入 arXiv 最新清單的 K‑Bench 指出,這種單通道證明無法直接套用到具備 RAG、工具與推理暫存區的代理。

K‑Bench 把合成個資分別植入模型權重、系統上下文、文字檢索庫或結構化檢索庫,再同時檢查 chain-of-thought、工具參數、工具結果、檢索內容、最終答案與摘要。只要任一通道含有秘密,就計為洩漏;K‑Score 還會比較保留集表現與代理是否崩潰,避免把全面拒答誤認成選擇性遺忘。

論文的一個 Llama‑3.1‑8B 案例中,StaR 過濾器把錯誤生日寫進最終回答,答案型評測因而判定成功;真正日期卻仍逐字存在工具結果,六通道聚合洩漏率為 0.857,幾乎沒有低於未介入基準的 0.855。整體而言,當資料位於提示或檢索庫時,TOFU、MUSE 顯示零洩漏,但代理仍在 22% 至 86% 查詢中外洩;資料位於權重時,受測的二十種已發表方法沒有一種可被證明真正移除知識。

團隊公開了 CLI、基準轉錄、LoRA 目標 adapter,以及兩個約 8.4GB 的 FAISS 索引,涵蓋 Llama‑3.1‑8B、Qwen3.5‑9B 與 Mistral‑7B。不過部分 retain-set 尚未完成,Qwen 的思考模式也會耗盡步數並顯著改變洩漏率;Hugging Face 資料檢視器目前更因 schema 不一致而無法載入。工程團隊應把「刪除」驗收延伸到日誌、工具輸入輸出、快取、向量庫與摘要,而不是只測使用者看見的文字。

來源

  1. K-Bench: A Benchmark for LLM Unlearning in Agentic Deployments
  2. K-Bench reference assets