AI 代理與評測
舊工具軌跡可劫持代理決策:ContextPollute-Bench 測得 Qwen3-1.7B 有 32.1% 正確答案被翻轉
新基準在保持目前請求、工具集合與正確動作不變的情況下,只插入已失效但看似合理的歷史紀錄。Oracle-OPD 將 Qwen3-1.7B 的平衡工具使用準確率提高至 87.0%,但驗證範圍仍限於合成的零售與航空情境。
多輪工具代理面對的上下文風險,不一定來自惡意提示注入;過去失敗的 API 呼叫、舊實體識別碼或已停用的參數格式,也可能在語法上保持合理,卻不再代表目前狀態。新研究提出 [ContextPollute-Bench](https://arxiv.org/abs/2608.06057),從 APIGen-MT 的航空與零售軌跡建立 Original、Polluted 與 Oracle State 三種同步視圖,固定系統規則、可用工具、最新要求及正確下一步,只改變歷史紀錄。
基準涵蓋 11 種干擾,包括虛假的任務完成紀錄、競爭實體、已下線工具,以及錯誤、缺漏、過時或單位轉換後的參數。Qwen3-1.7B 原本答對的決策中,有 32.1% 在加入污染軌跡後轉錯;格式漂移情境更有 65.8% 的輸出直接沿用被植入的錯誤格式。這表示模型並非不會選擇工具,而是無法穩定判斷哪一份狀態仍具權威性。
研究同時提出 Oracle-OPD:教師模型讀取乾淨的 Oracle State,學生則讀取污染歷史並自行生成 prefix;教師再於相同 prefix 上提供 token 分布,以反向 KL 蒸餾決策政策。部署時不需要 Oracle 或教師。Qwen3-1.7B 的 Balanced Tool-Use Accuracy 從裸模型的 47.2% 升至 87.0%,高於 Gold-SFT 的 66.3%與離策略蒸餾的 85.0%;換用 8B 教師後可達 91.9%。
工程上的訊息是,摘要或裁切上下文不能取代「狀態權威性」訓練;記憶系統應標示工具結果是否仍有效、實體版本及 schema 世代。不過資料源仍是 [APIGen-MT](https://apigen-mt.github.io/) 的模擬客服流程,評測也只檢查下一個動作。下一步應觀察完整任務、真實生產日誌與非客服 API 是否重現相同增益,以及建立 Oracle State 所需的額外資料成本。