代理評測
代理壓縮上下文後成功率未變,GPT-5.5 的狀態重查次數仍增至約三倍
新評測把工具呼叫拆成狀態擷取與任務執行,發現上下文壓縮可在成功率下降前大幅增加代理的重查成本。GPT-5.5 在五倍壓縮下完成率由 80% 變為 85%,但平均擷取呼叫由 21.0 次升至 63.9 次。

長時代理通常透過滑動視窗、摘要或檢索壓縮舊軌跡,而評測往往只檢查任務是否完成。8 月 17 日提交的新研究指出,這會漏掉一種先於失敗出現的成本:代理忘記執行所需狀態後,必須耗用更多工具呼叫重新取得資料,最終答案卻可能仍然正確。
研究建立一個確定性規劃環境,把每次工具呼叫標成 retrieval 或 execution,並固定每輪最多 24 個互動回合。實驗比較完整上下文、只保留近期內容的 sliding operator,以及在相同 token 預算下保存事實的摘要;另以 oracle 把被刪狀態重新注入,測試增加的查詢是否確由資訊遺失造成。三款受測模型為 DeepSeek V4 Flash、Qwen3.7 Plus 與 GPT-5.5,每項主要條件使用相同種子的配對測試。
在六個模型與任務難度組合中,retrieval 呼叫全部增加,其中五項經 Holm–Bonferroni 校正後仍顯著;execution 次數則大致不變。最明顯的 GPT-5.5 高擷取需求設定中,五倍壓縮令平均 retrieval 由 21.0 增至 63.9 次,但完成率的 80% 至 85% 變化沒有統計顯著性。DeepSeek 也要到十倍壓縮時,完成率才出現顯著下降。恢復被刪狀態可消除約一半額外查詢,而保存事實的摘要避開了大部分成本。
這意味代理平台不應只用 pass rate 選擇壓縮器,還要記錄重新查詢、工具延遲及付費 API 次數;否則「維持準確度」可能只是代理用更多互動補回遺失資訊。不過相同 sliding operator 在第二個環境 ALFWorld 並未造成擷取暴增,顯示結果取決於狀態能否重新取得、工具介面與回合上限。論文的互動成本也不是直接量得的金錢或牆鐘時間,部署團隊仍須在真實工作流驗證。