程式代理/推論最佳化
SWE-Pruner Pro 直接讀取程式模型隱藏狀態,最多削減 39% 代理 token
SWE-Pruner Pro 不再呼叫獨立分類器,而以輕量預測頭從程式代理的內部表徵判斷每行工具輸出是否保留。研究在兩款開放 MoE 模型與四項多輪基準上取得 token 節省,但需要修改推論伺服器,且部分品質增益尚待重現。

上海交通大學與抖音團隊提出 SWE-Pruner Pro,針對程式代理反覆讀取檔案、搜尋程式碼及執行命令後累積的大量上下文。既有 SWE-Pruner 需要額外分類模型,並要求代理在每輪產生目標提示;新方法則利用主模型正常 prefill 時已產生的最後一層隱藏狀態,在每行末端接上一個小型預測頭,直接輸出 keep 或 prune。模型另加入依工具輸出行數編碼的 length-aware embedding,並以平衡 focal loss 處理保留與刪除樣本不均。
研究以 MiMo-V2-Flash 和 Qwen3-Coder-Next 兩款開放 MoE 模型,在 SWE-QA、SWE-QA-Pro、Oolong 與 SWE-Bench Verified 等多輪任務測試。作者報告總 prompt 與 completion token 最多下降 39%;MiMo-V2-Flash 在 SWE-Bench Verified 的解題率反而增加 3.8 個百分點,Oolong 準確率增加 2.2 點。其解釋是刪除無關工具輸出不只節省成本,也能減少舊資訊干擾後續推理。
這不是能套在任意 API 前方的文字壓縮器。預測頭必須存取模型內部 activation,實作使用修改過的 SGLang,因此封閉模型服務或只提供標準 OpenAI 相容端點的部署無法直接採用。論文估算伺服器內預測頭使整條代理軌跡的牆鐘時間增加約 15%,是否能由較短上下文抵銷取決於工具輸出規模、KV cache 策略與多租戶批次。後續應觀察公開程式能否重現跨模型結果,以及訓練於特定代理軌跡的剪枝器在新儲存庫、工具格式與任務分布下是否會誤刪關鍵證據。