代理架構與評測
SKILL.state 丟棄代理執行歷史,以結構化狀態將百步任務 token 用量縮至十六分之一
Google 與普渡大學研究者讓代理每一步只讀取固定技能、目前狀態與最新觀察,驗證狀態更新後立即捨棄推理歷史。在百步倉儲測試中,它以 65,408 token 取得 0.94 準確率,但成效依賴預先設計的狀態結構能保留未來所需資訊。

SKILL.state 嘗試把長時間代理從「不斷增長的對話」改造成較接近傳統狀態機的執行期。每一步輸入只包含不可變的技能規格、結構化目前狀態與最新環境觀察;模型提出狀態 patch 及下一個動作後,確定性 runtime 先依 schema 驗證 patch,成功才提交,先前的自然語言推理與工具歷史則立即丟棄。格式錯誤會觸發 rollback 與重試,因此模型不能直接破壞持久狀態。
在使用 Gemini-3-Flash 的合成倉儲任務中,SKILL.state 從 10 步擴展至 200 步時,平均提示維持約 1,736 至 1,905 token。百步測試取得 0.94 準確率、累計使用 65,408 token;保留歷史的 LangGraph 式基線為 0.91 與 1,062,387 token,相差 16.2 倍。到 200 步時,前者仍為 0.94、約 12.2 萬 token,摘要記憶基線則降至 0.84 並消耗約 618 萬 token。研究者也做了相近 1,800-token 預算的控制實驗:滑動視窗、封頂摘要與 LLMLingua 分別只得到 0.18、0.52 和 0.22,表示優勢不只是把提示截短,而是明確保存物品位置、依賴關係等操作狀態。
公開互動基準亦呈現同方向結果:InterCode CTF 的 pass@1 為 54.2%,高於最佳基線 46.4%;在 τ-Bench 零售與航空任務分別為 58.3% 和 32.4%。不過,狀態 schema 由人預先定義,模型若未預見某項資訊稍後仍有用途,歷史一旦刪除便可能無法復原;外部世界出現沒有被觀察事件描述的變化時,各種方法也可能同樣失敗。論文公開了提示,但未附獨立維護的完整程式庫。下一步應測試更開放的軟體工程與瀏覽器工作、狀態遷移的語意驗證,以及 schema 設計和重試所增加的延遲。