返回首頁

代理記憶與評測

代理記憶拆成子任務後轉移較可靠,文字技能平均領先程式碼 2.9 點

一項跨九款模型、三套長流程評測的研究顯示,從完整任務歸納的技能通常令代理退步,從子任務歸納則平均帶來增益。自然語言流程筆記也比可執行 Python 技能更穩定,但效果仍高度依賴模型與評測。

Copyleft · CC0 · Image source
zh-Hant

代理從成功軌跡累積「技能」並不保證愈用愈好。[新研究](https://arxiv.org/abs/2608.20274)把技能記憶拆成兩個設計軸:在完整任務結束後歸納,或先把任務分解、再由各子任務歸納;保存格式則分為自然語言操作筆記與參數化 Python 函式。每種設定均與相同代理的無記憶版本比較,以隔離技能本身的正負轉移。

實驗涵蓋 [AppWorld](https://github.com/StonyBrookNLP/appworld) 的 417 項多應用程式任務、OfficeBench 的 300 項文件流程,以及 KramaBench 的 92 項科學資料分析任務;模型包括 Qwen3、GPT-OSS-120B、Nemotron-Super-120B、Gemma 3 與 Gemini 3.1 Pro。跨模型平均後,完整任務技能令成功率比各自無記憶基線低 1.2 點(文字)或 4.1 點(程式碼);子任務技能則分別提高 1.9 與 0.5 點。固定歸納層級時,文字技能平均比程式碼高 2.9 點(子任務)及 1.4 點(完整任務)。不過個別結果並不整齊,例如 GPT-OSS-120B 在 AppWorld 加入完整任務程式碼技能後,由 27.3% 跌至 1.0%。

團隊另以「具體性」與「抽象性」的乘積建立 skill utility,嘗試在實際執行前篩掉過度專用或過度籠統的記憶;高分技能在 KramaBench 的受控比較中僅小幅領先低分組,尚不足以當成可靠閘門。對代理工程師而言,結果支持把記憶單位設在可重組的操作步驟,並優先保存帶有環境限制的文字程序,而非直接回灌整段解法或脆弱程式。接下來仍需等待程式與技能庫公開,確認結果能否在不同檢索器、任務排序及線上持續更新下重現。

來源

  1. Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents
  2. AppWorld benchmark repository
  3. North East AI Agents Day 2026 programme