AI 研究
JitMem 按新任務整理代理記憶,兩項測試成功率增加逾16個百分點
研究保留成功任務的原始軌跡,等下一項任務到來才生成適用摘要。增益來自特定基準與模型配置,整理模型的額外成本仍須納入部署評估。

Salesforce AI Research研究團隊於9月23日提出JitMem,作者翌日在Hugging Face介紹其設計:保留代理過去任務的原始操作軌跡,等新任務到來,再產生當次需要的記憶摘要。對需要反覆處理相似流程的代理,這提供了重新安排記憶生成時機的方法。[作者介紹](https://huggingface.co/papers/2609.27334)
常見做法在任務結束時,把經驗整理成固定反思、技能或工作流程;當時尚不知道未來需求,刪掉的細節可能正是下一題需要的資訊。JitMem讓同一份原始經驗隨查詢產生不同摘要,並只把被判定成功的軌跡加入記憶庫。這裡的完整保留限於獲准存入的軌跡,並非無條件保存每次嘗試。[研究說明](https://arxiv.org/html/2609.27334v1)
實作以BM25比對任務描述,取回相關軌跡,交給記憶整理模型生成簡報,再供固定權重的執行模型使用。整理模型以Qwen3-8B初始化,透過GRPO訓練100步,依同一任務的完成結果取得獎勵。這把記憶決策與驗證結果拉近,減少等待未來任務才知道摘要是否有用的困難。[方法與設定](https://arxiv.org/html/2609.27334v1)
作者報告,在Qwen3-8B執行器下,ALFWorld成功率由SkillOS的61.2%升至77.4%,WebShop由16.5%升至32.8%,分別增加16.2及16.3個百分點。這是特定基準與模型配置的比較;另一項τ²-bench只測免訓練版本,不能視為同一套訓練模型的連續勝績。[結果表](https://arxiv.org/html/2609.27334v1)
成本也要分開看。論文的token與步數比較只統計執行器,尚不足以證明整個系統更便宜;部署評估仍須加上整理模型生成摘要、成功判斷與原始軌跡儲存。[成本口徑](https://arxiv.org/html/2609.27334v1)
對產品團隊而言,可先在相同任務串流比較固定摘要與按需摘要,保持執行器、檢索數量及工具設定一致;否則摘要模型能力或資料篩選差異也可能改變結果。驗收還應區分任務已成功、模型自認成功,以及評測器判定成功,避免把錯誤經驗持續寫回記憶庫。
本文認為下一步應優先重驗任務順序改變、記憶冷啟動及成功判斷出錯時的表現,並把端到端延遲與成功率一起比較。若新的任務與既有經驗差異很大,還應檢查整理模型是否引入不適用的操作建議,才能判斷按需整理是否適合真實代理服務。