代理評測
ContextWeave 以千項可執行辦公任務重測代理記憶,偏好分數由 41.50 升至 70.60
ContextWeave 不再只問代理能否找回舊資訊,而是檢查記憶能否改善後續文件與辦公工作。實驗顯示保留可採取行動的完整經驗優於短摘要,但錯誤回憶也更容易影響執行結果。

語言代理的記憶評測常被簡化成「能否從歷史對話找到答案」,卻沒有驗證取回內容是否真的改善下一項工作。8 月 5 日提交的 ContextWeave 改以縱向工作流測試這件事:研究團隊將 14 名參與者跨數月、經過隱私處理的工作紀錄,重建成 1,005 項可執行任務,其中 568 項構成核心評測。每項任務均附指令、容器化環境、操作軌跡及專屬評分規則,使代理必須延續既有專案,而非回答孤立問題。
評測分成 Workspace Score 與 Preference Score。前者檢查產出的工作區是否完成任務,後者衡量結果是否符合特定使用者過去顯示的偏好;另有相關性、連續性、可解性,以及面對誤導性回憶時的穩健度診斷。在固定基礎模型、比較六種記憶元件時,最佳組態把 Workspace Score 從 68.08 提高至 78.20,Preference Score 則由 41.50 升至 70.60。反過來固定記憶元件後,五款受測模型都從回憶機制獲益,但改善幅度並不一致。
更值得工程團隊注意的是,包含操作細節、決策原因與先前成果的「經驗型記憶」,比壓縮摘要更能減少重複探索並延續工作;代價是它也較容易把錯誤或不相干內容帶入執行。這意味生產級代理不能只最佳化向量檢索命中率,還需要在使用記憶前驗證其時效、來源與任務相容性。現階段結果仍來自 14 人資料及作者設計的評分規則,論文頁面也未連結公開程式庫;後續應觀察完整資料、容器與裁判設定能否釋出,以及其他團隊能否重現分數。