代理框架與記憶
TARL 將代理記憶更新拆成五種交易,次狀態準確率升至 66.21%
TARL 不再以「寫入或保留」二分法管理代理記憶,而是明確區分新增、忽略、修訂、拒絕衝突及延後驗證。作者實驗顯示記憶污染率降至 25.24%,但模型與資料目前僅隨論文補充材料提供。

長期代理若把錯誤資訊寫進記憶,污染會在後續檢索與決策中反覆放大。新提出的 Transaction-Aware Reliable Ledgers(TARL)因此把常見的 Write/Hold 判定,改為 `append`、`noop`、`revise`、`reject_conflict` 與 `defer_verify` 五種可執行交易。兩項資訊都可能被標成「寫入」,實際上新增事實與取代過期事實需要不同狀態轉移;「不寫入」也可能代表內容重複、來源不可信,或仍待查證。
TARL 先定位候選敘述涉及的既有記憶槽,結合時間範圍、來源、信心及衝突訊號比較新舊證據,再把資料分流到 accepted、pending 與 rejected/history 三本帳冊。被新事實取代的內容不會直接消失,而會連同來源保留在歷史帳冊。訓練時,系統還會模擬每一種候選交易產生的次狀態,以正確帳冊結果監督選擇,而不只要求動作名稱分類正確。
配套的 TARL-Mem 從 HaluMem、LoCoMo 與 LongMemEval 衍生細粒度標籤。論文在五次獨立訓練的主比較中,自報五類 Macro F1 為 0.8286、完整次狀態準確率為 0.6621,均高於七種記憶基線;accepted 記憶污染率為 0.2524,仍表示約四分之一的預測承諾不應進入可信帳冊。另在 14 條、每條 200 次連續交易的閉環測試中,Stateful Rollout Score 達 0.7258。
工程上的價值是把「記憶更新」變成可稽核的狀態機,讓錯誤究竟發生於寫入、修訂或檢索更容易定位。不過結果均由作者建立的資料轉換與執行器支持,尚未證明能處理開放網路中的惡意來源、複合陳述或大量並行更新;完整獨立儲存庫也尚未公開。下一步應觀察交易語意能否接入現有向量資料庫,以及 pending 記憶的查證、逾期與併發衝突政策。