代理評測
ContinualSkillBench 發現代理「累積技能」的進步多半可由上下文適應解釋
ContinualSkillBench 以五個領域、每域 100 個逐步相依任務,檢驗代理能否把經驗整理成可重用技能。顯式技能庫平均未明顯勝過單純保留上下文,顯示技能數量增加不能直接證明代理具備持續學習。

許多代理框架允許模型在完成任務後撰寫提示、腳本或操作程序,加入外部技能庫供後續工作調用。然而現有評測常只比較第一次與最後一次任務的成功率,難以區分真正的技能抽象、單純記住先前答案,以及從錯誤回饋臨時適應等不同機制。
ContinualSkillBench 為此建立動態評測:五個代表性領域各含 100 個互相關聯的子任務,依難度排序,並刻意安排可跨任務重用的程序。代理必須依序執行,因此研究者可比較無歷史、保留互動上下文,以及明確建立與維護技能庫等設定,觀察新技能是否在較後面的不同任務上產生可轉移收益。
論文發現,循序執行通常能提高整體表現,但幅度隨模型與領域大幅變動。更關鍵的是,只保留既有上下文的 in-context learning,平均可達到與顯式技能維護相近的成績;這表示不少所謂「自我進化」可能只是模型看到先前嘗試與評分後的短期適應。顯式技能仍會在需要固定程序或精確輸出格式的任務帶來選擇性優勢,但能力較弱的模型反而容易累積更多零碎、只適用單一任務的技能。
這項結果要求技能型代理把評測單位從「庫中新增了多少檔案」改成「移除原始軌跡後,技能能否在新任務獨立提升成功率」。目前論文未在摘要頁提供程式碼連結,完整模型、上下文長度與技能清理策略也可能左右結論。後續值得追蹤的是公開評測環境、跨模型重現,以及技能合併、淘汰和版本回歸測試能否改善長期可轉移性。