返回首頁

AI 程式開發

CAPA 測試程式助理的跨工作階段記憶:同一使用者歷史讓首次成功率平均提高 15.6 點

CAPA 將使用者反覆省略的實作偏好植入 600 場可執行程式任務,檢驗助理能否從過往對話推斷新需求。十二款模型加入同使用者歷史後,最終成功率僅平均增加 6.8 點,但首次成功率提高 15.6 點,顯示記憶主要減少來回確認,而非消除失敗。

Jim.henderson · CC0 · Image source
zh-Hant

新提出的 CAPA(Cross-Session Adaptation to Personalized Ambiguity)把程式助理的長期記憶問題,從「記得使用者說過什麼」改寫成可執行測試:當同一人反覆省略相同資訊,模型能否由已解決的舊工作階段推斷其真正意圖。研究者以 HumanEval 任務為基礎,設計六種個人化歧義機制,建立 600 場對話,涵蓋 60 組使用者—歧義配置,其中 300 場保留作評估。

十二款模型分別在無歷史及提供五場同使用者歷史的條件下執行程式。加入歷史後,平均可執行成功率提高 6.8 個百分點,首次回覆成功率則提高 15.6 點,完成所需輪數減少 0.81。最佳模型 Claude Opus 4.8 的首次成功率由 24.3% 升至 60.3%,但仍有近四成任務需要追問或首次失敗;ChatGPT-5.6-Sol 的最終成功率甚至微降 0.3 點,說明更多上下文並非穩定增益。

研究也用其他使用者的歷史作控制。錯配歷史仍能提供通用程式與對話範例,但正確配對後,三款受測模型的首次成功率再增加 2 至 12 點。通用記憶系統 Mem0、A-mem 並未一致勝過直接放入原始歷史;研究者提出的無參數 history gate,先判斷舊對話是否包含一致的歧義—解法證據,再決定直接作答或要求澄清,最多再提高 13.33 點首次成功率。

工程上的重點不是把全部對話永久塞進上下文,而是保存「需求歧義如何被確認」的結構化證據,並在使用前核對身分、相關性與一致性。CAPA 仍由 HumanEval 衍生的合成任務構成,未涵蓋大型儲存庫、需求變更與多人共用帳號;下一步應觀察資料及程式是否公開,以及結果能否在真實 IDE 遙測與隱私限制下重現。

來源

  1. Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants
  2. HumanEval: Hand-Written Evaluation Set