返回首頁

程式代理評測

ProgramDistill 以可重播網頁行為評測代理重建軟體,完整工作流成功率僅約一半

Microsoft Research 團隊讓 coding agent 觀察可操作的參考網站,再於看不到原始碼的情況下重建其功能。ProgramDistill 從 26 個應用產生 4,063 項任務,結果顯示單一功能修復容易得多,依賴多段狀態的完整工作流仍是主要瓶頸。

miss_rogue on flickr, https://www.flickr.com/photos/missrogue/132777293/ · CC BY-SA 2.0 · Image source
zh-Hant

9 月 16 日提交的 ProgramDistill,把 coding agent 評測從「依 issue 修補已描述的錯誤」推向較接近逆向工程的情境:代理只能透過瀏覽器操作完整參考網站,不能讀取其原始碼或標準 patch;它必須推斷狀態轉移與功能依賴,再修改另一份缺少功能的應用。驗證器重播相同操作並檢查結果,因此不要求實作與原版逐行一致,而是比較可觀察行為。

團隊的 `mine-craft-patch` 管線先由代理探索應用,保存包含瀏覽器動作、成功訊號及先決條件的 trace;再移除對應實作,確認先決功能仍可運作、目標行為確實失敗,並用 gold patch 驗證可恢復性。管線在 26 個網站找到 1,975 個可重播行為,無人工介入地組成 2,862 個單一功能任務及 1,201 個累積任務。後者沿著依賴鏈同時移除多項功能,可控制一到八層的重建深度。

九款代理參加 300 題局部重建測試。GPT‑6 Astra 在深度一全部成功,但深度八降至 64%;其餘代理在深度八保留的成功率不到自身深度一的一半。從最小 scaffold 重建完整應用時,Astra 在 413 條累積工作流取得 49.15%,Claude Opus 5 為 28.81%,GPT‑5.6 Sol 為 21.07%。977 個失敗行為中,59.2% 根本未曾被代理在參考網站觀察到,指出探索覆蓋率比純粹產碼能力更早成為瓶頸。

這套方法讓工程團隊可以分開量測「有沒有找到功能」與「能否忠實重建」,也提供可作為強化學習獎勵的確定性重播軌跡。不過,結果均由論文團隊的 harness、預算與模型設定產生;目前驗證集中於可由動作及成功訊號描述的網站行為,尚未評估截圖層級的視覺還原。官方完整 dashboard 亦仍標示為即將推出,第三方重現程度有待檢驗。

來源

  1. ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks
  2. ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks