代理框架與可重現性
Shepherd v0.3.0 將代理修改留作可審核提案,但論文展示的自動分叉監督仍未完整交付
Shepherd 把模型呼叫、工具操作與檔案變更記成持久執行軌跡,讓使用者在修改進入工作區前檢查或捨棄。最新文件同時明確指出,論文與專案首頁展示的 meta-agent 委派、執行中分叉及自動重試介面,尚不是 v0.3.0 可直接使用的功能。

近期在代理開發社群受到關注的 Shepherd,試圖把一次代理執行從短暫對話改造成可治理的程式物件。v0.3.0 的實際交付核心是 retained execution:任務以帶型別的 Python `@task` 宣告,對儲存庫的唯讀或讀寫權限寫進函式簽章;執行產生的檔案變更先保留在工作區旁,不直接覆寫原始檔案。使用者可讀取 trace、changeset 與產物,再以 `select`、`apply`、`release` 或 `discard` 完成一次性處置。
其 effect 模型會記錄模型請求、外部工具及檔案系統邊界事件,因此審計不是依賴代理自行撰寫的文字日誌。Linux 使用 Landlock、macOS 使用 Seatbelt 執行作業系統層級限制;套件要求 Python 3.11 以上,Windows 目前只能建議透過 WSL。這種「先隔離、後結算」模式對編碼代理尤其實用:即使模型產生可疑修改,工作目錄也不必先承受副作用。
不過,專案論文展示的是更完整的可逆執行模型:meta-agent 可觀察、攔截、回退並分叉另一個代理,研究中報告分叉速度較 `docker commit` 快約五倍、重播可沿用超過 95% 的提示快取,並在 CooperBench 將雙代理編碼通過率由 28.8% 提至 54.7%。v0.3.0 路線圖卻明列 task-as-value 委派、持久子代理、型別化結果投影與自動監督重試仍屬未交付項目。評估者因此應依版本化文件與可執行範例採購或整合,而不能把論文原型數字視為目前 PyPI 套件的完整能力。