返回首頁

AI 編程工具

Coderlet 公開可讀的編程代理控制層,但尚無沙箱與自動測試

Coderlet 將模型呼叫、工具驗證、執行結果與持久記憶拆成三個明確邊界,並以 MIT 授權提供可執行的 Python 實作。它適合研究代理控制流與失敗復原,不是性能更強的編程代理,而且目前會直接沿用使用者的作業系統權限。

NASA · Public domain · Image source
zh-Hant

8 月 10 日公開的 Coderlet 並未提出新模型,而是把編程代理最容易被忽略的部分——harness 控制層——縮成一個可閱讀、可執行的 Python 專案。它連接支援 Responses API、串流與 function calling 的模型端點,內建檔案讀寫、精確編輯、搜尋、shell 及網頁工具,並把一次請求明確排列成建立上下文、呼叫模型、驗證工具參數、執行或拒絕、回傳 observation、保存紀錄,最後才通知完成。

設計的核心是三個責任邊界。模型邊界只負責把上下文與工具描述轉成 API 請求,再解碼文字及結構化呼叫;執行邊界檢查工具名稱與參數,並按生成順序執行有效動作;狀態邊界則以 JSONL 保存 session,將舊上下文壓縮到 `PENDING_MEMORY.md`,再整合進長期 `MEMORY.md`。每個工具結果保留原始 call ID,因此開發者能區分「模型已提出」「工具已改動環境」「請求紀錄已保存」三種不同完成狀態。若動作成功但後續存檔失敗,復原流程可從最後確認的階段繼續,而不必盲目重播可能具有副作用的命令。

這份實作的價值主要是提供可檢查的參考骨架,而不是刷新 SWE-bench。作者明確表示沒有提出任務性能增益;儲存庫目前只有兩次提交、沒有自動測試,也只支援單一使用者、單一終端 session。更重要的是,工具會以目前帳號的完整權限讀寫檔案及執行 shell,沒有作業系統沙箱、命令核准閘門、檔案系統邊界或多租戶隔離。工程團隊若用它做原型,首先應補上權限政策、可追蹤的副作用狀態、機密遮罩與測試,而不是直接接入重要工作區。

來源

  1. From Prompt to Harness: Coderlet from Scratch
  2. Coderlet source repository