返回首頁

代理開發工具

Agent Lightning 1.0.1 把代理調優流程封裝成 Skill,要求逐次量測成本、延遲與正確率

Microsoft 新增可供 Claude Code、Codex 與 GitHub Copilot 使用的 Agent Lightning Skill,讓程式代理在固定 benchmark 上修改另一個可編輯代理。它是一套受預算約束的實驗規則,不會自動替目標代理進行強化學習。

Coolcaesar · CC BY-SA 4.0 · Image source
zh-Hant

Agent Lightning 1.0.1 首次正式發布同名 Skill,把「改善另一個 AI 代理」整理成可由程式代理執行的搜尋流程。使用者提供可編輯的目標代理與 benchmark 後,Skill 要求優化器反覆量測、修改及重新評分,並同時追蹤正確率、每次執行成本、延遲、完成率與變異,而非看到單次分數上升便停止。它可透過 `gh skill install` 安裝至 Claude Code、Codex 或 GitHub Copilot。

Skill 列出的搜尋空間包括輸入 grounding、輸出 schema、提示詞、工具、模型、推理強度、失敗隔離、條件式重試、路由、檢索及多候選選擇。開發期間的實驗預算與部署後的單次成本被分開處理:優化器必須讀取剩餘預算,利用固定測試案例、validation split 或重複執行降低隨機性,再保留一個完整量測過的 checkpoint。規則亦禁止改動 scorer、把 held-out label 洩漏至部署路徑,或依賴正式環境不存在的 metadata。

這項發布與 Agent Lightning 的強化學習框架相關,但兩者不能混為一談。框架以 API gateway 攔截實際 harness 的模型呼叫,處理 retokenization、動態樣本數及 rollout-level advantage;論文報告以約 6,000 筆訓練資料把 Qwen3.5-9B 在 SWE-bench Verified 從 41.8% 提升至 56.4%。新 Skill 本身則主要是操作規範及搜尋指引,沒有承諾會重現該 RL 成績,也沒有內建通用自動調參演算法。工程團隊下一步應檢查它在未見任務、不同模型與不同 scorer 上是否仍能找到穩定改進,以及長時間搜尋會否過度擬合 benchmark 或耗盡 API 預算。

來源

  1. Agent Lightning v1.0.1 release
  2. Agent Lightning v1.0: Towards Harnessed Agentic RL