AI 代理/評測
SkillProx 驗證再收斂代理技能,Qwen3.6-27B 表格任務準確率升至 54.5%
SkillProx 不直接保留模型提出的技能修改,而是重新執行任務、回滾退步版本,再刪除效用為負的知識單元。三款 Qwen 模型在表格任務均獲得增益,但作者目前只公開兩次提交的空殼儲存庫。

代理技能通常是載入上下文的 `SKILL.md`、範例與參考資料;它們可以免訓練擴充行為,卻也會在反覆修補後累積衝突規則。SkillProx 把這個問題類比為前向—近端最佳化,但實際操作仍是離散文字編輯,而非可微分的梯度下降。
前向階段先從失敗與成功軌跡產生診斷,修改技能後在同一批任務重新執行。候選版本的 hard accuracy 或 cell accuracy 若退步便遭回滾,測得的失敗方向則寫入下一輪診斷。後向階段把技能拆成章節及參考檔,逐一移除以估計 leave-one-out 效用;效用偏低的單元可被合併、降級或刪除,但每次變更仍須通過固定驗證集。
作者在 SpreadsheetBench Verified 訓練技能,再測 WikiTableQuestions 與 HiTab。Qwen3.6-27B 的表格任務分數由人工技能的 36.7% 升至 54.5%,無技能基線為 45.3%;在 HiTab 則取得 80.0%。跨三款模型與三項測試彙總後,論文稱其平均比最強文字梯度基線高 3.0 個百分點。消融實驗中,移除閉環診斷或收斂階段,分數分別降至 53.0% 與 52.0%。
這套設計的工程價值在於把技能更新視為需要測試與版本控制的程式資產,而不是可信的模型筆記。不過,同批重跑可能讓修改過度適應局部案例;固定驗證集反覆參與決策也會形成選擇偏差,論文並未證明部署後單調改善。更直接的限制是官方 GitHub 目前僅有 README,明列程式「即將提供」,沒有授權、實作或可重現腳本。下一步應觀察完整程式是否交付,以及在非表格代理、長期線上更新與污染軌跡下是否仍能安全回滾。