AI 代理與研究自動化
DisCo 將千個機器學習儲存庫蒸餾成 5,353 項可驗證代理技能
新研究把原始碼、文件與測試轉成按需載入的操作知識,讓固定模型及代理框架在四項研究基準全面提升。技能建置成本另行計算,成果仍是作者評測,不能直接視為低成本取代模型訓練。

研究代理通常已有負責規劃、記憶與工具呼叫的 harness,卻仍須在每次任務中重新摸索框架 API、資料格式與除錯方法。[Repo-To-Skill 論文](https://arxiv.org/abs/2609.02749)將這類實作訣竅定義為「操作知識」,並提出 DisCo:先從儲存庫或論文蒸餾技能,再於研究任務中按需檢索,而不是把整個專案塞進上下文。
每個儲存庫會被拆成技能圖。`SKILL.md`描述何時使用,`references/`保存證據,`scripts/`提供可執行流程;候選技能須經原生範例、測試、CLI 檢查或小型 smoke test 驗證,失敗後可局部修復重跑。公開的 [AREX-Skill](https://github.com/VectorSpaceLab/AREX-Skill) 快照含 1,000 個儲存庫圖、5,353 項技能,分布於 20 個領域及 178 個能力家族。兩層路由器先縮小候選範圍,代理才載入相關技能,藉此控制上下文成本;格式可接入 Codex、Claude Code、Pi 等程式代理。
研究以相同 GPT-5.5、Codex harness、推理強度與下游執行預算比較有無技能:MLE-bench 相對提高 134.3%,PaperBench 提高 34.4%,FrontierCS 與 PassNet 分別提高 9.2%及 14.0%。PaperBench 排除了目標論文及其實作,MLE-bench 也排除競賽專屬內容,以降低直接洩漏答案的風險。
但比較沒有把技能建置費用算進執行預算;批次蒸餾平均每個儲存庫約需 40 美元,並使用 GPT-5.5 與 GPT-5.6 Sol。這使成果更適合可重複攤銷的團隊知識庫,而非一次性任務。工程團隊接下來應觀察上游版本漂移、惡意儲存庫造成的技能供應鏈風險,以及第三方能否在不同模型與代理框架重現增益。