返回首頁

AI 研究

SoL-Pi 以四項機制降低代理成本,EdgeBench 分數保留約 94%

NVIDIA 等團隊透過自動實驗優化代理框架,在兩款模型上減少約 45% 至 49% 的 token 流量。公開擴充套件保留原始證據供取回,但完整配置仍有分數與任務完成率的取捨。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA、南洋理工大學與 MIT 團隊於 9 月 17 日公開 SoL-Pi 研究,透過自動實驗改良程式代理的執行框架。系統從 152 個方向、535 個可執行環境中篩出四項機制,著眼於工具往返與上下文重送成本;模型權重並未因此更新。研究先固定能力與效率門檻,再檢驗候選修改,保留的框架才進入獨立評測。[論文](https://arxiv.org/abs/2609.20519)

四項機制對應不同浪費來源:Action Fusion 把編輯及後續驗證命令合成一次工具呼叫;Online Context Compact 在子任務結束時,估算後續節省能否抵銷快取重寫成本。ObservationPack 將大型輸出存於本機,後續改傳索引與節錄,需要時再取回原文;Evidence-Preserving Reducer 則讓較便宜的模型先讀建置、測試日誌,並核對引文與來源,驗證失敗就保留原始輸出。[技術說明](https://nvlabs.github.io/SoL-Pi/)

從這種驗證方式可推知,引文可追溯仍不代表沒有遺漏重要訊息。對依賴長日誌診斷的流程,應把原文取回次數、漏判錯誤與重試成本一起量測,避免省下當次輸入,卻增加後續調查迴圈。尤其當錯誤線索跨越多段輸出時,保留內容的選擇仍須由任務結果驗證。

作者在 51 項公開 EdgeBench 任務上報告,完整效率配置相較 Pi,於兩款模型減少 44.7% 至 49.0% 的 token 流量,API 成本約降三分之一。但這不是完全無損:GPT-5.6 Sol 的平均分數從 44.8 降至 42.0,Opus 5 則從 44.8 降至 42.2。流量統計包含快取讀寫,不能解讀為生成文字減半;成本也採用 8 月 17 日的 API 價格。[結果表格](https://arxiv.org/html/2609.20519v1)

外部任務更凸顯取捨:在 63 項僅使用 CPU 的 Terminal-Bench 4 任務中,SoL-Pi 解出 15 項,Pi 解出 18 項。總費用雖下降,每題成功成本與完成率仍應一起比較。研究也保留人工設定方向、檢視成果與重構程式的步驟,持續遞迴改進仍是後續目標。[專案評測與限制](https://nvlabs.github.io/SoL-Pi/)

公開版本以 MIT 授權提供 Pi 擴充套件,四項機制預設全部關閉,測試對應 Pi 0.85.1。導入者須另外確認日誌是否允許送往輔助模型,以及本機封存的保存期限。工程上的下一步,是逐項啟用並量測成功率、快取命中與實際帳單,確認節省可轉移到自己的工作負載。[儲存庫](https://github.com/NVlabs/SoL-Pi)

來源

  1. SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness
  2. SoL-Pi 論文全文與評測表格
  3. SoL-Pi: Scaling Auto-Research Loops for Efficient Agent Harnesses
  4. NVlabs/SoL-Pi