AI 代理與評測
HarnessOpt-Bench 測試模型改寫代理外殼,模型選擇的影響約為編碼工具 1.8 倍
Scale AI 將提示、工具、記憶與控制流程視為可由模型修改的程式,並以隱藏測試集衡量實際增益。111 次實驗顯示,原生編碼代理並未穩定勝過共用外殼,驗證階段看到的最佳分數也普遍偏樂觀。

代理能力不只取決於模型權重,也取決於包在外面的提示、工具定義、記憶、重試策略與控制流程。Scale AI 發表 HarnessOpt-Bench,把這套「外殼工程」改寫成端到端評測:最佳化模型取得一個初始代理程式、開發案例的逐題軌跡、驗證集總分及固定評測預算,可直接增刪程式碼,最後只能提交一個候選版本,由隔離的可信執行環境在未公開測試集評分。
基準涵蓋 OfficeQA、BrowseComp-Plus、Terminal-Bench 與 GAIA,測試五款前沿模型,分別搭配共用的 OpenCode 及 Claude Code、Codex、Kimi CLI 等原生工具,共完成 111 次計分執行。分數採「正規化增益」,衡量新外殼取得初始版本剩餘改善空間的比例。控制任務與外殼後,更換最佳化模型令分數平均移動 0.142;控制模型與任務後,更換編碼外殼平均移動 0.079,前者約為後者的 1.8 倍。最強組合取得 OfficeQA 約三分之二、BrowseComp-Plus 約一半的剩餘改善空間,但中段模型的差異常小於重跑波動。
搜尋軌跡也暴露實務問題。觸及提示、上下文、步數上限、工具 schema、檢索策略等更多槓桿,與較高測試增益呈正相關;然而完整失敗軌跡在 111 個實驗單元中只被要求 16 次。多數最佳驗證分數未能在隱藏測試集重現,說明讓代理反覆看同一評測,容易把選擇偏差誤認為真正進步。
工程團隊可借用其隔離測試、資源計量與版本保存設計,建立可稽核的代理最佳化流程。不過每個組合僅重跑兩次,最佳化模型自身的推論預算又未設上限;目前結果較適合比較搜尋行為,尚不能直接換算成固定成本下的生產效益。