返回首頁

AI 評測與開發工具

optstop 以貝葉斯可信區間動態停止評測,九組測試最多省下 97.3% 試驗

英國 AI Security Institute 開源 optstop,按題目與任務層級的後驗不確定性決定何時停止重複評測。九組影子測試平均省下 81.1% 試驗,但效果依評分型態、題目排序及交換性假設而變。

Robert Underwood · CC BY-SA 2.0 · Image source
zh-Hant

固定為每道題執行相同次數,會讓已經收斂的項目繼續消耗 API 與 GPU;optstop 把這件事改寫成序列測量問題。它在每次取得新結果後更新階層式貝葉斯模型,當個別題目或模型—任務群組的後驗可信區間寬度低於門檻,便停止相應試驗。預設 97% 可信區間與寬度 0.05,等同要求估計值約落在正負 2.5 個百分點內;若區間遲遲無法達標,另以近期寬度斜率判斷資訊增益是否已趨穩。

工具分別處理二元、序位及有界連續分數。二元結果採階層式 logit-normal;序位量表結合 ordered-logistic、眾數區間與熵收斂;連續分數則以題目摘要進行階層推論。它可離線裁剪既有資料,也已實作 `inspect_ai` 的 `EarlyStopping` 協定。為避免在接近零分時錯過罕見成功,框架會加強保守取樣,而不是看到連續失敗便立即停止。

論文以 200 題、每題原定十輪的九組影子實驗驗證:所有請求仍完整執行,再回放提前停止點,因此排除了兩次模型執行間的隨機差異。被省略的試驗介於 57.2% 至 97.3%,平均 81.1%;截斷與完整估計的平均絕對差為 0.006。不過這不是生產流量下的直接成本實驗,模型亦是 2026 年 3 月呼叫的 GPT-3.5 Turbo、GPT-4o 與 Claude Sonnet 4.5。工程團隊還須隨機化題目順序並檢查群組內交換性;若題目按難度排序,提前停止可能形成系統性偏差。下一步應觀察它在稀有危險能力、代理式長任務及模型裁判漂移下能否維持覆蓋率。

來源

  1. Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations
  2. UKGovernmentBEIS/optstop