返回首頁

代理評測與推理效率

R³-Bench 讓六題共用推理預算,71/72 組測試的模型表現低於自身離線上限

新評測不再為每題提供獨立額度,而是要求模型在六道題之間分配 token 或工具操作。六款模型即使已能單獨解題,放入共享預算後仍普遍無法把算力投向最有回報的題目。

Tamanoeconomico · CC BY-SA 4.0 · Image source
zh-Hant

R³-Bench 把數學、競賽程式設計與抽象推理各自組成 50 套六題競賽,每套固定包含三道低資源需求、兩道中等題及一道高需求題。無工具模式以輸出 token 計算共享預算;代理模式則計算 shell、測試及其他工具動作。模型因此不只要解題,也必須決定何時繼續推導、驗證、換題或停止。

研究先讓同一模型在六個預算級別下逐題作答,每個條件重跑五次,建立「投入多少資源後曾成功」的經驗反應曲線。作者再以多重選擇背包問題建立離線 oracle:在總預算內,回顧性地挑選模型已展示過的成功配置。六款模型的 72 個主要測試格中,oracle 全部不差於實際競賽,並在 71 格嚴格勝出;即使採取較簡單的平均分配,中等壓力下也能勝過部分模型自行規劃。

軌跡分析顯示,問題不只是模型沒有涵蓋所有題目。五款模型會對逾半題目投入實質工作,但只有一款在逾半情況下會隨新證據與剩餘預算調整策略。強壓力時,常見失敗是先在其他題耗盡額度;壓力較低時,則常在已有進展後過早停止。加入固定排程指令可改善九個模型/領域組合中的六個,但沒有一套策略跨領域穩定領先。

這對同時執行多項工作的程式代理相當直接:單題 benchmark 分數不能推導出併發工作負載下的實際產能,排程器可能需要顯式估算剩餘成本、成功機率及機會成本。限制是 oracle 使用事後成功紀錄,並非可部署策略;題目難度又以參考模型輸出長度分層。開源評測器也未包含程式題隱藏測試與部分驗證資產,完整重現仍需自行補齊。

來源

  1. R³-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets
  2. R³-Bench official implementation
  3. R³-Bench dataset