返回首頁

推論系統

CoBa 動態分配推理算力,以少 58.9% 加權 token 追平 Best-of-16

CoBa 先少量生成候選答案,再依分歧與驗證分數決定是否追加取樣或啟用較強驗證器。它在五套推理測試取得 85.13% 宏平均準確率,但結果來自離線候選池重播,尚非線上服務實測。

Reforma.imufomot · Public domain · Image source
zh-Hant

推理模型的測試時計算通常只有幾種固定配方:延長思考、一次產生更多答案,或讓另一個模型逐一評分。CoBa 把三者改寫成同一個預算分配問題,讓路由器在每一步選擇繼續取樣、使用輕量或強力驗證器,或直接停止。

其流程先由 Qwen3-14B、Phi-4-reasoning 或 Qwen3-8B 生成兩個候選,以答案一致度和 Qwen3-8B 評分判斷是否穩定;不確定時最多擴充至八個候選,再把排名最高的四個交給 Qwen3-14B 深度驗證。最終分數融合答案頻率、輕量判斷、可用的過程評分與強驗證結果。研究另以「模型參數十億數 × 輸入輸出 token」計算成本,近似不同模型處理相同 token 的算力差異。

在 MATH-500、AIME 2024/2025、AMC 2023 與 Reasoning Gym 困難子集的1,043題、3,129個題目—生成器組合中,CoBa-Routed-Strong 達到85.13%宏平均準確率,與 Best-of-16 多數決的85.12%相近,加權 token 則少58.9%;相較自我評估加權投票的85.20%,成本少49.1%。AIME 2024由單樣本的65.6%升至82.2%,但AIME 2025仍與91.36%的候選池 oracle 上限存在明顯差距,表示部分錯誤源自根本沒有生成正解,而非路由選錯。

主要限制是所有方法都在預先生成的16候選池上離線重播;論文把部分近期方法實作成代理版本,也沒有公開完整程式庫。參數加權 token 不是實際GPU時間或費用,跨架構比較尤其粗略。工程上下一步應觀察線上逐步生成時,路由開銷、批次效率與尾端延遲是否仍能保留這條準確率—成本曲線。

來源

  1. CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing
  2. HuggingFaceH4/MATH-500 Dataset Card