返回首頁

模型評測與推論

相同模型排名隨 token 上限反轉,四模型測試錄得 56,476 次推論

一項新研究把四款開放權重模型的生成上限由 64 提高至 4,096 token,三項推理基準的領先模型均曾改變。排除截斷後仍有 3%至19%題目在增加預算時由對轉錯,顯示單一 token 設定不足以支撐部署選型。

Lionel Baur · CC BY-SA 3.0 · Image source
zh-Hant

模型排行榜往往把一次固定推論設定壓縮成單一分數,但不同模型的準確率未必會隨生成預算同步增加。巴西聖卡塔琳娜聯邦大學研究者比較 Llama 3 8B、Qwen3 32B、Llama 3.3 70B 與 [gpt-oss-20b](https://huggingface.co/openai/gpt-oss-20b),在 GSM8K、MATH-500、GPQA-Diamond 上分別設定 64、128、256、512、1,024、2,048及4,096 token,合計執行 56,476 次溫度為零的確定性推論。

[論文](https://arxiv.org/abs/2608.12150)發現三項基準都出現排名反轉。以 GSM8K 為例,256-token 時 Llama 3.3 70B 以 62.4%領先,gpt-oss-20b 只有 48.6%;到4,096 token,後者升至 94.9%,高於 Qwen3 32B 的 91.7%。MATH-500 在中等預算由 Llama 3.3 70B 領先,4,096-token 的表面排名則改由 gpt-oss-20b 居首,但這次差異未達統計顯著。GPQA-Diamond 僅有198題,最高排名亦由8B模型移至70B及20B模型,應避免過度解讀小樣本差距。

部分變化來自輸出被截斷:Qwen3 32B 在4,096-token 的 GPQA 測試仍有59.7%回應因長度停止,而 Llama 3.3 70B 只有0.5%。研究因此另比較所有模型均完成回答的共同子集;若只看這些題目,MATH-500 的4,096-token 首名會由 gpt-oss-20b 改成 Qwen3 32B。換言之,「有限預算內完成」與「完成後答對」是兩個不同部署指標。

截斷也不能解釋全部結果。移除截斷軌跡後,各模型與資料集仍有約3%至19%的題目在預算增加時由正確轉為錯誤,而且86%至94%的此類題目只出現在單一模型。研究的 XGBoost 路由器把題目文字特徵與 token 預算一併輸入,跨領域測試只回收理想 oracle 差距的14.1%,顯示預算效應不易泛化。實務上,評測報告應公開完整的準確率、截斷率、成本與延遲曲線;模型閘道也應以工作負載實測決定上限,而不是假定更多推論 token 必然更好。

來源

  1. Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation
  2. openai/gpt-oss-20b Model Card
  3. GPQA Dataset