模型評測與推論
64 路自一致投票在多數 GPQA 難題上反而降低單題準確率
一項預先註冊研究發現,Qwen2.5-7B 與 Llama-3-8B 在多數 GPQA Diamond 題目上愈投票愈容易鎖定錯誤答案。整體平均分數仍略升,顯示聚合指標會掩蓋逐題退步。

自一致性通常讓模型抽樣多條推理路徑,再以多數答案作輸出;常見假設是增加抽樣最多浪費算力,不會降低品質。新研究以 [GPQA Diamond 的 198 道研究所級科學題](https://arxiv.org/abs/2608.11403)檢驗這項假設,對 Qwen2.5-7B-Instruct-Turbo 與 Meta-Llama-3-8B-Instruct-Lite 各題抽樣 64 次,溫度設為 0.7。
結果顯示,相對單次抽樣,64 路投票在 Qwen 的 56.6% 題目及 Llama 的 65.7% 題目上降低期望準確率;最差單題分別損失 47 與 46 個百分點。然而聚合準確率仍由 0.342 升至 0.369、以及由 0.273 升至 0.313。少數大幅改善的題目抵銷了大量較小退步,因此只報總分會得出「自一致性有效」的相反直覺。
研究先用 47 題探索,再把假設與門檻鎖進 [Git tag 及完整重現管線](https://github.com/u7k4rs6/self-consistency-backfire),最後以其餘 151 題確認。若有知道正解的 oracle,可逐題從 1、2、4、8、16、32、64 次抽樣中選擇最佳預算,準確率上限可達 0.482 與 0.439;但這不是可部署方法。作者測試的答案一致率 gate 與 token entropy gate,與固定 64 次投票的準確率差距均不足 0.002。
原因是模型在難題上可能穩定集中於同一個合理但錯誤的干擾選項。Qwen 最高一致率區間的多數答案僅 52.5% 正確,Llama 更只有 28.6%,甚至低於其低一致率區間。這提醒推論系統不要把「多次說法一致」直接當成可靠性訊號;較值得測試的是外部驗證器、可執行檢查或按題型校準的路由器。限制則是實驗只涵蓋兩款舊式 7B/8B 指令模型與單一多選基準,尚不能外推至 reasoning-native 或前沿模型。