推論系統
ParaTempo 以時間信心非同步裁切推理分支,Qwen3.5 延遲降低 21.8%
ParaTempo 定期探測各條推理路徑的暫定答案分布,據此獨立執行裁切、提前退休及分叉。Qwen3.5-35B-A3B 的四項評測平均準確率較固定 16 路 self-consistency 低 1.1 個百分點,但延遲與生成 token 分別減少 21.8% 及 30.3%。

平行採樣多條 chain-of-thought 能提高推理可靠性,代價是所有路徑通常取得相同 token 預算,即使某些分支早已收斂或持續搖擺仍會繼續解碼。[ParaTempo 論文](https://arxiv.org/abs/2608.16425)把問題改寫成線上資源配置:每生成 500 個 token,便在當前前綴後加入要求直接作答的後綴,取得最多 20 個候選答案及機率。
系統不是用單次 top-1 信心作決策,而是把最近七次探測的答案分布平均,再以負熵的指數計算「時間信心」。數值接近 1,代表近期機率質量持續集中於同一答案;分布分散則代表路徑尚未穩定。暖身階段會按當前問題的信心分布設定裁切門檻,毋須為不同模型共用固定閾值。
暖身後,低信心分支被移除;連續九次對同一主導答案保持至少 0.9 機率的分支會提前退休,但其答案仍保留於投票池。空出的執行槽從最高信心的活躍前綴重新分叉,以不同隨機種子延續探索。全域答案的加權票數達門檻時,所有解碼即可停止。整個流程不要求各路徑抵達相同深度,因而同時縮短總計算量與最慢路徑。
作者在單張 A100 80GB、vLLM、16 條分支下測試 Qwen3.5-35B-A3B 與 GPT-OSS-20B,涵蓋 AIME 2026、兩組 HMMT 及 GPQA。Qwen 的平均準確率為 71.1%,固定 self-consistency 為 72.2%;前者延遲少 21.8%、token 少 30.3%。它相對同步 Parallel-Probe 提高 3.9 個準確率百分點並降低 10.6% 延遲。
[公開程式碼](https://github.com/ScottZhang812/ParaTempo)已提供四項資料集的執行器與預設參數。不過結果只涵蓋兩款模型、答案格式明確的推理題及單卡環境;探測本身也要求模型能輸出可正規化的答案機率。工程上下一步應驗證自由文字、工具呼叫與多 GPU continuous batching 中,非同步控制是否仍能帶來相同收益。