推論系統
DARTree 先批次建樹再剪枝,Qwen3-4B 解碼最高達本機 AR 的 9.73 倍
DARTree 把擴散草稿模型的因果校正由單一路徑延伸至多分支,並把逐節點 heap 搜尋改成按深度批次展開。單張 RTX 6000 Ada 測試中,七項任務的平均加速均勝過 DFlash、DDTree 與 Domino,但程式尚未公開。

DARTree 要解決的是擴散式推測解碼中的兩難:DFlash 類草稿模型可一次預測整個 16-token 區塊,速度快,卻沒有依照區塊內已選 token 調整後續分布;Domino 加入自回歸校正頭後能恢復因果條件,但若逐節點執行 best-first 搜尋,校正頭又會退回序列式工作。
新方法沿樹深逐層批次處理所有活躍分支。它先由區塊草稿器產生共享表徵,每個位置保留前 64 個候選,再讓既有 Domino 校正頭依各分支前綴重新評分;每層保留固定寬度,形成比最終驗證樹更大的 supertree。完成後,系統才以累積對數機率及深度懲罰一次取出最高分的 64 個節點。當深度獎勵不為正時,作者證明這組節點保持前綴封閉,等價於在已物化樹上逐項執行 heap 選擇,因此可以交給目標模型以 tree attention 一次驗證。
作者在 Qwen3-4B、8B及溫度 0、1 四組設定,測試 GSM8K、MATH-500、AIME 2025、HumanEval、MBPP、MT-Bench 與 Alpaca。Qwen3-4B、溫度 0 的整體平均加速為 6.99 倍,高於 DFlash 的 4.58 倍及 Domino 的 5.17 倍;GSM8K 單項則每輪接受 12.97 token,達 9.73 倍。結果保持目標模型輸出分布,但不是所有工作負載都接近峰值:聊天任務的增益較小,AIME 的一個設定亦略慢於 DDTree。所有延遲數字來自 batch size 1、最多生成 2,048 token及單張 RTX 6000 Ada,尚未涵蓋高併發、長提示或資料中心級服務;DARTree 實作也未公開,工程團隊仍需等待可重現的核心整合與記憶體成本資料。