返回首頁

模型架構與推論

T‑LoopFormer 讓每個 token 自選遞迴深度,並按迴圈拆分 KV cache

新架構以三層共享區塊反覆運算,讓路由器按 token 決定提早退出或繼續進行潛在推理。論文在約 10 億參數實驗中報告優於固定深度 looped Transformer 的延遲與準確率,但尚未驗證到前沿模型或主流推論引擎。

Dennis 96 · CC BY-SA 3.0 · Image source
zh-Hant

9 月 14 日公開的 [T‑LoopFormer](https://arxiv.org/abs/2609.15160) 把動態計算從「整段序列選深度」細化到單一 token。一般 looped Transformer 會重複使用同一組權重,以較少參數形成較大的有效深度;問題是簡單與困難 token 通常都被迫執行相同次數。T‑LoopFormer 的輕量路由器依 token 初始隱藏狀態指定遞迴深度,簡單 token 提早退出,較難 token 則繼續通過共享區塊。決策只依賴該 token 當下已有狀態,因此不破壞自回歸因果性。

動態退出若仍為所有深度保存完整 KV cache,實際延遲未必下降。研究團隊因此為每一輪遞迴維護獨立快取,只保留仍在該深度活動的 token,注意力也限制在對應快取;訓練與推論另用 gather–scatter 跳過已退出項目。FineWeb‑Edu 驗證集中約 61% token 在二至三輪退出,但仍有約 15% 跑到七或八輪,顯示固定深度會同時過度計算簡單 token,又可能低估長尾 token 的需求。

實驗以 NanoGPT 類解碼器在 FineWeb‑Edu‑100B 訓練 1000 億 token,比較 24 層、約 10 億參數的非循環基線,以及三層共享區塊最多重複八次的模型。於論文定義的 24× FLOPs 設定,T‑LoopFormer 在十項零樣本任務平均為 44.20%,略高於 24 層基線的 43.80%;每個輸出 token 延遲為 0.197 毫秒,對照 LoopFormer 的 0.441 毫秒。作者已公開 [MIT 授權實作](https://github.com/YuMingQian1234/T-LoopFormer),程式維持接近 NanoGPT,方便檢查路由與快取邏輯。

這些數字仍是受控研究設定,不代表 vLLM、SGLang 或長批次服務上的實際吞吐。當最大深度降至 12× 或 6× FLOPs,模型也落後同級非循環基線。下一步要看更大規模預訓練、不同硬體上的路由分歧成本,以及動態 token 集合能否在 GPU kernel 中保持高利用率。

來源

  1. T-LoopFormer: Token-Level Elastic-Depth Looped Transformers for Latent Reasoning With Dynamic Routing
  2. YuMingQian1234/T-LoopFormer