推論系統
Recirculation 回灌 Transformer 深層狀態,Gemma 3 困惑度最多降低 35%
Google DeepMind 提出在推論時把深層 residual stream 混回後續 token 的淺層,以現成 Gemma 3 建立跨 token 遞迴。方法不增加模型權重,卻把平行 prefill 改成序列處理,實際延遲仍待完整量測。

Google DeepMind 等研究者提出 Recirculation,試圖補足標準 Transformer 不擅長持續更新內部狀態的結構限制。一般模型對每個 token 由淺至深計算;已在深層完成消歧或整合的表示,無法回到淺層影響下一步的早期處理。新方法在處理下一個 token 時,將前一步某個深層 residual stream 經 L2 範數正規化後,以係數 α 混入指定淺層。這不是單純重跑同一批 block 的 depth looping,而是同時沿深度與 token 時序形成遞迴。
研究凍結原模型權重,在 Gemma 3 1B、4B、12B 預訓練模型上搜尋來源層、目的層及混合係數。固定 Recirculation 在十個語言建模資料集中的九個跨尺寸改善困惑度;12B 在 PG-19 降低 35.40%,但 Lambada 反而惡化 2.81%。基本版本在 Gemma 3 4B 的八項單 token 評測中改善六項,幅度多不到一個百分點。另以少量資料調整回灌係數的 adaptive 版本,整體困惑度相對基線降低約 23%,GSM8K 準確率相對提升約 21%。
工程價值在於它不需重訓或新增參數,也幾乎不改變逐 token 解碼的臨界路徑;但代價落在 prefill:狀態必須按 token 序列更新,不能像標準 Transformer 一次平行處理整段提示。長上下文服務的首 token 延遲可能因此大幅增加,論文尚未提供端到端吞吐、顯存或不同加速器量測。結果也集中於 Gemma 3,且部分 instruction-tuned 12B 狀態追蹤測試變差。下一步應看其他模型家族能否重現、係數能否免資料自動選擇,以及 runtime 是否能以分塊或投機方式降低序列 prefill 成本。