推論基礎設施
SQD 依注意力型態拆分解碼,次平方模型推論不再沿用密集模型的分離方式
新研究提出 SQD,按二次與次平方注意力的記憶體、運算特性分派解碼工作。論文報告最高 56% 每焦耳 token 增益,但 Rubin/LPX 數字仍來自分析模型而非實機叢集。

9 月 14 日進入 arXiv 最新批次的一篇系統研究指出,現有分離式推論多從密集 Transformer 出發,把 prefill、decode,或 attention、FFN 放到不同裝置;當模型改採稀疏、線性或滑動視窗注意力後,這種切法未必仍能匹配資料移動與算術強度。
研究團隊提出 SubQuadratic Disaggregation(SQD)。對內容式稀疏注意力,系統把需要掃描完整 KV cache 的 top-k 選取,與只處理入選位置的 attention 加 FFN 分開;對線性及滑動視窗模型,則將少量密集注意力層獨立,其餘次平方層和 FFN 留在另一側。重點不是新增注意力演算法,而是讓排程器感知不同層的動態工作集:前者需要高容量、可索引的記憶體,後者的工作集較固定,較適合 SRAM 型加速器。
在調整過的八張 B200 異質系統代理環境中,作者相對最強純 GPU 基線,於 GLM 5.2、Nemotron 3 Ultra及 Gemma 4 31B 分別量得平均 53%、31%與56%的 tokens/J 改善。另以固定功耗的 Rubin 加 LPX 分析模型估算,相較既有 attention–FFN 分離方式,延遲界線可收緊 1.2 至 1.5 倍,吞吐最高提高 3.6 倍。
工程意義在於,次平方注意力可能迫使服務框架把「模型架構」納入硬體放置,而不能只辨識 prefill 與 decode。不過目前結果混合代理平台與分析模型,論文頁面也未列出公開程式碼;跨裝置通訊、批次變動、top-k 索引成本及真實尾延遲,仍需在實際 Rubin/LPX 或同級硬體上重現。