推論系統
Sol-Attn 在 online softmax 內動態稀疏化注意力,影片生成端到端加速逾 2 倍
NVIDIA 研究團隊公開無需重新訓練的 Sol-Attn,在注意力運算期間選取關鍵區塊,並近似補回被跳過區塊的貢獻。官方在多款影片模型測得約 1.9 至 2.34 倍端到端加速,但品質與硬體泛化仍需獨立驗證。

NVIDIA 研究團隊公開 Sol-Attn,試圖降低擴散 Transformer 在高解析度影片生成時的注意力成本。既有動態稀疏注意力通常先建立 proxy score map,再依固定比例或累積機率挑選 key-value 區塊;前者無法依查詢難度調整算量,後者可能造成工作量失衡,兩者還要付出路由與中間張量的成本。
Sol-Attn 把路由、稀疏計算及誤差修正合併進一次 online softmax。核心做法是在晶片上逐塊比較 proxy score 與門檻,不先實體化完整分數圖;低於門檻的區塊不直接歸零,而是重用其分數欄位,近似長尾注意力貢獻。這讓每個 query 使用不同區塊預算,同時避免傳統 keep-or-drop 方法在高稀疏率下迅速破壞畫面。
作者以相同 prompt 與 seed 比較密集注意力管線:Wan 2.1 與 Hunyuan 1.5 的 720p 文字轉影片分別達 2.02 倍及 2.12 倍端到端加速,LTX 2.3 的 1080p 兩階段生成為 1.90 倍,Bernini 影片編輯則為 2.34 倍。若再結合核心融合與快取組成 Sol-Engine,官方報告最高約 5 倍,但這個數字不能歸因於 Sol-Attn 單一技術。
程式已放入 Sana 儲存庫的 `sol-engine` 分支,工程團隊可檢查核心與管線整合。不過目前展示主要來自 NVIDIA 自測與視覺案例,尚缺跨 GPU、不同長度與高動態場景的盲測;B200 核心也仍在最佳化。接下來應觀察記憶體峰值、批次吞吐、低門檻時的時間一致性,以及能否整合至主流推論框架。