ホームへ戻る

模型架構與可解釋性

混合線性注意力在完整注意力層前形成巨量啟用尖峰,規律橫跨 1.2B 至 397B 模型

新研究發現,混合線性注意力模型的巨量啟用並非隨機散布,而會在完整注意力層前形成尖峰,並於中間的線性層維持平台。團隊公開分析程式與受控模型,但完整論文圖表所用的逐筆輸入尚未全部釋出。

zh-Hant

混合線性注意力(HLA)以固定大小的循環狀態處理多數 token,只間歇插入成本較高的完整注意力層,已成為長上下文模型的重要架構。但模型內部少數極端大的「巨量啟用」如何穿過這兩類層,過去缺乏系統性描述。8 月 12 日提交的新研究在五種線性注意力架構、六種混合比例及五類資料上追蹤 residual stream,涵蓋的公開模型由 1.2B 延伸至 397B 總參數。

團隊辨識出兩種與架構位置對齊的形態。第一種是 pre-attention spike(PAS):極端啟用穩定出現在完整注意力層之前;第二種是 inter-spike plateau(ISP):該訊號未立即消失,而是在兩個完整注意力層之間的線性層維持高位。完整注意力層愈密集,相鄰 PAS 愈容易被 ISP 連接,最終接近純完整注意力 Transformer 中較連續的巨量啟用形態。

作者另自行預訓練最高 1.3B 參數的 gated delta network 混合模型,以區分相關性與架構因素。PAS 與 ISP 在訓練早期已出現;關閉完整注意力輸出閘門會大幅降低絕對幅度,卻沒有消除其逐層位置規律,而移除 GDN 閘門只帶來較小的放大。研究據此提出 `write–sink–cancel` 解釋:完整注意力前先寫入並集中訊號,PAS 隨後局部抵消;ISP 則代表抵消被延後。這仍是由介入與系統性離群值分析支持的機制假說,並非已完成的因果證明。

公開儲存庫提供 forward hook、PAS/ISP 指標、生命週期圖與 340M 模型快速範例,也釋出受控 GDN 權重。這些工具可協助量化研究、異常偵測與 KV/狀態壓縮判斷哪些大值是架構必要訊號;粗暴裁切可能破壞跨層傳遞。重現時則要注意,大型模型需要各自相容的執行環境與大量顯存,儲存庫也未提供每張論文圖所用的完整抽樣 JSONL,因此目前能重跑分析流程,未必能逐點重現全部結果。

出典

  1. Massive Activations in Hybrid Linear Attention Large Language Models
  2. Official Massive-Activations-HLA Code
  3. Massive-Activations-HLA Model Weights