AI 研究與推論
百萬 token 不等於可用記憶:實測鎖定少數 retrieval heads 為長上下文瓶頸
一項針對未發布 27B 混合模型的推論端實驗顯示,模型在約 100 萬 token 只找回 21.4% 的植入資訊,遠低於 3.3 萬 token 時的 92.9%。位置縮放、注意力溫度與更高精度 KV cache 均未顯著修復問題,檢索能力則高度集中於 18 個注意力頭。

模型宣告支援百萬 token,並不代表它能可靠使用整段內容。開發者 David Davidich 以一款正在準備公開的 27B 混合模型做推論端測試:架構含 48 層 gated delta recurrent layer,以及 16 層採 GQA 的完整注意力;原始訓練長度為 262,144 token,百萬 token 則屬免訓練延伸。
測試把唯一的存取碼植入俄文長篇文本。模型在約 33,000 token、14 筆相似紀錄下找回率為 92.9%,到 250,000 token 降至 64.3%,在 1,005,000 token 則只剩 21.4%。作者以極值競爭解釋:目標 token 必須擊敗隨上下文增加的大量干擾位置,因此很小的 logit margin 變化也會被放大。
四條直覺路徑沒有奏效。YaRN 在百萬 token 的測試為 0/14;壓縮或凍結部分 RoPE 位置只能帶來零星命中。恢復長上下文注意力溫度未改善結果;把三位元 KV cache 換成 FP8,40 筆測試雖由 60% 升至 70%,配對檢定卻只有 p=0.34,尚不足以證明量化雜訊是主因。
較具啟發性的結果來自內部電路分析:384 個注意力頭中,18 個承擔一半檢索質量,而且約四分之三檢索集中在同一個 GQA KV group。這與既有研究所稱少於 5% 的 retrieval heads 相符,也把下一步從「全面提高 cache 精度」縮小為針對少數 projection 訓練 adapter。
工程團隊應注意,這仍是單一未發布模型、少量人工 needle 測試,沒有程式、權重或獨立重現;結果不能直接外推到所有百萬上下文模型。後續最值得觀察的是模型公開後的 RULER、長文件推理與真實程式庫測試,以及局部 adapter 能否在不污染評測形狀的前提下恢復檢索。