推論系統
MoNe 將長上下文寫入測試時神經記憶,128K 推論總 FLOPs 減少 81%
Qualcomm AI Research 為凍結的 Transformer 外掛逐層快速權重,以 512-token 分段吸收上下文,查詢時不再讀取原文。Qwen2.5-0.5B 的 128K 實驗維持固定顯存並勝過 ICL、RAG,但證據目前限於三項合成檢索任務。

Qualcomm AI Research 提出的 MoNe,把長上下文處理拆成「寫入記憶」與「回答查詢」兩階段。系統將文件切成 512-token 區段,依序送入凍結的 Transformer;每一層另接一個 SwiGLU 快速權重網路,以該層產生的 key-value 關聯及局部梯度更新記憶,不需反向傳播穿越整個模型。完成寫入後,查詢 token 直接從快速權重產生固定數量的記憶 token,再作為自注意力的 key、value,原始上下文不必重新進入 KV cache。
這種設計令預處理成本隨上下文呈 O(N) 增長,單次查詢成本則不再依賴 N;保存後的快速權重亦可供多個查詢重用或隨新資料增量更新。論文以凍結的 Qwen2.5-0.5B-Instruct 測試:在 128K token 下,完整寫入加推論使用 1.41GB 峰值顯存及 149.61T FLOPs,相較直接 ICL 的 7.07GB、786.33T,分別減少約 80% 與 81%。模型只用最長 4K 的上下文訓練外掛,卻在 RULER 的單針、多鍵檢索及高頻詞抽取中,於 128K 分別取得 0.96、0.94、0.96;直接 ICL 為 0.28、0、0.23。
工程價值在於既有 Transformer 可保留主幹權重,不必為線性長上下文重新預訓練整個架構。不過 6.4% 額外參數仍須離線訓練,測試時寫入也包含梯度更新;論文報告的是 FLOPs 與峰值顯存,而非不同硬體上的端到端延遲。評測只涵蓋一款 0.5B 模型與三項高度結構化任務,尚未證明能在長文件問答、程式庫分析或多輪代理記憶中保留細緻語義。下一步應觀察大型模型、真實工作負載、記憶污染與長期增量更新的穩定性。