推論系統
FreeToken 動態拆分 MoE 快取失誤,8GB RTX 4060 跑 35B 模型達 39.3 token/s
FreeToken 依主機記憶體與 PCIe 頻寬,動態決定未命中專家應傳入 GPU 或直接由 CPU 計算。論文在五款消費級系統報告較最強基線高 1.3 至 2.1 倍解碼吞吐,但所連結的程式碼庫目前尚無法公開存取。

FreeToken 把本地 MoE 推論重新定義為 CPU、主記憶體、PCIe 與 GPU 的聯合排程問題,而不是把個人電腦視為縮小版伺服器。完整專家權重常駐主機記憶體,非專家權重留在 GPU,剩餘 VRAM 則成為跨層共用、可在執行期間調整容量的 LRU 專家快取。這種配置的正確性不依賴快取命中率;主機端始終保存權重真值,GPU 容量只影響速度。
解碼遇到 `m` 個未命中專家時,系統不固定選擇搬運或 CPU offload,而按實測主機頻寬 `B_H` 與 PCIe 頻寬 `B_P`,以 `q≈m·B_P/B_H` 決定傳入 GPU 的數量,其餘由 CPU 原地計算。兩條分支並行後合併部分輸出,沒有刪除專家或近似路由。論文亦指出短期路由具有局部性;在 RTX 5090 的相同快取容量下,FreeToken 對 Qwen3.6 與 DeepSeek-V4-Flash 的專家讀取失誤率分別為 16% 與 39%,低於 KTransformers 的 41% 與 59%。
代理工作負載的另一個成本來自工具呼叫後反覆 prefill。FreeToken 在特殊 token 邊界保存 KV 與循環狀態檢查點,對話被裁切或改寫時只重算最近有效錨點後的後綴;模型層載入則以雙緩衝把下一層 PCIe 傳輸藏在當前層計算之後。[論文](https://arxiv.org/abs/2608.16157)在 RTX 5090 報告 Qwen3.6-35B-A3B 為 77–83 token/s,並在 8GB RTX 4060 筆電以 [NVFP4 檢查點](https://huggingface.co/nvidia/Qwen3.6-35B-A3B-NVFP4)達到 39.3 token/s;該模型共有 35B 參數、每 token 啟用約 3B。
這些結果仍是作者控制的單請求測試,工作負載、CPU 執行緒及量化格式並非所有引擎都完全相同,也未涵蓋多租戶吞吐或功耗。更關鍵的是,論文雖連到 GitHub 程式庫,檢查時仍回傳 404,外界尚不能重現 kernel、狀態快取與動態 VRAM 重建。工程團隊應觀察公開程式碼後的記憶體需求、模型支援矩陣,以及長時間代理流程能否維持相同尾延遲。