推論系統
FreeToken 動態分配 CPU、GPU 與 PCIe,讓 35B MoE 在 8GB 顯示記憶體運行
FreeToken 不採固定卸載,而是按實測頻寬決定把未命中專家傳入 GPU 或直接交給 CPU 計算。論文亦展示單張工作站 GPU 服務 753B 模型,但完整權重仍需主記憶體,不能解讀成「753B 全放進一張卡」。

FreeToken 是針對個人電腦重新設計的 MoE 推論引擎。一般 CPU–GPU 混合方案會在載入時固定哪些專家留在 GPU;FreeToken 則把 GPU、CPU、主記憶體及 PCIe 視為同一個可變資源池,先用 `ft bench bw` 量測硬件,再於每個解碼步驟決定:快取未命中的專家應經 PCIe 傳入 GPU,還是直接在 CPU 執行,並讓兩條路徑重疊。
這套設計分別處理 prefill 與 decode。長提示的 prefill 幾乎會觸及每層全部專家,因此系統採逐層雙緩衝串流,把下一批權重搬移藏在目前計算後方;decode 的工作集較稀疏,則使用全域 LRU 專家快取及頻寬自適應排程。針對 coding agent 反覆新增工具結果、刪除思考區塊或壓縮上下文的情況,FreeToken 還保存語意錨點、循環狀態與 KV cache,避免每輪從頭重算。剩餘 VRAM 可在專家槽與 KV 頁面之間動態重分配,毋須重啟或重新載入主記憶體內的權重。
論文在 8GB 筆電 GPU 上服務 35B MoE、在遊戲桌機上服務 284B DeepSeek-V4-Flash,並以單張 96GB RTX PRO 6000 Blackwell 執行 753B GLM-5.2。這些數字指模型總參數量,不代表全部權重駐留 GPU;效能高度依賴主記憶體容量、CPU 頻寬、PCIe 世代、量化格式及專家路由分布。專案以 Apache 2.0 開源,提供 OpenAI/Anthropic 相容端點並支援二十多款模型,但目前主要面向 NVIDIA RTX 30、40、50 與 Blackwell,跨 AMD、Apple Silicon 及較慢記憶體配置仍待驗證。