推論系統
FreeToken 動態分拆 CPU/GPU 專家運算,讓 284B MoE 在單張 RTX 5090 推論
FreeToken 不再以固定規則卸載 MoE 專家,而是按實測記憶體及 PCIe 頻寬,在 CPU 執行與 GPU 快取之間動態分工。作者報告 RTX 5090 可用每秒 22 至 25 token 執行 284B 模型,但測試仍由開發團隊完成,且完整權重依然需要大量主記憶體。

FreeToken 是 UC Berkeley、MIT 等研究者公開的 Apache 2.0 推論引擎,目標不是把個人電腦當成縮小版資料中心,而是把 GPU、CPU、主記憶體與 PCIe 視為同一個異質運算池。稀疏 MoE 每個 token 只啟用少量專家,卻仍須保存完整專家權重;傳統靜態卸載一旦 GPU 快取未命中,便會同步搬運權重或把工作全丟給受 DRAM 頻寬限制的 CPU。
FreeToken 的 `q*` 策略先量測主記憶體與 PCIe 的實際頻寬,再逐層決定有多少未命中專家應搬入 GPU、多少直接由 CPU 計算。兩條路徑並行執行,最後合併部分輸出,沒有以近似計算換取速度。引擎另以跨層雙緩衝把下一層權重傳輸藏在目前層的計算後方,並用全域 LRU 快取追蹤生成過程中持續變動的熱門專家。
針對 coding agent,系統會在思考區段、工具呼叫與對話輪次等語意邊界保存 KV cache 或循環狀態。代理刪除舊工具輸出或修改中段內容時,可從仍有效的錨點重算後綴,而非重新 prefill 整段上下文。VRAM 也可在專家快取與日益增長的 KV cache 之間重新配置,不必重載模型。
論文在 RTX 5090 上報告 Qwen3.6-35B-A3B 達每秒 77 至 83 token,DeepSeek-V4-Flash 284B 達每秒 22 至 25 token;8GB RTX 4060 筆電則可執行 35B 模型。這不代表巨型模型只需顯示卡容量:完整專家池仍置於主記憶體,例如 284B FP4 部署約需搬動 140GB 權重。工程團隊應等待獨立重跑,並檢查 RAM 容量、NUMA、PCIe 世代、量化品質、首 token 延遲及多請求併發;目前數字不能直接外推至所有模型與一般消費級主機。