開源模型與推論
K2 Horizon 一次釋出六種尺寸,MoVA 模型每個 token 只啟用部分 value 投影
IFM 發布 0.9B 至 375B 的 K2 Horizon 模型家族,其中 36B 版本把 MoE 路由延伸至注意力的 value 投影。權重與部署配方已可取得,但官方所稱的「完全開源」仍領先實際交付進度。

基礎模型研究院(IFM)發布 K2 Horizon,共有 0.9B、3.7B、7B、32B、36B-A4B 與 375B-A23B 六種規模,採 Apache 2.0 授權。除了讓同一家族涵蓋端側到多 GPU 伺服器,較值得注意的是 36B-A4B:它同時使用 Mixture-of-Experts 與 Mixture-of-Values Attention(MoVA),由路由器為每個 token 選取部分 value 投影矩陣,而非所有 token 共用單一 value projection。模型卡稱其儲存約 36B 參數、每個 token 啟用約 4B,並原生支援 524,288-token 上下文。
部署端已提供 Transformers、vLLM 及 SGLang 路徑;官方驗證的 SGLang 配方使用兩張 H200、BF16、TP=2、EP=2 與 FlashAttention-3,還要求特定 router GEMM 分割設定以維持數值行為。這提醒工程團隊,「只啟用 4B」描述的是每 token 計算量,不等於只需載入 4B 權重,也不代表一般消費級 GPU 能輕易承擔 512K KV cache。模型卡列出的 Terminal-Bench 2.1、tau3-Banking 等成績目前主要由發布方提供,仍需第三方在相同取樣與推論設定下重測。
發布透明度亦有時間差。IFM 新聞稿宣稱權重、程式碼、訓練資料與方法已完整公開;但 36B 模型卡明確寫著中間檢查點、資料及訓練程式「將會發布」,目前可直接下載的是最終權重、模型實作和部分後訓練資源。研究者下一步應核對資料配方、完整預訓練程式與中間檢查點是否真正到位,並測試 MoVA 在不同推論框架、量化格式及長上下文負載下是否保持品質與吞吐量。