開放模型與推論
Kimi K3 完整權重正式上線,2.8T MoE 從 API 走向自行部署
Moonshot AI 於 7 月 27 日釋出 Kimi K3 完整權重、模型卡與技術報告,外部團隊如今可實際部署與稽核這款三兆級稀疏模型,但至少 64 顆加速器、自訂程式碼及推理歷史相依性也形成明確門檻。

Moonshot AI 於 7 月 27 日在 Hugging Face 公布 Kimi K3 的完整權重、模型卡與技術報告,履行先前預告的開放權重計畫。K3 最初推出時主要透過 Moonshot 的應用與 API 提供服務;當時已公開其 2.8 兆參數稀疏 MoE 架構及後續釋出權重的安排,但外界仍無法直接檢查模型或驗證自行部署表現。此次發布使研究者與工程團隊得以稽核、量測及修改實際權重,也把討論焦點從端點能力推進到基礎設施、授權與可重現性。
K3 為原生多模態模型,共有 896 個專家,每個 token 選取 16 個,另設兩個共享專家;總參數為 2.8T,單次前向運算約啟用 104B。其 93 層網路由 69 層 Kimi Delta Attention(KDA)與 24 層 Gated MLA 組成,並以 Attention Residuals 選擇性取回不同深度的表示。Moonshot 稱 Stable LatentMoE 與新訓練配方使 scaling efficiency 約為 Kimi K2 的 2.5 倍,但這項結果仍有待外部依照相同定義重現。
公開權重採量化感知訓練所得的 MXFP4,啟用值使用 MXFP8;模型卡標示的上下文上限為 1,048,576 token。低精度格式雖可降低儲存與運算負擔,部署需求仍十分高:官方建議使用至少 64 顆加速器、具大型高頻寬通訊域的 supernode。vLLM、SGLang 與 Transformers 已提供啟動方式,但 KDA 的 prefix cache 需要專門實作;Transformers 範例亦要求啟用 `trust_remote_code=True`,團隊在執行前應審查遠端自訂程式碼及 Kimi K3 授權條款。
官方技術報告列出 Terminal-Bench 2.1 為 88.3、DeepSWE 為 67.5,但比較模型採用 Kimi Code、Claude Code或 Codex 等不同代理 harness,部分任務也曾在 H20 上重校,分數不宜視為完全同條件對照。模型另依賴完整保留 thinking history;若代理中途切換其他模型,或框架未回傳既有推理歷史,輸出品質可能明顯不穩。權重到位後,下一階段的關鍵將是社群能否在相同 harness 下重跑代理基準,以及開源推論後端能否重現其吞吐與長上下文能力。