開放模型
Kimi K3 公開 2.8T MoE 權重,104B 啟用參數把自架門檻推至叢集等級
Moonshot AI 正式釋出 Kimi K3 權重與技術報告;模型具備原生視覺、百萬 token 上下文,每個 token 啟用 896 個專家中的 16 個。開放權重使官方能力宣稱終於可以重現,但逾 1TB 的低精度權重仍讓完整部署遠離一般工作站。

Moonshot AI 於 7 月 27 日公開 Kimi K3 的模型權重與技術報告,補上 7 月中產品發布時尚未交付的核心資產。K3 是總參數 2.8 兆、每個 token 啟用 1040 億參數的稀疏專家模型;路由器從 896 個專家中選取 16 個,另保留共享專家。模型整合 MoonViT-V2 視覺編碼器,可處理文字、圖片與影片,標示的上下文上限為 100 萬 token。
架構上的重點不只是規模。Kimi Delta Attention 以有限狀態壓縮部分歷史資訊,降低長序列注意力成本;Attention Residuals 則讓不同層直接混合先前注意力輸出,而非只依賴傳統逐層殘差傳遞。官方也以 MXFP4 保存大部分 MoE 權重,目的是降低記憶體流量與部署成本。這些設計使「每步計算量」遠小於 2.8T 密集模型,卻不會消除載入完整專家集合所需的儲存空間與跨 GPU 通訊。
技術報告稱 K3 在長程程式開發、終端工具、視覺代理及一般知識評測上領先多款開放與既有商用模型,但整體仍落後 Claude Fable 5 與 GPT-5.6 Sol。這些比較主要由 Moonshot 執行,模型選用的 agent harness、推理預算和工具環境都可能顯著左右結果,不能只看單一排行榜。
對工程團隊而言,真正的新訊息是可檢查、量化與改寫的權重已經落地,而非 API 多了一個名稱。接下來應觀察 vLLM、SGLang 等執行器對 KDA、視覺輸入與專家並行的正式支援,以及社群在相同 harness 下能否重現長程代理成績。授權雖允許廣泛商用,自架團隊仍須先估算逾 TB 級權重、節點間頻寬及百萬上下文 KV 狀態的實際成本。