返回首頁

開放權重模型

Kimi K3 以 2.8 兆參數 MoE 把開放權重模型推向三兆級

Moonshot AI 發布 Kimi K3,採 2.8 兆總參數、每 token 啟用 16 個專家的 MoE 架構,並支援百萬 token 上下文與視覺輸入。完整權重排定稍後釋出,因此目前仍應區分 API 表現與可自行部署的實證。

Yuki Shimazu · CC BY-SA 2.0 · Image source
zh-Hant

Moonshot AI 在 7 月 16 日推出 Kimi K3,將其定位為接近三兆參數級的開放權重模型。公開資料顯示模型具有 2.8 兆總參數、896 個專家,每個 token 選用其中 16 個,並提供約一百萬 token 上下文與原生視覺能力。架構加入 Kimi Delta Attention 的混合線性注意力,以及調整層間訊息傳遞的 Attention Residuals;後訓練階段則導入量化感知訓練,目標格式包含 MXFP4 權重與 MXFP8 activation。

MoE 的低啟用比例可把每 token 計算量壓到遠低於總參數規模,但不會消除記憶體、通訊與部署難題。896 個專家需要有效的路由、負載平衡和 all-to-all 通訊;若跨節點頻寬不足,理論上的稀疏計算優勢可能被通訊等待抵銷。百萬 token 上下文也不能只看最大長度,還要測量長序列召回、位置偏差、KV cache 占用與多輪代理狀態的一致性。

Moonshot 公布的程式與代理基準顯示 K3 接近部分閉源前沿模型,且在前端程式設計盲測中表現突出,但多數數字仍來自發布方或單一排行榜。完整權重的實際供應時間、授權條款、量化檢查點品質與最低叢集需求,將決定它是否真能被廣泛自行部署。研究者還應檢查專家利用率、不同語言的能力落差,以及低精度格式在非最新硬體上的相容性。

來源

  1. China's 2.8-trillion-parameter Kimi K3 pushes open-weight model scale
  2. Chinese AI model takes US tech industry by surprise