開放模型與推論系統
Ling-3.0-flash 以 5:1 混合注意力與 1/64 稀疏 MoE,將每 token 啟用參數壓至 5.1B
InclusionAI 發布 124B 參數的 Ling-3.0-flash,採 KDA、MLA 與高度稀疏 MoE,面向長流程代理推論。API 已上線,但權重預定 8 月才公開,效能數字現階段無法完整重現。

螞蟻集團旗下 InclusionAI 發布 Ling-3.0-flash:模型共有 124B 參數,但每個 token 僅啟用約 5.1B。架構並非單純縮小既有 Transformer,而是以 5:1 比例交替堆疊 KDA 線性注意力與 MLA,搭配細粒度對角門控及 1/64 稀疏 MoE。其設計目標是讓狀態記憶、全注意力品質與推論成本取得折衷,並同時提供思考和非思考模式。
官方宣稱,Ling-3.0-flash 在多數內部基準可匹敵或超越上一代 Ring-2.6-1T,儘管總參數約為後者八分之一、啟用參數約為十二分之一。模型面向 coding、通用操作與 deep-research agent,訓練使用逾一萬個可互動環境。不過,參數效率不等於實際服務速度;MoE 路由、跨卡通訊、KV 狀態管理與批次大小,都可能使理論 FLOPs 優勢無法線性轉成吞吐。
推論端另結合 SGLang HiCache 與 Mooncake 分級快取,利用 prefill、decode 雙池及叢集共享 L3,避免長程互動反覆計算共同前綴。團隊稱長輸入的首 token 延遲可降低 60% 至 80% 以上,但尚未公布完整硬體、負載形狀、命中率與對照設定。模型目前可經 OpenRouter 等 API 測試,權重則預定免費 API 活動結束後公開。工程團隊接下來應觀察正式授權、vLLM/SGLang 原生支援、單機顯存需求,以及公開權重能否重現長上下文和代理基準。