ホームへ戻る

開放模型與推論系統

Ling-3.0-flash、5:1の混合Attentionと1/64の疎なMoEで、token当たりの有効化パラメータを5.1Bに圧縮

InclusionAIは、124BパラメータのLing-3.0-flashを公開した。KDA、MLA、高度に疎なMoEを採用し、長いワークフローを伴うエージェント推論を主眼とする。APIはすでに提供されているが、weightsの公開は8月を予定しており、現時点では性能値を完全には再現できない。

Alec Wilson from Khon Kaen, Thailand · CC BY-SA 2.0 · Image source
zh-Hant

Ant Group傘下のInclusionAIは、Ling-3.0-flashを公開した。モデルの総パラメータ数は124Bだが、tokenごとに有効化されるのは約5.1Bにとどまる。このアーキテクチャは、既存のTransformerを単純に小型化したものではない。KDA linear attentionとMLAを5:1の比率で交互に積層し、fine-grained diagonal gatingと1/64の疎なMoEを組み合わせている。state memory、full attentionの品質、推論コストのバランスを取ることを設計目標とし、thinking modeとnon-thinking modeの両方を提供する。

公式発表によると、Ling-3.0-flashは、総パラメータ数が前世代のRing-2.6-1Tの約8分の1、有効化パラメータ数が約12分の1であるにもかかわらず、大半の社内benchmarkで同モデルに匹敵、または上回るという。このモデルはcoding、general operation、deep-research agentを対象としており、学習には1万を超えるinteractive environmentが使用された。ただし、parameter efficiencyが実サービスでの速度に直結するとは限らない。MoE routing、cross-device communication、KV state management、batch sizeの影響により、理論上のFLOPsの優位性がthroughputへ線形に反映されない可能性がある。

推論側では、SGLang HiCacheとMooncakeのhierarchical cacheも組み合わせている。prefillとdecodeを分離した2つのpool、およびclusterで共有するL3を活用し、長時間のinteractionで共通prefixが繰り返し計算されることを防ぐ。チームは、長い入力におけるtime to first tokenを60%から80%以上短縮できるとしているが、ハードウェア、workload shape、cache hit rate、比較条件の詳細はまだ公開していない。現在、このモデルはOpenRouterなどのAPIを通じてテストでき、weightsは無料APIキャンペーン終了後に公開される予定だ。今後、エンジニアリングチームは、正式なlicense、vLLM/SGLangのnative support、single-nodeで必要なVRAM、そして公開weightsでlong contextおよびagent benchmarkを再現できるかどうかを注視すべきだ。

出典

  1. 螞蟻集團發布百靈原生混合推理模型 Ling-3.0-flash
  2. Ling 3.0 Flash model endpoint
  3. Announcing Ling 3.0 Flash: Free on Kilo for a Limited Time