開放模型與評測
Ling‑3.0‑flash‑VL 補齊低精度權重,獨立評測卻與官方 42 分不可直接對照
InclusionAI 的 124B 多模態 MoE 已新增 FP8、FP4 與 INT4 權重及可執行的 SGLang 配方,將影像、影片和工具呼叫納入同一模型。Artificial Analysis 最新獨立測試得到 25 分,與模型卡宣稱的 42 分採用不同版本評測,部署者不應把兩者視為同一尺度。

Ling‑3.0‑flash‑VL 的發布面在週末變得較完整:除 MIT 授權的 BF16 權重外,InclusionAI 已上架 FP8、FP4 與 INT4 版本,模型卡亦改用經驗證的 SGLang 啟動配方。模型共有 124B 參數,但稀疏 MoE 每個 token 只啟用約 5.5B;視覺端由 ViT 擷取影像與影片特徵,再經兩層 MLP 投影至語言表示。42 層主幹以 5:1 比例交錯 KDA 與 Gated MLA,VideoRoPE 同時編碼空間位置和時間順序,標示的最大上下文為 256K token。
實際部署仍不是「5.5B 模型」的硬體成本。官方 BF16 配方建議使用四張約 141GB 等級 GPU,80GB H100/H800 則需擴至八張;SGLang 透過 YaRN 把原始 131K 位置範圍延伸至 262,144,並自動選用 Ling3 reasoning 與 tool-call parser。vLLM 路徑目前要求安裝 InclusionAI 的專用分支及 `trust-remote-code`,升級、供應鏈審查和與上游 vLLM 的相容性都應列入部署檢查。
評測資料出現值得追蹤的落差。官方模型卡宣稱在 Artificial Analysis Intelligence Index v4.1.1 得到 42 分;Artificial Analysis 現時以 v4.3 獨立列出的成績則為 25,並記錄約 140.7 token/秒、1.78 秒首 token 延遲及高達 1.6 億個評測輸出 token。兩個分數使用不同版本、題組與執行條件,不能直接解讀成模型退步或官方數字被推翻;速度也來自 InclusionAI API,而非自行架設的量化 checkpoint。工程團隊下一步應等待同版本重測,並比較 BF16、FP8、FP4、INT4 在影片理解、GUI 操作、工具呼叫格式與長上下文下的品質及記憶體實測。