最新模型
Mistral Large 4 開放 API 預覽,兆級 MoE 模型在漏洞重現與修補評測取得 81.7%
Mistral 於 10 月 6 日推出 Large 4 公開預覽,採原生多模態 MoE 架構,權重預計月底釋出。獨立資安評測顯示其漏洞處理能力突出,但通過測試不代表已完整修復原始漏洞。

Mistral 於 10 月 6 日推出 Large 4 公開預覽,開發者可透過 Mistral Studio API 試用。官方公布模型約有一兆個參數,每個 token 啟用約 490 億個參數,支援原生多模態理解;權重預計月底釋出,目前仍在進行實際場景的紅隊測試。因此,這次發布提供的是託管試用入口,自行部署仍須等待權重與完整技術資料。官方公告
MoE 的技術意義在於,每次生成只動用部分專家參數,讓總容量與逐 token 計算量可以分開擴大。不過,從這種架構推論,490 億啟用參數不能直接當成整套模型的記憶體需求:部署仍須容納或調度大量專家權重,另加上下文快取與推論系統開銷。工程團隊應等待實際權重格式、量化支援與吞吐測試,再估算所需硬體。
較具體的能力證據來自 Artificial Analysis 的 CyberGym-E2E-AA:Large 4 Preview 在單次嘗試成功率取得 81.7%,居該頁所列模型首位。評測涵蓋 131 個 C/C++ 記憶體安全任務,每個專案選取一題,代理須在隔離沙箱內尋找漏洞、產生可觸發崩潰的概念驗證輸入,並修改程式碼;每題時間上限為 90 分鐘。這比單純回答資安問答,更接近需要讀取原始碼、執行工具及驗證結果的工程流程。獨立評測
但這個分數有明確邊界。成功條件是讓未修補版本崩潰、讓補丁消除該次崩潰,且原有功能測試仍通過;補丁是否修復資料集標記的真正漏洞,只記為診斷資訊,不計入主分數。因此,81.7% 不能解讀成完整漏洞修復率,也不能直接與 Berkeley 原版評測結果比較。評分方法
對準備導入資安或程式碼代理的團隊,下一步應以自家專案驗證補丁正確性,加入額外測試與人工審查,並記錄完整任務成本、失敗模式及工具權限需求。月底還需追蹤實際授權、架構細節與部署支援;Mistral 表示預覽背後的強化學習仍在進行,今日評測應視為目前版本的快照。發布進度