ホームへ戻る

最新模型

Mistral Large 4、APIで公開プレビュー開始 1兆パラメータのMoEモデルが脆弱性の再現・修正評価で81.7%を記録

Mistralは10月6日、Large 4の公開プレビューを開始した。ネイティブなマルチモーダルMoEアーキテクチャを採用し、重みは月末に公開予定。独立したセキュリティ評価では脆弱性対応能力が際立ったが、テストに合格しても元の脆弱性が完全に修正されたとは限らない。

VulcanSphere · Public domain · Image source
zh-Hant

Mistralは10月6日、Large 4の公開プレビューを開始した。開発者はMistral Studio APIを通じて試用できる。公式発表によると、モデルのパラメータ数は約1兆で、各トークンの処理時に有効化されるのは約490億パラメータ。ネイティブなマルチモーダル理解に対応する。重みは月末に公開予定で、現在も実環境を想定したレッドチームテストが進められている。したがって、今回のリリースで提供されるのはホスト型の試用環境であり、自前でのデプロイには重みと完全な技術資料の公開を待つ必要がある。公式発表

MoEの技術的な意味は、生成のたびに一部の専門家パラメータだけを使うことで、モデル全体の容量とトークンごとの計算量を別々に拡大できる点にある。ただし、このアーキテクチャから推測すると、490億という有効パラメータ数をモデル全体のメモリ要件とみなすことはできない。デプロイでは依然として大量の専門家重みを保持またはスケジューリングする必要があり、さらにコンテキストキャッシュや推論システムのオーバーヘッドも加わる。必要なハードウェアを見積もる前に、実際の重み形式、量子化のサポート、スループットのテスト結果を待つべきだ。

より具体的な能力の根拠は、Artificial AnalysisのCyberGym-E2E-AAにある。Large 4 Previewは単一試行の成功率で81.7%を記録し、同ページに掲載されたモデルの中で首位となった。評価対象はC/C++のメモリ安全性に関する131のタスクで、各プロジェクトから1問ずつ選ばれる。エージェントは隔離されたサンドボックス内で脆弱性を探し、クラッシュを引き起こす概念実証用の入力を作成し、コードを変更する。各問題の制限時間は90分だ。これは、セキュリティに関する質問に答えるだけの評価よりも、ソースコードの読み取り、ツールの実行、結果の検証を要するエンジニアリングのワークフローに近い。独立評価

ただし、このスコアには明確な限界がある。成功と判定されるには、未修正のバージョンをクラッシュさせ、パッチによってそのクラッシュを解消し、既存の機能テストにも合格する必要がある。パッチがデータセットで示された本来の脆弱性を修正したかどうかは診断情報として記録されるだけで、メインスコアには含まれない。したがって、81.7%を完全な脆弱性修正率と解釈することはできず、Berkeleyのオリジナル評価の結果と直接比較することもできない。採点方法

セキュリティやコード向けのエージェント導入を検討するチームは、次に自社のプロジェクトでパッチの正しさを検証し、追加テストと人手によるレビューを加えたうえで、タスク全体のコスト、失敗のパターン、必要なツール権限を記録するとよい。月末には実際のライセンス、アーキテクチャの詳細、デプロイ支援についても確認する必要がある。Mistralによると、プレビュー版を支える強化学習はまだ進行中だ。今回の評価は、あくまで現時点のモデルのスナップショットとして捉えるべきだ。リリース状況

出典

  1. Introducing Mistral Large 4
  2. CyberGym-E2E-AA Benchmark Leaderboard