ホームへ戻る

模型、代理與資安

Gemini 3.8 Flash、高強度のエージェント推論へ転換──Cyber版は審査制で脆弱性修正能力を提供

GoogleはGemini 3.8 Flashを正式に本番環境向けとして提供し、100万tokenのコンテキスト、調整可能な推論強度、新たなAPI移行要件を導入した。共通のコアを持つFlash Cyberは脆弱性の発見と自動修正に特化するが、審査を通過した防御側の利用者にのみFairwindプログラムを通じて提供される。

Gciriani · CC BY-SA 4.0 · Image source
zh-Hant

Googleは9月2日、Gemini 3.8 Flashと、利用が制限された3.8 Flash Cyberを発表した。通常版のモデルIDは`gemini-3.8-flash`で、すでにGA(一般提供)に達している。100万tokenのコンテキスト、最大64K tokenの出力、low、medium、highの3段階の推論強度をサポートする。GoogleはこれをAntigravityのマネージドエージェントのデフォルトモデルに設定しており、その位置付けは低レイテンシのチャットから、長期間にわたるソフトウェアエンジニアリング、反復的なツール呼び出し、企業データのワークフローへと明確に移行している。

このアップグレードには代償もある。モデルは意図的に、より多くの小さな推論ステップを踏み、ツールを繰り返し呼び出して結果を検証するため、難易度の高いタスクではtoken消費量が増える可能性がある。APIの暫定価格は年末まで、入力100万token当たり0.75米ドル、出力100万token当たり3.75米ドルで、2027年からは倍増する。エンジニアリングチームは、1回当たりのtoken単価だけでエージェントのコストを見積もるべきではない。移行も単なるモデル名の変更ではない。公式要件では、`temperature`、`top_p`、`top_k`、`candidate_count`を削除し、`thinking_budget`を文字列型の`thinking_level`に置き換える必要がある。マルチターンの状態管理にはサーバー側の`previous_interaction_id`を使用し、関数レスポンスのフィールドも再確認しなければならない。

Flash Cyberは同じ基盤インテリジェンスを使用しているが、脆弱性の探索と修正に最適化されている。Googleの報告によると、CWE-Benchにおけるpass@1は47.2%で、同社が示したトップモデルの47.8%に迫る。社内で20種類のプログラミング言語を対象に実施したテストでは成功率が70%を超え、Chromeチームが得た正しい修正の件数は、大規模な商用モデルの2.6倍だった。安全上の制限が比較的緩和されているため、Cyber版はFairwindプログラムを通じて、政府機関、重要インフラ事業者、ソフトウェアメンテナーにのみ提供される。

これらの成果の大半はGoogleまたはそのパートナーによって得られたもので、社内データセットも公開されていない。モデルカードでは、タイムアウト、ハルシネーション、token消費量の増加が発生する可能性も認めている。また、多言語の安全性に関する自動評価では、3.7 Flashと比べてわずかに後退した。中国語を扱うチームは、公式ベンチマークの順位をそのまま採用するのではなく、プロンプトインジェクション、関数呼び出しの形式、タスク全体のコストを優先的に再検証すべきだ。

出典

  1. Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
  2. Gemini 3.8 Flash Model Card
  3. Google releases Gemini 3.8 Flash, its third Flash model in six weeks