ホームへ戻る

模型與開發者平台

Gemini 3.6 Flash、エージェントの出力tokenを削減—3.5 Flash-Liteは350 token/sで大量のサブタスクを処理

GoogleはGemini 3.6 Flashと3.5 Flash-Liteを安定版APIとして提供し、それぞれ複雑なエージェントのメインモデルと高スループットのサブエージェントをターゲットにしている。公式データでは、token使用量、コーディングタスク、コンピュータ操作で両モデルの改善が示されているが、比較の多くはGoogleまたは提携する評価機関によるものであり、実際のワークフローでの検証がなお必要だ。

Asoundd · CC BY-SA 4.0 · Image source
zh-Hant

GoogleはGemini 3.6 FlashとGemini 3.5 Flash-Liteの安定版モデルIDを公開し、いずれもGemini APIから利用可能になった。3.6 Flashの料金は、入力100万token当たり1.50ドル、出力100万token当たり7.50ドル。Googleによると、Artificial Analysis Indexでは3.5 Flashより出力tokenが17%少なく、推論ステップとツール呼び出しも抑えながら複数ステップのタスクを完了する。公式発表では、DeepSWEのスコアが37%から49%、MLE-Benchが49.7%から63.9%、OSWorld-Verifiedが78.4%から83.0%へ向上した。エージェントサービスにとっては、無駄なツール実行ループを1回減らすだけでも、モデル料金、エンドツーエンドのレイテンシ、外部APIコストを同時に削減できる可能性があり、単に1秒当たりのtoken数を高めるより価値が大きい場合がある。

一方、3.5 Flash-Liteは、大規模な自動化とサブエージェント向けモデルと位置付けられている。第三者機関のArtificial Analysisは、出力速度を約350 token/sと測定した。API料金は、入力100万token当たり0.30ドル、出力100万token当たり2.50ドル。Googleの報告によれば、Terminal-Bench 2.1のスコアは54%で、前世代の31%を上回った。また、モデルには複数のthinking levelが用意されており、分類、検索、文書処理では推論予算を制限し、複数ステップのタスクに直面した際には推論強度を高められる。両モデルともコンピュータ操作ツールを統合しており、メインエージェントが大量の短いタスクをより安価なモデルへ割り当てやすくなっている。

ただし、開発者はベンダーのベンチマークをそのまま本番環境での信頼性に換算することはできない。DeepSWE、OSWorld、スループット測定では、プロンプト、ツール環境、同時実行数、失敗時のリトライ設定が異なる。出力tokenの減少も、計画能力が実際に改善したのではなく、単に回答が短くなった結果である可能性がある。Gemini APIでは同時に、`temperature`、`top_p`、`top_k`が非推奨とされているため、移行時にはモデル名を置き換えるだけで済ませるべきではない。構造化出力、ツール選択、長いコンテキスト、コスト分布の裾を改めてテストし、`latest`エイリアスの更新による挙動のドリフトを避けるため、安定版モデルIDを固定する必要がある。

出典

  1. Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
  2. Introducing Gemini 3.5 Flash Cyber
  3. Gemini API release notes
  4. Gemini 3.6 Flash is now available in GitHub Copilot