返回首頁

模型與開發者平台

Gemini 3.6 Flash 降低代理輸出 token,3.5 Flash-Lite 以 350 token/s 承接大量子任務

Google 將 Gemini 3.6 Flash 與 3.5 Flash-Lite 推向穩定 API,分別瞄準複雜代理主模型與高吞吐子代理。官方數據顯示兩者在 token 用量、程式任務和電腦操作上進步,但比較多由 Google 或合作評測方產生,仍需以真實工作流驗證。

Asoundd · CC BY-SA 4.0 · Image source
zh-Hant

Google 發布 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 的穩定模型 ID,兩者已可由 Gemini API 使用。3.6 Flash 的價格為每百萬輸入、輸出 token 1.50 與 7.50 美元;Google 表示,它在 Artificial Analysis Index 比 3.5 Flash 少產生 17% 輸出 token,也用更少推理步驟及工具呼叫完成多步任務。官方列出的 DeepSWE 成績由 37% 升至 49%,MLE-Bench 由 49.7% 升至 63.9%,OSWorld-Verified 則由 78.4% 升至 83.0%。對代理服務而言,少一次無效工具迴圈可能同時降低模型費用、端到端延遲與外部 API 成本,比單純提高每秒 token 更有價值。

3.5 Flash-Lite 則被定位成大量自動化和子代理模型。第三方 Artificial Analysis 測得約每秒 350 個輸出 token,API 定價為每百萬輸入 0.30 美元、輸出 2.50 美元。Google 報告其 Terminal-Bench 2.1 為 54%,高於前代的 31%;模型也提供不同 thinking level,讓系統在分類、搜尋或文件處理時限制推理預算,遇到多步任務再提高強度。兩款模型均整合電腦操作工具,方便主代理將大量短任務分派給較便宜的模型。

開發者仍不能把供應商基準直接換算成生產可靠度。DeepSWE、OSWorld 與吞吐測量的提示、工具環境、併發度和失敗重試設定不同,輸出 token 減少也可能來自回答縮短,而非規劃真正改善。Gemini API 同時將 `temperature`、`top_p`、`top_k` 標成棄用,遷移時不應只替換模型名稱;應重新測試結構化輸出、工具選擇、長上下文及成本尾端分布,並固定穩定模型 ID,避免 `latest` 別名更新造成行為漂移。

來源

  1. Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
  2. Introducing Gemini 3.5 Flash Cyber
  3. Gemini API release notes
  4. Gemini 3.6 Flash is now available in GitHub Copilot