返回首頁

模型與開發者平台

Gemini 3.7 Flash 主攻程式代理,LiteLLM 提醒 `minimal` 推理層級會直接回傳 400

Google 將 Gemini 3.7 Flash 推向 API、Antigravity、Android Studio及企業代理平台,並以限時半價切入高流量代理工作負載。首批整合顯示多模態、工具呼叫與跨 API 格式已可用,但推理參數和成本資料仍有遷移陷阱。

Press Information Department · Public domain · Image source
zh-Hant

Google 於 8 月 13 日推出 Gemini 3.7 Flash,定位不是縮小版聊天模型,而是承接程式編寫、多步代理與複雜知識工作的高吞吐「主力模型」。它已進入 Gemini API、Google AI Studio、Antigravity、Android Studio及企業代理平台;Gemini Spark亦改用此模型處理 Gmail、Calendar與Docs等工具流程。

對工程團隊而言,較具體的變化在介面而非產品名稱。LiteLLM確認模型可經 Google AI Studio的`gemini/`或Vertex AI的`vertex_ai/`路由呼叫,並支援`/v1/chat/completions`、`/v1/responses`、Anthropic相容的`/v1/messages`及原生`generateContent`。串流、函式呼叫、thought signatures、多輪對話,以及文字、影像、音訊和影片輸入均已接通,方便既有代理以相同閘道切換模型。

推理參數仍不能無痛照搬。LiteLLM會把OpenAI格式的`reasoning_effort`映射至Gemini `thinkingLevel`,但3.7 Flash首發不接受`minimal`,請求會回傳HTTP 400;部署前應在模型能力表做參數裁剪,而不是讓重試機制反覆送出相同無效請求。舊版LiteLLM雖可直接推理,成本追蹤須重新載入model cost map;使用本機固定成本表者至少需要`v1.98.0-dev.2`所附資料。

模型在2026年底前的推廣價為每百萬輸入、輸出token分別0.75及3.75美元,之後預定倍增。這使它特別適合大量子代理和工具迴圈,但官方所稱的程式及指令遵循增益尚需以真實儲存庫、長對話和工具失敗恢復測試驗證。團隊接下來應觀察`minimal`支援、穩定模型別名、正式成本表,以及高推理層級是否以更長輸出抵消單價優勢。

來源

  1. Introducing Gemini 3.7 Flash, our most intelligent workhorse model yet for coding and agents
  2. Day 0 support: Gemini 3.7 Flash
  3. Gemini 3.7 Flash benchmarks community thread