模型與開發者平台
Gemini 3.8 Flash 強化長週期程式代理,但遷移須調整取樣與思考參數
Google 將 Gemini 3.8 Flash 正式投入生產,提供 100 萬 token 上下文、三段思考強度及內建工具,並改為 Antigravity 受管代理的預設模型。程式評測有所提升,但多數數字仍由 Google 提供,模型卡也揭露非英語安全評測相對退步。

Google 已將 `gemini-3.8-flash` 設為正式可用(GA),定位從低延遲聊天模型進一步轉向長週期軟體工程、工具編排與企業知識工作。模型接受文字、影像、音訊、影片與 PDF,具 100 萬 token 輸入視窗、最多 64K token 文字輸出,並支援函式呼叫、搜尋和電腦操作。開發者可在 `low`、`medium`、`high` 三種 thinking level 間調整品質、延遲與 token 消耗;預設為 medium,不支援 minimal。
Google 把 3.8 Flash 改為 Antigravity 受管代理與 SDK 的預設底層模型,顯示本次更新重點是多步執行,而非只提高單輪問答分數。官方稱其 DeepSWE v1.1 長週期程式工程成功率超過 70%,HLE-Verified 為 54.9%,Vals Finance Agent v2 為 61.4%。不過不同模型的成績可能沿用各供應商公布值,Google 也說新版評測流程與舊模型卡數字不一定能直接比較;OSWorld 2.0 的電腦操作表現雖較 3.7 Flash 改善,仍落後領先模型。
API 遷移不是只替換模型名稱。Google 要求移除 `temperature`、`top_p`、`top_k` 與 `candidate_count`,把數值型 `thinking_budget` 改成字串型 `thinking_level`;多輪對話應使用伺服器端 `previous_interaction_id`,函式回應則須保留呼叫識別資訊。若既有代理依賴固定取樣參數、預填模型訊息或自行管理完整歷史,升級前應以真實工具軌跡做回歸測試。
模型卡另列出偶發逾時、複雜任務主動消耗更多 token,以及知識日期依領域可能只到 2025 年初等限制。尤其值得中文團隊注意的是,Google 的自動化多語安全指標相較 3.7 Flash 惡化 5.4 個百分點;官方人工覆核認為多數損失屬誤判,但未提供逐語言拆分。年末前的輸入/輸出優惠價為每百萬 token 0.75/3.75 美元,2027 年將加倍,成本評估不宜只依目前價格。