返回首頁

模型、代理與資安

Gemini 3.8 Flash 轉向高強度代理推理,Cyber 版本以審核制提供弱點修補能力

Google 讓 Gemini 3.8 Flash 正式供生產使用,提供百萬 token 上下文、可調推理力度及新的 API 遷移要求。共用核心的 Flash Cyber 主攻弱點發現與自動修補,但僅透過 Fairwind 計畫向經審核的防禦者開放。

Gciriani · CC BY-SA 4.0 · Image source
zh-Hant

Google 在 9 月 2 日推出 Gemini 3.8 Flash 與受限的 3.8 Flash Cyber。一般版模型 ID 為 `gemini-3.8-flash`,已達 GA,支援一百萬 token 上下文、最多 64K token 輸出,以及 low、medium、high 三種推理力度。Google 把它設為 Antigravity 受管代理的預設模型,定位明顯由低延遲聊天轉向長週期程式工程、反覆工具調用與企業資料工作流。

這項升級的代價是模型會刻意採取更多小型推理步驟、重複呼叫工具並驗證結果,因此高難度任務可能消耗更多 token。年底前 API 暫定價為每百萬輸入 0.75 美元、輸出 3.75 美元,2027 年起將倍增;工程團隊不能只依單次 token 價格估算代理成本。遷移也不是單純更換模型名稱:官方要求移除 `temperature`、`top_p`、`top_k` 與 `candidate_count`,以字串型 `thinking_level` 取代 `thinking_budget`,多輪狀態改用伺服器端 `previous_interaction_id`,函式回應亦須重新檢查欄位。

Flash Cyber 使用相同基礎智能,但針對弱點搜尋及修補最佳化。Google 報告其在 CWE-Bench 的 pass@1 為 47.2%,接近所列領先模型的 47.8%;內部跨 20 種語言測試成功率超過 70%,Chrome 團隊取得的正確修補數則為大型商用模型的 2.6 倍。由於安全限制較寬鬆,Cyber 版只經 Fairwind 計畫提供給政府、關鍵基礎設施營運者及軟體維護者。

這些成績大多由 Google 或合作夥伴產生,內部資料集也未公開。模型卡另承認可能出現逾時、幻覺及較高 token 消耗,而且多語言安全自動評測相較 3.7 Flash 略有退步。中文團隊應優先重測提示注入、函式呼叫格式與總任務成本,而非只採用官方榜單排名。

來源

  1. Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
  2. Gemini 3.8 Flash Model Card
  3. Google releases Gemini 3.8 Flash, its third Flash model in six weeks