AI 基礎設施
Groq 免費與 Developer 層停用兩款 Llama 端點,替代模型不是透明別名
Groq 已於 8 月 16 日在 Free 與 Developer 方案停用兩款 Llama 端點,舊模型 ID 現會回傳錯誤。官方建議改用 GPT-OSS 或 Qwen,但跨模型家族遷移意味工具呼叫、結構化輸出與提示行為都須重新驗證。

Groq 的退役時程已正式生效:`llama-3.1-8b-instant` 與 `llama-3.3-70b-versatile` 自 8 月 16 日起不再供 Free、Developer 方案呼叫;使用承諾消費合約的 Enterprise 客戶暫不受影響。這次不是由伺服器把舊名稱靜默導向新版,仍傳送原模型 ID 的線上服務、批次工作或備援路由會直接收到錯誤。
官方把 8B 端點的建議替代品列為 `openai/gpt-oss-20b`,70B 則可遷往 `openai/gpt-oss-120b` 或 `qwen/qwen3.6-27b`。然而這些模型並非 Llama 的等價升級:GPT-OSS 具有不同的推理強度與工具使用慣例;Qwen3.6-27B 的原始模型卡則描述了混合架構、原生 262,144 token 上下文及多模態能力,但 Groq 實際開放的輸入型別、上下文上限與服務參數仍應以其端點文件為準。
工程團隊除了替換模型字串,還應重跑 JSON schema、函式參數、停止字串、系統提示、串流事件及最大輸出長度測試。依賴特定 tokenizer 的成本估算、提示截斷與快取鍵也可能改變;模型允許清單、監控維度及故障轉移設定同樣需要更新。由於退役公告早在 6 月發布,這次的新聞點是關閉期限已到。下一步應觀察 Groq 是否為企業合約另訂退役日期,以及替代端點在高併發下的延遲、限流與輸出相容性。