GitHub Repo
Ollama 0.34.3 候選版公開模型思考選項,減少代理端硬編碼設定
新版讓模型資訊介面回傳支援的思考等級與預設值,改善客戶端自行維護設定表的問題。版本仍在預發布階段,其他中繼資料缺口與文件差異仍需核對。

Ollama 於 9 月 19 日發布 0.34.3-rc1,讓模型資訊端點 `/api/show` 回傳支援的思考選項與預設值。發布說明以 GLM-5.3-Flash 雲端模型示範:`thinking.values` 列出 low、high、max,`thinking.default` 為 max。代理或聊天介面因此有了可查詢的設定依據,能依模型建立選單。[發布說明](https://github.com/ollama/ollama/releases/tag/v0.34.3-rc1)
這項變更回應了實際整合痛點。9 月 11 日,一名 Pi 擴充套件開發者在 issue 中指出,既有介面只標示模型是否具備思考能力;為取得可接受的等級,他必須載入第三方資料、維護預設對照表,甚至故意傳入錯誤參數,從錯誤回應反推選項。這類做法容易隨模型更新失效,新欄位可減少其中一部分維護工作。[開發者回報](https://github.com/ollama/ollama/issues/18385)
思考設定也不能跨模型直接套用。官方文件說明,請求使用 `think` 欄位,部分模型接受布林值或強度等級;GPT-OSS 則接受 low、medium、high,傳入布林值會被忽略。回應中的思考內容與最終答案分開,隱藏思考文字也不等於停止這段生成。就工程設計而言,客戶端應依查得的選項驗證輸入,並將顯示偏好與推論設定分開管理。[思考功能文件](https://docs.ollama.com/capabilities/thinking)
文件仍有一處需注意:發布說明把端點寫成 GET,但附上的 curl 範例使用會送出 POST 的資料參數,正式 API 文件也標示 POST。整合時應依正式介面送出模型名稱,不能只照發布摘要改動 HTTP 方法。[端點文件](https://docs.ollama.com/api-reference/show-model-details)
對評測管線而言,這也增加一個可記錄的條件:除了模型名稱與伺服器版本,團隊還可保存查得的預設值及實際送出的設定。若上游調整預設思考強度,只比較速度或帳單,可能把設定差異誤認為模型退步。因此,導入測試仍應固定任務、輸入及思考設定,再觀察延遲與品質。
目前版本仍屬候選版。此次說明沒有宣告價格、快取費率或最大輸出長度等其他中繼資料需求全部完成;同版雖也加入 Apple Silicon 上以 MLX 執行 Nemotron H 視覺模型的支援,卻未提供效能數字。接下來值得驗證的是本機與雲端模型回傳是否一致、舊伺服器缺少欄位時如何降級,以及設定是否確實反映到生成行為。[版本變更](https://github.com/ollama/ollama/releases/tag/v0.34.3-rc1)