GitHub Repo
Ollamaコミュニティ、Qwen GGUFで思考レベルが反映されず、低強度設定でも既定値が使われる可能性を報告
Ollama 0.35.0のコミュニティ報告によると、特定のQwen3.8 GGUFでは低強度の思考設定を指定しても、テンプレートの既定値であるxhighが使われる可能性がある。公式ドキュメントはモデルのメタデータに基づいてサポート対象の値を選ぶよう求めている。テンプレートの機能とAPI制御が一致しているかは、引き続き確認が必要だ。

Ollamaの人気リポジトリでは10月3日、思考制御に関する報告が追加された。報告者はOllama 0.35.0でQwen3.8 27B GGUFを読み込み、/api/chat に think: "low"、"medium"、または "high" を指定したが、思考が有効な場合に近い挙動が続いたという。出力に明確な変化が見られたのは false を指定した場合だけだった。これは特定環境でのコミュニティ報告であり、同種のモデルすべてに影響があると判断するには、現時点で十分な証拠がない。問題報告
報告に添付されたチャットテンプレートは、reasoning_effort で強度を決める。既定値は xhigh で、受け付ける値は xhigh、medium、low だ。報告者は、リクエストの think レベルがテンプレートに渡されていない可能性を指摘している。手動で reasoning_effort="low" を使ってプロンプトをレンダリングし、/api/generate の raw: true 経由で送ったところ、類似したプロンプトでは思考内容が短くなったという。ただし、この比較だけでは原因を証明できず、APIの high とテンプレートの xhigh が同等だとも断定できない。テンプレートと比較テスト
現行の公式ドキュメントは、重要な前提を示している。思考制御はモデルごとに異なるため、まず /api/show を呼び出し、thinking.values と既定値を確認したうえで、完全に一致する値を使う必要がある。また、メタデータからレベルを解決するモデルでは、未対応の値を指定するとモデルの既定値が使われる。したがって、GGUFのテンプレートにレベル別の機能があるだけでは、Ollamaがそれをリクエスト設定として公開していることの証明にはならない。思考制御のドキュメント
エンジニアリングチームにとって、このような不一致は、エージェントの処理フローで想定以上のレイテンシや生成量につながる可能性がある。これはデプロイ上の推論であり、広く発生していることが定量的に確認されたわけではない。検証では、モデルのメタデータ、テンプレートのバージョン、実際の思考出力をあわせて保存し、ウォームアップ後に各レベルを繰り返し比較するとよい。生成トークン数と所要時間も記録する。OllamaのチャットAPIは eval_count、eval_duration、load_duration を返し、モデル読み込みと生成のコストを切り分けるのに役立つ。APIフィールドの説明
今後は、上流がメタデータの認識またはテンプレートパラメーターのマッピングに関する問題を確認するか、サポート値の案内や回帰検証を追加するかが注目点となる。確認時点で、このissueはオープンのままで、ページに関連する修正は記載されていない。正式な影響範囲と解決策は、引き続き確認が必要だ。issueの状態