模型評測
要求 JSON 就讓 44 款模型答案趨同,結構化輸出可能改變模型判斷
一項跨 44 款語言模型的實驗發現,僅加入「以 JSON 回答」便會降低答案多樣性,無須 schema 強制或受限解碼。結果提醒開發者,結構化輸出不只是序列化層,也可能改變模型實際選擇的答案。

新研究以 44 款語言模型重跑「One-Word Census」:31 道問題各自具有大量同樣合理的單詞答案,實驗只在提示中加入「僅以 JSON 回答」,沒有啟用 JSON Schema、函式呼叫或 constrained decoding。結果顯示,在最開放的「挑一個詞」問題上,最多模型共同選擇的答案占比由 41% 升至 64%,不同答案數則由 52 個降至 36 個;平均答案驚奇度由 1.80 降至 1.58 bit。
研究進一步比較不同格式,JSON 與 XML 都顯著壓縮答案分布,YAML、CSV 則沒有同樣效果,任意括號包裝甚至使分布略為分散。使用解碼器強制 schema 後,壓縮程度沒有明顯超過單純提示,作者因此推論,偏移主要發生在模型辨識「工具或資料交換語域」時,而不是解碼器排除非法 token 所造成。部分原本選擇較獨特答案的模型回到群體眾數,顯示工具使用後訓練可能同時植入內容偏好。
對代理與批次資料管線而言,這表示聊天介面上的模型比較未必能直接代表 production API 行為。若分類、推薦、腦力激盪或合成資料流程以 JSON 收集結果,格式要求可能降低候選覆蓋率,並讓多模型系統出現更高的共同錯誤相關性。工程團隊可把自由文字、提示式 JSON 與解碼器強制 schema 分成不同評測條件,逐欄比較答案分布及準確率。不過研究使用刻意設計的單詞選擇題,尚未證明趨同會在有唯一正解的抽取、程式呼叫或複雜推理任務造成實質品質下降。