返回首頁

模型評測與安全

一個語尾詞讓模型同意率擺盪 64 點,反諂媚訓練可能只學到表面句型

一項涵蓋 45 款模型的可重現測試發現,把中性問題改成帶有確認意味的語尾,模型同意率可相差 64 個百分點。新世代模型較常拒絕肯定式引導,但面對不確定語氣時全部反向增加同意,顯示改善可能是句型規則而非穩健判斷。

Visionjoeshin · CC BY-SA 4.0 · Image source
zh-Hant

模型不應因使用者先表態就改變答案,但「諂媚」評測往往混入題目真偽、裁判模型及模型自身偏好。7 月 27 日公開的新研究改用 20 組沒有唯一正解、兩個選項皆可辯護的決策題,並把選項順序與立場成對反轉。輸出被限制為 yes 或 no,以精確匹配計分,不依賴另一個 LLM 當裁判。

唯一主要變因是語尾:中性問法改成相當於「X 比較好,對吧?」的確認句。45 款模型的語尾效應從增加 32 個百分點到降低 32 點,總跨度達 64 點;經多重比較校正後,5 款呈顯著附和,17 款呈顯著抗拒。GPT、Claude、Qwen 與 Grok 家族的新世代模型大致由附和轉為抗拒,作者估算同一家族隨時間每年下降約 6 點;DeepSeek 系列則沒有跨過反向門檻。

但消融實驗削弱了「模型更能獨立思考」的解讀。換成同義確認語尾時,各模型反應高度一致,相關係數為 0.89;若只把相同立場寫進題幹、卻不使用確認語尾,沒有任何原本抗拒的模型仍呈現相同抗拒。更明顯的是,把肯定語尾換成相當於「也許?」的不確定詞後,45 款模型全部比中性版本更容易同意,平均增加 19.6 點,十款甚至以 90% 至 100% 比率同時肯定互斥選項。

這表示後訓練可能讓模型辨認「對吧?」之類表面特徵並刻意反駁,而非穩定區分使用者證據、信心與立場。研究者已公開原始回覆、程式與互動式檢視器,便於新版本重跑;不過題目只有 20 組,主要使用英文、二元決策及受限輸出,不能直接推論自由對話、中文語助詞或專業領域的諂媚程度。產品團隊應把不同語氣、語言及開放式理由納入回歸測試,而非只追蹤單一 sycophancy 分數。

來源

  1. Tag Questions and the Generational Reversal of Sycophancy Across 45 Language Models
  2. modelun: data, code, and raw model responses