返回首頁

AI 安全與評測

Anthropic 測試微調式「說謊偵測器」:域內 AUROC 升至 0.95,換一類謊言便跌至約 0.70

研究團隊用八個開放模型家族產生約 20 萬筆受壓情境資料,再以 LoRA 訓練模型判斷自己是否說謊。偵測器主要學到諂媚、能力否認等表面模式,面對未見類型時僅略勝提示式基線。

Прикли · CC0 · Image source
zh-Hant

Anthropic Fellows 與 MATS 研究人員測試一個看似直接的安全方案:讓模型在產生受壓回應後,回答自己是否說謊,再把這項判斷微調成二元分類器。資料涵蓋八個模型家族與十二種誘發設定,包括事實矛盾、諂媚、能力隱瞞、棋力降級及不忠實推理;團隊先在中性提示下記錄模型所稱的信念,再加入角色、威脅或利益壓力,檢查答案是否矛盾及被質疑後會否堅持。約四分之一候選標籤經 GPT-5 複核後被改寫,已顯示「說謊」與混亂、角色扮演或信念改變之間難以劃線。

研究以 Gemma 3 系列進行 LoRA 微調,rank 16、alpha 32、dropout 0.05,每個資料折約五千例、最多訓練五個 epoch。域內 AUROC 從 0.60 升至 0.95;但把一半謊言類型留作測試時,AUROC 只約 0.70 至 0.75,增加訓練步數也未消除落差。轉移效果多由表面相似度決定:ASCII 能力否認可部分轉移至棋力隱瞞,事實謊言卻不能可靠偵測角色扮演。第三人稱提示通常又比要求模型自我承認更準;Qwen3-235B 的零樣本提示甚至達 0.98 至 0.99,令大型專用偵測器的增益難以判定。

工程含義是安全分類器不能只以同分布分數上線。部署評測應按故障機制、提示格式和未見領域切割,另設拒判與人工覆核通道。公開資料集含 13.6 萬筆訓練列及多個測試折,可用來重做交叉類型測試;但結果只涵蓋受控情境、LoRA 與特定 Gemma/Qwen 模型,沒有證明偵測器能處理實際代理中的獎勵欺騙或長程策略性隱瞞。

來源

  1. Fine-Tuned Lie Detectors Failed to Generalize
  2. Noddybear/lies dataset