返回首頁

模型評測

22 款前沿模型的分子基準稽核:高推理強度反而更容易取回已發表數值

研究者發現,部分模型在分子性質回歸測試中可能不是預測,而是逐位重現訓練資料裡的答案。提高推理強度後,檢索跡象增加 89%,顯示推理設定本身也會改變基準污染程度。

Christiaan Briggs · CC BY-SA 3.0 · Image source
zh-Hant

分子性質基準常以平均絕對誤差等指標評估模型,但低誤差無法區分模型是從分子結構推導答案,還是記住論文與資料庫中的既有數值。新研究以 12 組分子回歸資料集稽核 22 款前沿語言模型,檢查輸出是否在數字位元層級重現已發表標籤。結果顯示污染並非均勻分布:五組資料集中,超過半數受測模型出現逐值檢索跡象;其餘資料集則只有零星命中。

團隊亦以相同分子與提示、不同推理強度重跑實驗。高推理設定被標記為檢索的次數比最低設定多 89%,意味較長的推理過程不只可能改善計算,也可能讓模型更容易喚回訓練時見過的數值。研究者再改寫 SMILES 表示法並干擾直接檢索;部分最強模型仍能辨認變換後的分子字串與原始標籤組合。當檢索受到抑制,各模型的相對預測誤差反而變得更接近,說明排行榜差距可能有一部分來自記憶量,而非分子泛化能力。

這對藥物探索與材料模型評測有直接影響。工程團隊不應只換提示或隱藏分子名稱,而應使用發表時間晚於訓練截止點的新測量值、未公開標籤,以及結構等價但文字表示不同的反事實測試;報告成績時也應固定推理強度。論文目前是預印本,沒有證明所有精確命中都源自訓練資料,也未涵蓋私有模型的完整語料,因此「檢索跡象」不能直接等同資料洩漏。下一步要看稽核方法能否在盲測資料與可控訓練模型上重現。

來源

  1. Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models
  2. Molecular Déjà Vu:研究摘要與來源證據