返回首頁

AI evaluation / scientific reasoning

物理專家重評六套 AI 基準,修正題目後 GPT‑5.6‑Sol 分數最多上升逾 50 點

一項涵蓋六套物理評測的人工稽核發現,多數被自動判錯的答案其實涉及錯誤參考解、評分器缺陷或題意不完整。修正或剔除問題後,GPT‑5.6‑Sol 在保留的 CritPt 題目達 94.4% pass@4,但這不等同原始完整榜單成績。

HTML/CSS generated by GPT-5.6 Sol (high) from a prompt by the uploader; screenshot captured by the 鈴音雨 · Public domain · Image source
zh-Hant

最新預印本召集各物理子領域的教師與研究生,重新檢查 HLE-Physics、CMT-Benchmark、CritPt、UGPhysics、PRISM-Physics 與 PHYBench 六套評測。稽核對象包括題目、官方參考解、模型回答及自動評分結果,並把失敗拆成真正推理錯誤、錯誤參考答案、評分器誤判,以及含糊或資訊不足的題目。作者報告,多數受查的初始錯誤屬於後三類,而非模型真的不會物理。

影響最大的例子是 GPT‑5.6‑Sol:HLE-Physics 的 mean@4 從 47.3% 升至 78.7%,CMT-Benchmark 從 61.0% 升至 87.2%。CritPt 原先在 70 個研究級挑戰上的 mean@5 為 32.3%;專家修正答案並排除不合格題目後,留下 54 題,mean@4 為 87.5%、pass@4 達 94.4%。這顯示精確答案或專用評分器未必可靠:符號等價、單位慣例、近似假設與題目缺漏,都可能把有效解答算成錯誤。

對模型開發者而言,結論不是「物理推理已解決」,而是許多封閉式科學基準的量測上限已受資料品質限制。評測管線應保存完整推理與評分紀錄、允許領域專家覆核,並分開回報原始全集與修正後子集;否則一次資料清理就可能造成看似跨世代的模型躍升。

94.4% 不能直接取代 Artificial Analysis 公布的 CritPt 榜單分數,因為題目集合、重試次數與指標都已改變,而且研究主要聚焦文字題與可驗證終值。真正的研究能力仍包含建模、提出假說、設計實驗及判斷未知問題;下一批基準還需採用先驗驗證的題目、版本化答案與可稽核評分器。

來源

  1. How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks
  2. CritPt Benchmark Leaderboard
  3. Evaluation Pipeline for the CritPt Benchmark