返回首頁

AI 研究與科學代理

Fisher-R1 以可驗證 p 值訓練統計代理,P-Hard 嚴格 pass@1 達 33.0%

P-Bench 要求代理自行選擇統計方法、執行 R 程式並回報 p 值,不再只檢查程式能否執行。14B 模型在困難題的嚴格指標領先所列開放模型,但目前公開儲存庫仍只有說明文件。

Kolossos · CC BY-SA 3.0 · Image source
zh-Hant

科學代理即使能寫出可執行程式,仍可能因選錯統計檢定而產生精確但無效的結論。史丹佛與威斯康辛大學團隊提出的 [P-Bench](https://arxiv.org/abs/2608.07437) 專門測量這個缺口:425 項任務取自經濟學、生物與醫學的真實資料,代理只取得研究問題、資料說明及 CSV,必須自行探索資料、選擇方法、執行 R 程式,再提交 p 值與拒絕或不拒絕虛無假設的決策。

題目涵蓋 17 類方法,包括 Cox 迴歸、工具變數、混合效應與非參數檢定;困難組另加入離群值、異質變異及群聚觀測等陷阱。評測的 Raw 指標只看結論方向,Strict 還要求回報 p 值換算後的雙尾 z 分數與參考答案相差小於 0.5,因此較難靠猜測顯著與否過關。

Fisher-R1 以 Qwen2.5-Coder-7B/14B 為骨幹,先用 3,851 條篩選後軌跡做監督微調,再以 8,642 項合成統計任務進行 DAPO。其獎勵有 90% 取決於 p 值接近程度、10% 檢查結論,並要求軌跡包含可執行程式。14B 版本在 P-Hard Strict 的 pass@1 為 33.0%,高於 DeepSeek V4 Pro 的 26.3%與 GPT-5.4 的 30.5%;7B 版本則把骨幹在 P-Easy Strict 的 36.3%提高至 65.7%。

工程上值得注意的是,獎勵並未直接驗證「方法是否正確」,而是假設不恰當的方法通常會導致不同 p 值;面對多種同樣合理的分析策略時,單一標準答案仍可能過窄。此外,[公開儲存庫](https://github.com/jmu27/FisherR1) 截至查核時只有一個 README,尚未提供論文所稱的權重、P-Bench 資料、訓練程式或授權。下一步應觀察完整資產能否重建數字,以及模型在預先註冊、複合終點與多重比較等更真實工作流程中的可靠性。

來源

  1. Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing
  2. FisherR1 public repository