返回首頁

AI 輔助科學研究

雙代理研究系統從反覆失敗中導出 Grothendieck 常數新下界,但關鍵轉向仍由人類提出

研究團隊以推理模型、編程代理及檔案式記憶執行約 240 個研究 session,最終提出並由作者驗證 `K_G ≥ 6π/11`。系統展現強大局部證明能力,卻未自行察覺搜尋已陷入瓶頸,研究方向與成果取捨仍依賴約 40 次人類指令。

Own work with ChatGPT-5 Pro · Public domain · Image source
zh-Hant

一篇 8 月 11 日提交的案例研究,公開 AI 如何參與改進自 1953 年仍未確定精確值的 Grothendieck 常數。這個常數描述雙線性組合最佳化問題與其半正定規劃鬆弛之間最壞情況的整數差距;團隊最終把已驗證區間收窄至 `6π/11 ≤ K_G ≤ π/[2 log(1+√2)] − 3.47×10⁻⁴`,並首次確定其十分位數為 7。

研究外殼把工作拆給兩種代理:GPT-5.5-Pro、後來的 GPT-5.6-Sol 負責選擇方向、推導論證與審核主張;Claude Code 搭配 Opus、後來的 Fable 5,負責維護儲存庫、寫實驗、檢索文獻及驅動推理模型。每個 session 都沒有跨回合模型狀態,延續性改由問題說明、單一摘要檔、唯增逐字稿及實驗紀錄承擔。結束時,系統必須把主張標成已證明、數值支持、猜想或啟發式。

6 月 16 日至 7 月 24 日間,系統執行約 240 個 session、呼叫推理模型 2,091 次,消耗約 1.52 億 token,估算 API 成本為 5,400 美元。它原先反覆搜尋更好的上界,卻只記錄到非線性項與主導項之間的共同取捨,沒有主動把失敗提升為一般性障礙。人類研究者在第 18 個 session 後要求轉向下界,並進一步指示系統綜合失敗模式;代理隨後找到相關係數的仿射不等式,把高維問題化成一維高斯不等式,得到 `K_G ≥ 6π/11`。

作者已獨立檢查這項下界,但系統另產生的兩個更強下界及後續上界目前僅通過內部機器驗證,尚未列為定理;一次早期數值結果也在稽核後被撤回。這份紀錄的重要性因此不只在數學成果,而在於清楚劃出現階段長程研究代理的能力邊界:局部技術執行很強,研究判斷、失敗整合及全域狀態維護仍脆弱。

來源

  1. Long-Horizon AI Research for Grothendieck Constant
  2. Rahul Saha research page
  3. Grothendieck's Constant