代理與科學 AI
ScienceIDE 將科學程式封裝成可驗證代理環境,並以數值模擬結果直接回饋訓練
ScienceIDE 把固定版本的科學軟體、容器、物理案例與私人驗證器組成 SFT、RL 及評測共用環境。首批結果顯示科學修復軌跡可改善部分模型與基準,但目前只公開少數環境和任務,泛化證據仍有限。

PhAI Labs 等團隊發布 ScienceIDE,嘗試把散落於科研程式庫中的領域知識轉成代理可執行、可評分的學習環境。每個任務固定上游程式版本並放入容器;代理修改原始碼後,驗證器重新編譯、執行物理案例,再將數值輸出與參考結果或不變量比較。獎勵因此取決於模擬是否恢復正確,而不是 patch 是否與作者答案逐字相同。
論文建立 64 個環境,取自 27 套科學程式,合計製造 2,812 項任務與 1,076 項數值或物理檢查;其中絕大多數仍是修復及缺失函式重建,只有兩項效能加速任務。公開評測 ScienceIDE-Hard 包含 85 項天文流體、電漿、海洋與粒子模擬任務。十五個模型—代理組合各獲一小時,其中最佳觀測成功率為 67.1%,但作者明確提醒榜首只執行一次,且其他前段系統的信賴區間重疊。
團隊另用通過驗證的互動軌跡微調 4B、9B、72B 模型,並以容器驗證器作為多輪 RL 的結果獎勵。值得注意的是,直接把超出 token 或回合預算的軌跡當失敗,會誘使模型縮短回應而非完成較難修復;ScienceIDE 將截斷軌跡保留在 group baseline、但從 policy loss 遮蔽,才避免訓練崩潰。30 步後,4B 模型在兩組小型 held-out 任務的平均 shaped reward 分別由 0.357 升至 0.857、由 0.286 升至 0.571。
目前 GitHub 僅公開 64 個環境中的 15 個,以及 85 項 hard task 中的 30 項;完整任務庫與製作管線仍保留。工程價值在於它提供了科學代理、SFT 與 RL 共用的可執行契約,但是否能跨越既有程式庫、不同科學領域及更開放的發現任務,仍需第三方重現。