代理與科學 AI
ScienceIDE、科学コードを検証可能なエージェント環境にパッケージ化し、数値シミュレーション結果を訓練へ直接フィードバック
ScienceIDEは、バージョンを固定した科学ソフトウェア、コンテナ、物理ケース、非公開の検証器を組み合わせ、SFT、RL、評価で共有できる環境を構築する。初期結果では、科学コードの修復軌跡が一部のモデルとベンチマークを改善できることが示されたが、現時点で公開されている環境とタスクは少なく、汎化を裏付ける証拠は依然として限定的だ。

PhAI LabsなどのチームはScienceIDEを発表し、科学研究用コードベースに点在するドメイン知識を、エージェントが実行でき、採点可能な学習環境へ変換することを試みた。各タスクでは上流コードのバージョンを固定し、コンテナに格納する。エージェントがソースコードを修正すると、検証器が再コンパイルして物理ケースを実行し、その数値出力を参照結果または不変量と比較する。したがって報酬は、patchが作成者の解答と一字一句同じかどうかではなく、シミュレーションが正しい状態に復旧したかどうかで決まる。
論文では、27種類の科学ソフトウェアから64の環境を構築し、合計2,812件のタスクと1,076件の数値的または物理的チェックを作成した。ただし、その大半は依然としてバグ修正と欠落関数の再実装であり、性能高速化タスクは2件しかない。公開評価セットScienceIDE-Hardには、天体流体、プラズマ、海洋、粒子シミュレーションに関する85件のタスクが含まれる。15通りのモデルとエージェントの組み合わせにはそれぞれ1時間が与えられ、観測された最高成功率は67.1%だった。ただし著者らは、首位のシステムについては1回しか実行しておらず、ほかの上位システムの信頼区間とも重なっていると明確に注意を促している。
チームはさらに、検証を通過したインタラクション軌跡を用いて4B、9B、72Bモデルをファインチューニングし、コンテナ内の検証器をマルチターンRLの結果報酬として使用した。注目すべき点として、token数またはターン数の予算を超えた軌跡をそのまま失敗として扱うと、モデルは難しい修復を完了するのではなく、応答を短くするよう促されてしまう。ScienceIDEでは、打ち切られた軌跡をgroup baselineには残しつつ、policy lossからマスクすることで、ようやく訓練の崩壊を回避した。30ステップ後、4Bモデルの平均shaped rewardは、2つの小規模なheld-outタスク群で、それぞれ0.357から0.857、0.286から0.571へ上昇した。
現在GitHubで公開されているのは、64環境のうち15環境と、85件のhard taskのうち30件のみであり、完全なタスクライブラリと作成パイプラインは依然として非公開だ。エンジニアリング上の価値は、科学エージェント、SFT、RLが共有できる実行可能な契約を提供したことにある。一方、既存のコードベースや異なる科学分野を越えて、よりオープンな発見タスクにも汎化できるかどうかについては、今後の第三者による再現が必要だ。