ホームへ戻る

AI 代理/機器學習工程

ScienceFlow、実行可能なワークスペースをエージェントの記憶に統合し、75問のMLE-benchでAny-Medal率70.22%を達成

ScienceFlowは会話の要約を保存するだけでなく、コード、検証エビデンス、リソース記録、ワークスペースのスナップショットを、復元可能なStageとしてパッケージ化する。公式報告では、MLE-bench全75問でAny-Medal率70.22%を達成したが、システム間の比較は依然としてモデル、ハードウェア、時間予算の違いに左右される。

Brocken Inaglory · CC BY-SA 3.0 · Image source
zh-Hant

Huawei Noah’s Ark Labは、長時間稼働する研究エージェント[ScienceFlow](https://github.com/huawei-noah/noah-research/tree/master/ScienceFlow)をオープンソース化した。数時間、さらには数日間にわたる機械学習実験でも、増え続けるチャットコンテキストに頼って進捗を維持するのではなく、検証済みの状態から作業を再開できるようにすることが狙いだ。システム内の各研究workerは、隔離された実行可能なワークスペースを使用する。Evaluatorが正規化されたエビデンスを生成し、Stage Gateが結果を受理すると、フレームワークはコード、成果物、圧縮されたメモリ、検証記録、リソース使用状況を不変のStageとしてパッケージ化する。その後、ESTRAメカニズムは現在または過去のStageを選択し、既存の方向性を継続するか、その状態を起点に再アンカーして別の研究経路へ進むかを決定できる。

この設計は、長時間稼働するエージェントにありがちな「テキスト上では記憶しているが、実行環境には戻れない」という問題に対処する。メモリ層は直近の結果、最良の検証エビデンス、アンカーに必要な情報を保持し、古い記録は折り畳む。実行コントローラーはCPU/GPUリース、タイムボックス、停止条件を管理する。また、フレームワークは成果物の形式、評価の方向性、evaluatorをtask packageに組み込み、研究エージェントが自ら成功を宣言することを防ぐ。

[論文](https://arxiv.org/abs/2608.14354)では、全75問のMLE-benchにDeepSeek-V4-Flash-Previewを使用し、各問題につき最大2基のGPUと24時間の予算を割り当てた。3回の実行におけるAny-Medal率は70.22±1.18%で、表に掲載された既報の最強ベースラインを4.92ポイント上回った。Mediumカテゴリでは74.56%だった一方、Highカテゴリでは44.44%にとどまった。エンジニアリングチームは、Stageスナップショットの保存コスト、外部データやサービスを本当に再現できるか、過去のワークスペースを復元した際に古くなったプロンプトやデータまで引き継がれないかに注意する必要がある。著者らも、異なるtask profileをまたいで過去のワークスペースを復元しないよう明確に警告している。比較値は、リソース条件を完全にそろえた実験によるものではない。一部のベースラインは実行時間が12時間に限られ、異なるモデルを使用しているほか、Any-Medalもメダル獲得のしきい値を超えたかどうかを示す粗粒度の指標にすぎない。そのため、ScienceFlowがコストや最終的なモデル品質で全面的に優位に立つとは、現時点では直接結論づけられない。

出典

  1. ScienceFlow: A Long-horizon Agent for ML Research, Scientific Discovery and Beyond
  2. ScienceFlow source code and documentation
  3. ScienceFlow technical results page