ホームへ戻る

AI 代理與自動化研究

グローバルなデバッグメモリでAutoResearchエージェントの同じ失敗の繰り返しを防止、AIDEの金メダル獲得実行は22回から38回に増加

研究者らは、GPT‑5‑miniと2時間の予算を固定した条件下で、デバッグアドバイザーに探索ブランチ間で実行環境の制約を共有させ、AIDEの90回の実行すべてで有効な提出を生成させた。この結果は、エージェントの外側の仕組みには依然として回収可能な計算資源が大量に残されていることを示すが、実験対象は9件の表形式予測コンペティションに限られる。

Earthpig · CC BY-SA 3.0 · Image source
zh-Hant

自動研究エージェントに不足しているのは、必ずしもモデルの能力とは限らない。同じエラーを何度も修正することに計算資源を浪費している可能性もある。8月11日に公開された[研究](https://arxiv.org/abs/2608.10424)では、AIDE、ML‑Master、MLEvolveの探索プロセスを調査し、異なるコードブランチが互いに分離されていることを明らかにした。あるブランチがパッケージのバージョン、カラム形式、実行環境の制約を特定しても、ほかのブランチは同じ問題に再び遭遇する。

チームは「グローバルデバッグアドバイザー」を導入し、確認済みのランタイム制約と修正経験をブランチ横断メモリに記録して、エージェントが次のコードを生成する前に関連情報を注入した。9件のMLE‑bench/Kaggle表形式データタスクについて、それぞれ10個のシードで実行したところ、AIDEの有効な提出は73/90件から90/90件に増加した。人間のリーダーボードで上位10%に相当する金メダル獲得実行は22回から38回に増え、ML‑Masterでも18回から29回に増加した。AIDEの探索ログにおける重複エラーの割合は46%から7.8%に低下し、正常に実行できるノードの割合は54.7%から79.0%に上昇した。

研究では、ハイパーパラメータチューニングを明示的に指示する手法や、より硬直的なノード選択をThompson samplingとバックトラッキングの組み合わせで置き換える手法もテストした。一方、探索的データ分析(EDA)の結論に意図的に誤りを混入させても、その後のモデル選択が変わらない場合が多かった。これは、エージェントが分析プロセスを表面的に模倣しているだけである可能性を示している。

AutoMLと研究エージェントのエンジニアリングにとって、この研究が示唆するのは、エラーメモリ、探索ポリシー、予算管理を第一級のシステムコンポーネントとして扱うべきだということだ。[公開コード](https://github.com/tingtang2/autoresearch-compute-recovery/tree/main)には処理群と対照群のコマンドが含まれているが、メンテナーは、一部のワークフローでは構文と配線の検証のみが完了しており、そのcheckout上でエンドツーエンドの再実行はまだ行われていないと注記している。また、主要な実験はすべてGPT‑5‑mini、表形式データ、固定されたCPU時間制限のみを使用しており、その結果を深層学習の訓練、科学シミュレーション、より高性能なモデルへ直接一般化することはできない。

出典

  1. Recovering Wasted Compute in Autoresearch Agents
  2. autoresearch-compute-recovery:論文實驗程式