AI 代理/機器學習工程
ScienceFlow 將可執行工作區納入代理記憶,75 題 MLE-bench Any-Medal 率達 70.22%
ScienceFlow 不只保存對話摘要,而是把程式、驗證證據、資源紀錄與工作區快照封裝成可恢復階段。官方在完整 MLE-bench 報告 70.22% Any-Medal 率,但跨系統比較仍受模型、硬體與時間預算差異影響。

華為諾亞方舟實驗室開源長時研究代理 [ScienceFlow](https://github.com/huawei-noah/noah-research/tree/master/ScienceFlow),目標是讓機器學習實驗跨越數小時甚至數日後,仍可從已驗證狀態繼續,而不是靠不斷增長的聊天上下文維持進度。系統中的每個研究 worker 使用隔離且可執行的工作區;當 Evaluator 產生正規化證據、Stage Gate 接納結果後,框架會把程式、產物、精簡記憶、驗證紀錄及資源使用封裝成不可變 Stage。ESTRA 機制之後可以選擇目前或舊 Stage,並決定繼續既有方向或從該狀態重新定錨、改走另一條研究路徑。
這種設計處理的是長時代理常見的「文字記得、環境卻回不去」問題。記憶層會保留近期結果、最佳驗證證據及定錨所需資訊,折疊較舊紀錄;執行控制器則管理 CPU/GPU 租約、時間盒與停止條件。框架也把任務的產物格式、評分方向及 evaluator 放進 task package,避免研究代理自行宣告成功。
[論文](https://arxiv.org/abs/2608.14354)在完整 75 題 MLE-bench 上使用 DeepSeek-V4-Flash-Preview、每題最多兩張 GPU 與 24 小時預算,三次執行的 Any-Medal 率為 70.22±1.18%,比表中最強已報告基線高 4.92 個百分點;Medium 類別為 74.56%,High 類別則只有 44.44%。工程團隊應關注 Stage 快照的儲存成本、外部資料與服務能否真正重播,以及恢復舊工作區是否會繼承過時提示或資料。作者亦明確警告不要跨不同 task profile 恢復舊工作區。比較數字不是完全等資源實驗:部分基線只用 12 小時、採用不同模型,Any-Medal 又只是跨過獎牌門檻的粗粒度指標,因此尚不能直接推論 ScienceFlow 在成本或最終模型品質上全面領先。