返回首頁

科學代理/持續學習

ScienceBuddy 交替改寫代理 Harness 與模型,將研究互動轉成持續訓練材料

ScienceBuddy 把研究者的要求、回饋與執行紀錄轉成任務及評分規則,再交替優化代理程式與模型。團隊開放簡化實驗框架,但託管工作區的完整程式碼與長期自我改進證據仍未公開。

Naray14 · CC BY-SA 4.0 · Image source
zh-Hant

PhAI Labs 與合作者發布 ScienceBuddy,試圖把科學代理從一次性問答工具改造成能隨研究工作持續調整的系統。其工作區可接收論文、表格、生物序列與科學影像,並保留規劃、工具輸入輸出及分析產物;論文描述的版本涵蓋 22 個模組、224 項工具,主要集中於基因體、分子與癌症生物學、藥理、影像及文獻檢索。

核心方法稱為「遞迴中的遞迴」。內層固定模型,從互動與驗證結果提出新的 Python harness,讓候選版本與父版本在固定驗證集上競爭;外層固定選出的 harness,以驗證器獎勵透過 SkyRL GRPO 更新任務模型。新模型再進入下一輪 harness 搜尋,因此改善的不只是權重,也包括模型可用的工具、步驟與評分程序。

公開實驗採 Qwen3.5-4B,資料切成 715 個訓練、90 個驗證及 90 個測試任務,共跑三輪 harness/RL 循環;每個 harness 階段只有三步、每步 16 次互動與三個候選,RL 階段則進行 30 次 GRPO 更新。這使研究者能檢查雙層迴圈如何交接狀態,而非只看到產品展示。

限制也相當關鍵。開源倉庫只包含 Simple-SciBuddy、執行代理、驗證器與訓練介面,沒有託管工作區前端、帳戶系統及完整產品 API;實驗使用凍結資料與模擬回饋,尚未證明它能在真實實驗室中安全地長期學習。若實際把未發表資料與研究者回饋納入訓練,工程團隊還需釐清資料所有權、污染、回滾及評分器漂移。下一步應觀察完整基準成績、跨領域重現,以及每次自我修改能否留下可稽核版本。

來源

  1. ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
  2. ScienceBuddy Technical Report
  3. Gen-Verse/ScienceBuddy