返回首頁

科學 AI 與代理

SciDataSailor 讓代理直接探索科學資料庫,9B 模型 Pass@1 由 14.01 升至 28.99

SciDataSailor 以蒙地卡羅樹搜尋合成可執行的檔案探索軌跡,並公開逾 2,300 筆監督資料。Qwen3.5-9B 微調後在受限步數測試中減少試錯,但部分評分仍仰賴 LLM 裁判。

Plumbago · CC BY-SA 4.0 · Image source
zh-Hant

多數科學問答基準把整理好的文字或表格直接交給模型,沒有測量代理能否在陌生資料庫中找到檔案、推斷 schema、對齊識別碼並實際計算。SciDataSailor 將這些步驟組成「深度科學資料探索」任務:代理只能在受控沙箱內呼叫 Python,不能使用網路搜尋或外部檢索,所有結論都應來自讀檔與程式執行結果。

團隊以蒙地卡羅樹搜尋合成訓練軌跡。系統先按難度選取探索意圖,再以執行結果與回饋調整首次探索優先度,將高階策略展開成具體工具動作,並依分支不確定性分配搜尋量;無法執行、資訊量不足或缺乏證據的軌跡會被過濾。公開的 SciDataSailor-SFT-2K 實際包含 1,102 條資料庫概覽軌跡與 1,225 組定向問答,涵蓋生命、地球及物理科學。

配套基準使用 27 個原始資料集,包含 627 項後設資訊整理及 586 項科學問答。以這批軌跡微調 Qwen3.5-9B 後,在 12 步限制下的資料庫概覽 Pass@1 由 14.01 提高至 28.99,完成率由 49.76% 升至 96.14%,平均步數則由 10.21 降至 6.24。這表示軌跡監督主要教會小模型更快決定要檢查哪些檔案,而不只是增加領域知識。

結果同時暴露評測預算的重要性。DeepSeek-V4-Pro 的概覽 Pass@1 在步數上限由 12 增至 24 後,從 16.43 升至 52.66;專有模型通常較早找到有效路徑,部分開放模型則靠更多試錯追回差距。工程上比較科學代理時,因此必須連同工具呼叫上限、token、錯誤恢復及沙箱設定一起報告。

限制是後設資訊答案由 LLM 裁判評分,只有定向問答採數值容差與文字規則;訓練資料雖已公開,完整基準及產生管線的可重現程度仍需外部驗證。27 個資料集也不足以代表實驗室裡的權限、損壞檔案、專有格式與資料治理問題。

來源

  1. SciDataSailor: Deep Scientific Data Exploring
  2. SciDataSailor-SFT-2K dataset