返回首頁

AI for Science/訓練基礎設施

Periodic Neon 用實驗室資料訓練兆參數 XRD 代理,並公開長軌跡 RL 的系統瓶頸

Periodic Labs 以 1,300 張 H200 對兆參數開放模型進行科學中期訓練與強化學習,讓 Neon 自動分析複雜 X 光繞射結果。55.3% 成功率與前沿模型比較均出自內部資料、專用工具鏈及模型評審,現階段更像可檢驗的垂直 AI 配方,而非已證實的自主科學發現。

Ricordisamoa · GPLv3 · Image source
zh-Hant

Periodic Labs 發表 Periodic Neon,從一個兆參數開放權重模型出發,加入論文、程式碼與自家實驗資料的多模態中期訓練,再以實驗室資料執行長上下文強化學習。首個部署任務是粉末 X 光繞射(XRD)分析:代理必須結合繞射峰、合成條件、歷史實驗、晶體資料庫與模擬工具,判斷樣品中有哪些晶相及其比例,之後再把結果送回材料探索迴圈。

在 134 個由人類專家也需數小時處理的 FrontierXRD 樣品上,官方報告 Neon 成功率為 55.3%,相較原始 Kimi K2.6 的 2.7% 提升約 20 倍,並在其成本設定下超過 GPT-6 Astra 與 Claude Fable 5.1。另有 198 個排除於中期訓練及 RL 的化學系統用於泛化測試。訓練峰值使用 1,300 張 H200,但這不是從零預訓練的總成本,而是建立在既有兆參數權重之上的後續訓練。

這次釋出最具通用性的部分其實是系統設計。XRD rollout 可持續一小時以上,訓練步驟卻只需數分鐘,因此團隊把生成與更新放到不同 GPU 配額非同步執行,容許單一軌跡跨越多個權重版本。WideEP 增加 KV cache 容量後會放大資料平行 rank 的同步停頓;團隊改以 Delta router replay 只回傳新增 token 的路由資料,並把相關修改送進 SGLang。配合 prefill/decode 分離,官方稱同批次下兆參數模型由每請求 10 tok/s 提升至 25 tok/s;長序列打包與成本感知排程則讓訓練吞吐量達其 Megatron 基線的 4.1 倍。

評測仍須保守解讀。所有模型都使用 Periodic 的專用 harness,其中包含內部資料庫與實驗脈絡;同一模型換用該 harness,成功率可比一般工具組高 3.8 倍。成功標籤又由 Opus 5 與 GPT-5.6 Sol 組成的評審判定,雖與專家共識有 84% 一致率,仍非客觀真值。Neon 的權重、FrontierXRD 原始資料及完整訓練配方也尚未公開。下一步應看其是否能由分析既有結果,進一步可靠地選擇新實驗,並由外部實驗室重現材料發現增益。

來源

  1. Nature Is Our Learning Environment
  2. AI Infrastructure at Periodic
  3. SGLang PR #24851: Absolute Routing Slice Control