科學 AI 與模型後訓練
PertMind 以細胞擾動終點訓練 4B 模型,把一億份單細胞資料轉成強化學習獎勵
PertMind 從 Qwen3-4B 出發,以基因反應、路徑方向及輸出格式組成可計算獎勵,不必人工撰寫大量生物推理軌跡。模型可零樣本轉移至逆向擾動辨識及雙擾動任務,但自然語言機制解釋仍不能視為因果證明。

PertMind 嘗試解決科學語言模型後訓練的一個核心瓶頸:實驗資料通常只記錄處理條件與最終量測,沒有完整的自然語言推理過程。團隊把 Tahoe-100M 約一億份單細胞資料的預先計算差異表達統計,整理成「細胞系、藥物擾動、目標基因」查詢,要求模型預測基因表達上升、下降或沒有可靠變化。
系統以 Qwen3-4B Base 為起點。第一階段從公開生物知識圖譜與訓練分區檢索上下文,採樣候選解釋,只保留結論正確、格式可解析且實體關係有來源支持的軌跡,進行一輪帶權 SFT。第二階段使用 GRPO,結合三種訊號:實驗觀察到的基因終點、由其他路徑成員轉錄反應計算的路徑方向,以及格式合規。當前查詢的標籤與路徑代理標籤只存在於獎勵端,不會放入提示。
為降低洩漏,作者依細胞系切分資料,將五個細胞系完整留作測試;當前查詢的差異表達值、標籤及測試分區結果都不能進入檢索。論文報告 PertMind 在未見細胞系的差異表達偵測與方向預測上,平均追平或略高於使用 Gemini 2.5 Flash 的 VCWorld 參考流程。模型只接受正向反應訓練,卻能在沒有額外微調下處理由細胞狀態反推擾動、69 選一候選排序,以及 131 組雙基因擾動;MMLU、CMMLU 則只出現小幅下降。
真正值得注意的是把高通量實驗終點轉成可驗證 RL 環境,而不是某一排行榜名次。這套方法可延伸到具有大量量測、但缺少人工推理標註的科學領域。工程師接下來應檢查獎勵代理是否會誘發捷徑,以及跨實驗平台與新藥物的外部分布表現。作者亦明確警告:終點正確只能約束結論,不能證明模型生成的中間機制具有因果忠實度。