科學 AI 與模型後訓練
PertMind、細胞摂動のエンドポイントで4Bモデルを訓練し、1億件の単一細胞データを強化学習の報酬に変換
PertMindはQwen3-4Bをベースに、遺伝子応答、パスウェイの方向性、出力形式から計算可能な報酬を構成し、人手で大量の生物学的推論軌跡を作成する必要をなくした。モデルは摂動の逆推定や二重摂動タスクにもゼロショットで転移できるが、自然言語によるメカニズムの説明を因果関係の証明とみなすことはできない。

PertMindは、科学分野の言語モデルにおけるポストトレーニングの中核的なボトルネックの解消を試みている。実験データには通常、処理条件と最終的な測定結果しか記録されておらず、自然言語による完全な推論過程は含まれていない。チームは、Tahoe-100Mの約1億件の単一細胞データから事前計算された差次的遺伝子発現統計を、「細胞株、薬物摂動、標的遺伝子」というクエリ形式に整理し、遺伝子発現が上昇するか、低下するか、あるいは信頼できる変化がないかをモデルに予測させた。
システムはQwen3-4B Baseを出発点としている。第1段階では、公開されている生物学的知識グラフと訓練用データ分割からコンテキストを検索し、説明候補をサンプリングする。そのうち、結論が正しく、形式を解析でき、エンティティ間の関係が出典によって裏付けられている推論軌跡だけを残し、重み付きSFTを1ラウンド実施する。第2段階ではGRPOを使用し、実験で観測された遺伝子エンドポイント、ほかのパスウェイ構成要素の転写応答から算出したパスウェイの方向性、形式への準拠という3種類のシグナルを組み合わせる。現在のクエリのラベルとパスウェイの代理ラベルは報酬側にのみ存在し、プロンプトには含まれない。
データ漏洩を抑えるため、著者らはデータを細胞株単位で分割し、5つの細胞株を丸ごとテスト用に確保した。現在のクエリに対応する差次的発現値やラベル、テスト分割の結果は、いずれも検索対象に含めない。論文によると、PertMindは未知の細胞株における差次的発現の検出と方向予測で、Gemini 2.5 Flashを使用するVCWorldの参照パイプラインと平均して同等か、わずかに上回る性能を示した。モデルは順方向の応答だけで訓練されたにもかかわらず、追加のファインチューニングなしで、細胞状態から摂動を逆推定するタスク、69候補から1つを選ぶランキング、131組の二重遺伝子摂動に対応できた。MMLUとCMMLUの性能低下は小幅にとどまった。
真に注目すべきなのは、特定のランキング順位ではなく、ハイスループット実験のエンドポイントを検証可能なRL環境へ変換した点だ。この手法は、測定データは大量にあるものの、人手による推論アノテーションが不足している科学分野にも拡張できる。エンジニアは次に、報酬プロキシがショートカットを誘発しないか、また異なる実験プラットフォームや新規薬物に対する分布外性能がどうなるかを検証すべきだ。著者らも明確に警告している。エンドポイントが正しいことは結論を制約できるにすぎず、モデルが生成した中間メカニズムが因果的に忠実であることを証明するものではない。