返回首頁

AI for Science/生物基礎模型

CellWorld 改以潛在細胞表徵預訓練,5.74M 模型在 18 項空間轉錄體任務勝過所列基線

CellWorld 不直接重建被遮蔽的基因值,而是根據鄰近細胞與少量表達提示預測目標編碼器的潛在表示。程式與訓練配置已採 MIT 授權公開,但預訓練權重仍放在需核准的私人儲存庫。

Laboratoires Servier · CC BY-SA 3.0 · Image source
zh-Hant

空間轉錄體資料同時記錄細胞的基因表達與組織座標,但不同測量平台會引入掉落、深度差異及其他技術雜訊。多數既有基礎模型要求網路重建被遮蔽的基因名稱或表達值,可能連同平台特有的誤差一起學習。8 月 7 日發布的 CellWorld 改採類似 joint-embedding predictive architecture 的目標:不還原原始量測,而是預測被遮蔽細胞在目標編碼器中的潛在表徵。

訓練時,每個細胞是一個 token;模型遮蔽一個空間區域,context encoder 讀取可見細胞,predictor 再結合少量被遮蔽細胞的部分表達提示,逼近以指數移動平均更新的 target encoder 輸出。公開配置使用 2D ALiBi 表示空間關係、60% 隨機遮蔽率、10% 部分表達提示及 MSE 損失。四個版本由 5.74M 至 94.56M 可訓練參數,論文稱預訓練語料涵蓋 4,600 萬個人類細胞。

作者在四套保留資料上測試,報告最小的 CellWorld-Small 已在 11 項凍結編碼器的線性探測與七項完整微調任務超過所有列出的基線。更值得注意的是,只使用 5% 預訓練語料、但保留較廣生物來源覆蓋的 frozen CellWorld-Large,在七項空間任務仍勝過全部完全微調基線;這支持「來源多樣性與足夠最佳化可能比單純增加細胞數更重要」的結論,但仍是作者控制實驗所得,不能直接外推到其他平台或疾病族群。

GitHub 已包含預訓練、線性探測、微調、`.h5ad` 推論與多 GPU 啟動程式,資料位置則由使用者自行提供。最大的重現障礙是四組官方 checkpoint 位於需授權的私人 Hugging Face 儲存庫,訓練用 4,600 萬細胞資料也未隨程式發布。研究者接下來應檢查資料授權、跨平台外部驗證,以及移除部分表達提示後是否仍保持優勢。

來源

  1. CellWorld: From Gene-Level Reconstruction to Latent Cell Prediction in Spatial Transcriptomics Foundation Models
  2. UoM-HealthAI/CellWorld