返回首頁

模型發布

Intern-S2-Preview-397B 加入數值預測分支,4B 記憶模組令生物任務均分提高 3.40 點

新技術報告把科學 PDF、時間序列、工具操作及長時代理任務納入同一訓練管線,並公開 Apache 2.0 權重。獨立的 Memory Decoder 可在凍結 397B 主幹下加入領域能力,但目前只以生物學模組示範。

NASA · Public domain · Image source
zh-Hant

InternLM 團隊為 Intern-S2-Preview-397B 補上完整技術報告,重點不只是擴大模型,而是把科學資料的不同表示形式放進共同訓練流程。視覺預訓練直接把論文頁面交給凍結的視覺編碼器,排除空白區後,以對比式 next-latent 目標學習圖表、公式與版面;另一條資料管線則用 OCR 與版面解析,建立跨頁的圖文交錯序列。後訓練結合 SFT、多任務強化學習、黑箱與白箱代理 RL、on-policy distillation,並以群組熵控制、部分 rollout 校正等機制處理不同任務的探索差異。

時間序列不再只轉成文字或圖片。模型加入專用編碼器與數值預測分支,由 Q-Former 融合語意及數值表徵,再交給因果 Transformer 產生未來序列;horizon predictor 從指令判斷預測長度。論文稱它在 SciTS 與專用預測基線比較中取得多項優勢,並在通用 GIFT-Eval 得到零樣本 MASE 0.785,但多數結果仍由團隊自行評測。

另一項較具部署意義的設計是獨立 Intern-MemDec-4B。它把檢索所得的 token 分布蒸餾進小型參數記憶,推論時與凍結主幹並行,再由 token 級路由器混合兩邊的 next-token 分布。生物學版本把 21 項 Biology-Instructions 平均分由 56.92提高至60.32,但其中若干子任務反而退步,現階段不能視為通用的無損專精方法。397B 權重採 Apache 2.0,模型卡列出 LMDeploy、vLLM及SGLang部署方式與256K文字上下文;然而 Hugging Face metadata 顯示實際載入規模約404B參數,且沒有代管推論供應商,硬體門檻、遠端自訂程式碼與 Memory Decoder 尚未完整發布,仍是採用前的主要風險。

來源

  1. Intern-S2-Preview: Scientific Agentic Foundation Model
  2. Intern-S2-Preview-397B Model Card
  3. Intern Model API Documentation