ホームへ戻る

模型發布

Intern-S2-Preview-397B、数値予測ブランチを追加。4Bメモリモジュールで生物学タスクの平均スコアが3.40ポイント向上

新たな技術報告では、科学PDF、時系列、ツール操作、長期エージェントタスクを単一の訓練パイプラインに統合し、Apache 2.0ライセンスの重みを公開した。独立したMemory Decoderにより、397Bのバックボーンを凍結したままドメイン能力を追加できるが、現時点では生物学モジュールでのみ実証されている。

NASA · Public domain · Image source
zh-Hant

InternLMチームは、Intern-S2-Preview-397Bの完全な技術報告を公開した。焦点は単なるモデルの大規模化ではなく、科学データの異なる表現形式を共通の訓練プロセスに取り込むことにある。視覚事前学習では、論文のページを凍結済みの視覚エンコーダーへ直接入力し、余白領域を除外したうえで、対照学習型のnext-latent目的により図表、数式、レイアウトを学習する。もう一方のデータパイプラインでは、OCRとレイアウト解析を用いて、ページをまたぐテキストと画像のインターリーブシーケンスを構築する。事後学習では、SFT、マルチタスク強化学習、ブラックボックスおよびホワイトボックスのエージェントRL、on-policy distillationを組み合わせ、グループエントロピー制御や部分的なrollout補正などの仕組みにより、タスクごとに異なる探索特性へ対処する。

時系列は、もはやテキストや画像へ変換するだけではない。モデルには専用エンコーダーと数値予測ブランチが追加され、Q-Formerが意味表現と数値表現を融合し、それを因果Transformerへ渡して将来の系列を生成する。horizon predictorは、指示から予測期間を判定する。論文によれば、SciTSおよび専用の予測ベースラインとの比較で複数の優位性を示し、汎用ベンチマークGIFT-EvalではゼロショットMASE 0.785を達成した。ただし、結果の大半は依然としてチーム自身による評価に基づいている。

もう一つ、デプロイの観点で比較的重要な設計が、独立したIntern-MemDec-4Bである。これは検索で得たtoken分布を小規模なパラメトリックメモリへ蒸留し、推論時には凍結されたバックボーンと並列に動作する。その後、tokenレベルのルーターが両者のnext-token分布を混合する。生物学版では、21項目からなるBiology-Instructionsの平均スコアが56.92から60.32へ向上したが、一部のサブタスクでは逆に性能が低下している。そのため、現段階では汎用的かつ損失のない専門化手法とは見なせない。397Bの重みはApache 2.0で提供され、モデルカードにはLMDeploy、vLLM、SGLangを使ったデプロイ方法と256Kのテキストコンテキストが記載されている。しかし、Hugging Faceのmetadataでは実際のロード規模が約404Bパラメータと示されており、ホスト型推論プロバイダーも存在しない。高いハードウェア要件、リモートのカスタムコード、Memory Decoderがまだ完全には公開されていないことが、導入前の主なリスクとして残る。

出典

  1. Intern-S2-Preview: Scientific Agentic Foundation Model
  2. Intern-S2-Preview-397B Model Card
  3. Intern Model API Documentation