模型架構/推論
Intern-S2-Mobius 將 FFN 記憶全域共享,35B 模型報告近 4 倍端到端推論加速
Intern-S2-Mobius 把傳統 Transformer 各層綁定的知識儲存與注意力推理拆開,讓多個 Reasoner 反覆查詢同一組全域 Memory。開放權重可由 LMDeploy、vLLM 或 Transformers 載入,但近 4 倍加速仍是官方特定評測結果。

InternLM 團隊公開 35B 級 Intern-S2-Mobius 權重,核心不是增加 MoE 專家,而是重新安排 Transformer 內部的知識與計算。傳統架構在每層以 FFN 儲存知識、以 self-attention 操作當前表示;Mobius-v0 改為全模型共享一組 Memory,並讓多個 Reasoner 反覆以 hidden state 查詢及組合其中的知識向量。其 backward residual connection 也允許較早的推理階段存取較深層知識,而非只能沿固定層序單向傳遞。
[技術報告](https://arxiv.org/abs/2608.14290)稱,從零訓練的 7B 版本只使用 Transformer 基線 62.6%的訓練資料,便取得相近下游分數;由 Qwen3.5-35B 持續預訓練、再經 SFT 與 RL 的 Intern-S2-Mobius,則在維持相近整體能力下取得接近 4 倍端到端推論加速。官方將增益歸因於連續隱狀態中的動態 latent reasoning、較短的可見推理輸出,以及較高請求吞吐,而不是單一 kernel 的四倍提速。
[模型卡](https://huggingface.co/internlm/Intern-S2-Mobius)提供 Apache-2.0 權重,標示約 36B 參數及 BF16 儲存,並列出 LMDeploy、Transformers、vLLM 的部署方式。建議路徑會啟用四個 draft token 的 MTP 推測解碼;vLLM 還需 `trust_remote_code`、Qwen3 reasoning parser 與工具呼叫 parser,因此現階段並非可直接替換任意 35B Transformer 的透明端點。
工程團隊接下來應分開量測架構、較短輸出與 MTP 各自帶來的速度收益,並在相同硬體、批次、提示長度及輸出 token 數下重跑。論文比較主要集中於自家模型與 Qwen3.5-35B,尚缺跨框架的第三方吞吐、首 token 延遲、長上下文品質與記憶體占用驗證。