返回首頁

開放模型

Mimir 1B 以階層循環取代深層堆疊,丹麥語基準均分超過受測 9B 模型

丹麥 Foundation Models 團隊從零訓練 Mimir v1,利用 HRM 的高、低層循環,在作者測試的 20 項基準上逼近部分 4B 模型。權重已公開,但「可允許資料」不等於完全開放資料,部分語料只依協議或歐盟研究例外使用。

Stevens Vaughn · CC BY-SA 4.0 · Image source
zh-Hant

丹麥 Foundation Models 團隊發布 Mimir v1,一款採用 Hierarchical Reasoning Model Text 架構的 10 億參數模型。它不是把 Transformer 層數一路加深,而是以 32 層、1,536 維隱藏狀態為基礎,配置兩個高層循環與三個低層循環,讓同一組計算模組反覆修正表示;訓練時又以截斷反向傳播把最長梯度路徑限制在五步。模型使用 Gemma 4 tokenizer、4,096 token 上下文及 PrefixLM,現階段推論須正確配置 FlashAttention。

訓練混合涵蓋 161 個資料集,每輪取樣約 704.8 億 token,其中英語佔 68.6%、丹麥語佔 24.7%。團隊另用 Gemma 4 31B 生成並審核「移植資料」,代替不符合其資料政策的既有指令任務。整個模型以八張 B200、全域 batch 262,144 token 訓練 165 萬步,歷時不足三週。

作者在統一的 greedy-decoding 設定下,測得 Mimir 的英語七項平均為 69.0,僅比 Qwen 3.5 4B 的 69.3 低;GSM8K、MATH 與 HumanEval 平均為 64.1。丹麥語十項平均達 56.8,不但高於同級模型,也高於受測的 Munin 8B、9B 系列。不過這些比較仍是發布團隊自行執行,提示格式、PrefixLM 支援及不同模型的思考模式並不完全等價;Mimir 在數學與程式能力仍落後 Gemma 4 E2B,作者也承認一般助理能力尚未達前沿水準。

對低資源語言工程而言,更值得追蹤的是 HRM 能否在其他語言、較長上下文及強化學習後維持優勢。資料政策同樣要細讀:部分協議提供的語料不能公開,另一些依歐盟研究機構的文字與資料探勘例外使用,因此它展示的是可審計的訓練配方,而非每個 token 都可自由再散布的完整開放語料庫。

來源

  1. DFM Mimir v1 technical report
  2. HRM-Text training framework