開放模型
Mimir 1B 以階層循環取代深層堆疊,丹麥語基準均分超過受測 9B 模型
丹麥 Foundation Models 團隊從零訓練 Mimir v1,利用 HRM 的高、低層循環,在作者測試的 20 項基準上逼近部分 4B 模型。權重已公開,但「可允許資料」不等於完全開放資料,部分語料只依協議或歐盟研究例外使用。

丹麥 Foundation Models 團隊發布 Mimir v1,一款採用 Hierarchical Reasoning Model Text 架構的 10 億參數模型。它不是把 Transformer 層數一路加深,而是以 32 層、1,536 維隱藏狀態為基礎,配置兩個高層循環與三個低層循環,讓同一組計算模組反覆修正表示;訓練時又以截斷反向傳播把最長梯度路徑限制在五步。模型使用 Gemma 4 tokenizer、4,096 token 上下文及 PrefixLM,現階段推論須正確配置 FlashAttention。
訓練混合涵蓋 161 個資料集,每輪取樣約 704.8 億 token,其中英語佔 68.6%、丹麥語佔 24.7%。團隊另用 Gemma 4 31B 生成並審核「移植資料」,代替不符合其資料政策的既有指令任務。整個模型以八張 B200、全域 batch 262,144 token 訓練 165 萬步,歷時不足三週。
作者在統一的 greedy-decoding 設定下,測得 Mimir 的英語七項平均為 69.0,僅比 Qwen 3.5 4B 的 69.3 低;GSM8K、MATH 與 HumanEval 平均為 64.1。丹麥語十項平均達 56.8,不但高於同級模型,也高於受測的 Munin 8B、9B 系列。不過這些比較仍是發布團隊自行執行,提示格式、PrefixLM 支援及不同模型的思考模式並不完全等價;Mimir 在數學與程式能力仍落後 Gemma 4 E2B,作者也承認一般助理能力尚未達前沿水準。
對低資源語言工程而言,更值得追蹤的是 HRM 能否在其他語言、較長上下文及強化學習後維持優勢。資料政策同樣要細讀:部分協議提供的語料不能公開,另一些依歐盟研究機構的文字與資料探勘例外使用,因此它展示的是可審計的訓練配方,而非每個 token 都可自由再散布的完整開放語料庫。