模型架構與推論
Matryoshka 將三種模型嵌入單一權重,訓練算力減少 36%
Matryoshka Language Model Suites 將 500M、1.5B 與 3B 子模型串成可獨立截取的巢狀架構,避免為每個尺寸重複訓練。共享前段層與 KV 快取亦令推測解碼吞吐提高 14% 至 26%,但目前只在 3B 級基礎模型驗證。

康乃爾大學研究者提出 Matryoshka Language Model Suites,把不同尺寸的語言模型改造成同一組逐層擴張的權重,而非三個互不相干的 checkpoint。實驗架構先執行 24 層、500M 參數子模型,再接上較寬的 10 層形成 1.5B 模型,最後增加 5 層形成 3B 模型;不同寬度之間以不增加參數的 junction 銜接,先將前一子模型輸出的範數對齊新嵌入,再拼接新增通道。
這項設計使完整套件只需 3.2B 參數,較三個獨立模型合計的 5.2B 少 38%。由於一次前向傳播會同時產生各出口的 logits,最大模型也能在每一步直接蒸餾較小模型,不必另存教師輸出或重跑教師。團隊以 FineWeb-Edu 的 350 億 token 從頭訓練,在七項零樣本選擇題上,各尺寸平均分與相同 token 數的獨立模型相差不超過 0.5 分,總訓練 FLOPs 則減少 36%;1.5B 與 3B 出口的域外 perplexity 亦略低。
推論端的關鍵不是單純少載入權重,而是 draft 與 verifier 共用前段層及其 KV 快取。500M/3B 組合在傳統獨立模型中會因 draft 過大而拖慢生成,巢狀版本卻能令自身標準解碼加速約 20% 至 40%;跨測試設定的整體吞吐增益為 14% 至 26%。作者已公開 Transformers 相容權重及多個訓練階段,但它是英語 FineWeb-Edu 訓練的未對齊基礎模型,需啟用 `trust_remote_code`,也尚未證明節省幅度能延伸到數十或數百 B 的 MoE、長上下文與量化部署。工程團隊下一步應觀察 vLLM、SGLang 是否原生實作共享層推測解碼,以及多租戶服務能否真正回收記憶體與延遲收益。