推論與模型架構
MACRO 重排凍結 Transformer 層,六款模型平均準確率提高 5.0 個百分點
MACRO 不更新模型權重,而是為每項任務搜尋可跳層、回跳及重用隱藏狀態的固定執行路徑。作者在 13 項基準報告搜尋時間由 14.8 小時降至 1.6 小時,但每個新任務仍需標註訓練與驗證資料。

新研究 MACRO 把 Transformer 固定的逐層前向傳播改寫成可搜尋的程式:模型可以略過某層、回到較早的層再次執行,或把舊隱藏狀態加回 residual stream,最後再接回原本的後段網路。整個過程凍結模型權重,不訓練額外神經路由器,也不在每筆測試輸入上重新搜尋;產出的路徑以任務為單位,部署時所有樣本共用。
其搜尋器是一個以目前層、剩餘計算預算、移動方向與運算類型為狀態的 Markov policy。每輪抽取 30 條候選路徑,在訓練資料分塊上評分,再以高分樣本更新轉移機率;最多執行十輪。完成後,系統用 top-k Viterbi 精確解出五條最高機率的有效路徑,最後由獨立驗證集選出一條。這將原本需要 MCTS 產生路由標籤的 Dr.LLM 搜尋時間,由作者測得的 14.8 小時縮至 1.6 小時。
在 Qwen3 1.7B、4B、8B、14B、Llama 3.2 3B、Mixtral 8x7B 與 DeepSeek-R1-Distill-Llama-8B 等設定、13 項推理及知識基準上,MACRO 相對正常順序平均提高 5.0 個百分點,並比 Dr.LLM 高 7.2 點。最醒目的案例是 Qwen3-1.7B 在 GSM8K:執行第 0 至第 7 層後回到第 3 層,重播五個 block,再走到末端,準確率由 43.4% 升至 69.5%。這條路徑共呼叫 33 次 block,而原模型為 28 次。
因此 MACRO 不是免費加速法:部分路徑會增加層呼叫、KV cache 槽位與延遲,平均收益也主要集中在較弱的小模型。它還需每項任務最多 1,000 筆訓練樣本和獨立驗證集,對開放式或持續變動工作負載未必實用。程式庫已提供六類模型設定、三個隨機種子的重現命令及 MIT 授權;下一步要看固定路徑能否跨相近任務轉移,以及在真實生成、長上下文和批次服務中是否仍能抵銷額外運算。