模型訓練與最佳化
Hyper-ES 先用梯度建立低維搜尋空間,數學推理平均高於 GRPO-LoRA 1%
Hyper-ES 不在數十億維模型權重上直接做隨機演化,而是以少量微調方向構成子空間,再搜尋逐層模型合併係數。作者在三款模型與六項數學資料集報告小幅增益,但方法並非完全無梯度。

新提出的 Hyper-ES 嘗試解決演化策略難以直接擴展到大型語言模型的問題。傳統 Evolution Strategy 以隨機擾動估計更新方向;當參數達數十億維時,多數擾動幾乎與真正有用的下降方向正交,樣本效率與穩定性都會快速惡化。Hyper-ES 因此沒有在完整權重空間盲搜,而是先執行少量、成本較低的梯度微調,取得多個雖然各自增益有限、但具有任務資訊的下降方向。
這些方向的線性張成空間成為後續演化搜尋範圍。系統使用 CMA-ES 最佳化逐層係數,再透過 DARE-TIES 類型的模型合併,把多條更新方向組合成最終模型。換句話說,演化策略搜尋的是「如何混合已知有用方向」,而不是重新發現數十億個參數應往哪裡移動。這讓黑箱最佳化的維度取決於候選方向與層數,理論上比全參數擾動更適合資源受限的後訓練。
作者以 Qwen2.5-Instruct 與 DeepSeek-R1-Distill 系列共三款骨幹,在六套數學推理資料集上比較,報告 Hyper-ES 平均比 GRPO-LoRA 高約 1%,同時少用 10% 需要保存中間狀態的梯度更新。技術價值主要不在一個百分點本身,而在於把模型合併、低維子空間與演化策略串成可實作的後訓練流程;它也可能適用於獎勵不可微、評估器複雜或希望減少反向傳播次數的情境。
不過 Hyper-ES 仍需要梯度微調來產生基底,不能視為純黑箱或零反向傳播方案。現有結果也只涵蓋數學推理與三款模型,尚未證明在程式代理、開放式生成或更大模型上仍有相同收益。下一步應比較完整 GPU 時數、峰值記憶體與搜尋評估成本,並測試方向數增加後是否真的維持低維優勢。