模型後訓練與企業 AI
9B 模型以 500 美元 GRPO 學會目錄審查,單項工作流超越前沿 API
Fermi Sense 在可評分的電商目錄環境中,以兩張 GPU 和約 500 美元把 9B 開放模型訓練至 87.3% 的可達成分數。成果顯示企業規則可透過強化學習寫入小模型,但評測資料、模型權重與完整重現套件尚未公開。

Fermi Sense 公布一項垂直模型實驗:團隊把電商商品目錄審查重建成可重複執行的環境,模型必須根據圖片、描述、分類樹與工具結果,判斷商品類別及屬性是否正確。每次決策都由固定規則評分,再以 GRPO 產生 rollout 並更新一款 9B 開放模型,而非持續把完整企業規則塞進前沿模型的提示。
團隊使用兩張 RTX PRO 6000,一張負責生成軌跡、一張執行梯度更新,透過開源 prime-rl 跑 1,000 個最佳化步驟,約三天半、GPU 成本約 500 美元。最終模型在嚴格評測中的原始分數為 0.626,相當於作者定義之可達上限的 87.3%;未訓練基礎模型為 64.2%,最佳前沿 API 配置為 76.9%。訓練約 250 步便越過前沿模型區間。作者估算推論成本為每千項商品 0.50 美元,最便宜的比較 API 約高 40 倍;最佳前沿配置則為每千項 34 美元。
技術重點不是證明 9B 模型具備更強通用推理,而是把穩定的分類規則、工具使用方式與例外處理壓入權重,免除每次請求重新提供長提示。這種方法適合高頻、結果可機械驗證且規則相對穩定的流程;若工作品質只能靠主觀討論,GRPO 的獎勵函式反而可能固化錯誤代理指標。
目前數字主要由供應商自行報告,未公開測試集、訓練後權重、隨機種子與完整成本帳目,也只涵蓋單一目錄工作流。工程團隊下一步應觀察資料漂移、規則改版後的重訓成本、獎勵投機,以及小模型在罕見類別與跨商店分類體系中的泛化能力。