AI 訓練與開發工具
Google 公開 autofinetune:代理在 TPU 上自動搜尋 SFT 與 GRPO 訓練配置
autofinetune 讓代理依 Markdown 規格修改 Tunix 訓練程式、執行評測,並只保留改善指標的 Git commit。首批實驗涵蓋 FunctionGemma 的 SFT 與 Gemma 3 1B 的 GRPO,但仍是小規模、單指標的探索性流程。

Google 開發者團隊公開 `autofinetune`,把原本需要人工反覆調參的 LLM 後訓練改造成可持續執行的代理迴圈。使用者先在 `program.md` 定義允許修改的超參數、資源限制與評測目標,再提供單一 `run.py`;由 Antigravity CLI 與 Gemini Flash 3.7 修改程式、啟動 Tunix 工作、讀取評測結果,將改善版本提交至 Git,退步版本則回復,並把軌跡寫入 TSV。
第一個案例在單顆 Cloud TPU v5e 上微調 FunctionGemma 270M,代理於數小時內執行 20 次實驗,可調整 LoRA rank、alpha、目標投影層、最佳化器、學習率與批次大小,但不能更換資料集、epoch 數或模型架構。第二個案例以 TPU v6e、Gemma 3 1B 和 GSM8K 執行 GRPO,搜尋 LoRA、rollout temperature、KL penalty 與 system prompt;官方表示約 40 次實驗後,自訂總指標提升約 10%。
技術價值不在於新的最佳化演算法,而是把「提出假設—修改程式—昂貴訓練—量測—版本控制」封裝成可稽核迴圈,適合批次探索明確且有限的搜尋空間。工程團隊仍須注意,GRPO 案例將數值正確率與格式正確率直接相加,代理可能過度最佳化代理指標;公開資料也只有兩個模型與兩條樣本軌跡,尚未比較貝葉斯最佳化、Population Based Training 或人工調參。部落格稱 40 次、歷時二至三天,儲存庫則記載 45 次、約四天,顯示實驗報告仍需整理。儲存庫另要求先套用 TPU VM 當機 workaround,並示範跳過權限確認;若投入真實資料與雲端帳號,應先隔離憑證、限制可改檔案及 TPU 預算,並以保留測試集重新驗證勝出配置。