模型訓練/LLMOps
Together 微調服務讓 LoRA 直接訓練 MoE 專家,並開放檢查實際送入 trainer 的 token
Together AI 新增 Expert LoRA、逐樣本權重、訓練前資料驗證及即時指標,讓開發者能控制 MoE 的專家層而非只調整注意力。官方實驗的知識回憶率由 15% 升至最高 89%,但比較規模有限,且專家與注意力 adapter 目前不能混用。

Together AI 在 9 月 11 日擴充託管微調服務,其中技術上最值得注意的是 Expert LoRA。一般 LoRA 通常把低秩 adapter 掛在 `q_proj`、`k_proj` 等注意力模組;對 MoE 而言,大量參數與領域知識卻位於專家前饋層。新介面允許用 `lora_trainable_modules` 指定 `w_up`、`w_gate`、`w_down`,並以跨專家共享低秩因子的配置控制 adapter 大小。
Together 以 Gemma 4 26B‑A4B 與 Qwen3.6 35B‑A3B 注入 200 項虛構事實,自報訓練專家層後最高可回憶 89%,注意力限定版本最高為 15%;MMLU‑Pro 比較則為 75.3% 對 71.5%。團隊認為只調注意力會令部分已路由專家逐漸停止參與。不過這是供應商設計的窄型知識注入實驗,尚不足以推論所有領域微調都會得到同樣幅度。
更新亦處理微調流水線中較常見、但容易被忽略的資料問題。使用者可在開跑前查看套用實際 tokenizer 與 chat template 後的 token、loss mask 和截斷狀態;完成後還能下載 trainer 真正接收的已 tokenization、packing 與 collation 資料子集。伺服器會預先檢查訊息角色、工具呼叫配對、推理欄位、偏好資料及影像解碼,並支援逐樣本 loss 權重、packing 開關、梯度累積、early stopping,以及從 API、CLI 取得逐步 loss、gradient norm 和 learning rate。
部署限制仍需先讀清楚:Expert LoRA 只開放給列出的 Mixtral、DeepSeek、Kimi 與 Nemotron 模型,單一工作不能同時指定專家和注意力模組;專家 adapter 也不會合併成完整權重,必須放在專用端點服務。文章提到訓練途中直接部署中間 adapter 的功能仍屬預告,不能納入現有生產流程。