LLMOps 與評測工具
MLflow 3.15.2 加入多評分器集成,資料集不可變版本目前僅限 Databricks
新版可用投票、平均值或自訂函式合併多個 LLM 評分器,並保留各子評分的理由與來源。發布說明所稱的不可變評測資料集版本目前只支援 Databricks,開源追蹤後端仍未具備同等能力。

MLflow 3.15.2 把多評分器組合納入 GenAI 評測介面。新的實驗性 `make_scorer_ensemble` 可執行多個單輪或 session-level scorer,再把布林值、數字或類別結果合成一筆 `Feedback`。內建函式包括 `majority_vote`、`mean`、`minimum`、`maximum`、`agg_all` 與 `agg_any`,也可傳入自訂聚合函式。
這不只是把數字取平均。介面會先檢查子評分器的輸出型別,例如拒絕以數值平均處理 yes/no 類別;單輪與 session-level 評分器也不能混在同一 ensemble。聚合結果的 metadata 會保存每個子評分的值、理由及 judge 來源,讓安全性、相關性或正確性投票仍可追查。使用具名內建函式時,整組 scorer 可遞迴序列化與註冊;自訂 callable 則無法完成相同的序列化 round-trip。
另一項更新是不可變的 evaluation dataset version。評測執行時可解析特定版本,並把版本座標保存在輸入紀錄中,避免團隊後來修改測試案例後,舊 run 無法還原當時實際使用的資料。這對代理回歸測試很重要:模型、提示詞、judge 與資料集若沒有共同版本化,分數變化很難歸因。
不過官方簡短發布說明容易讓人誤以為所有後端都已支援。合併的實作明確限定為 Databricks evaluation datasets;MLflow 文件亦指出非 Databricks 環境不能傳入版本。開源後端的對應功能仍在後續提案階段。此外,ensemble API 標為 experimental,可能無預警變動;官方只披露三筆資料的手動端到端測試,沒有量測多 judge 帶來的延遲、token 成本或評分穩定度。工程團隊升級後應先固定 API、資料後端與 tie-breaking 行為,再納入 CI 閘門。