返回首頁

AI 開發工具與評測

Claude Code 2.1.269 加入外掛 A/B 評測,但自動分數仍缺乏品質基準

新指令 `claude plugin eval` 可比較啟用與停用外掛時的表現,輸出 JSON 與 HTML 評測報告。首批實測顯示,自動產生的規則較能驗證指令遵循,未必能證明外掛真正改善任務品質。

Qzekrom (screenshot) · Public domain · Image source
zh-Hant

Anthropic 在 Claude Code 2.1.269 加入 `claude plugin eval`,把外掛品質檢查納入官方 CLI。開發者可準備測試案例,分別在載入與不載入外掛的條件下執行,再取得逐案分數、彙總 JSON 與 HTML 報告。這種 ablation 設計比只展示一次成功輸出更有用:當底層模型本身已能完成任務時,真正要量測的是外掛帶來的增量,而非最終答案看起來是否合理。

同版亦讓 `/output-style` 可在 Remote Control、雲端與其他 headless session 中切換,並可在 Bash 工具負責編輯時,把檔案差異附進工具結果。對維護企業內部 Skill、hook 或 MCP 整合的團隊而言,機器可讀評測輸出提供了接入 CI、版本升級前回歸比較及保存證據的基礎。不過官方 release note 只承諾「scored、reproducible results」,沒有公開說明評分器校準、重複抽樣、模型版本固定方式或統計不確定性。

評測研究者 Hamel Husain 的公開實測也揭露這項工具的限制。他們用寫作風格外掛試跑時,系統產生三個 grader、JSONL 資料與報告,但部分準則直接取自外掛自身規則。如此一來,處理組自然比未載入外掛的基線更符合那些規則;結果證明的是外掛有被遵循,而非文字更清楚或使用者更滿意。測試者也指出,分數及準則欠缺來源脈絡,而工具仍要求作者自行提供真實失敗案例——這正是評測流程中最耗工的 error analysis。

因此工程團隊可先把它視為回歸測試 runner,而不是通用品質裁判。較可靠的做法是固定 CLI、被測模型與 judge model,保存原始 trace,以真實失敗樣本建立人工標註集,並設定成本上限;對有副作用的工具還要使用合成 fixture、mock 外部服務及最小權限。後續值得觀察 Anthropic 是否公開 suite schema、評分來源與重複試驗控制,並讓單獨 Skill 也能以同一流程穩定受測。

來源

  1. Claude Code releases: v2.1.269
  2. Trying the New Claude Eval Tool — Hamel Husain (live)