ホームへ戻る

AI 研究

LangChainがエージェント評価器Jevを検証、5つの固定ケースでスコアのばらつきが小さい結果に

LangChainは天気エージェントの実行ログ5件をそれぞれ100回再評価し、Jevのスコアのばらつきと呼び出しコストが低いことを確認した。ただし、人手でラベル付けを行ったアノテーターは1人のみで、サンプリング設定やホストされたモデルのバージョンも結果の解釈を制約している。

Black-hole-diver · CC BY-SA 4.0 · Image source
zh-Hant

LangChainは9月20日、TypeSafe AIのJevと言語モデルを使った3種類の評価器を比較するエージェント評価実験を発表した。実験の焦点は、同じ実行ログを繰り返し評価したときに、スコアが一貫性を保てるかどうかだ。これは、チームがプログラムの性能低下と評価器自体の揺らぎを見分けられるかに関わる。[実験の発表](https://www.langchain.com/blog/jev-agent-evals-langsmith)

チームはDeep Agentsで天気エージェントを構築し、5つのケースについて回答、根拠、ツール呼び出しを固定して保存した。各評価器で各ケースを100回ずつ再評価し、二値の合否判定は1人のアノテーターによる正解ラベルとの比較に、連続値の品質スコアはばらつきの測定に用いた。「500回の判定」とは、実際には5件の固定された出力を繰り返し評価したものであり、500件の異なるタスクを評価したわけではない。[実験設計](https://github.com/danielgshea/jev-as-a-judge)

著者らによると、Jevの品質スコアのケース内分散は平均0.0000149だった。Sonnet 4.6、GPT-5.6 Luna、Terraの分散は、それぞれJevの92倍、433倍、913倍だった。Jevの二値判定はすべて人手によるラベルと一致したものの、連続値のスコアには依然として揺らぎがあり、完全に決定論的な評価器とはいえない。1回の呼び出しにかかった時間は平均0.44秒、費用は約0.00035米ドルだったが、いずれも今回の負荷条件に限った結果だ。[結果と限界](https://www.langchain.com/blog/jev-agent-evals-langsmith)

Jevのインターフェースは選択肢、スコア、またはYes/Noの確率を直接返すため、アプリケーションは自由形式のテキストを解析せずに、複数の細かな判定を組み合わせられる。ただし、確率と品質の尺度は明確に区別する必要がある。ある条件が50%の確率で成立することは、回答の品質が中程度であることを意味しない。TypeSafeのドキュメントは、評価要素を先に分解し、その後プログラムで重み付けすることを推奨している。この方法は、評価ルールを点検する手がかりにもなる。[型付き質問のドキュメント](https://docs.typesafe.ai/primitives)

再現性にはなお不十分な点がある。リポジトリでは固定したケース、人手によるラベル、分析の実行手順が公開されているが、言語モデルの温度やサンプリングシードなどのパラメーターは明示的に設定されず、サービスのデフォルト値が使われている。また、実験のメタデータには、ホストされたJevのサービスバージョンが開示されていない。そのため、ばらつきの小ささとモデルアーキテクチャの因果関係はまだ立証されていない。同じ誤判定を繰り返せば、安定して誤ったシグナルを出す可能性も残る。再検証では、ネットワーク遅延やプロバイダーのバージョン変更も追跡する必要がある。[再現手順の説明](https://github.com/danielgshea/jev-as-a-judge)

中国語を扱うエージェントの開発チームにとって、この結果が示すのは評価の方法論だ。まず実行トレースを固定し、正確性と繰り返し評価の一貫性を別々に測定する。導入前には、繁体字中国語、曖昧な要件、失敗ケースを追加し、複数のアノテーター間で合意を得る必要がある。同じケースの再評価回数を単に増やすよりも、対象タスクの範囲を広げるほうが汎化能力を検証しやすい。

出典

  1. Jev-as-a-Judge for Agent Evals
  2. Jev as a judge:實驗程式、資料與重現說明
  3. TypeSafe Primitives:Choice、Score 與 Noul