AI 評測與開發工具
LiveEvalBench、エージェントにWebページを実際に構築・操作させ、フロントエンドのスクリーンショット照合だけによる静的評価を代替
LiveEvalBenchは、構築、コード、ブラウザ操作を担当する3種類のエージェントで証拠を収集し、各成果物で実際に動作する機能に基づいてチェック項目を生成する。フレームワークとデータは公開されているが、採点は依然としてLLMジャッジに依存しており、コスト、再現性、ジャッジのバイアスについては、さらなる定量化が必要だ。

生成系フロントエンドモデルはすでにプロジェクト一式を出力できるようになっているが、一般的な評価は依然として、スクリーンショットの類似度、静的コード、または少数の固定テストを重視している。こうした手法では、「見た目は正しいがボタンが動作しない」、依存パッケージをインストールできない、ルーティングに失敗する、状態更新が誤っている、といった問題を見落としやすい。逆に、参照スクリーンショットとは異なっていても機能的には正しい実装が、誤って低く評価される可能性もある。
8月4日に公開されたLiveEvalBenchは、評価をエージェント型のレビュー工程へと作り替えた。Build Engineerが最初にプロジェクトを構築して起動し、Code Engineerが実装と構造を確認し、UI TesterがPlaywrightを通じてChromium上でページを操作する。各役割は主観的なスコアを出すだけではなく、ビルドログ、ソースコード、実際のインタラクションから証拠を収集し、共通の採点プロセスに渡して整理する。このフレームワークは、モデル間で共通のrubricを維持しつつ、個々の成果物が実際に掲げる機能に応じて実装指向のチェック項目を作成することで、比較可能性とフロントエンド実装手法の多様性を両立させようとしている。
公開リポジトリには、Pythonランナー、4つのコアエージェント設定、採点テンプレート、チェックポイントからの再開、JSONLシャーディング、結果ダッシュボードが含まれている。Anthropic、OpenAI、Google、またはOpenAI互換エンドポイントに接続できる。デフォルトでは各エージェントが最大80回のReActステップを実行でき、1タスク当たりのタイムアウト上限は5,400秒で、マルチプロセスによるシャーディングにも対応する。ベンチマークデータは別途Hugging Faceで公開されており、評価パイプライン全体を書き直さずにタスクを更新できる。
技術的な価値は、「Webサイトを実際に使用できるか」をモデル比較に組み込んだ点にあり、企業がAI生成フロントエンドを受け入れテストする際の出発点にもなり得る。ただし、論文は結果が人間の専門家による判断と高い一致を示したと述べるにとどまり、要約には独立して評価できるだけの完全な一致度の数値が示されていない。また、適応型チェックもモデルによって生成されるため、ジャッジモデルが異なればランキングも変わる可能性がある。今後は、バージョンを固定したコンテナ、ネットワーク分離、tokenおよび実行コストの報告、さらに異なるジャッジモデル間でのランキング安定性を検証する必要がある。