推論系統
Pandora Router、モデル評価コストをルーティングに組み込み、EmbedLLMの総合損失を0.386に低減
Google DeepMindは、高コストなモデル評価を実行するかどうかを「Pandora’s box」探索問題として定式化し、情報価値に基づいて追加評価の要否を逐次判断する。3種類のテストすべてで、平均ルーティング後悔と評価コストの合計が最小となったが、その効果は適切にキャリブレーションされたシグナル分布とコスト設定に依存する。

Google DeepMindの研究チームは、既存のモデルルーターが見落としがちなコストに対処するPandora’s Routerを提案した。各候補モデルの回答品質を予測する処理自体にも、推論、検索、ツール利用のコストがかかる。システムはまず、プロンプト埋め込みの3近傍における平均スコアを低コストな推定値 `f` として使用し、続いて小規模なファインチューニング済みモデル、検索結果、または推論トレースの先頭20 tokenを、より正確だが高コストな推定値 `g` として用いる。
中核となる手法では、各候補モデルをまだ開けていない箱として扱う。研究者らはGaussianシグナルの仮定のもと、`f` と `g` のキャリブレーション関係からreservation priceを算出し、高コストな評価によって得られる期待情報価値がコストを上回る場合にのみ「箱を開ける」。非強制検査版では、`g` をまったく実行しない候補を1つ残すこともできるため、判断が容易なプロンプトに対してルーターが追加の評価コストを支払うのを避けられる。
実験は16,512問の数学問題、Wikipedia/PubMedのRAGエキスパート、および100を超えるオープンウェイトモデルを含むEmbedLLMを対象とした。ルーティング後悔と評価コストの合計では、Pandoraは3つのテストでそれぞれ0.105、0.118、0.386を記録した。同じ評価予算を用いるmargin heuristicは、それぞれ0.105、0.128、0.389だった。Gaussian近似では、数学とRAGにおける高コストな推定値への問い合わせ回数は1問当たり平均0.58回と1.40回にとどまり、少なくとも1つの候補を必ず検査する版より少なかった。
この研究は、ルーターを「予測スコアを比較する」仕組みから、「より良いスコアを取得する価値があるかを判断する」仕組みへと発展させるもので、モデルゲートウェイ、階層型RAG、可変推論予算を備えたサービスに適している。ただし、数学の設定には候補が2つしかなく、Pandoraとmarginの総合スコアは実際には同一だった。また、価格は特定のAPIに基づいており、完全なend-to-end latencyを表すものではない。エンジニアリング上の次の課題は、分布シフト、異種GPUのキュー待ち時間、そして非Gaussian分布や候補間の相関がキャリブレーションを損なうかどうかを観察することだ。