返回首頁

推論系統

Pandora Router 把模型評分成本納入路由,EmbedLLM 綜合損失降至 0.386

Google DeepMind 將是否執行昂貴模型評分寫成「潘朵拉盒」搜尋問題,按資訊價值逐一決定是否加算評估。三種測試中,它都取得最低的平均路由遺憾加評估成本,但效果依賴已校準的訊號分布與成本設定。

Gciriani · CC BY-SA 4.0 · Image source
zh-Hant

Google DeepMind 研究團隊提出 Pandora’s Router,處理現有模型路由器常忽略的一筆開銷:為每個候選模型預測答題品質,本身也會消耗推論、檢索或工具成本。系統先以提示嵌入的三近鄰平均分作廉價估計 `f`,再把小型微調模型、檢索結果或推理軌跡前 20 個 token 作為較準確但昂貴的估計 `g`。

核心做法把每個候選模型視為一個尚未打開的盒子。研究者在高斯訊號假設下,依 `f` 與 `g` 的校準關係算出保留價格;只有昂貴評估帶來的預期資訊價值高於成本時才「開盒」。非強制檢查版本還可保留一個完全不執行 `g` 的候選,避免路由器為容易判斷的提示支付任何額外評分費用。

實驗涵蓋 16,512 道數學題、Wikipedia/PubMed RAG 專家,以及包含逾 100 個開放權重模型的 EmbedLLM。以路由遺憾加評估成本計算,Pandora 在三組測試分別得到 0.105、0.118、0.386;同等評估預算的 margin 啟發式則為 0.105、0.128、0.389。在高斯近似下,數學與 RAG 每題平均只查詢昂貴估計 0.58 與 1.40 次,少於必須至少檢查一個候選的版本。

這項工作把路由器從「比較預測分數」推進到「決定是否值得取得更好分數」,適合模型閘道、分層 RAG 與可變推理預算服務。不過數學場景只有兩個候選,Pandora 與 margin 的總分實際相同;價格也取自特定 API,並非完整端到端延遲。工程端下一步應觀察分布漂移、異質 GPU 排隊時間,以及非高斯或相關候選是否會破壞校準。

來源

  1. Pandora’s AI Model Routing Box: Efficient Allocation with Costly Value Estimation
  2. EmbedLLM: Learning Compact Representations of Large Language Models