推論系統
Yutori 披露瀏覽器代理推論架構:100K 長輸入配短工具輸出,靠前綴快取壓低每步成本
Yutori 的 Navigator 每項瀏覽器任務會連續呼叫視覺語言模型數十次,歷史上下文最長可增至約 100K token。Together AI 以 vLLM 前綴快取及分流延遲目標承載這種負載,但兩倍速度與低四至五倍成本仍是供應商披露的比較結果。

Yutori 與 Together AI 新公開 Navigator 瀏覽器代理的生產推論設計,揭示電腦操作模型與一般聊天服務截然不同的負載形狀。代理每走一步都要擷取瀏覽器畫面,把新截圖與完整操作歷史追加到上下文,再要求模型輸出滑鼠、鍵盤或 JavaScript 工具動作;單一任務可持續 10 至 15 分鐘並產生數十次模型呼叫。輸入會由數千增至約 100K token,輸出卻通常很短,因此瓶頸主要落在重複預填,而非長篇解碼。
[Together AI 的技術案例](https://www.together.ai/customers/yutori)指出,其服務以 vLLM 為基礎啟用前綴快取。相鄰步驟的大部分對話歷史完全相同,理論上可直接重用先前計算的 KV cache,只重新處理最新畫面和動作結果。這種架構若排程器沒有感知快取位置,請求在 GPU 間搬動便會失去命中,因此瀏覽器代理的每步延遲不能只靠平均 token/s 判斷。
平台同時把工作負載分成兩類:背景運行的 Scouts 重視批次吞吐量與單次成本;使用者正在等待的互動代理則需要嚴格控制尾端延遲,否則瀏覽器工作階段可能逾時。Together 聲稱 Navigator 相較可比前沿方案每步快兩倍、推論成本低四至五倍,並提供 99.9% SLA;但沒有公開 GPU 型號、批次策略、快取命中率或完整成本基準,暫時無法獨立重現。
模型端方面,Yutori 表示 Navigator 使用合成及真實網站資料進行監督微調與強化學習。[Navigator n1.5 的官方資料](https://yutori.com/blog/introducing-n1-5)報告 Online-Mind2Web 人工評估成功率為 97.3%,但網站持續變動,線上基準亦容易受到登入狀態、地區與頁面版本影響。工程團隊下一步應關注快取隔離、截圖資料保存、跨租戶 KV 洩漏防護,以及在網站改版後的真實任務失敗率,而不只是供應商公布的平均速度。