推論系統
Oilbird 重用驗證器隱藏狀態做語意草稿,API-Bank 解碼達自回歸 4.4 倍速
Oilbird 為免訓練推測解碼加入語意索引,找回因少量參數或 token 不同而被精確字串比對漏掉的既有續文。研究自報把三種草稿器的平均接受長度提高 24% 至 29%,但尚未釋出可獨立重現的程式碼。

推測解碼先用較便宜的方法產生多個候選 token,再由原模型一次驗證,以減少逐 token 執行大型模型的成本。免訓練方法通常從目前請求或歷史請求建立續文池,再用上下文的精確後綴尋找可重用片段;這種設計不需另訓練草稿模型,卻很怕工具呼叫中的訂單編號、時間戳或 API 參數發生變化。即使正確續文已存在池內,只要前方一個 token 不同,字串索引便可能無法抵達它。
Oilbird 將問題重新定義為「定址不足」而非「候選不足」。研究團隊分析十項基準後表示,在工具呼叫最密集的測試中,最強精確比對草稿器漏掉的候選約有一半其實已存在。新方法保留原有續文池,但另以驗證模型在已確認 token 上產生的隱藏狀態作為語意鍵;這些狀態本來就會在驗證過程中計算,因此不需再跑獨立編碼器。語意候選隨後被合併進既有詞彙草稿樹,讓兩種索引共同接受驗證。
在相同池大小與草稿預算下,論文自報 Oilbird 接入三種既有草稿器後,平均接受長度提升 24% 至 29%。API-Bank 上的速度為標準自回歸解碼的 4.4 倍,高於作者測試框架中最強免訓練基線的 3.9 倍,也高於 EAGLE-3 的 2.0 倍。技術價值在於它特別貼近代理與 API 服務的重複結構,而且不要求訓練配套模型。
目前數字仍來自作者的單一實驗框架,尚不能直接換算成生產環境的端到端延遲。工程團隊接下來應觀察程式碼是否公開、語意索引的記憶體與近鄰搜尋成本,以及在多租戶快取隔離、長上下文和低重複率流量下是否仍有淨收益。