返回首頁

代理系統

PILOT 以確定性護欄管理淘寶推薦實驗,搜尋效率由 53.3% 升至 93.3%

PILOT 將實驗管理、分群策略搜尋與記憶整理交給三個 LLM 角色,但把權限、統計判定及狀態寫入留給確定性服務。淘寶五個線上 bucket 的內部結果顯示搜尋效率提高 40 個百分點,但報告未提供可公開重現的程式與流量規模。

Łukasz Golowanow, Maciej Hypś, Konflikty.pl · Attribution · Image source
zh-Hant

淘寶團隊提出 PILOT,讓 LLM 代理參與線上推薦系統的實驗設計,而不是直接生成推薦清單。系統分成三個角色:Experiment Manager 管理需求確認、觀測、異常處理與結案;Search Planner 以決策樹為不同使用者分群提出候選策略;Memory Curator 則在結果確定後,把策略差異及實驗方法整理成帶來源與可信度的記憶。

架構的關鍵並非讓代理擁有更多權限,而是限制其決策空間。Manager Guard 依狀態機與凍結政策產生合法指令集合,LLM 只能從中選擇;State Committer 是唯一可寫入狀態的元件。Statistics Engine 產生不可由代理修改的判定憑證,Contract Builder 在收集資料前鎖定成功、失敗與延長觀察的條件,Candidate Validator 與 Action Enumerator 則阻止 Planner 發明未授權操作。估計量、流量預算、停止規則及最終擴量等高風險欄位仍需人工確認。

搜尋採固定基準 B0、目前 Champion 與 Challenger 結構。每個 Challenger 相對 Champion 只能包含一項原子變更,並在預先登記的規則下取得 promote、reject 或 continue 憑證。指標方向在觀察窗口真正結束前不供決策使用,以降低偷看結果、挑選日期或反覆修改門檻的風險。記憶也採任務分支與合併機制,只有驗證後的內容才可進入共享知識庫。

團隊在淘寶首頁「猜你喜歡」的五個實驗 bucket 比較 PILOT 與自由探索型 ROAM。報告稱搜尋效率由 53.3% 升至 93.3%,最佳 bucket 的商品詳情頁瀏覽量、核心瀏覽量、交易筆數及交易金額分別增加 1.40%、1.60%、0.96% 與 1.50%。技術意義在於示範如何把 LLM 的語義判斷嵌入既有 A/B 基礎設施,同時把不可逆操作留在可稽核服務內。

不過,這些是單一平台自行報告的線上結果;論文沒有揭露流量、信賴區間、模型成本或完整程式,五個 bucket 也不足以證明能跨場景泛化。工程團隊接下來應關注護欄誤判、代理延遲、記憶污染,以及提升是否足以抵銷額外推論與實驗流量成本。

來源

  1. PILOT Technical Report
  2. Alibaba Cloud recommendation experiment configuration documentation