返回首頁

代理工具與實驗基礎設施

AIBTest 推出 MCP 原生 A/B 測試流程,讓代理自行驗證網域、部署 SDK 並讀取成效

AIBTest 把網站 A/B 測試拆成網域驗證、短期憑證、瀏覽器分流與 MCP 報表四段流程,目標是讓 AI agent 不只建議實驗,而是能在受限權限下操作實驗。第一版強調 credential-safe 設計與窄化 DOM 變更面,但目前報表仍以描述性指標為主,尚未宣稱統計顯著性。

zh-Hant

AIBTest 正在把傳統由人操作的 A/B 測試儀表板,改成 AI agent 可以直接使用的 MCP 原生實驗基礎設施。其公開頁面描述的流程從 DNS TXT 或 HTTPS 檔案完成網域控制權驗證開始,接著由本機 CLI 保存私鑰並取得短期 scoped token,再透過瀏覽器 SDK 做 sticky A/B assignment,最後讓代理從 MCP 讀取曝光與轉換結果。

這個設計的技術重點不是多一個實驗面板,而是把管理平面、執行平面和憑證邊界拆開。AIBTest 的 discovery 文件提供 MCP URL、版本化 SDK URL、Linux amd64 CLI 下載與 skill URL;skill 文件則要求代理不要讀取或輸出 credential store,並透過本機 loopback proxy 代管 client assertion 與遠端 access token。換言之,模型看到的是工具與報表,不應接觸私鑰或 bearer token。

在實驗執行面,第一版把 DOM 變更限制在 textContent、className 或 style,流量可由 1% 到 100% 調整,並要求在 selector 存在後才啟動 running 狀態。文件也提醒可見內容實驗要使用 anti-flicker pattern,避免 SDK 載入前後造成畫面跳動。這些限制使它比較像給代理使用的安全操作介面,而不是任意改寫前端的遠端腳本系統。

需要保留的是,AIBTest 目前公開文件顯示報表偏向曝光、轉換與轉換率等描述性指標,並明確提醒不要只靠 conversion rate 宣稱統計顯著性。它更適合被視為 agentic web development 的實驗閉環雛形:代理可以提出假設、建立實驗、部署 SDK、觀察結果並調整流量,但真正的推論門檻、樣本量規畫與產品決策仍需要工程與產品團隊共同把關。

來源

  1. AIBTest | Experiments your agent can operate
  2. AIBTest machine-readable discovery document
  3. AIBTest agent skill operating instructions
  4. Threads public post mentioning AIBTest