AI 研究與代理訓練
TRACE 用隱藏干預合成可驗證獎勵,讓 35B 代理學會追查資料異常
TRACE 先在模擬器注入已知故障,再讓代理透過 Python 與 SQL 從含雜訊、混淆因素的觀測資料反推根因。Qwen3.5-35B-A3B 經 SFT 與強化學習後,在保留測試集超過論文評估的提示式前沿模型,但成果仍限於單一合成廣告環境。

數學與程式碼適合採用可驗證獎勵強化學習(RLVR),因為答案能由計算器或測試套件低成本判定;營運異常診斷卻通常沒有即時、無歧義的真實標籤。TRACE 的做法是反轉資料生成流程:先抽取一個隱藏干預並注入受控模擬器,再生成代理可觀察的資料。干預本身就是根因標籤,因此可提供客觀獎勵;代理仍必須面對雜訊、混淆因素與分散於不同資料表的證據。
研究團隊把方法實作成數位廣告診斷環境,涵蓋 12 種根因。代理能呼叫 Python 和 SQL,不只要指出故障類型,還須在適用時找出受影響的細分受眾。以 235 個保留案例衡量 FullAttr@1,提示式 Claude Opus 5 得到 0.686;Qwen3.5-35B-A3B 原始模型只有 0.159,監督微調後升至 0.637,再以合成獎勵進行強化學習則達 0.757。論文也稱,訓練後模型使用的工具呼叫顯著少於同一 35B 基礎模型的提示式版本。
技術重點不是特定廣告任務,而是把難以事後確認的診斷問題改造成「先製造原因、再隱藏原因」的訓練環境。這可延伸至資料管線故障、雲端維運或安全事件,但前提是模擬器能覆蓋真實世界的因果結構。現有結果來自單一、合成且只有 12 類根因的環境,也尚未證明模型能處理未知故障、模擬器未建模的交互作用或真實企業資料偏移。工程團隊接下來應關注環境生成器是否開源、獎勵是否可被鑽漏洞,以及跨系統遷移時的效能下降。