評測與關聯式學習
RelArena-α 統一重跑 21 項關聯資料任務,TabPFN-Rel 在標準調參模型中居首
Prior Labs 開源統一資料切分、調參與評分流程,重新比較圖模型、關聯 Transformer 與資料表方法。TabPFN-Rel 顯示先聚合關聯資料再交給表格基礎模型仍具競爭力,但 CPU 特徵合成成本未完整計入排行榜時間。

關聯資料學習長期缺少可重現的共同跑道:不同論文使用不同時間切分、資料庫快照、調參預算,甚至沒有公開訓練程式。Prior Labs 發布的 [RelArena-α 論文](https://arxiv.org/abs/2608.16319)與 [Apache 2.0 程式庫](https://github.com/PriorLabs/relarena),把 RelBench v1 的七個資料庫、21 項實體層級預測任務,統一到相同載入、巢狀時間驗證、調參及 Bradley–Terry Elo 評分流程。
框架刻意區分「模型」與「系統」。模型只宣告搜尋空間,由 RelArena 控制試驗、驗證集選擇與最終重訓;系統可自行帶入連續或條件式調參程序,因此只能比較端到端結果,不能把差距全歸因於模型架構。這項區分解釋了排行榜:TabPFN-Rel 在標準調參的模型組居首,但採自訂調參的 RT-PluRel 才是合併排行榜第一。
TabPFN-Rel 沒有直接在整個關聯圖上訓練。它沿主鍵及外鍵路徑執行 deep feature synthesis,把相關資料表聚合成單一特徵表,再由 TabPFN-3 以標註列作為 context 預測。新版修正調參與測試階段資料庫時間點不一致的問題,把可用 context 擴大約一個數量級,並以近期性與多樣性選取示例。API 版本還可保留文字欄位,Elo 為 1821;不傳送資料至託管服務的開源文字-free 版本為 1706,差距主要集中在兩項文字訊號強的任務。
結果也挑戰「關聯資料一定需要專用圖架構」的直覺。TabPFN-Rel 與 RT-PluRel 是僅有在全部 21 項任務都勝過每實體常數預測器的方法;該零特徵基線甚至各自在四項任務擊敗 RelGNN 與 RelGT。這不代表攤平方法普遍較好:特徵合成的 join path 隨深度快速增加,而整份單 seed 排行榜已需數百小時。
目前發布物明確標示為研究用 α 版,只涵蓋實體層級預測。計時表也未納入各方法差異甚大的 CPU 預處理;TabPFN-Rel 在大型資料庫可能反而由這一步主導。下一步應觀察多 seed 排名、端到端資源計量,以及第三方提交在相同時間邊界下能否重現現有次序。