ホームへ戻る

評測與關聯式學習

RelArena-α、21件のリレーショナルデータタスクを統一条件で再実行。標準チューニングモデルではTabPFN-Relが首位

Prior Labsは、データ分割、ハイパーパラメーターチューニング、評価を統一するオープンソースのパイプラインを公開し、グラフモデル、リレーショナルTransformer、表形式データ手法を改めて比較した。TabPFN-Relの結果は、リレーショナルデータを先に集約してから表形式データ向け基盤モデルに渡す手法が依然として競争力を持つことを示す。ただし、CPUによる特徴量合成のコストは、ランキングの実行時間に完全には算入されていない。

Planet Labs inc. · CC BY-SA 4.0 · Image source
zh-Hant

リレーショナルデータ学習の分野では長らく、再現可能な共通の評価基盤が不足していた。論文ごとに時間分割、データベースのスナップショット、チューニング予算が異なり、学習コードさえ公開されていない場合もあった。Prior Labsが公開した[RelArena-αの論文](https://arxiv.org/abs/2608.16319)と[Apache 2.0ライセンスのライブラリ](https://github.com/PriorLabs/relarena)は、RelBench v1の7つのデータベースと21件のエンティティレベル予測タスクを、共通のデータ読み込み、ネストされた時間ベース検証、ハイパーパラメーターチューニング、Bradley–Terry Elo評価のパイプラインに統合した。

このフレームワークでは、「モデル」と「システム」を意図的に区別している。モデルは探索空間のみを宣言し、試行、検証セットによる選択、最終的な再学習はRelArenaが制御する。一方、システムは独自の逐次的または条件付きチューニング手順を組み込めるため、比較できるのはエンドツーエンドの結果に限られ、性能差のすべてをモデルアーキテクチャに帰することはできない。この区別がランキングの結果を説明している。標準チューニングを用いるモデル群ではTabPFN-Relが首位だが、統合ランキングの1位は独自チューニングを採用するRT-PluRelである。

TabPFN-Relは、リレーショナルグラフ全体を直接学習するわけではない。主キーと外キーのパスに沿ってdeep feature synthesisを実行し、関連するテーブルを単一の特徴量テーブルへ集約した後、TabPFN-3がラベル付き行をcontextとして予測する。新版では、チューニング時とテスト時でデータベースの時点が一致していなかった問題を修正し、利用可能なcontextを約1桁拡大したうえで、最新性と多様性に基づいて例を選択する。API版ではテキスト列も保持でき、Eloは1821だった。ホスト型サービスへデータを送信しないオープンソースのtext-free版は1706で、差は主にテキスト信号が強い2つのタスクに集中していた。

この結果は、「リレーショナルデータには必ず専用のグラフアーキテクチャが必要だ」という直感にも疑問を投げかける。全21タスクでエンティティごとの定数予測器を上回ったのは、TabPFN-RelとRT-PluRelだけだった。この特徴量ゼロのベースラインは、RelGNNとRelGTをそれぞれ4つのタスクで上回っている。ただし、これはフラット化手法が一般に優れていることを意味しない。特徴量合成のjoin pathは深さとともに急速に増加し、ランキング全体を単一seedで実行するだけでも数百時間を要している。

現時点のリリースは研究用途のα版であることが明記されており、対象もエンティティレベル予測に限られる。また、実行時間の表には、手法間で大きく異なるCPU前処理の時間が含まれていない。大規模データベースでは、TabPFN-Relの処理時間はむしろこの工程に支配される可能性がある。今後は、複数seedでの順位、エンドツーエンドのリソース計測、さらに第三者による提出結果が同一の時間境界条件で現在の順位を再現できるかどうかに注目すべきだ。

出典

  1. Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI
  2. PriorLabs/relarena