評測與可重現性
Orcetra 自揭 AutoML 基準失真:同一子集勝率由 59.4% 降至 34.3%
Orcetra 原稱在 513 套 OpenML 資料上大幅勝過 FLAML 與 AutoGluon,但作者稽核後發現測試集洩漏及算力不對等。修正協定後,三套系統在重跑子集已無統計顯著差異。

Orcetra 團隊公開一份罕見的自我稽核:這套 1,661 行的 AutoML 搜尋器,原先在 513 套 OpenML 表格資料上取得 57.1% 勝率,高於 AutoGluon 的 21.6% 與 FLAML 的 10.9%。但搜尋迴圈會在同一測試切分上評估數十個候選模型,再回報其中最高分;競品則在訓練資料內選模,最後只碰測試集一次。Orcetra 因而不是單純評估泛化能力,而是在適應性地挑選最有利的測試噪音。
第二個問題是名義上的 60 秒並非硬性截止。程式只在啟動下一個候選前檢查時間,已開始的模型仍可跑完,使 Orcetra 每套資料的中位耗時達 120 秒,為 AutoGluon 的 2.24 倍。四個工作程序還會讓各模型爭用同一台 20 核 ARM64 主機;遵守時間限制的 FLAML、AutoGluon 因壅塞減少試驗,Orcetra 則以延長牆鐘時間保住搜尋量。另一次只重跑迴歸任務的結果若被錯誤合併,甚至會把表面勝率推至 61.2%。
作者改以驗證集選模、外部程序強制截止,並讓每套框架固定取得五個核心。在143 套重跑資料上,舊協定會給 Orcetra 59.4% 勝率;修正後只剩 34.3%,對 FLAML 與 AutoGluon 的成對差異均不顯著。配對分析顯示,直接使用測試集選模約貢獻 4.8 個百分點,更多失真來自算力配置。
這對短時限模型搜尋、代理評測及推論路由都有直接警示:預算必須由外部執行器強制,並記錄實際牆鐘、核心與候選數。限制是修正版只重跑 143 套資料、每套僅用一個切分,AutoGluon 又缺少選用的 fastai 模型;百分比不宜外推至其他硬體。不過 Orcetra 網站與 README 目前仍展示舊的 57.1% 結果,工程團隊應觀察其是否同步更新公開宣稱與預設評測管線。