應用研究
Otter 以棋步歷史與時限預測人類決策,15.3M 參數模型報告 55.23% top-1
Otter 不把每個棋盤局面視為獨立樣本,而是同時納入最近 20 步及時間控制資訊。模型在作者的 Lichess rapid 測試上優於 Maia-2,但未與已發布的 Maia-3 在同一資料切分直接比較。

棋力引擎尋找的是客觀最佳著,而人類行為模型要預測特定程度玩家實際會走哪一步。Otter 的核心改動是把這個問題由單一棋盤分類改成具歷史與時間條件的序列預測:15.3M 參數模型讀取最近 20 步,用歷史編碼器捕捉開局偏好、局勢演變與同一盤棋中的行為慣性,再以時間控制模組調整棋步分布,反映不同用時壓力下的選擇差異。
作者從 1.17 億盤 Lichess rapid 對局建立 61 億個局面,聲稱只用一張 T4、30 天完成訓練。模型取得 55.23% top-1 與 90.95% top-5 棋步命中率;在 11 個 Elo 區間中,1900 至 1999 分組的 top-1 最高,達 57.38%。這顯示對人類行為而言,前序動作與時間條件可能比單純擴大位置模型更有價值,也適合用於分級陪練、錯誤預測及以「同程度玩家會怎麼走」為核心的分析工具。
不過,「超越先前最佳」需保守解讀。論文主要比較 Maia-2;Maia-3 已在今年稍早公布 57.1% move-matching accuracy,並提供 5M、23M、79M 模型,但兩者使用的棋種、時間控制、資料期間與測試切分不同,不能直接以 55.23% 對 57.1% 判定高下。Otter 的資料量也不等於可重現性:研究者仍需核對去重、玩家洩漏、時間欄位缺失及不同月份的分布漂移。最有價值的後續將是把 Otter、Maia-3 與其他人類棋步模型放進同一公開測試集,分別消融歷史長度與時限訊號。