ホームへ戻る

AI 研究

再帰モデルの推論を512ステップに延長、数独の累積正解率が向上

同じ重みのまま計算を延長した研究で、当初は解けなかった問題の一部が後に解けることが確認された。結果は停止条件の研究に手がかりを与えるが、実サービスでの費用対効果はまだ実証されていない。

U.S. District Court for the Southern District of New York. 1814 · Public domain · Image source
zh-Hant

9月22日に投稿された研究《When Recursive Models Finish Computing》は、小型再帰モデルが一定のステップ数内で誤答しても、計算を続ければ解答に到達する可能性があると指摘している。著者らは難しい数独1,000問を対象に、外側の再帰を16ステップから512ステップに延長した。盤面全体が正解した問題の累積割合は、アテンションモデルで59.2%から87.5%に、MLP版で74.4%から91.9%に上昇した。[論文概要](https://arxiv.org/abs/2609.26487)

こうしたTiny Recursive Modelsは、小型ネットワークを繰り返し使い、潜在状態と解答表現を交互に更新する。元のプロジェクトは、数独向けにアテンション版とMLP版の学習設定を提供しており、計算の反復によって計算深度を増やせる。その工学的な価値は、パラメータ容量と推論の計算予算を分けて議論できる点にある。モデルの重みは同じままでも、各問題に何回の更新が必要かは、別途測定すべきコストとなる。[元の実装](https://github.com/SamsungSAILMontreal/TinyRecursiveModels)

今回の実験では重みと入力を固定し、問題が解けた後に潜在状態の変化が小さくなることも確認した。局所的なヤコビアン解析では、モデル自身の計算が進む方向に沿った摂動は通常縮小する一方、他の方向では依然として増幅する可能性が示された。したがって、状態が安定して見えるという観察は特定の軌道について述べたものにすぎず、あらゆる摂動に対して信頼できると直接解釈することはできない。[手法と分析](https://arxiv.org/html/2609.26487v1)

再現時には、データの範囲と評価基準にも注意が必要だ。Sudoku-Extremeのデータカードには、難易度の異なる複数の出典が記載されている。また、盤面の数字がすべて正しい場合にのみ成功と判定し、学習用とテスト用の問題は数学的に同値ではないと説明されている。実装・評価では、問題リスト、チェックポイント、デコード方法を固定し、異なるサブセットのスコアを直接比較しないようにする必要がある。データセットの難易度評価には記号的ソルバーのバックトラック回数が使われているが、これをそのままニューラルネットワークに必要なステップ数の推定値とみなすこともできない。[データセットの説明](https://huggingface.co/datasets/sapientinc/sudoku-extreme)

本研究の累積指標は、一度でも正解した問題を数えるものであり、指定した時点の出力の正解率とは概念が異なる。主な分析対象も、アテンションモデルのチェックポイント2つとMLPのチェックポイント1つに限られ、現時点ではプレプリントによる知見である。[評価の定義と限界](https://arxiv.org/html/2609.26487v1)

推論システムにとって、次に検証する価値があるのは、正解を知らずに確実に停止できるかどうかだ。状態の変化量と外部のルール検証器を組み合わせ、問題ごとの平均ステップ数、テールレイテンシ、誤停止率を別途測定し、計算予算を固定した運用方式と比較することが考えられる。これは今回の結果から導かれる工学的な研究方向である。許容ステップ数を増やしたこと自体は、サービスのスループットやコスト効率の改善を実証するものではなく、自由形式の言語タスクにそのまま外挿することもできない。

出典

  1. When Recursive Models Finish Computing
  2. When Recursive Models Finish Computing:全文與實驗附錄
  3. TinyRecursiveModels 原始實作
  4. Sudoku-Extreme 資料集說明