AI 研究
遞迴模型延長推論至 512 步,數獨累積解題率測得提高
研究以相同權重延長運算,觀察到部分原先失敗的題目後續完成。結果提供停止條件的研究線索,但尚未證明真實服務的成本效益。

9 月 22 日提交的研究《When Recursive Models Finish Computing》指出,小型遞迴模型在固定步數內答錯,可能仍有完成運算的空間。作者在一千道困難數獨上,將外層遞迴由十六步延至五百一十二步;注意力模型的累積完整解題率由 59.2% 升至 87.5%,MLP 版本由 74.4% 升至 91.9%。[論文摘要](https://arxiv.org/abs/2609.26487)
這類 Tiny Recursive Models 重複使用小型網路,交替更新潛在狀態與答案表示。原始專案提供注意力與 MLP 數獨訓練配置,讓計算深度可透過重複運算增加。其工程價值在於分開討論參數容量與推論預算:模型可以維持相同權重,但每題需要多少次更新,仍是另一個必須量測的成本。[原始實作](https://github.com/SamsungSAILMontreal/TinyRecursiveModels)
新實驗保持權重與輸入不變,並觀察到解題後潛在狀態變動下降。局部雅可比分析顯示,沿模型自身運算方向的擾動通常收縮,其他方向卻仍可能放大。因此,狀態看似穩定只描述特定軌跡,不能直接視為任何擾動下都可靠。[方法與分析](https://arxiv.org/html/2609.26487v1)
重現時也要注意資料口徑。Sudoku-Extreme 資料卡列有多種難度來源,要求整盤數字皆正確才算成功,並說明訓練與測試題在數學上不等價。工程上應固定題目清單、檢查點與解碼方式,避免把不同子集的分數直接比較。資料集評分採符號求解器的回溯次數,也不能自行當成神經網路所需步數的估計。[資料集說明](https://huggingface.co/datasets/sapientinc/sudoku-extreme)
本研究的累積指標計入曾經答對的題目,與指定時刻的輸出正確率概念不同;主要分析僅涵蓋兩個注意力檢查點與一個 MLP 檢查點,仍屬預印本證據。[評測定義與限制](https://arxiv.org/html/2609.26487v1)
對推論系統而言,下一步值得驗證的是能否在不知道答案時可靠停止。可將狀態變動量與外部規則驗證器結合,另量測每題平均步數、尾端延遲及錯誤停止率,並與固定預算的部署方式比較。這是由結果延伸的工程方向;增加允許步數本身,並未證明服務吞吐量或成本效率改善,也不能直接外推到開放式語言任務。