模型評測
TsuGO 將推理文字還原成搜尋樹,Gemini 3.1 Pro 開放式難題準確率僅 19%
TsuGO 用 600 道可驗證圍棋死活題,量度模型是否把推理資源投向正確分支,而不只計算答案與 token 數。移除四選一候選後,多款推理模型的準確率與搜尋效率同步急跌,與神經網路引導的 KataGo 仍有明顯距離。

長鏈式思考通常以答案正確率或每 token 效益評分,卻無法分辨模型是在有方向地驗證候選,還是產生大量文字後碰巧命中答案。8 月 13 日公開的 TsuGO 把這個問題改寫成可驗證的對抗搜尋:模型必須從圍棋死活局面找出關鍵第一手,並預讀對手的最佳反擊。
資料池包含 1,500 題,局面以 SGF 保存,並轉成座標、19×19 矩陣及影像等五種表示。主實驗從三個難度各抽 200 題,分別測試提供四個候選點的 K=4 模式,以及完全不提供候選的開放搜尋。系統再以 LLM extractor 將自由格式推理拆成候選探索、變化圖閱讀、局面判斷與回溯,重建 process search tree;300 題人工覆核中,抽取器與兩名專家在目標結構上的一致率為 93% 至 98%。
核心指標 SearchE 結合錯誤分支浪費、首次命中正確候選的時機,以及正確候選的搜尋次序。結果顯示,Kimi-K2.5 在簡單題由 K=4 的 52.0% 準確率、39.9 SearchE,降至開放模式的 27.8% 與 26.4。Gemini 3.1 Pro 雖在簡單四選一達 80%,到了開放式困難題只剩 19%。相同 200 次 visit 預算下,KataGo-b18 在開放式困難題仍達 43%,反映語言模型的瓶頸不只是棋力,而是候選生成、排序與持續追蹤有效分支。
TsuGO 適合用來檢查 inference-time search、tree-of-thought 或 verifier 是否真正改善資源配置,但不能把 SearchE 當成模型內部思考的直接量測。封閉模型只暴露壓縮後的 reasoning summary;KataGo 又直接讀取棋盤狀態,並非 token 或介面等價的基線。資料與評測程式是否完整公開,也仍是後續重現的關鍵。