代理與評測研究
強模型把任務規則編譯成 harness,GPT‑5.4‑mini 準確率由 0.488 升至 0.912
一項強到弱測試時轉移實驗,讓較強模型替固定的小模型編寫路由、格式檢查與確定性求解程式,而不更新其權重。最佳 harness 修正約 83% 的基線錯誤,但成績高度依賴可被編譯成規則的心智理論基準。

Salesforce AI Research 等研究者提出「strong-to-weak scaffolding」實驗:強模型不直接回答測試題,也不蒸餾或微調弱模型,而是在代理式編程環境內建立可重用的推論 harness。這個外層程式可包含任務分類、提示模板、確定性規則、答案格式驗證、檢索範例及符號求解器;完成後再由固定的弱模型透過同一入口處理未見測試資料。
實驗整合 BigToM、Hi‑ToM、MMToM‑QA 與 MuMA‑ToM 四項心智理論資料集。建造者只能看到 195 題、即整體 5% 的標記驗證集,最終在約 3,900 題隱藏測試集上評分。研究共執行 72 次建造,涵蓋 Cursor、Claude Code 與 Codex 三種平台,以及 GPT‑5.5、Opus‑4.7、Gemini‑3.1‑Pro 等建造模型。固定目標 GPT‑5.4‑mini 的無 harness 宏平均準確率為 0.488;所有建造設定均帶來正增益,平均達 0.763,最佳 GPT‑5.5/Codex 組合為 0.912,甚至高於未加外層程式的 GPT‑5.4 所得 0.619。
分析顯示,提升並非主要來自更多抽樣或更長思考,而是把脆弱推理搬到程式碼:由規則或確定性程式直接處理的題目比例,與準確率呈 `r=0.72` 相關。格式強制、貪婪解碼及題型路由提供共同底線;深層信念遞迴、欺騙與貝葉斯目標推斷則仍是主要錯誤來源。
這也構成最重要的限制。BigToM 的部分結構可被近乎完整編譯,成績可能衡量建造者發現基準規律的能力,而非弱模型獲得可泛化推理。人工設計的 UserHarness 仍以 0.939 高於最佳自動結果,且論文頁目前未列出完整 harness 程式與執行產物。工程團隊應把方法視為一次性高成本的工作流編譯:下一步要觀察它能否跨開放式任務、資料分布與模型版本維持增益,以及新增外層呼叫後的實際延遲、維護成本和失敗模式。