代理與評測研究
強力なモデルがタスク規則を harness にコンパイル、GPT‑5.4‑mini の正解率が0.488から0.912に向上
強いモデルから弱いモデルへのテスト時転移実験で、より強力なモデルが、重みを更新することなく固定された小型モデル向けにルーティング、フォーマット検査、決定論的ソルバーを実装した。最良の harness はベースラインの誤りの約83%を修正したが、その成績は規則としてコンパイル可能な心の理論ベンチマークに大きく依存している。

Salesforce AI Research などの研究者は、「strong-to-weak scaffolding」実験を提案した。強力なモデルはテスト問題に直接回答せず、弱いモデルの蒸留やファインチューニングも行わない。代わりに、エージェント型プログラミング環境で再利用可能な推論 harness を構築する。この外部プログラムには、タスク分類、プロンプトテンプレート、決定論的ルール、回答フォーマットの検証、事例検索、シンボリックソルバーなどを組み込める。完成後は、固定された弱いモデルが同じエントリーポイントを通じて未知のテストデータを処理する。
実験では、BigToM、Hi‑ToM、MMToM‑QA、MuMA‑ToMという4つの心の理論データセットを統合した。構築側が参照できるのは、全体の5%に当たるラベル付き検証セット195問のみで、最終評価は約3,900問の非公開テストセットで行われた。研究では計72回の構築を実施し、Cursor、Claude Code、Codexの3プラットフォームと、GPT‑5.5、Opus‑4.7、Gemini‑3.1‑Proなどの構築モデルを網羅した。固定されたターゲットモデルであるGPT‑5.4‑miniは、harnessなしでのマクロ平均正解率が0.488だった。すべての構築設定で改善が見られ、平均は0.763、最良のGPT‑5.5/Codex構成は0.912に達した。これは、外部プログラムを追加していないGPT‑5.4の0.619さえ上回る。
分析によると、向上の主因はサンプリング回数の増加や思考時間の延長ではなく、不安定な推論をコードへ移したことにある。ルールや決定論的プログラムで直接処理される問題の割合と正解率には、`r=0.72`の相関が見られた。フォーマットの強制、貪欲デコーディング、問題タイプ別ルーティングが共通の下限性能を支える一方、深い信念の再帰、欺瞞、ベイズ的な目標推論は依然として主要なエラー要因だった。
これは最も重要な制約でもある。BigToMの一部の構造はほぼ完全にコンパイルできるため、この成績は弱いモデルが汎化可能な推論能力を獲得したことよりも、構築モデルがベンチマークの規則性を発見する能力を測っている可能性がある。人手で設計されたUserHarnessは0.939で、依然として最良の自動構築結果を上回る。また、現時点の論文ページには、完全なharnessコードと実行成果物が掲載されていない。エンジニアリングチームは、この手法を一度限りの高コストなワークフロー・コンパイルとして捉えるべきだ。次に検証すべきなのは、オープンエンドなタスク、データ分布、モデルのバージョンが変わっても改善を維持できるか、そして外部呼び出しの追加に伴う実際のレイテンシー、保守コスト、失敗モードである。