模型訓練與開發工具
Compile by Training、自然言語仕様をオフラインで再利用可能なニューラル関数にコンパイル
新手法は、まず教師モデルでタスクデータを合成し、次に小型インタープリターのアダプターを微調整することで、テキスト仕様をバージョン管理可能な `.paw` 関数としてパッケージ化する。難易度の高い曖昧なテキストタスクで83.6%の意味的精度を達成した一方、コンパイルには外部モデルと約40GBのアクセラレーターメモリが必要で、従来のプログラムのような形式的保証も提供できない。

研究チームは、「カスタマーサポートのメッセージを分類する」「書式を修正する」といった、自然言語では簡単に記述できるものの、ルールとして完全に実装するのが難しいテキスト処理を、繰り返し実行可能なローカルのニューラル関数へ変換する「Compile by Training」を提案した。この手法は大規模モデルにPythonコードを生成させるのではなく、まず既存の高速なProgram-as-Weightsコンパイラーで重みを初期化する。次に、GPT系の教師モデルが仕様に基づいて入力と正解を合成し、共有の0.6BパラメーターPAWインタープリターを微調整する。最後に、タスク能力を保存、バージョン管理、合成が可能な`.paw`アダプターとしてパッケージ化する。
この設計では、リモートモデルを呼び出すたびに発生するコストを、一度限りの「コンパイル」段階へ移す。公開実装は教師モデルによる合成結果をキャッシュする。デプロイ先では、共有インタープリターを初回にダウンロードした後はローカルで推論でき、実際の入力を教師サービスへ送信する必要がなくなる。論文は、高速コンパイラーでは正確に回答できないサブセットであるFuzzyBench-Hardにおいて、83.6%の意味的精度を報告している。その代償として、コンパイル時間は数秒から約1分に延びる。公式SDKによると、標準的なプログラムファイルは約22MBであり、大量処理が必要で、出力空間が限定された分類、抽出、ルーティングのタスクに適している。
一方、エンジニアリング上の制約も明確だ。オープンソースのレシピには依然としてOpenAI APIキーが必要で、デフォルト設定の学習には約40GBのアクセラレーターメモリを要する。そのため、「オフライン」とはコンパイル完了後の推論のみを指す。また、重みは一般的なソースコードほど容易にレビューできず、分布外入力、競合する仕様、仕様変更に直面した場合、型チェックによって動作の正しさを証明することもできない。チームは現在、単一ファイルの学習実装とMITライセンスのライブラリを公開しているが、83.6%という数値は、あくまで著者が独自に定義した高難度サブセットで得た結果である。導入を検討する組織は次の段階として、独立にアノテーションされたテストセットでエッジケースを検証し、コンパイル、GPU、保守にかかるコストが、どの時点で大規模モデルを継続的に呼び出すコストを実際に下回るのかを比較すべきだ。