模型編譯與本機推論
Compile by Training:自然言語仕様を0.6Bモデルで実行可能なローカル関数へコンパイル
新手法では、大規模な教師モデルでタスクデータを合成し、関数ごとに専用のLoRAを学習することで、以降のリクエストではリモートモデルを呼び出す必要がなくなる。難易度の高いテストセットで83.6%の意味的正解率を達成した一方、コンパイルには依然として教師API、約40 GBのアクセラレーターメモリ、出力検証が必要だ。

大規模モデルは、「説明するのは簡単だが、ルールとして記述するのは難しい」テキスト処理に適している。しかし、リクエストごとにAPIを呼び出すと、レイテンシーやコスト、ベンダー依存が積み重なる。ウォータールー大学とハーバード大学の研究者が提案した[Compile by Training](https://arxiv.org/abs/2609.04199)は、モデル適応をソフトウェアのビルドに似た工程へと変える。開発者がまず入力、出力、制約を自然言語で定義し、それに基づいて教師モデルが構造化された例を合成する。コンパイラーはデータを検証した後、勾配降下法によってタスク専用のLoRAをファインチューニングする。
すべての関数は、凍結・量子化された単一のQwen3-0.6Bインタープリターを共有する。公開されている構成では、既存のProgram-as-Weightsコンパイラーで初期重みと実行プロンプトを生成した後、rank 64、alpha 16のLoRAを100ステップ学習する。完成物は`.paw`としてパッケージ化され、adapter、プロンプトのスケルトン、元の仕様、インタープリターのメタデータが含まれる。インタープリターは一度ダウンロードするだけでよく、新しい入力はローカルで処理できるほか、関数のキャッシュ、バージョン管理、合成も可能だ。チームが公開したWebサイトアシスタントでは、曖昧な分類と回答選択を30個のコンパイル済み関数に任せる一方、BM25検索とフロー制御は決定論的なプログラムに残している。
旧来の高速コンパイラーでは正確に処理できない例を特に選んだFuzzyBench-Hardにおいて、新手法はLLM Exact Matchを22.4%から83.6%へ引き上げた。その代償として、B300でのビルド時間は3.5秒から50.9秒に増加し、H200とRTXではそれぞれ68.2秒、99.2秒だった。この指標ではGPT-5.5が意味的な正しさを判定している。著者が注釈した128件に対して97.7%の一致精度を示したものの、形式検証ではない。
[公開実装](https://github.com/programasweights/compile-by-training)はMIT Licenseで提供されているが、現時点の中核部分は簡素なコンパイルスクリプト一式にすぎず、デフォルトのワークフローにはOpenAI APIキーと約40 GBの空きアクセラレーターメモリが必要となる。「ローカル」と呼べるのはコンパイル後の推論だけであり、仕様とデータ合成の段階では依然として外部の教師モデルに情報が渡る。また、adapterは教師モデルが見落としたエッジケースも引き継ぐ。エンジニアリングチームは次の段階として、中国語タスク、分布外入力、仕様変更後の挙動ドリフトを測定し、安全性やコンプライアンスに関わる処理には決定論的な検証ゲートを残すべきだ。