模型訓練與開發工具
Compile by Training 將自然語言規格編成可離線重用的神經函式
新方法先以教師模型合成任務資料,再微調小型直譯器的適配器,把文字規格封裝成可版本化的 `.paw` 函式。它在困難模糊文字任務取得 83.6%語意準確率,但編譯需外部模型、約 40GB 加速器記憶體,亦不能提供傳統程式的形式保證。

研究團隊提出 Compile by Training,把「分類客服訊息」「修補格式」等容易用自然語言描述、卻難以用規則完整實作的文字工作,轉成可重複執行的本機神經函式。它不是請大型模型產生 Python 程式,而是先用既有的快速 Program-as-Weights 編譯器初始化權重,再由 GPT 類教師模型依規格合成輸入與答案,微調共用的 0.6B 參數 PAW 直譯器,最後把任務能力包裝成可儲存、版本控制及組合的 `.paw` 適配器。
這項設計把成本由每次呼叫遠端模型,移到一次性的「編譯」階段。公開實作會快取教師合成結果;部署端首次下載共用直譯器後,即可在本機推論,不再把實際輸入傳給教師服務。論文在 FuzzyBench-Hard——快速編譯器無法精確答對的子集——報告 83.6%語意準確率,代價是編譯時間由數秒增至約一分鐘。官方 SDK 另稱標準程式檔約 22MB,適合大量、輸出空間受限的分類、抽取或路由工作。
工程邊界同樣明確。開源配方仍須 OpenAI API 金鑰,預設訓練約需 40GB 加速器記憶體,因此「離線」只描述編譯完成後的推論。權重也不像一般程式碼般容易審查,遇到分布外輸入、衝突規格或規格改版時,不能靠型別檢查證明行為正確。團隊目前公開了單檔訓練實作及 MIT 授權程式庫,但 83.6%仍是作者在自訂困難子集上的結果。採用者下一步應以獨立標註測試集驗證邊界案例,並比較編譯、GPU與維護成本何時真正低於持續呼叫大型模型。