代理框架與開發工具
NVIDIA 開源 NOOA,以 Python 類別統一代理狀態、工具與持久記憶
NOOA 將代理表示成單一 Python 類別,以方法、欄位、docstring 與型別標註取代分散的提示及工具 schema。官方在 SWE-bench Verified 報告 82.2% 與約一半 token 用量,但框架仍屬研究預覽,執行模型生成程式碼時必須另加沙箱。

NVIDIA Labs 於 7 月 27 日公開 Object-Oriented Agents(NOOA)研究預覽,試圖把代理框架拉回一般 Python 軟體工程。開發者以一個類別描述代理:欄位保存狀態、方法代表能力、docstring 提供提示,型別標註則成為輸入輸出契約。方法本體若是省略號,執行期便交由 LLM 迴圈完成;具有正常函式本體的方法仍是確定性的 Python。這種設計讓代理能直接接受 diff、單元測試、追蹤及版本控制,而不必另外維護工具 schema、工作流圖與提示模板。
NOOA 的關鍵不只在語法。模型透過 Jupyter 式 REPL 撰寫 Python,把工具結果保留成執行環境中的活物件,只在上下文顯示有界預覽。相較把大型 JSON 或終端輸出反覆序列化回提示,pass-by-reference 可縮短 transcript,也能維持 append-only 提示快取。其長期記憶則存於可讀取的 SQLite 檔案,記錄具有型別、重要性及標籤,並能用 supports、contradicts、derived-from 等關係形成小型知識圖;代理可主動寫入、更正及查詢,背景程序再合併重複資料與清除失效內容。
NVIDIA 報告,以相同 GPT-5.5 為底層模型時,253 行的通用代理在 SWE-bench Verified 達 82.2%,平均每題約 29 次模型呼叫及 110 萬 token;比較系統需要 66 次呼叫與 220 萬 token 才達 78.2%。NOOA 亦在 CyberGym L1 報告 86.8%,並在 ARC-AGI-3 搭配 GPT-5.6 Sol 得到 85.1% mean RHAE、成本約每局 13.3 美元。這些結果附有程式、資料及評測流程,但比較點取自提交當時的公開結果,模型、預算與 harness 並非全部一致,仍不能把提升完全歸因於物件導向介面。
程式庫目前需直接從 GitHub 安裝,CLI、記憶及評測管線仍是選配子套件。更重要的是,「code as action」意味模型能執行任意 Python;專案明確警告可能外傳資料、刪除檔案或修改環境,並建議搭配 OpenShell 等隔離執行環境。工程團隊接下來應驗證型別契約在錯誤重試時是否穩定、SQLite 記憶如何處理敏感資料,以及 token 優勢能否跨模型與真實企業工具鏈重現。