返回首頁

代理評測

AeroCopilotBench 把飛行程序變成可執行狀態機,最佳代理安全通過率仍僅 72.6%

新評測以 73 項駕駛艙異常任務測試代理能否觀察狀態、操作系統並全程遵守硬性安全限制,而非只回答航空知識題。GPT-5.6 Sol 的成功率最高,但相近的知識分數與任務成功率並不一致,顯示靜態問答不能替代互動安全測試。

Tony Kiriakidis · CC BY 2.0 · Image source
zh-Hant

北京航空航天大學團隊提出 [AeroCopilotBench](https://arxiv.org/abs/2608.16349),把航空代理評測由選擇題推進至具狀態的虛擬駕駛艙。Tier-1 包含從 FAA、CFR 與飛行手冊整理的 1,200 題航空知識題;Tier-2 則把 Cessna 172S 與 Piper PA-44-180 的緊急及異常程序編碼成 12 個情境模板、73 項任務及 259 條任務專屬硬性安全限制。

其 AeroCopilot Operational Environment(ACOE)不是連續飛行模擬器,而是部分可觀察、確定性離散狀態機。代理只能透過 12 項固定工具逐項讀取儀表、改變可寫控制器或查詢凍結的天氣、性能與法規資料;隱藏狀態、最終目標及評分規則均不可直接讀取。合法但危險的操作會真正執行並永久記入軌跡,因此代理即使稍後恢復正確設定,也不能抹去安全違規。每題最多 48 個決策回合,成功條件同時要求完成全部目標及整段軌跡零違規。

環境另包裝成 MCP server;研究者以全部 73 項任務的參考操作序列驗證原生介面與 MCP 介面會產生相同回應及分數。這利用了 [MCP 對模型工具的標準化介面](https://modelcontextprotocol.io/docs/getting-started/intro),但正式模型實驗仍走原生 function-calling 路徑。

12 款模型各執行每項 Tier-2 任務三次。GPT-5.6 Sol 以 72.6% 成功率居首,安全合規率為 97.3%;開放權重模型最佳是 GLM-5.1 的 53.0%。更值得注意的是,Qwen3.5-397B-A17B 與 DeepSeek V4 Pro 的知識題準確率只差 0.41 個百分點,互動成功率卻相差 27.4 個百分點。三款代表模型的 451 次失敗主要涉及漏掉關鍵程序、錯誤語義先驗、未用最新狀態約束動作,以及長流程後段漂移。

限制同樣明顯:ACOE 不模擬空氣動力、感測雜訊、故障演化或真實時間壓力,且採閉卷設定,未提供電子檢查表;論文頁面也未連結公開程式庫。它目前更適合作為代理編排與回歸測試方法,而非證明模型已能安全進入真實駕駛艙。

來源

  1. AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots
  2. What is the Model Context Protocol (MCP)?