返回首頁

AI 程式代理/評測

Harness‑IF 分離「本來就會做」與真正遵令,12 款程式代理落差最高 7.4 點

Harness‑IF 將規則分散到系統提示、專案檔案、使用者指令、工具與技能描述,再以實際執行證據逐條評分。12 款前沿模型面對違反自身預設傾向的規則時,準確率一致下降。

File URL IIIF manifest Catalog record · Public domain · Image source
zh-Hant

程式代理通過測試,不代表它真的讀懂並遵守專案規則;它可能只是碰巧採取相同做法。8 月 12 日提交的 [Harness‑IF](https://arxiv.org/abs/2608.11727) 為此建立對照:60 個多輪程式任務取自 642 條規則庫,最終對 256 條規則給出判定,規則分別置於系統提示、專案指令檔、使用者訊息、工具描述及技能描述等五種介面。

核心指標 Against‑Prior Accuracy(AP‑Acc)只計算與代理無提示預設行為相反的規則。研究者先在九個探測版本中移除規則重跑,判定哪些行為原本就會發生,再測量加入規則後是否真正改變行動。12 款前沿模型的一般準確率為 72.1%至85.9%,AP‑Acc 則只有66.1%至78.6%;每款模型均下降3.6至7.4點,平均落差5.81點。控制共同題目後,最高名次不變,但三組相鄰排名互換,說明傳統總分可能錯估模型的實際服從能力。

這對採用 [AGENTS.md](https://agents.md/) 或類似專案規則的團隊很實際。OpenAI 公開的 [Codex agent loop](https://openai.com/index/unrolling-the-codex-agent-loop/) 顯示,代理會把沙箱政策、專案檔、技能與環境資訊聚合成不同提示層;Harness‑IF 的九版本衝突試驗卻發現,實際優先順序並不單純依提示深度排列,系統提示、專案檔與使用者指令整體上高於工具及技能描述。

工程上應把關鍵規則轉成可觀察的測試、政策檢查或執行收據,不能只確認最終 patch 正確。限制是主實驗僅60項任務,衝突試驗更只有九個版本;論文也未附公開程式或資料連結。下一步要看跨代理框架重現,以及規則互相矛盾、上下文壓縮後是否仍維持同樣排序。

來源

  1. Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents
  2. Unrolling the Codex agent loop
  3. AGENTS.md open format