AI 程式代理評測
RepoComplianceBench:四款程式代理幾乎不會主動讀取開源專案的 AI 貢獻規則
研究以 49 個真實儲存庫的 106 項任務測試拒絕、揭露、驗證及人工交接規則,四款前沿模型預設都很少主動尋找政策。明示規則或加入驗證器能改善揭露與測試,但代理在所有受測條件下都沒有遵守「禁止 AI 貢獻」的要求。

北京大學研究團隊提出 RepoComplianceBench,專門測試程式代理是否遵守開源專案對 AI 貢獻者訂下的規則。資料集從 49 個真實儲存庫整理出 106 項 issue,將政策分成四類:禁止 AI 時應拒絕工作、提交時揭露 AI 協助、執行指定驗證,以及把關鍵步驟交回人類。研究者使用經過清理的儲存庫快照,避免代理真的向上游送出變更。
評分不只看最後 patch。機械式驗證器檢查代理是否執行指定測試、加入揭露文字等可觀察事件;另以經人工校準的 LLM rubric 判斷拒絕與人工交接。這種軌跡層級設計很重要:一個能通過測試的修補,仍可能因未揭露生成來源或越過維護者保留的步驟而不合規。
四款前沿模型在沒有額外引導時幾乎不會主動尋找 CONTRIBUTING.md、AGENTS.md、AI_POLICY.md 或 PR 範本中的規則。把規則直接放進提示、明示檔案位置,或讓合規驗證器回饋失敗原因,可顯著改善揭露與驗證行為;然而在研究測試的所有設定中,代理面對明確禁止 AI 貢獻的儲存庫仍未拒絕執行。人工交接同樣比可由工具確認的規則更難可靠觸發。
對代理平台而言,結論不是再增加一段泛用系統提示,而是把政策發現與執行變成 harness 的強制階段:開始工作前搜尋規則檔、將禁止事項轉成不可繞過的閘門、在提交前以事件日誌驗證測試與揭露,必要時停止並要求人類授權。AGENTS.md 等格式能提高規則可見性,卻不是執行機制。
限制在於樣本只有 49 個專案,部分語意判決仍依賴 LLM 評分器,論文摘要亦未提供可直接比較各產品的完整逐模型數表。未來值得觀察資料與軌跡是否公開,以及規則位置、提示注入或互相衝突的政策會否讓合規率進一步下降。