AI 程式代理評測
RepoComplianceBench:4つのコーディングエージェントは、オープンソースプロジェクトのAIコントリビューション規則をほぼ自発的に確認しない
49の実在するリポジトリから抽出した106件のタスクを用い、拒否、開示、検証、人間への引き継ぎに関する規則を評価した。4つの最先端モデルはいずれも、デフォルトではポリシーを自発的に探すことがほとんどなかった。規則の明示や検証器の導入により開示とテストは改善したものの、エージェントはすべての評価条件で「AIによるコントリビューション禁止」という要件に従わなかった。