返回首頁

AI coding/軟體工程研究

RAMP 以版本庫內 AI 設定檔分級:未配置專案採用 coding agent 後複雜度增幅近兩倍

研究團隊以 441 個企業版本庫建立四級 Repository AI Maturity Profile,再重新分析 509 個採用 coding agent 的開源專案。具共同規則或代理設定的版本庫品質指標較佳,但觀察性研究尚不能證明設定檔本身造成改善。

King of Hearts · CC BY-SA 3.0 · Image source
zh-Hant

研究團隊提出 Repository AI Maturity Profile(RAMP),不靠問卷,而是掃描提交到版本控制系統的 AI 工具設定,衡量專案如何管理 coding agent。四個層級依序是:完全沒有設定的 L1;具有行為規則、架構說明或 coding standards 的 L2;加入具名代理、指令與 Skills 的 L3;以及定義多代理依賴、交接和執行紀錄的 L4。

分類器涵蓋 Claude Code、Cursor、GitHub Copilot、Codex、Gemini CLI、OpenHands 等 12 種工具,先以 43 組路徑模式尋找檔案,再用路徑與內容 embedding 對應至九種語意類別。開發樣本包含 27 家組織的 441 個私人版本庫、1,046 份驗證過的 AI artifact;獨立人工標註在留出樣本的 35 個版本庫中重現 34 個等級。結果顯示 66.7% 為 L1、24.7% 為 L2、8.6% 為 L3,私人樣本沒有觀察到 L4;73.8% 的設定檔提交後從未修改。

團隊隨後把固定分類器套用到既有 coding-agent 採用資料。509 個可追蹤版本庫中,agent-first 子樣本的提交量在各成熟度層級均增加約 28% 至 38%,但品質變化不同:L1 的 cognitive complexity 增加 53%,L2 以上增加 27%;靜態分析警告的增幅亦相差約 1.7 倍。這使 `AGENTS.md`、`CLAUDE.md`、`.cursor/` 規則及可重用技能不再只是操作便利,也可能成為可量度的工程控制面。

工程團隊可先把代理規則納入 code review、設定擁有者與更新週期,並追蹤複雜度、警告及重工率。不過 RAMP 只顯示相關性:管理紀律較佳的團隊本來就可能同時維護設定檔與產出較佳程式碼;私人樣本無法逐庫公開,且 L4 在開發資料中缺席。下一步需要在代理導入前固定配置的前瞻或隨機實驗,才能判斷哪些規則真正降低技術債。

來源

  1. A Few Pages of Markdown: Committed AI Configuration and Lower Quality Cost after Coding-Agent Adoption
  2. RAMP replication package