返回首頁

AI coding infrastructure

代理寫碼令 Anthropic CI 工作量半年增 25 倍,測試選擇服務被迫改為無狀態架構

Anthropic 的測試數量增加十倍,原本依賴單一寫入程序的測試影響分析服務逐漸追不上 PR。新版以可水平擴展的 listener、日誌與獨立彙整器取代程序內狀態,但成本與漏選率等關鍵數據仍未公開。

البرمجية: كلود لقطة الشاشة: أنون · Public domain · Image source
zh-Hant

Anthropic 9 月 14 日公開其內部持續整合系統的擴展經驗:在代理開始大量撰寫、審查與送出程式碼後,CI 工作數於六個月內增加 25 倍,測試總量也成長十倍。公司另稱 Claude 撰寫約 80% 的合併程式碼,工程師產出是 2021 至 2025 年平均值的八倍;這些都是未經外部稽核的內部統計,程式碼行數也不能直接等同生產力。

真正失效的是測試影響分析服務。舊版由 listener 依序記錄每次 CI 結果,再由 selector 根據歷史失敗與套件相依性決定每個 PR 應跑哪些測試。因每項測試的歷史狀態留在單一程序,系統無法任意增加寫入器;當 listener 落後二十分鐘,可能已有數萬筆結果尚未反映,令 selector 繼續執行已知 flaky 測試,或暫時看不到新增及修復後的測試。這不代表未測程式直接上線,但會降低測試集合的即時性與可信度。

團隊依序擴充主機、按套件分片及每日重啟,三次修補分別只維持 70 日、29 日及不足一日。最終版本把狀態移到記憶體資料庫:任何無狀態 listener 都可把結果附加至 journal,另一個小型 consumer 每數秒彙整成逐測試歷史,selector 再直接查詢。架構較昂貴,卻可水平擴展及分段量測;官方稱一名工程師用三週完成。

對採用 coding agent 的團隊,重點是容量規劃不能只看模型 token。PR 粒度、夜間提交、測試建立速度與自動審查會共同放大下游負載。接下來應觀察 Anthropic 是否公開絕對工作量、選測召回率、端到端延遲及成本;導入類似架構時,也應監控輸入/輸出事件守恆、佇列落後量,並以全量測試抽樣驗證 selector 沒有漏掉回歸。

來源

  1. Agentic coding is straining CI. Here’s how we scaled test impact analysis at Anthropic
  2. Claude writes 80% of the code, CI broke first