返回首頁

AI coding tools

阿里巴巴開源 Open Code Review,以確定性管線約束 LLM 的審查範圍與留言位置

Open Code Review 將檔案篩選、規則匹配和留言定位交給確定性程式,再讓 LLM 代理搜尋儲存庫上下文並判斷缺陷。官方自測顯示其 token 用量約為 Claude Code 的九分之一,但以精確率換取較低召回率,不能直接取代既有測試與靜態分析。

The original uploader was Snow storm in Eastern Asia at English Wikipedia. · CC BY 3.0 · Image source
zh-Hant

阿里巴巴將內部使用的 AI 程式碼審查工具 Open Code Review 以 Apache 2.0 授權開源。這套 Go 語言 CLI 讀取 Git diff,把評論錨定到具體程式行,也能用 `ocr scan` 掃描沒有可用 diff 的完整檔案或目錄;模型端則支援 OpenAI、Anthropic 相容介面,並可接入 GitHub Actions、GitLab CI、Gerrit及其他交付流程。

其技術重點不是再包裝一層提示詞,而是把審查拆成確定性管線與代理兩部分。程式邏輯負責選取檔案、過濾無關變更、把相依檔案組成審查單元,以及依副檔名與路徑套用空指標、執行緒安全、XSS、SQL injection 等規則;每個單元再交給隔離上下文的子代理。LLM 可以讀取完整檔案、搜尋程式庫及檢查其他變更,最後由獨立的定位與反思模組修正留言位置和內容。這種分工意在降低大型變更中漏讀檔案、行號漂移及提示細微變動造成的結果不穩定。

官方基準涵蓋 50 個開源儲存庫、200 個真實 pull request、10 種語言及 1,505 個由逾 80 名資深工程師交叉驗證的問題。團隊宣稱,在使用相同底層模型時,Open Code Review 的 precision 與 F1 高於 Claude Code,平均 token 用量約為其九分之一;但維護者也明示 recall 較低,代表較少誤報的代價是可能漏掉更多真實缺陷。這些結果尚未由獨立團隊重現,且比較會受模型版本、規則集及儲存庫類型影響。工程團隊下一步應檢查基準資料能否公開重跑、中文註解與內部框架的規則覆蓋率,以及低召回是否會把風險悄悄留到人工審查階段。

來源

  1. alibaba/open-code-review repository and benchmark
  2. Open Code Review v1.7.16 release