AI coding tools
阿里巴巴開源 Open Code Review,以確定性管線約束 LLM 的審查範圍與留言位置
Open Code Review 將檔案篩選、規則匹配和留言定位交給確定性程式,再讓 LLM 代理搜尋儲存庫上下文並判斷缺陷。官方自測顯示其 token 用量約為 Claude Code 的九分之一,但以精確率換取較低召回率,不能直接取代既有測試與靜態分析。

阿里巴巴將內部使用的 AI 程式碼審查工具 Open Code Review 以 Apache 2.0 授權開源。這套 Go 語言 CLI 讀取 Git diff,把評論錨定到具體程式行,也能用 `ocr scan` 掃描沒有可用 diff 的完整檔案或目錄;模型端則支援 OpenAI、Anthropic 相容介面,並可接入 GitHub Actions、GitLab CI、Gerrit及其他交付流程。
其技術重點不是再包裝一層提示詞,而是把審查拆成確定性管線與代理兩部分。程式邏輯負責選取檔案、過濾無關變更、把相依檔案組成審查單元,以及依副檔名與路徑套用空指標、執行緒安全、XSS、SQL injection 等規則;每個單元再交給隔離上下文的子代理。LLM 可以讀取完整檔案、搜尋程式庫及檢查其他變更,最後由獨立的定位與反思模組修正留言位置和內容。這種分工意在降低大型變更中漏讀檔案、行號漂移及提示細微變動造成的結果不穩定。
官方基準涵蓋 50 個開源儲存庫、200 個真實 pull request、10 種語言及 1,505 個由逾 80 名資深工程師交叉驗證的問題。團隊宣稱,在使用相同底層模型時,Open Code Review 的 precision 與 F1 高於 Claude Code,平均 token 用量約為其九分之一;但維護者也明示 recall 較低,代表較少誤報的代價是可能漏掉更多真實缺陷。這些結果尚未由獨立團隊重現,且比較會受模型版本、規則集及儲存庫類型影響。工程團隊下一步應檢查基準資料能否公開重跑、中文註解與內部框架的規則覆蓋率,以及低召回是否會把風險悄悄留到人工審查階段。