乐于分享
好东西不私藏

阿里内部用了两年的 AI 代码审查工具开源了:比 Claude Code 准确率更高,token 消耗仅 1/9

阿里内部用了两年的 AI 代码审查工具开源了:比 Claude Code 准确率更高,token 消耗仅 1/9

Open Code Review(OCR) 是阿里巴巴开源的 AI 代码审查 CLI 工具(Apache 2.0),前身是阿里集团内部官方 AI 代码审查助手——过去两年服务了数万开发者,识别了数百万个代码缺陷。经过大规模验证后开源,只需配置一个模型端点即可使用。在相同底层模型下,准确率和 F1 综合得分显著高于 Claude Code 等通用 Agent,token 消耗仅约 1/9。

基准测试

200 个真实 Pull Request,50 个热门开源仓库,10 种编程语言,80+ 位资深工程师交叉标注验证(1,505 个标注缺陷):

指标
Open Code Review
通用 Agent (Claude Code)
含义
准确率 (Precision)
显著更高
较低
报告的问题中真正有效的比例
F1 综合得分
显著更高
较低
准确率与召回率的调和均值
平均 Token
~1/9
基准
直接影响 API 成本
审查速度
更快
较慢
CI 流水线等待时间

设计取舍:召回率略低于通用 Agent——以精准度换取低噪声,减少人工确认假阳性的成本。

核心设计:确定性工程 × Agent 混合

确定性工程(负责"不能出错"的事)

环节
做什么
精准文件筛选
工程逻辑决定哪些文件该审、哪些该跳过,不让模型"偷懒"
智能文件打包
关联文件归并为一个审查单元(如 en/zh 资源文件),每个包作为独立 sub-agent,天然支持并发
精细化规则匹配
按文件特征匹配审查规则,聚焦模型注意力,而不是靠 prompt 硬描述
外挂定位与反思
独立的评论定位模块 + 评论反思模块,系统性提升位置准确性和内容准确性

Agent(负责"需要判断"的事)

  • • 场景化提示词:针对代码审查深度优化,提升效果同时降低 token
  • • 场景化工具集:基于大量线上数据分析工具调用轨迹后精简沉淀的专属工具集
  • • 读取完整文件:不只是看 diff,可以读完整文件、搜索代码库、检查其他变更文件获取上下文

使用方法

安装

npm install -g @alibaba-group/open-code-review

配置模型

ocr config provider   # 选择供应商(OpenAI/Anthropic/DeepSeek/通义千问等)
ocr config model      # 选择模型

交互式界面引导,完成后自动测试连通性。

开始审查

cd your-project

# 审查工作区所有变更

ocr review

# 比较两个分支

ocr review --from main --to feature-branch

# 审查单个 commit

ocr review --commit abc123

# 全量扫描(审查整个文件,不只是 diff)

ocr scan
ocr scan --path internal/agent

CI/CD 集成

支持 GitHub Actions、GitLab CI、GitFlic CI、Gerrit——每次提交自动审查。

编程 Agent 集成

# 委托模式:让你的 AI 编程 agent 自己执行审查
ocr delegate preview
ocr delegate rule src/main.go src/handler.go

支持作为 Skill 或 Plugin 接入 Claude Code、Codex、Cursor。

功能亮点

行级精度的结构化审查意见

不是给你一段笼统的评论——每条审查意见精确到具体行号,告诉你问题在哪一行、是什么问题、建议怎么改。

深度审查,不只是看 diff

Agent 具备工具调用能力:

  • • 读取变更文件的完整内容
  • • 搜索代码库中的相关实现
  • • 检查其他文件获取上下文

做到理解意图再审查,而不是只看表面 diff。

ocr scan:审查整个文件

不只是审查 diff——对不熟悉的代码库或没有有意义 diff 的目录,直接扫描整个文件做全量审查。

会话恢复

审查中断了?可以恢复继续,不用重跑:

ocr session list
ocr review --from main --to feature-branch --resume <session-id>

会话查看器

在浏览器中浏览和回放审查会话,方便团队内分享审查结果。

应用场景

场景 1:CI/CD 自动审查

传统痛点:人工 Code Review 排队等,大 PR 没人愿意看

解决方案:每次 PR 自动触发 OCR 审查,行级意见直接 comment 到 PR,人工只需确认

场景 2:代替通用 Agent 做审查

传统痛点:Claude Code + Skills 做审查,行号飘、效果不稳、token 消耗大

解决方案:专为代码审查设计的工程 + Agent 混合架构,准确率更高,成本 1/9

场景 3:审计不熟悉的代码库

传统痛点:接手一个旧项目,想全面了解代码质量但没有最近的 diff

解决方案ocr scan 全量扫描整个目录,不需要 Git 历史也能审查

场景 4:大 PR 审查

传统痛点:几十个文件的大 PR,通用 Agent 选择性跳过,遗漏严重

解决方案:确定性的文件筛选 + 智能打包 + 并发审查,确保每个重要文件都被覆盖

常见问题

Q:支持哪些模型?

任何 OpenAI 兼容的模型端点都行。内置支持 OpenAI、Anthropic、DeepSeek、通义千问等。

Q:和 CodeRabbit / Qodo 等商业工具比?

核心区别:开源免费、私有化部署、数据不出你的环境。且经过阿里内部两年大规模验证。

Q:审查规则可以自定义吗?

可以。支持深度定制规则,过滤路径、指定路径、调整审查重点。详见文档。

Q:支持哪些语言?

基于 LLM,理论上支持所有编程语言。基准测试覆盖了 10 种语言。

资源链接

  • • GitHub 仓库https://github.com/alibaba/open-code-review