GitHub发布ReviewBench 给AI代码审查立标尺

GitHub在官方博客宣布推出ReviewBench,一个用于评测AI代码审查智能体的公开基准,即日起以研究预览版开放。它想回答的是一个此前缺少统一答案的问题:不同的AI审查工具各自能发现什么、会漏掉什么、误报有多少。
基准语料来自对GitHub全站1.039亿个真实拉取请求(PR)的分布分析,最终选取219个公开PR,覆盖187个开源仓库和19种编程语言,语言与仓库规模分布与全站对齐,同时刻意提高多文件、实质性改动的权重,避免测试集被琐碎的单文件修改稀释。
为解决“标准答案从哪来”的老问题,ReviewBench采用多源黄金集:由真实人类审查员、从作者后续提交中反推的问题、确定性静态分析工具和多家族前沿大模型共同产出候选发现,语义去重后按统一规则逐条判定,只有真实、相关且非琐碎的发现才算命中。裁判由Claude Sonnet 5担任,评分规则与裁判配置全部公开。
可信度方面,GitHub请未参与构建基准的资深工程师对全部黄金发现独立复标,与基准判定的一致率达96.6%。指标分两族:grounded系列只对照固定答案集,用于跨系统比较;augmented系列会把未命中的发现单独送裁判判断真伪,给“发现了标准答案之外的真问题”的智能体记分。结果还可按严重度与问题类别切片,并调整查全与精准之间的权重。
GitHub称,借助ReviewBench,其Copilot代码审查的离线评测已能更准确地预判线上实验的方向。对开发者而言,这个公开排行榜最实际的用途,是按自己的风险偏好挑选审查工具:安全团队可以只看critical级别和correctness类别,追求安静反馈的团队则调高精准权重。
编译自 GitHub Blog,原标题:"ReviewBench: An open benchmark for AI code review"