跳到正文
GitHub Blog · AI & ML· Michelle Zhou·· 3 小时前精选AI 评分81

GitHub 发布 AI 代码审查开源基准测试 ReviewBench

ReviewBench: An open benchmark for AI code review

AI 导读

GitHub 发布了针对 AI 代码审查智能体的开源基准测试 ReviewBench,旨在提供严谨且可复现的离线评估方法。该基准包含从海量 GitHub PR 中筛选出的 219 个样本,采用多源黄金数据集和统一评分标准,支持按严重程度和类别进行细分评估。内部实践表明,该基准的离线评估结果与线上 A/B 测试表现高度一致,开发者现可提交自己的智能体参与排行榜评测。

推荐理由

该开源基准测试基于海量真实 PR 构建,能为 AI 代码审查智能体提供与线上生产环境高度一致的离线评估信号。

来源:GitHub Blog · AI & ML · github.blog