GitHub, 코드 리뷰 에이전트 평가용 공개 벤치마크 ReviewBench 소개
GitHub가 AI 코드 리뷰 에이전트를 평가하는 공개 벤치마크 ReviewBench를 소개했다. GitHub에 따르면 풀리퀘스트 1억390만 건을 분석해 설계했으며, 19개 언어의 PR 219개로 구성됐다. 개발자는 자신의 리뷰 에이전트를 평가하고 결과를 제출할 수 있다.
중요한 문제를 잡아내면서 불필요한 지적을 줄이는 코드 리뷰 성능을 평가하려는 벤치마크다.
설계에 활용한 PR 분석 규모는 1억390만 건이며, 벤치마크 구성은 19개 언어·PR 219개다.
외부 개발자의 코드 리뷰 에이전트 평가와 결과 제출을 받는다.