벤치마크 상세

SWE-bench Verified 500

동일 하네스 코딩 비교: 버그 수정, repo 단위 코드 변경, 코딩 에이전트 평가

공식 리더보드 보기 공식 Verified 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.

점수 그래프

왼쪽부터 높은 순서

실제 GitHub issue를 고치는 능력을 평가합니다. 사람이 검수한 500개 문제 subset입니다.

모델 자체 능력뿐 아니라 agent scaffold, tool 사용, test 실행 능력이 섞입니다.