벤치마크 상세
SWE-bench Verified 500
동일 하네스 코딩 비교: 버그 수정, repo 단위 코드 변경, 코딩 에이전트 평가
공식 리더보드 보기
공식 Verified 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.
점수 그래프
왼쪽부터 높은 순서읽는 법
전체 벤치마크실제 GitHub issue를 고치는 능력을 평가합니다. 사람이 검수한 500개 문제 subset입니다.
모델 자체 능력뿐 아니라 agent scaffold, tool 사용, test 실행 능력이 섞입니다.