벤치마크 상세
Aider Polyglot
기존 코드 편집 성공률: 터미널 pair programming, 기존 코드 수정, PR 단위 변경
공식 리더보드 보기
모델 단독 점수가 아니라 Aider 버전, 명령, 편집 형식이 결합된 결과입니다. 같은 모델도 실행 구성에 따라 별도 행으로 나타날 수 있습니다.
점수 그래프
왼쪽부터 높은 순서
1
88
gpt-5 (high) · diff
2
86.7
gpt-5 (medium) · diff
3
84.9
o3-pro (high) · diff
4
83.1
gemini-2.5-pro-preview-06-05 (32k think) · diff-fenced
5
81.3
o3 (high) · diff
6
81.3
gpt-5 (low) · diff
7
79.6
grok-4 (high) · diff
8
79.1
gemini-2.5-pro-preview-06-05 (default think) · diff-fenced
9
78.2
o3 (high) + gpt-4.1 · architect
10
76.9
Gemini 2.5 Pro Preview 05-06 · diff-fenced
읽는 법
전체 벤치마크여러 프로그래밍 언어에서 기존 파일을 직접 수정하는 능력을 봅니다.
코드를 새로 쓰는 능력보다 ‘이미 있는 코드를 제대로 고치는지’를 볼 때 유용합니다.