벤치마크

벤치마크

벤치마크 이름은 원문 그대로 보고, 한국어 설명으로 무엇을 평가하는지 확인합니다. 카드를 클릭하면 원문 리더보드가 열립니다.

점수 요약

점수순
최신 종합 평가LiveBench

확인 시각: · 지표: mean of 7 category averages · 버전: 2026-06-25 release

claude-fable-5-1-max-effort
83.41
claude-fable-5-max-effort
82.97
gpt-6-astra-max
82.16
muse-spark-1.3-xhigh
81.59
gpt-5.6-sol-max
81.05
gpt-5.5-xhigh
80.19
claude-opus-5-max-effort
80.08
smaug-agentic
79.51
kimi-k3
79.19
gemini-3.7-flash-high
78.83

상위 10개만 표시했습니다. 전체 54개 결과는 공식 리더보드에서 확인할 수 있습니다.

공식 LiveBench 방식에 맞춰 분야별 평균을 먼저 계산하고, 공개된 분야 평균을 다시 동일 가중치로 평균했습니다. 해당 릴리스에 공개된 모델 전체를 담습니다.

동일 하네스 코딩 비교SWE-bench Verified 500

확인 시각: · 지표: % resolved · 버전: SWE-bench Verified 500 · mini-SWE-agent 2.0.0

Claude 4.5 Opus (high)
76.8
Gemini 3 Flash (high)
75.8
MiniMax M2.5 (high)
75.8
Claude 4.6 Opus
75.6
GLM 5 (high)
72.8
GPT 5.2 (high)
72.8
GPT 5.2 Codex
72.8
Claude 4.5 Sonnet (high)
71.4
Kimi K2.5 (high)
70.8
DeepSeek V3.2 (high)
70

상위 10개만 표시했습니다. 전체 13개 결과는 공식 리더보드에서 확인할 수 있습니다.

공식 Verified 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.

다언어 저장소 이슈 해결SWE-bench Multilingual 300

확인 시각: · 지표: % resolved · 버전: SWE-bench Multilingual 300 · mini-SWE-agent 2.0.0a0

Gemini 3 Flash
72.7
Claude 4.6 Opus
72
Claude 4.5 Opus
70.7
GLM 5
69.7
Gemini 3 Pro
68.7
MiniMax M2.5
68.3
Kimi K2.5
67.3
Claude 4.5 Sonnet
67
GPT 5.2 (high)
66.7
Claude 4.5 Haiku
64.7

상위 10개만 표시했습니다. 전체 12개 결과는 공식 리더보드에서 확인할 수 있습니다.

공식 multilingual 리더보드에서 같은 mini-SWE-agent 버전으로 평가된 모델만 비교합니다. 모델과 하네스·도구 설정이 결합된 결과이며 일반 채팅 성능으로 해석하지 않습니다.

기존 코드 편집 성공률Aider Polyglot

확인 시각: · 지표: pass rate 2 (%) · 버전: 225-case polyglot leaderboard

gpt-5 (high) · diff
88
gpt-5 (medium) · diff
86.7
o3-pro (high) · diff
84.9
gemini-2.5-pro-preview-06-05 (32k think) · diff-fenced
83.1
o3 (high) · diff
81.3
gpt-5 (low) · diff
81.3
grok-4 (high) · diff
79.6
gemini-2.5-pro-preview-06-05 (default think) · diff-fenced
79.1
o3 (high) + gpt-4.1 · architect
78.2
Gemini 2.5 Pro Preview 05-06 · diff-fenced
76.9

상위 10개만 표시했습니다. 전체 69개 결과는 공식 리더보드에서 확인할 수 있습니다.

모델 단독 점수가 아니라 Aider 버전, 명령, 편집 형식이 결합된 결과입니다. 같은 모델도 실행 구성에 따라 별도 행으로 나타날 수 있습니다.

벤치마크 목록

클릭해서 원문 이동
LMArena 체감 품질 일반 대화, 글쓰기, 설명력, 한국어처럼 사람이 읽었을 때 좋은 답변 상세 점수 보기 Artificial Analysis Intelligence Index 품질·속도·가격 실제 서비스에 어떤 모델을 붙일지 고를 때 상세 점수 보기 LiveBench 최신 종합 평가 최신 모델의 수학, 코딩, 추론, 언어 이해 흐름을 빠르게 볼 때 상세 점수 보기 BenchLM LLM 리더보드 허브 모델별 벤치마크 흐름을 빠르게 훑을 때 상세 점수 보기 Arena.ai 모델 아레나 사람이 체감하는 모델 답변 품질과 최신 모델 경쟁 구도를 볼 때 상세 점수 보기 Vellum LLM Leaderboard 실무형 모델 비교 제품에 어떤 모델을 붙일지 후보를 좁힐 때 상세 점수 보기 SWE-bench Verified 500 동일 하네스 코딩 비교 버그 수정, repo 단위 코드 변경, 코딩 에이전트 평가 상세 점수 보기 SWE-bench Multilingual 300 다언어 저장소 이슈 해결 TypeScript, Java, Go 등 다양한 코드베이스를 다루는 에이전트 상세 점수 보기 LiveCodeBench 코딩 추론 알고리즘 문제 풀이, 코드 생성, 디버깅형 coding reasoning 상세 점수 보기 Aider Polyglot 기존 코드 편집 성공률 터미널 pair programming, 기존 코드 수정, PR 단위 변경 상세 점수 보기 Terminal-Bench 터미널 작업 CLI 작업, repo 세팅, 데이터 처리, 시스템 작업 자동화 상세 점수 보기 TAU-bench 도구 사용 상담봇, 예약/환불/주문 변경 같은 업무 자동화 상세 점수 보기 BFCL 함수 호출 API 호출형 agent, 플러그인, 업무 자동화 상세 점수 보기 GPQA Diamond 전문 추론 과학, 수학, 전문 지식 질문, 깊은 추론 상세 점수 보기 Humanity's Last Exam 프론티어 한계 frontier 모델의 한계, 어려운 전문 질문, 장기 reasoning 비교 상세 점수 보기 MMLU-Pro 일반 지식 넓은 일반 지식, 시험형 문제, 기본 reasoning 비교 상세 점수 보기 MATH / AIME 수학 수학, 논리 퍼즐, 단계적 계산, formal reasoning 상세 점수 보기 MMMU 멀티모달 이해 차트, 문서 이미지, 시각 문제, 이미지 기반 질의응답 상세 점수 보기 ChartQA / DocVQA 문서·차트 이해 PDF, 보고서, 매출표, 사업 문서 분석 상세 점수 보기 LongBench 긴 문맥 대형 문서 요약, 긴 회의록, 긴 코드베이스 분석 상세 점수 보기 Needle-in-a-Haystack 긴 문맥 검색 대량 문서 검색, 계약서/로그/리서치 자료 탐색 상세 점수 보기 VibeEval 체감형 평가 일상 사용감, 글쓰기, 창의적 응답, 한국어 체감 품질을 볼 때 상세 점수 보기 HELM 종합 평가 모델을 품질, 편향, 견고성, 효율 등 여러 축으로 넓게 비교 상세 점수 보기