DeepSeek는 2026년 4월 24일 V4 Pro Preview를 공개한 뒤 8월 13일 앱·웹·API에 GA 버전을 배포했다. 현재 API 모델 ID는 deepseek-v4-pro, 가격표에 표시된 버전은 DeepSeek-V4-Pro-0813이다. OpenAI Chat Completions와 Anthropic 형식에 더해 GA에서 Responses API를 공식 지원하며, low·high·max 세 단계로 추론 강도를 조절할 수 있다.
제품 사양은 100만 토큰 컨텍스트와 최대 38만 4천 토큰 출력까지 열려 있다. 하지만 실제 도입비를 가르는 요소는 컨텍스트 크기보다 출력량과 호출 시간대다. V4 Pro는 같은 공식 가격표의 V4 Flash보다 캐시 적중 입력·캐시 미적중 입력·출력이 모두 정확히 3배 비싸고, 평일 피크 시간에는 비피크 요금의 2배가 적용된다.
정확히 어떤 모델인가
| 항목 | DeepSeek 공식 문서상 내용 |
|---|---|
| 공식 제품명 | DeepSeek-V4-Pro |
| API ID | deepseek-v4-pro |
| 현재 API 버전 | DeepSeek-V4-Pro-0813 |
| Preview 공개 | 2026년 4월 24일 |
| GA 배포 | 2026년 8월 13일, 앱·웹·API |
| 4월 Preview 공개 규모 | 총 1.6T 파라미터, 활성 49B 파라미터 |
| 컨텍스트 | 1,000,000 토큰 |
| 최대 출력 | 384,000 토큰 |
| 추론 모드 | Thinking·Non-thinking, 기본 Thinking/high |
| 실제 추론 강도 | low·high·max |
| API 형식 | OpenAI Chat Completions, OpenAI Responses, Anthropic |
| 기능 | JSON 출력, 도구 호출, Chat Prefix Completion, FIM Completion(Non-thinking에서만) |
| 동시성 한도 표기 | 500 |
4월 공개 안내는 V4 Pro의 구조를 토큰 단위 압축과 DSA(DeepSeek Sparse Attention)의 조합으로 설명한다. 같은 문서에서 100만 토큰 컨텍스트를 DeepSeek 공식 서비스의 기본 규격으로 제시했고, 코딩·도구 사용을 포함한 에이전트 작업에 맞춘 모델이라고 밝혔다.
가격표의 384K는 최대 출력 한도이고 1M은 전체 컨텍스트 길이다. 두 수치를 합산 가능한 별도 용량처럼 읽으면 안 된다. 긴 코드 생성이나 보고서 작성에서 출력 토큰이 늘면, 컨텍스트를 모두 채우지 않아도 출력 단가가 비용의 대부분을 차지할 수 있다.
GA에서 달라진 점
DeepSeek 변경 기록은 V4 Pro GA의 변화로 앱·웹·API 정식 배포, 에이전트 성능 개선, Responses API 기본 지원, 추론 강도 제어, 피크·비피크 요금 도입을 적고 있다. API 호출 시 모델 이름은 Preview와 같은 deepseek-v4-pro를 유지한다.
추론 설정은 표면적인 호환 값과 실제 동작 값을 구분해야 한다. 공식 Thinking Mode 문서에 따르면 요청한 medium, high, xhigh는 모두 실제 high로 매핑된다. 별도 수준으로 동작하는 값은 low·high·max이며, 기본값은 Thinking 활성화와 high다. OpenAI Responses 형식에서는 none으로 Thinking을 끌 수 있다.
도구를 쓰는 다중 턴 구현에는 추가 규칙이 있다. Thinking 모드에서 tools를 전달했다면, 모델이 그 턴에 도구를 호출하지 않았더라도 이후 요청에 reasoning_content를 빠짐없이 다시 보내야 한다. 공식 문서는 이 값이 누락되면 API가 400 오류를 반환한다고 설명한다. 기존 Chat Completions 기반 에이전트를 옮길 때 먼저 회귀 테스트해야 할 부분이다.
공식 벤치마크에서 확인되는 위치
8월 13일 변경 기록에 실린 V4 Pro GA의 에이전트 관련 결과는 다음과 같다. 이 수치는 DeepSeek가 공개한 결과이며, 외부 기관의 독립 재현 결과는 아니다.
| 벤치마크 | V4 Pro GA 공식 수치 |
|---|---|
| HLE, 도구 없음 / 도구 사용 | 42.7 / 60.0 |
| Terminal Bench 2.1 | 87.9 |
| NL2Repo | 61.5 |
| Cybergym | 83.3 |
| DeepSWE | 62.7 |
| Toolathlon-Verified | 74.1 |
| Agents' Last Exam | 25.7 |
| AutomationBench (Public) | 31.8 |
같은 변경 기록에는 DSBench-FullStack 71.1과 DSBench-Hard 67.2도 적혀 있지만, DeepSeek가 내부 테스트 세트라고 밝힌 항목이므로 위의 외부 공개 벤치마크 표와 분리해 보는 편이 안전하다. 제공된 공식 문서에는 V4 Pro Preview와 GA를 같은 조건으로 비교한 전후 표가 없다. 따라서 GA가 Preview보다 얼마나 향상됐는지는 이 자료만으로 계산할 수 없다.
가장 가까운 대안
공식 가격표와 변경 기록에서 같은 항목을 맞출 수 있는 대안은 DeepSeek V4 Flash다. 두 모델은 1M 컨텍스트, 384K 최대 출력, Thinking·Non-thinking, JSON 출력, 도구 호출, Responses API와 Anthropic API 지원이 같다. 차이는 에이전트 평가 결과, 단가, 동시성이다.
| 항목 | V4 Pro | V4 Flash |
|---|---|---|
| Terminal Bench 2.1 | 87.9 | 82.7 |
| NL2Repo | 61.5 | 54.2 |
| DeepSWE | 62.7 | 54.4 |
| Toolathlon-Verified | 74.1 | 70.3 |
| AutomationBench (Public) | 31.8 | 25.1 |
| 피크 캐시 미적중 입력 / 1M | $1.32 | $0.44 |
| 피크 출력 / 1M | $3.96 | $1.32 |
| 공식 동시성 한도 표기 | 500 | 2,500 |
V4 Pro는 표에 넣은 모든 에이전트 평가에서 높은 공식 수치를 보인다. 격차는 Agents' Last Exam처럼 0.5점에 그치는 항목도 있고 DeepSWE처럼 8.3점인 항목도 있어, 모든 작업에서 같은 개선 폭을 기대해서는 안 된다. 또한 V4 Flash 항목에는 DeepSeek Harness minimal mode와 max effort 등의 실행 조건이 적혀 있지만 V4 Pro GA 항목은 같은 설명을 반복하지 않는다. 이 표는 같은 변경 기록에서 확인되는 방향 비교이며 완전히 통제된 독립 실험으로 보기는 어렵다.
제공된 DeepSeek 공식 자료에는 Grok 4.5를 동일 조건으로 실행한 수치와 현재 xAI 요금이 없다. 그래서 이 글에서는 공급자 간 성능 순위와 비용 우열을 만들지 않는다.
가격과 실제 선택 조건
DeepSeek 가격표는 100만 토큰 단위로 청구하며, 평일 UTC 01:0004:00와 06:0010:00를 피크 시간으로 정한다. 한국 시간으로는 평일 10:0013:00와 15:0019:00다. 나머지 시간에는 피크의 절반인 비피크 요금이 적용된다.
| V4 Pro 항목 | 비피크 | 피크 |
|---|---|---|
| 캐시 적중 입력 / 1M | $0.022 | $0.044 |
| 캐시 미적중 입력 / 1M | $0.66 | $1.32 |
| 출력 / 1M | $1.98 | $3.96 |
공식 단가에 월 1,000만 토큰의 캐시 미적중 입력과 200만 토큰의 출력을 단순 대입하면 비피크 전용은 $10.56, 피크 전용은 $21.12다. 같은 사용량을 V4 Flash에 적용하면 각각 $3.52와 $7.04다. V4 Pro의 공식 벤치마크 우위가 해당 업무의 재시도 감소나 성공률 개선으로 3배의 토큰 가격을 상쇄하는지가 구매 판단선이다.
캐시가 모두 적중한다고 가정해도 출력 비용은 남는다. 같은 1,000만 입력·200만 출력 예시의 V4 Pro 비용은 비피크 $4.18, 피크 $8.36이며, 피크 예시 중 $7.92가 출력에서 발생한다. 긴 에이전트 응답을 그대로 저장하는 구조라면 프롬프트 캐시만 최적화하지 말고 최대 출력, 중간 보고 빈도, 도구 결과 요약 정책도 함께 제한해야 한다.
먼저 답하면
- 추천 작업: 도구 사용·저장소 탐색·터미널 실행이 여러 단계로 이어지고, 실패 한 건의 인건비가 토큰 가격 차이보다 큰 코딩·업무 에이전트
- 비추천 작업: 같은 1M 컨텍스트와 API 기능이면 충분하고 호출량·동시성이 더 중요한 단순 에이전트 및 대량 텍스트 처리
- 현재 판단: V4 Pro는 V4 Flash보다 높은 공식 에이전트 수치에 정확히 3배의 토큰 가격을 지불하는 선택이다. 대표 업무에서 성공률·재시도 횟수를 직접 비교하지 않았다면 전 호출을 Pro로 고정하기보다 난도가 높은 작업만 라우팅하는 편이 비용을 설명하기 쉽다.
추천 대상 / 비추천 대상
추천
- Terminal Bench·NL2Repo·DeepSWE와 가까운 장시간 코딩 작업을 운영하며, 자체 평가에서도 V4 Flash보다 재시도가 줄어드는 팀
- OpenAI Responses API나 Anthropic 형식을 유지하면서 1M 컨텍스트와 low·high·max 추론 제어를 함께 쓰려는 에이전트 개발팀
- 비피크 시간대로 비대화형 작업을 옮기고, 출력 길이와 캐시 적중률을 요청별로 측정할 수 있는 서비스
비추천
- 단순 분류·요약·변환처럼 V4 Flash로 충분한 작업을 높은 동시성으로 처리하는 서비스
- Thinking 도구 루프에서
reasoning_content를 보존할 수 없는 기존 클라이언트 - DeepSeek가 공개한 벤치마크만으로 다른 공급자 모델보다 낫다는 결론이 필요한 구매 절차
판단
DeepSeek V4 Pro GA는 Preview와 같은 API ID를 유지하면서 Responses API, 세 단계의 실제 추론 강도, 에이전트 평가 결과와 시간대별 요금을 제품 조건으로 정리했다. 1M 컨텍스트와 384K 최대 출력, OpenAI·Anthropic 호환 형식을 한 모델에서 제공한다는 점은 큰 코드베이스와 장기 도구 루프를 구성하기에 편하다.
가격값을 하는지는 에이전트 실패 비용으로 판단해야 한다. V4 Flash와 컨텍스트·최대 출력·주요 API 기능이 같은데 토큰 단가는 3배이고 동시성 한도 표기는 5분의 1이다. 반면 공식 변경 기록의 코딩·자동화 평가는 Pro가 일관되게 높다. 업무 성공률이 조금만 올라가도 사람의 재작업을 크게 줄이는 환경이라면 Pro가 맞고, 성공률 차이가 작거나 요청량이 우선이면 Flash가 더 합리적이다.
운영 단계에서는 난도 기반 라우팅, 한국 시간 피크 회피, 출력 상한, 캐시 적중률 측정을 함께 적용하는 구성이 적합하다. Pro를 모든 요청의 기본값으로 두기 전에 실제 저장소 작업과 도구 호출 시나리오로 V4 Flash와 나란히 평가해야 한다.
아직 공식 문서에서 확인되지 않은 부분
- V4 Pro Preview와 GA의 동일 조건 전후 벤치마크
- 한국어 장문 작성·교정 품질과 실제 첫 토큰 지연 시간
- 각 벤치마크에서 V4 Pro GA가 사용한 세부 하네스·추론 설정 전체
- DeepSeek 외부 모델과 동일 프롬프트·도구·예산으로 수행한 공식 비교
함께 읽을 글
근거와 출처
- DeepSeek V4 Preview 공개 안내 — V4 Pro 모델 규모, DSA, 1M 컨텍스트, API ID와 지원 형식. DeepSeek API Docs, 확인일 2026-08-26
- DeepSeek API 변경 기록 — 2026년 8월 13일 GA 배포, 에이전트 벤치마크, Responses API, 추론 강도, 가격 변경 시점. DeepSeek API Docs, 확인일 2026-08-26
- DeepSeek 모델·가격표 — 현재 모델 버전, 컨텍스트·최대 출력, 기능, 동시성, 피크·비피크 토큰 단가와 시간대. DeepSeek API Docs, 확인일 2026-08-26
- DeepSeek Thinking Mode 문서 — 기본 추론 모드, effort 매핑, Responses 형식 설정과 도구 호출 시
reasoning_content처리 규칙. DeepSeek API Docs, 확인일 2026-08-26
게시: 2026-08-26 00:05 KST 작성 방식: 직접 사용기가 아닌 DeepSeek 공식 문서 분석
독자 의견
댓글 0
글에 대한 생각과 경험을 남겨 주세요. 서로를 존중하는 표현을 부탁드립니다.