구글이 직전 모델인 Gemini 3.6 Flash를 내놓은 지 불과 3주 만에 Gemini 3.7 Flash를 기습 공개했다. 이번 업데이트는 모델 가중치를 처음부터 다시 학습하는 사전학습(pre-training)을 거치지 않고, 추론과 도구 호출 알고리즘을 손봐 실제 코딩 및 장기 에이전트 성능을 끌어올린 점이 특징이다. 동시에 연말까지 입력과 출력 단가를 절반으로 깎아주는 한시 프로모션을 적용했다. 단가 인하 뒤에 숨은 토큰 소비량 증가와 프로모션 종료 시점의 비용 리스크를 함께 따져본다.

먼저 답하면

  • 추천 작업: 초당 300토큰 이상의 고속 처리가 필요하면서 복잡한 도구 호출과 긴 코드베이스 탐색을 수행하는 에이전트 파이프라인
  • 비추천 작업: 모호한 질문에 대해 답변을 유보해야 하는 엄격한 금융·의료 컴플라이언스 워크플로, 2027년 이후 고정 단가 유지가 필수적인 장기 계약 서비스
  • 현재 판단: Gemini 3.7 Flash는 초당 340토큰이라는 압도적인 생성 속도와 DeepSWE 65.3%의 코딩 해결 능력을 갖춘 강력한 실무 워크호스 모델이다. 다만 2026년 12월 31일까지 적용되는 반값 프로모션($0.75 / $3.75)을 상시 원가로 간주해 예산을 잡아서는 안 되며, 3.6 대비 40% 늘어난 출력 토큰 소비량을 감안해야 한다.

정확히 어떤 모델인가

항목 확인된 내용
공급자 Google
공식 제품명 Gemini 3.7 Flash
API ID gemini-3.7-flash
접근 상태 Generally available (AI Studio, Vertex AI, Gemini API, Spark)
컨텍스트 1,000,000 토큰 (최대 2,000,000 토큰 지원)
최대 출력 64,000 토큰
프로모션 가격 (2026-12-31까지) 입력 $0.75 / 1M 토큰, 출력 $3.75 / 1M 토큰
표준 정가 (2027-01-01부터) 입력 $1.50 / 1M 토큰, 출력 $7.50 / 1M 토큰
입출력 형식 텍스트·이미지·오디오·비디오·PDF 입력, 텍스트 출력
주요 기능 Thinking 알고리즘 개편, 초당 340토큰 생성, 24시간 개인 에이전트 Spark 백엔드 연동, Computer Use 지원

구글 모델 카드에 따르면 3.7 Flash는 3.6 Flash와 기초 신경망 아키텍처, 사전학습 데이터셋, 실행 하드웨어가 동일하다. 달라진 핵심은 '사고 과정(Thinking Algorithm)'의 개편이다. 문제가 막히면 다른 가설을 시도하고, 명령이 모호하면 되물으며, 다단계 도구 호출 시 계획 수립에 더 많은 연산을 배분하도록 튜닝됐다.

벤치마크에서 확인되는 위치

벤치마크 Gemini 3.6 Flash Gemini 3.7 Flash 변화폭
FrontierCode 1.1 34.4% 43.6% +9.2%p
DeepSWE v1.1 49.0% 65.3% +16.3%p
GDP.pdf (문서 이해) 22.0% 34.0% +12.0%p
AutomationBench 17.0% 30.4% +13.4%p
AA Intelligence Index 52 56 +4점 (GPT-5.6 Terra와 1점 차)
AA-AnalystAgent - 60.0% Claude Opus 5(54%) 상회
생성 속도 (Artificial Analysis) - 340 tok/s 측정 모델 187개 중 1위

FrontierCode와 DeepSWE에서 두 자릿수 성장을 기록하며 상위 모델인 GPT-5.6 Terra(57점) 턱밑까지 추격했다. 특히 Artificial Analysis 측정 기준 초당 340토큰의 응답 속도를 기록해 대규모 실시간 에이전트 서빙에서 뚜렷한 속도 우위를 보인다.

가격과 실제 선택 조건

구글은 2026년 12월 31일까지 100만 토큰당 입력 $0.75, 출력 $3.75라는 반값 할인을 제공한다. 하지만 실제 결제 금액을 계산할 때는 두 가지를 주의해야 한다.

  1. 출력 토큰 증가: 알고리즘이 더 길게 사고하고 중간 단계를 스스로 검증하면서 동일한 질의에 대해 3.6 Flash 대비 약 40% 많은 출력 토큰을 소비한다. 토큰 단가는 50% 줄었지만 실제 작업당 청구 금액은 약 30% 절감되는 수준이다.
  2. 첫 토큰 지연 시간(TTFT): 초기 사고 과정이 늘어나 첫 응답까지 9.83초가 소요된다. 단순 챗봇처럼 즉각적인 반응이 필요한 UI에는 체감 지연이 발생할 수 있다.

가장 가까운 대안

선택지 대안이 나은 상황 Gemini 3.7 Flash를 고를 이유
GPT-5.4 Mini 단기 지연 시간이 짧아야 하고 연중 고정 가격이 중요한 프로덕션 환경 긴 비디오·오디오 직접 입력과 초당 340토큰의 빠른 배치 생성, 연말까지의 반값 단가
Claude Sonnet 5 복잡한 코딩 지시 이행과 안전성 검증이 엄격한 엔터프라이즈 환경 100만~200만 토큰의 멀티모달 컨텍스트 처리 비용 효율
DeepSeek-V4-Pro 상시 초저가 API 단가 유지가 최우선인 텍스트 전용 자동화 파이프라인 네이티브 멀티모달(비디오/오디오/PDF) 입력과 안정적인 글로벌 클라우드 SLA

최종 총평

Gemini 3.7 Flash는 사전학습 재수행 없이도 추론 행동 방식의 고도화만으로 상위 플래그십 모델에 근접한 코딩 및 에이전트 실전 능력을 보여준 수작이다. 연말까지 대규모 배치 작업을 돌리거나 에이전트 프로토타입을 빠르게 검증하려는 팀에게 최적의 선택지다. 다만 2027년 정상가 복귀를 전제로 한 백업 계획을 마련해 두는 것이 안전하다.

출처