Gemini 3.5 Flash는 Google Gemini API에서 Stable로 제공되는 텍스트 출력 모델이다. API ID는 gemini-3.5-flash이며 텍스트뿐 아니라 이미지, 영상, 오디오, PDF를 입력으로 받을 수 있다. 입력 한도는 1,048,576토큰, 최대 출력은 65,536토큰이다.

이 모델은 Gemini 3.5 Flash-Lite와 다르다. 이름이 비슷하지만 API ID, 가격, 권장 작업이 별개다. Google은 3.5 Flash를 서브에이전트 배치, 여러 단계의 워크플로, 장시간 작업, 반복적인 코딩 루프에 맞춘 모델로 설명한다.

다만 현재 신규 도입의 기준선은 아니다. Google의 최신 모델 가이드는 3.5 Flash에서 3.7 Flash로 이전하도록 안내하고, 전환 전에 일부 샘플링 파라미터와 사전 채움 모델 턴을 제거하라고 명시한다. 이미 3.5로 품질 검증을 끝낸 서비스에는 유지 기간이 필요할 수 있지만, 새 프로젝트라면 3.7을 먼저 평가하는 편이 공식 제품 방향과 가격 모두에 맞다.

이 글은 직접 사용기가 아니다. 사용자가 지정한 Google 공식 문서와 그 모델 목록에서 연결되는 3.5 Flash 사양 페이지만으로 현재 선택 조건을 정리한다.

먼저 답하면

  • 추천 작업: 이미 gemini-3.5-flash로 회귀 테스트와 운영 승인을 끝낸 장문·멀티모달·도구 호출 서비스
  • 비추천 작업: 지금 새로 시작하는 코딩 에이전트, 다단계 자동화, 비용 민감형 대량 처리
  • 가격 판단: Standard 유료 티어는 입력 100만 토큰당 $1.50, thinking 토큰을 포함한 출력은 $9.00이다. 같은 사용량을 Batch나 Flex로 처리하면 토큰 단가는 절반이다.
  • 현재 판단: 안정형 엔드포인트라는 장점은 남아 있지만, Google이 3.7을 권장 이전 대상으로 제시하고 더 낮은 출력 단가를 책정한 현재는 신규 기본값보다 기존 운영의 전환 대상에 가깝다.

공식 문서에서 확인되는 사양

항목 Google 공식 문서상 내용
공식 제품명·API ID Gemini 3.5 Flash · gemini-3.5-flash
버전 상태 Stable
입력 형식 텍스트, 이미지, 영상, 오디오, PDF
출력 형식 텍스트
입력 한도 1,048,576토큰
최대 출력 65,536토큰
지원 기능 캐싱, 코드 실행, 파일 검색, 함수 호출, Google Maps grounding, Search grounding, 구조화 출력, thinking, URL context
프리뷰 지원 Computer Use
미지원 기능 오디오 생성, 이미지 생성, Live API
처리 방식 Standard, Batch, Flex, Priority
모델 페이지의 최신 업데이트 표기 2026년 5월

입력 범위와 도구 구성을 보면 3.5 Flash는 단순 채팅 전용 모델이 아니다. 긴 문서와 여러 미디어를 한 요청 흐름에 넣고, 검색·코드 실행·함수 호출을 조합하는 작업까지 공식 지원 범위에 들어간다. 반면 텍스트 출력 모델이므로 이미지나 오디오를 직접 생성하는 용도로 선택하면 안 된다. 실시간 양방향 대화가 필요한 경우에도 Live API 미지원 조건을 먼저 봐야 한다.

Computer Use는 지원되지만 프리뷰다. 운영 자동화에 넣을 때는 일반 지원 기능과 같은 안정성을 전제하기보다 화면 변경, 잘못된 클릭, 중단 복구를 별도 평가해야 한다.

최신 모델 가이드에서 달라진 위치

Google의 현재 최신 모델 가이드는 3.7 Flash를 코드 생성, 공간·멀티모달 추론, 다단계 에이전트 워크플로, 디자인 지시 준수를 위한 모델로 분류한다. 권장 이전 대상에는 Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3 Flash Preview, Gemini 3.1 Pro가 함께 적혀 있다.

3.5에서 3.7로 옮길 때는 모델 ID만 바꾸면 끝나지 않는다. 공식 가이드는 temperature, top_p, top_k와 사전 채움 모델 턴을 제거하라고 안내한다. 기존 클라이언트가 이 설정에 의존한다면 요청 스키마를 먼저 정리하고, 같은 테스트 세트로 출력 형식과 도구 호출을 다시 확인해야 한다.

이전 안내가 곧 3.5의 즉시 중단을 뜻하지는 않는다. 3.5는 모델 목록과 개별 사양 페이지에서 Stable로 표시된다. 따라서 이미 검증된 운영을 무조건 한 번에 바꾸기보다 3.7 병행 평가, 실패율 비교, 단계적 트래픽 이동 순서로 전환하는 판단이 가능하다.

벤치마크에서 확인할 수 없는 부분

지정된 공식 페이지에는 3.5와 최신 Flash를 같은 프롬프트, 도구, thinking 설정으로 실행한 벤치마크 점수가 없다. 한국어 정확도, 실제 첫 응답 지연, 작업 완료율, 도구 호출 성공률도 수치로 제시되지 않는다.

따라서 공식 문서만으로 3.5가 특정 작업에서 몇 퍼센트 느리다거나 품질이 어느 정도 낮다고 계산할 수 없다. 이 글의 비교는 Stable 여부, 지원 기능, 마이그레이션 지침, 공개 가격처럼 문서에서 직접 대조할 수 있는 항목으로 제한한다.

3.7 Flash와 비교

항목 Gemini 3.5 Flash Gemini 3.7 Flash
공식 위치 Stable, 권장 이전 대상 최신 Stable Flash
공식 가이드의 주 사용처 서브에이전트, 다단계·장시간 작업, 반복 코딩 루프 코드 생성, 공간·멀티모달 추론, 다단계 에이전트, 디자인 지시 준수
2026년 말까지 Standard 입력·출력 $1.50 · $9.00 / 1M 토큰 $0.75 · $3.75 / 1M 토큰
2027년부터 Standard 입력·출력 $1.50 · $9.00 / 1M 토큰 $1.50 · $7.50 / 1M 토큰
도입 판단 기존 검증 결과와 전환 비용이 있을 때 유지 신규 프로젝트의 우선 평가 대상

현재 토큰 가격은 3.7 쪽이 낮다. 2026년 말까지 3.7의 한시 Standard 단가는 3.5 대비 입력은 절반, 출력은 약 41.7%다. 2027년부터 입력 가격은 같아지지만 출력은 3.7이 100만 토큰당 $1.50 낮다.

따라서 3.5를 유지할 근거는 가격보다 전환 위험에서 나온다. 기존 프롬프트와 함수 스키마가 3.5에서 검증됐고 모델 변경에 승인 절차가 필요하다면 일정 기간 유지할 수 있다. 반대로 신규 서비스는 더 낮은 가격과 공식 이전 방향을 두고 3.5부터 시작할 이유가 적다.

Gemini 3.5 Flash-Lite는 이 비교의 저가형 설정이 아니라 별도 모델이다. 대량 분류·추출처럼 처리량과 단가가 우선이면 gemini-3.5-flash-lite를 따로 평가해야 하며, 이 글의 3.5 Flash 가격과 혼용하면 안 된다.

가격과 실제 운영비

Gemini 3.5 Flash 유료 티어의 100만 토큰당 가격은 다음과 같다. 출력 가격에는 thinking 토큰이 포함된다.

처리 방식 입력 출력 캐시 입력
Standard $1.50 $9.00 $0.15
Batch $0.75 $4.50 $0.075
Flex $0.75 $4.50 $0.08
Priority $2.70 $16.20 $0.27

캐시 저장료는 100만 토큰을 한 시간 보관할 때 $1.00이다. Standard 무료 티어는 입력·출력·캐싱이 무료로 표시되지만, 실제 제공 범위와 호출 한도는 계정에서 확인해야 한다. Batch와 Flex는 무료 티어가 없다.

캐시와 grounding 비용을 제외하고 한 달에 입력 1,000만 토큰, 출력 200만 토큰을 쓴다고 가정하면 계산은 다음과 같다.

처리 방식 계산 토큰 비용
Standard 10 × $1.50 + 2 × $9.00 $33.00
Batch 또는 Flex 10 × $0.75 + 2 × $4.50 $16.50
Priority 10 × $2.70 + 2 × $16.20 $59.40

즉시 응답이 필요 없는 평가, 야간 문서 처리, 대량 요약은 Batch나 Flex로 분리하면 이 가정에서 Standard 토큰 비용의 절반이 된다. 사용자 대면 요청은 Standard로 두고, 지연 비용이 큰 일부 요청만 Priority로 보내는 편이 원가를 설명하기 쉽다.

Google Search와 Maps grounding은 토큰 비용과 별도다. 유료 티어에서는 Gemini 3 계열이 공유하는 월 5,000회 무료분 뒤 1,000회당 $14가 적용된다. 한 사용자 요청이 여러 Search 쿼리를 만들 수 있고 각 쿼리가 청구될 수 있으므로, 에이전트에는 토큰 상한과 검색 호출 상한을 따로 두는 편이 안전하다.

유지할 이유와 전환할 이유

상황 권장 판단 이유
3.5에서 이미 회귀 테스트와 운영 승인을 완료 단기 유지 후 병행 평가 모델 변경 자체의 실패 비용이 토큰 절감보다 클 수 있음
긴 문서·영상·오디오 입력과 도구 호출을 한 모델에서 처리 3.5 유지 가능, 3.7 동시 비교 3.5도 100만 토큰급 입력과 주요 내장 도구를 공식 지원
신규 코딩·다단계 에이전트 프로젝트 3.7 우선 평가 Google이 3.5의 권장 이전 대상으로 제시하고 현재 가격도 낮음
비동기 대량 작업 Batch·Flex 검토 3.5 안에서도 Standard 대비 토큰 단가가 절반
실시간 음성·이미지 생성 다른 모델 선택 3.5 Flash는 Live API와 오디오·이미지 생성을 지원하지 않음

전환 평가는 모델별 정답률 하나로 끝내기 어렵다. 같은 입력 세트에서 구조화 출력 유효성, 함수 선택 정확도, 전체 도구 호출 수, 출력 토큰, 완료 시간, 재시도율을 함께 기록해야 가격 차이가 실제 운영비 절감으로 이어지는지 알 수 있다.

추천 대상 / 비추천 대상

추천

  • 이미 gemini-3.5-flash로 품질 기준과 함수 호출 회귀 테스트를 통과한 운영팀
  • 텍스트·이미지·영상·오디오·PDF 입력을 한 요청 흐름에서 다루는 서비스
  • 즉시 처리가 필요 없는 작업을 Batch나 Flex로 분리할 수 있는 팀
  • 3.7 이전 전에 샘플링 설정과 사전 채움 턴 의존성을 점검해야 하는 레거시 클라이언트

비추천

  • 공식 권장 이전 모델인 3.7을 바로 평가할 수 있는 신규 프로젝트
  • 가장 낮은 단가가 우선인 대량 분류·추출 서비스
  • 이미지나 오디오를 직접 생성해야 하는 제품
  • Live API 기반의 실시간 음성 대화를 한 모델에서 처리하려는 제품
  • 공식 동일 조건 점수 없이 3.5의 성능 우위를 보장해야 하는 구매 절차

판단

Gemini 3.5 Flash는 지금도 Stable이며, 100만 토큰급 입력과 긴 출력, 멀티모달 입력, 검색·코드 실행·함수 호출·구조화 출력까지 갖춘 모델이다. 기존 서비스가 이미 이 엔드포인트에 맞춰 검증됐다면 전환 테스트가 끝날 때까지 유지할 실무적 이유가 있다.

새 프로젝트의 결론은 다르다. Google은 3.7을 3.5의 권장 이전 대상으로 제시하고, 2026년에는 3.5보다 훨씬 낮은 한시 가격을 적용한다. 한시 요금이 끝난 뒤에도 3.7의 출력 단가가 더 낮다. 신규 코딩·에이전트 작업은 3.7을 기준선으로 평가하고, 호환성이나 품질 문제가 확인될 때만 3.5를 비교군으로 남기는 순서가 적합하다.

3.5를 계속 쓴다면 Standard만 고정하지 말고 비동기 작업을 Batch·Flex로 분리해야 한다. 동시에 제거 대상 파라미터와 사전 채움 모델 턴을 정리해 두면 이후 모델 이전 비용을 낮출 수 있다.

아직 공식 문서에서 확인되지 않은 부분

  • 3.5와 최신 Flash의 동일 조건 벤치마크 점수와 평가 하네스
  • 한국어 작업 정확도와 실제 첫 응답 지연
  • 작업 유형별 출력 토큰 사용량과 도구 호출 성공률
  • 계정·지역·티어별 실제 처리량과 호출 한도
  • Computer Use 프리뷰의 장기 작업 성공률과 화면 변경 복구 성능

함께 읽을 글

근거와 출처

  • Gemini 최신 모델 가이드 — 3.7의 현재 위치, 3.5의 권장 이전 관계, 제거 대상 API 설정과 3.7 가격 시점. Google AI for Developers, 확인일 2026-08-26
  • Gemini Developer API 가격 — 3.5 Flash의 Standard·Batch·Flex·Priority 토큰 단가, 캐시 저장료와 Search·Maps grounding 가격. Google AI for Developers, 확인일 2026-08-26
  • Gemini 모델 목록 — Gemini 3 계열의 공식 API ID와 모델 목록. Google AI for Developers, 확인일 2026-08-26
  • Gemini 3.5 Flash 모델 사양 — Stable 버전, 입출력 형식, 토큰 한도, 지원·미지원 기능과 처리 방식. Google AI for Developers, 확인일 2026-08-26

게시: 2026-08-26 03:33 KST 작성 방식: 직접 사용기가 아닌 Google 공식 문서 분석