Gemini 3.8 Flash API 비용 계산: 추론 토큰과 캐시 요금까지

Gemini 3.8 Flash의 토큰·캐시 요금, 예산 계산 예시, 무료 티어 제한, Google과 Ofox API 연결 방법을 정리합니다. 2027년 예정 요금도 확인하세요.

더스티 핑크 배경 위 연한 카드에 한 줄로 그린 가격표 하나, 그 뒤로 반쯤 가려진 또 다른 가격표, 옆에는 검은색과 올리브색의 기하 문양 격자, 아래에는 세리프 제목 Gemini 3.8 Flash API

Google의 Gemini 3.8 Flash Standard 요금은 2026년 12월 31일까지 100만 토큰당 입력 $0.75, 사고 토큰을 포함한 출력 $3.75입니다. 2027년 1월 1일부터는 $1.50와 $7.50로 변경될 예정입니다. 앱이 실제로 쓰는 토큰을 계산한 뒤 캐시와 도구 요금을 더해야 예산을 잡을 수 있습니다.

2026년 9월 14일 확인했습니다. 아래 가격은 Gemini API 직접 호출 기준이며 Vertex AI나 Ofox의 제공업체 경로에 같은 가격을 보장하지 않습니다. 요금표의 출처는 Google 가격 페이지입니다.

토큰과 캐시 요금

토큰 단가는 모두 100만 토큰당 미국 달러입니다. 출력에는 과금 대상 사고 토큰이 포함됩니다.

서비스2026년 말까지 입력같은 기간 출력같은 기간 캐시 입력2027년 1월부터 입력 / 출력 / 캐시 입력
Standard$0.75$3.75$0.075$1.50 / $7.50 / $0.15
Batch 또는 Flex$0.375$1.875$0.0375$0.75 / $3.75 / $0.075
Priority$1.35$6.75$0.135$2.70 / $13.50 / $0.27

캐시 저장 요금은 별도입니다. 2026년 말까지 100만 토큰당 시간당 $0.50이며 1월에는 $1.00가 될 예정입니다. 캐시 읽기가 저렴해도 거의 재사용하지 않는 캐시가 경제적인 것은 아닙니다. 저장 시간과 재사용 횟수를 함께 계산하세요.

API 예산 계산 예시

앱이 1,000회 요청하고 매번 캐시되지 않은 입력 2,000토큰, 사고를 포함한 과금 출력 500토큰을 사용한다고 가정해 봅시다. 계산을 위한 가정이며 Gemini의 일반적인 응답 길이를 측정한 값이 아닙니다.

2026년 12월까지 Standard 요금으로 계산하면 다음과 같습니다.

  • 입력: (200만 ÷ 100만) × $0.75 = $1.50.
  • 출력: (50만 ÷ 100만) × $3.75 = $1.875.
  • 모델 토큰 합계: $3.375. 도구, 저장, 재시도 비용은 제외한 값입니다.

사용량이 같다면 1월 예정 요금의 합계는 $6.75입니다. 500토큰이 화면에 보이는 답변만 뜻한다면 이 예산은 부족합니다. 과금되는 사고 토큰도 포함해야 합니다.

캐시 요청은 캐시 토큰에 읽기 단가를 적용하고 캐시되지 않은 입력 수에서 빼세요. 같은 입력 토큰에 두 단가를 모두 적용하지 않습니다. 저장, 도구 사용, 과금되는 실패나 반복 시도도 더합니다.

확인해야 할 usage 항목

사용량 응답 전체를 보관하세요. 네이티브 generateContent에서는 usageMetadata.promptTokenCount, cachedContentTokenCount, candidatesTokenCount, thoughtsTokenCount를 확인합니다. 후보 출력과 사고는 별도 필드이므로 후보 출력만 보면 과금 대상 출력을 과소 계산합니다. UsageMetadata 참조에 정의가 있습니다.

OpenAI 호환 응답에서는 제공업체가 completion_tokens와 추론 세부 항목을 어떻게 정의하는지 확인하세요. 추론이 합계에 이미 포함되어 있으면 다시 더할 때 중복됩니다. 특히 도구와 멀티모달 입력은 선택한 제공업체의 청구 기록과 추정액을 대조해야 합니다.

무료 티어, 검색 그라운딩, 요청 제한

Google은 모델 입력·출력 무료 티어를 제공하지만 계정 자격과 프로젝트 한도가 적용됩니다. Gemini 3.8 Flash의 무료 티어에서는 검색 그라운딩을 지원하지 않습니다. 유료 티어에는 Gemini 3.x 전체가 공유하는 월 5,000회 요청 무료 제공량이 있고, 이후 검색 쿼리 1,000건당 $14입니다. 사용자 프롬프트 하나가 여러 검색을 일으킬 수 있으므로 프롬프트 하나가 언제나 과금 검색 쿼리 한 건에 해당한다고 가정하지 마세요.

현재 프로젝트 한도는 AI Studio에서 확인합니다. 요청 제한 문서는 프로젝트 단위 할당량과 사용 티어를 설명합니다. 같은 프로젝트에 키를 더 만들어도 별도 할당량이 생기지 않습니다.

429 응답이 오면 재시도 전에 오류 세부 내용, 프로젝트 할당량, 결제 상태를 확인하세요. 짧은 요청 집중과 할당량 소진은 대처 방법이 다릅니다. 즉시 반복 재시도하면 부하가 커질 수 있습니다. API 오류 참조를 확인하세요.

키를 만들고 Gemini 3.8 Flash 호출하기

직접 연결하려면 Google AI Studio에서 키를 만듭니다. 새 AI Studio 키는 이제 기본적으로 auth key입니다. 오래된 Standard key가 있다면 API 키 가이드의 전환 절차를 따르세요. 가이드는 2026년 9월부터 Standard key 요청을 거부한다고 안내하지만 특정 날짜는 적지 않았습니다. 이 전환 안내는 기존 키에 대한 것으로, 새로 발급하는 모든 키를 변환해야 한다는 뜻이 아닙니다.

키는 서버 환경 변수에 보관합니다. 아래 네이티브 REST 예시는 GEMINI_API_KEY가 설정되어 있다고 가정합니다.

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{"parts": [{"text": "Return only the sum of 17 and 25."}]}],
    "generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
  }'

이 간단한 예시의 예상 답은 42입니다. 요청 구조를 보여 주는 코드이며 모델 품질을 평가하지 않습니다. 사고 수준은 low, medium, high를 지원하며 minimal은 지원하지 않습니다. REST는 generationConfig.thinkingConfig 안의 thinkingLevel을 쓰지만 SDK의 필드명은 다를 수 있습니다. 지원 수준은 모델 문서, REST 형식은 generateContent 참조를 확인하세요.

현재 Ofox 연결 방법

Ofox에는 Gemini 3.8 Flash가 등록되어 있습니다. ID는 google/gemini-3.8-flash입니다. 모델 페이지에 OpenAI·Gemini 프로토콜과 Vertex 제공 경로가 명시되어 있습니다. OpenAI 호환 기본 URL은 https://api.ofox.run/v1, 네이티브 Gemini 기본 URL은 https://api.ofox.run/gemini입니다.

pip install openai로 Python 패키지를 설치하고 서버 환경에 OFOX_API_KEY를 설정한 뒤 실행하세요.

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.ofox.run/v1",
    api_key=os.environ["OFOX_API_KEY"],
)
response = client.chat.completions.create(
    model="google/gemini-3.8-flash",
    messages=[{"role": "user", "content": "Return only the sum of 17 and 25."}],
)
print(response.choices[0].message.content)
if response.usage is not None:
    print(response.usage.model_dump())

선택한 경로의 현재 요금과 지원 파라미터를 확인하세요. Google 직접 API의 무료 티어, 서비스 구분, 그라운딩 무료 제공량이 게이트웨이에도 자동 적용되지는 않습니다. 이번 업데이트에서는 등록 상태와 프로토콜 지원을 확인했으며 유료 추론 요청으로 예제를 실행 검증하지 않았습니다.

3.7에서 업그레이드하면 청구액도 달라질까?

두 모델의 직접 Standard 단가는 같지만 출력과 사고 사용량은 다를 수 있습니다. 실제 업무에서 채택 가능한 결과, 토큰, 재시도를 비교하세요. 3.8과 3.7 업그레이드 비교는 출시 당시 벤치마크와 실무 확인 사항을 구분합니다.

현재 다른 업체 모델도 후보로 삼는다면 DeepSeek V4.1 Flash·Gemini 3.8 Flash·Qwen3.8 Flash 비교를 보세요. 예전 V4 비교를 보고 왔다면 DeepSeek V4 버전과 별칭 변경부터 확인하세요.

자주 묻는 질문

Gemini 3.8 Flash는 얼마인가요?
Google Gemini API Standard 요금은 2026년 12월 31일까지 100만 토큰당 입력 $0.75, 사고 토큰을 포함한 출력 $3.75입니다. 2027년 1월 예정 요금은 $1.50와 $7.50입니다. 게이트웨이와 Vertex 요금은 별도로 확인해야 합니다.
무료로 쓸 수 있나요?
Google은 모델 입력·출력에 무료 티어를 제공하지만 계정 자격과 프로젝트 한도가 적용됩니다. 무료 티어에서는 Google Search 그라운딩을 사용할 수 없습니다. 유료 티어의 검색 무료 제공량이 모든 무료 요청이나 외부 경로에도 적용되는 것은 아닙니다.
예산에는 어떤 토큰을 포함해야 하나요?
캐시되지 않은 입력, 캐시 입력, 사용자에게 보이는 출력, 과금되는 사고 토큰과 해당되는 캐시 저장·도구 요금을 포함합니다. 네이티브 generateContent의 candidatesTokenCount와 thoughtsTokenCount는 별도 항목입니다. 호환 API의 completion_tokens에 추론이 이미 포함되어 있으면 다시 더하지 않습니다.
Ofox의 모델 ID는 무엇인가요?
Ofox에는 google/gemini-3.8-flash가 등록되어 있으며 OpenAI와 Gemini 프로토콜을 지원합니다. OpenAI 호환 기본 URL은 https://api.ofox.run/v1입니다. 선택한 제공업체 경로의 요금과 지원 옵션을 확인하세요.
API 키는 어떻게 만드나요?
Gemini API에 직접 연결하려면 Google AI Studio에서 키를 만듭니다. 새 AI Studio 키는 기본적으로 auth key입니다. 기존 Standard key는 Google 키 가이드의 전환 안내를 확인하세요. Ofox 경로에는 Ofox 키를 사용하며 두 키 모두 서버에서 관리합니다.
어떤 사고 수준을 지원하나요?
low, medium, high를 지원하며 기본값은 medium입니다. minimal은 지원하지 않습니다. 설정 문법은 프로토콜과 SDK에 따라 다릅니다.