Gemini 3.8 Flash와 3.7 Flash, 추론 설정에 따라 비용이 얼마나 달라질까?
Gemini 3.8과 3.7 Flash를 출시 당시 평가, 현재 요금, 사고 수준, 이전 점검 항목으로 비교합니다. 같은 단가에서도 청구액이 달라지는 이유를 확인하세요.
Gemini 3.8 Flash와 3.7 Flash는 직접 API의 Standard 토큰 단가가 같지만, 모델을 바꾸면 청구액이 달라질 수 있습니다. 중요한 것은 자신의 작업에서 채택 가능한 결과가 늘고 총비용과 지연 시간이 허용 범위에 들어오는지입니다.
2026년 9월 14일 업데이트했습니다. 현재 가격·접속 정보와 출시 당시 벤치마크를 구분해 과거 점수를 오늘의 순위처럼 제시하지 않습니다.
Gemini 3.8 Flash에서 달라진 점
Google은 2026년 9월 2일 Gemini 3.8 Flash를 출시했습니다. 출시 발표는 복잡한 작업, 특히 높은 사고 수준에서 추론과 반복적인 도구 사용을 늘렸다고 설명합니다. 효율이 중요한 작업에는 수준을 낮추거나 3.7을 유지할 수도 있다고 안내합니다. 추가 처리는 어려운 작업에 도움이 될 수 있지만 출력량과 실행 시간도 늘릴 수 있습니다.
이는 업그레이드를 시험할 이유이지 모든 요청이 토큰을 30% 더 쓰거나 모든 작업에서 개선된다는 근거는 아닙니다.
토큰 요금과 사고 설정
| 항목 | Gemini 3.7 Flash | Gemini 3.8 Flash |
|---|---|---|
| 2026년 말까지 Standard 입력 / 출력, 100만 토큰당 | $0.75 / $3.75 | $0.75 / $3.75 |
| 2027년 1월부터 예정 Standard 입력 / 출력 | $1.50 / $7.50 | $1.50 / $7.50 |
| 사고 수준 | low, medium, high | low, medium, high |
| 기본 사고 수준 | medium | medium |
minimal | 미지원 | 미지원 |
요금은 Google 가격 페이지, 지원 수준은 3.7 모델 페이지와 3.8 모델 페이지를 기준으로 합니다. 출력 요금에는 사고가 포함됩니다. Gemini 3.8 요금 가이드에서 Batch, Flex, Priority, 캐시 저장료와 예산 예시를 확인할 수 있습니다.
출시 벤치마크가 실제로 보여 준 것
Artificial Analysis 출시 분석은 다음 결과를 보고했습니다. 2026년 9월 2일 출시 당시 기록이며 현재 모델 페이지의 실시간 평가가 아닙니다.
| 모델과 사고 수준 | 출시 당시 AA Intelligence Index | AA 가중 Cost per Task |
|---|---|---|
| Gemini 3.8 Flash, high | 59 | $0.58 |
| Gemini 3.8 Flash, medium | 57 | $0.41 |
| Gemini 3.8 Flash, low | 52 | $0.24 |
| Gemini 3.7 Flash, high | 56 | $0.40 |
출시 분석에서는 high 설정의 3.8이 작업당 출력 토큰을 약 30% 더 썼습니다. 표시된 가중 비용은 $0.40에서 $0.58로 올랐으며 반올림된 이 수치로 계산하면 45% 증가입니다. 해당 평가 안에서는 medium의 비용이 더 낮았으므로 비용이 중요하다면 시험해 볼 만합니다.
AA의 Cost per Task는 가중 평가 지표입니다. 한 작업에 여러 모델 호출과 도구 왕복이 들어갈 수 있으므로 API 요청 한 번의 가격이 아닙니다. 평가 버전과 모델 페이지는 바뀔 수 있습니다. 출시 표와 현재 전체 인덱스 토큰 합계를 섞거나 순위 점수의 변화만으로 모델 성능이 퇴보했다고 해석하지 마세요.
59점이라고 해서 특정 앱에 ‘59점이 필요하다’고 말할 수도 없습니다. 고객 문의 분류, SQL 수정, 코딩 에이전트는 서로 다른 합격 기준을 가집니다.
예산 판단에 쓸 수 있는 업그레이드 비교
3.7이 이미 잘하는 사례와 실패하는 사례를 모두 포함해 같은 대표 입력을 사용하세요. 현재 운영하는 사고 설정부터 시작하고, 비용이 중요하면 3.8의 medium이나 low도 시험합니다. 제공 경로와 서비스 구분도 비교 가능하게 맞춥니다.
| 기록 항목 | 이유 |
|---|---|
| 고정 기준을 통과한 결과 | 앱에 실제로 도움이 되는 변화인지 측정 |
| 과금되는 모든 입력·출력·사고 토큰 | 같은 단가에 가려진 비용 변화 확인 |
| 도구 호출, 재시도, 실패 | 작업을 끝내는 데 드는 전체 비용 확인 |
| 도구를 포함한 전체 지연 시간 | 초당 출력 토큰만으로 알 수 없는 사용자 대기 시간 확인 |
| 출력 잘림과 스키마 오류 | 단순 텍스트 데모가 놓치는 회귀 확인 |
전체 시도 비용 ÷ 합격 결과 수를 계산합니다. 합격이 없으면 성공당 비용을 제시하지 말고 실패로 보고하세요. 화면에 보이는 답변 길이만으로 전체 청구액을 추정하지 않습니다.
네이티브 generateContent는 candidatesTokenCount와 thoughtsTokenCount를 포함한 usageMetadata 전체를 보관하세요. 호환 응답은 completion_tokens에 추론이 이미 포함될 수 있으므로 제공업체의 집계 방식을 확인한 뒤 계산합니다. 요금 가이드가 이 차이를 설명합니다.
모델 ID를 바꿀 때 확인할 사항
Google의 같은 지원 API에서 단순 텍스트 요청을 보내는 경우 모델 필드는 다음과 같이 바뀝니다.
- model="gemini-3.7-flash"
+ model="gemini-3.8-flash"
이 작은 변경만으로 이전 테스트가 끝나는 것은 아닙니다.
- 사고 설정. 지원되는 수준을 사용하세요. 네이티브 REST는
generationConfig.thinkingConfig.thinkingLevel을 쓰며 SDK 이름은 다를 수 있습니다. 이전 모델의minimal을 그대로 가져오지 마세요. - 출력과 타임아웃 예산. 추론, 긴 응답, 여러 턴의 실행을 포함해 테스트합니다.
- 도구와 구조화 출력. 스키마, 도구 결과 처리, 앱이 유지하는 대화 상태를 확인합니다.
- 제공업체와 지역. Google 네이티브 문서뿐 아니라 실제로 사용할 경로의 가용성과 기능을 확인합니다.
- 롤백. 새 구성이 같은 합격 기준을 만족할 때까지 이전 설정을 유지합니다.
Ofox로 Gemini 3.8 Flash 호출하기
Ofox에는 Gemini 3.8 Flash가 등록되어 있습니다. ID는 google/gemini-3.8-flash이며 OpenAI와 Gemini 프로토콜을 지원합니다. OpenAI 호환 클라이언트에는 https://api.ofox.run/v1, 네이티브 요청에는 문서화된 Gemini 경로를 사용하세요. 요금·접속 가이드에 전체 코드 예시가 있습니다.
선택한 제공업체의 가격과 옵션을 확인하세요. 카탈로그는 문서상 가용성을 나타낼 뿐 특정 도구 작업의 테스트 통과를 보장하지 않습니다. 이번 업데이트에서는 유료 추론 비교를 실행하지 않았습니다.
어떤 경우에 업그레이드할까?
자체 평가에서 합격 결과의 품질이 개선되고 비용·지연 시간 한도도 충족한 작업을 옮기세요. 3.7이 이미 요구사항을 만족하고 측정된 이점이 없다면 유지할 수 있습니다. 모델을 나누어 쓰는 방식도 가능하지만 추가 유지보수에 걸맞은 결과가 있어야 합니다.
2027년 1월을 넘어가는 예산은 예정된 직접 API 단가로 다시 계산하세요. 토큰 수가 같을 때 단가가 두 배가 되면 토큰 소계가 두 배가 됩니다. 도구와 저장 비용은 여전히 별도로 계산해야 합니다.
자주 묻는 질문
- Gemini 3.8 Flash가 3.7 Flash보다 비싼가요?
- 직접 Gemini API의 Standard 토큰 단가는 같습니다. 하지만 출력, 사고, 도구 왕복, 재시도가 달라지면 청구액도 달라집니다. 출시 벤치마크의 high 설정에서 가중 비용이 높았다는 관측은 모든 요청의 보편적인 비용 증가율이 아닙니다.
- 성능은 얼마나 나아졌나요?
- Artificial Analysis의 2026년 9월 2일 출시 글은 high 설정에서 3.8이 59점, 3.7이 56점이라고 보고했습니다. 당시 평가 기록이며 현재 순위나 개별 작업의 결과를 보장하지 않습니다.
- 업그레이드해야 하나요?
- 실제로 사용할 사고 수준과 대표 작업으로 두 모델을 비교하세요. 채택 가능한 결과의 품질 개선이 측정한 비용과 지연 시간을 정당화할 때 이전합니다. 종합 벤치마크 점수만으로 합격 기준을 정할 수는 없습니다.
- 모델 ID만 바꾸면 되나요?
- 같은 지원 프로토콜의 단순 텍스트 요청에는 충분할 수 있습니다. 그래도 운영 환경으로 전환하기 전에 사고 설정, 출력 상한, 구조화 출력, 도구 호출, 대화 상태를 확인해야 합니다.
- Ofox에서 사용할 수 있나요?
- Ofox에는 google/gemini-3.8-flash가 등록되어 있으며 OpenAI와 Gemini 프로토콜을 지원합니다. 선택한 제공 경로의 요금과 기능을 확인하세요. 카탈로그 등록이 모든 앱 작업의 검증을 뜻하지는 않습니다.


