Sonnet 5.5 API 요금: 캐시와 작업 완료 비용 계산하기

Sonnet 5.5의 입력·출력·캐시·Batch 요금을 계산 예제로 살펴봅니다. 토큰 단가와 재시도까지 포함한 작업 완료 비용을 구분하세요.

가격표를 그린 선화와 Sonnet 5.5 API 제목.

Claude Sonnet 5.5의 표준 Claude API 요금은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러입니다. 캐시 읽기는 100만 토큰당 0.20달러입니다. 이는 2026년 9월 29일 확인한 공급사의 공시 요금이며, Ofox 견적이나 Claude 구독 요금이 아닙니다. 예산을 정하려면 애플리케이션이 검수 기준을 통과하는 작업 하나를 끝내는 데 과금 대상 토큰을 얼마나 쓰는지 알아야 합니다.

Sonnet 5에서 옮겨도 요금표 자체는 같습니다. Anthropic이 여러 작업에서 비용이 줄었다고 설명하는 것은 모델 동작과 토큰 소비에 관한 주장입니다. 모든 요청에 적용되는 일괄 할인이 아닙니다. 공식 모델 사양을 먼저 확인하고 실제 처리할 작업을 기준으로 계산하세요.

Sonnet 5.5 요금표

토큰 구분100만 토큰당 USD집계 대상
캐시를 사용하지 않는 입력$2.00캐시 생성이나 읽기로 청구되지 않는 입력
출력$10.00과금되는 thinking 사용량을 포함한 출력
5분 캐시 생성$2.50해당 캐시 구간에 기록한 토큰
1시간 캐시 생성$4.00해당 캐시 구간에 기록한 토큰
캐시 읽기$0.20프롬프트 캐시에서 실제로 읽은 토큰

모델 페이지에는 Batch API 입력·출력 50% 할인과 캐시 가능한 프롬프트의 최소 길이인 512토큰도 명시돼 있습니다. 길이를 충족한다고 캐시가 자동으로 만들어지지는 않습니다. 캐시를 설정하고 사용량 필드를 확인하세요. 캐시 토큰을 일반 입력에도 더해 중복 계산하지 않아야 합니다.

도구 요금, 데이터 저장 지역 옵션 등 서비스별 추가 비용은 전체 요금 문서에서 따로 확인해야 합니다. 제공 업체마다 지원 기능, 통화, 과금 규칙이 다를 수 있습니다. 이 공급사 계산법을 다른 엔드포인트에 적용하기 전에 해당 업체의 최신 조건을 확인하세요.

작은 요청의 예: 0.04달러는 월 예산이 아니다

캐시 없는 입력 10,000토큰과 과금 대상 출력 2,000토큰을 사용하는 가상 요청을 계산하면 다음과 같습니다.

입력: 10,000 / 1,000,000 × $2  = $0.02
출력:  2,000 / 1,000,000 × $10 = $0.02
합계:                            $0.04

모든 요청이 정확히 이 사용량이라면 1,000건은 기타 요금을 제외하고 40달러입니다. 이는 산술 예제이지 Sonnet의 일반적인 응답 길이를 측정한 값이 아닙니다. 추론이 길어지거나 도구를 한 번 더 호출하거나 재시도하면 합계가 달라집니다. 화면에 보이는 답변의 단어 수에 추정 환산 계수를 곱하는 방식은 신뢰할 만한 과금 계산법이 아닙니다.

캐시를 사용하면 계산이 어떻게 달라질까

요청 10건이 100,000토큰의 공통 접두부를 공유한다고 가정해 보겠습니다. 5분 캐시 쓰기 1회, 유효 시간 안의 실제 캐시 적중 9회, 그 외 입력과 출력은 없다는 조건입니다. 쓰기 0.25달러에 읽기 9 × 0.02달러를 더하면 0.43달러입니다. 캐시 없이 10번 처리하는 2.00달러보다 이 접두부에 한해 1.57달러, 78.5% 적습니다.

전체 애플리케이션 비용이 78.5% 할인된다는 뜻은 아닙니다. 접두부 변경, 캐시 미적중, 많은 출력이 발생하면 전체 절감률은 줄어듭니다. 요청마다 캐시 생성과 읽기 사용량을 기록하세요. 캐시에 적합한 프롬프트를 만들었다는 사실만으로 실제 캐시 적중 요금이 적용됐다고 볼 수는 없습니다.

비대화형 작업이 이용 조건을 충족한다면 Batch도 별도로 평가할 수 있습니다. 위의 캐시 없는 0.04달러 예제에 공시된 입력·출력 50% 할인을 적용하면 같은 조건에서 0.02달러입니다. 이 예제는 Batch와 캐시를 함께 적용하지 않았으며, 모든 조합의 과금 방식을 설명하지도 않습니다.

검수를 통과한 작업당 비용 측정하기

버그 수정, 문서 작성, 추출 작업에 다음 기록표를 사용할 수 있습니다.

작업 ID | 모델 | Effort | 입력 | 캐시 쓰기 | 캐시 읽기
출력 | 도구 요금 | 시도 횟수 | 검수 통과 여부 | 총 USD

실패한 시도와 재시도도 해당 작업 비용에 포함하세요. 테스트 통과, 필수 필드의 정확성, 결과물 검수표 등 합격 기준을 먼저 정한 뒤 총비용을 통과한 작업 수로 나눕니다. 구독 사용량은 별도 열에 기록하세요. CLI가 추정한 API 환산 비용이 구독 청구서에 실제로 부과되는 금액은 아닐 수 있습니다.

Effort도 기록해야 합니다. Artificial Analysis의 출시 평가는 max에서 출력 소비량이 매우 높았다고 보고했습니다. 해당 벤치마크로 내 청구액을 예측할 수는 없습니다. 구조화 출력 문제가 있던 출시 전 배포 환경을 사용했고 재평가에 관한 단서도 있으므로 함께 읽어야 합니다. 작업 사용량을 측정할 이유는 되지만 Sonnet이 언제나 비싸다는 근거는 아닙니다.

대화 길이가 아니라 usage로 청구액 계산하기

위의 표준 요율을 사용하면 토큰 비용은 다음과 같습니다.

USD = (2 × 일반_입력
     + 2.5 × 5분_캐시_쓰기
     + 4 × 1시간_캐시_쓰기
     + 0.2 × 캐시_읽기
     + 10 × 과금_출력) / 1,000,000

각 변수는 서로 중복되지 않는 과금 항목입니다. Claude의 usage 응답에서 input_tokens, cache_creation_input_tokens, cache_read_input_tokens를 구분하세요. 유지 시간을 섞어 쓰면 생성 내역도 기간별로 보관해야 합니다. 캐시 생성 합계와 그 안에 포함된 5분·1시간 항목을 이중으로 계산하면 안 됩니다. 게이트웨이가 응답 형태를 바꾸면 해당 제공자의 usage 정의를 적용하세요. 필드가 없다는 것은 기록이 불완전하다는 뜻이지 비용이 0이라는 뜻이 아닙니다.

일반 입력 8,000토큰, 5분 캐시 쓰기 40,000토큰, 캐시 읽기 60,000토큰, 출력 3,000토큰인 가상 요청을 생각해 봅시다. $0.016 + $0.100 + $0.012 + $0.030 = $0.158입니다. 입력 컨텍스트에는 세 입력 항목이 모두 들어가지만 전부 일반 입력 요율을 적용하지는 않습니다. 계산과 원본 usage 응답을 함께 보관하면 청구 차이를 프롬프트 길이로 추측하지 않고 항목별로 추적할 수 있습니다.

thinking도 자주 놓치는 부분입니다. 화면에 보이는 답이 짧아도 과금되는 추론 토큰은 많을 수 있습니다. 추론 텍스트를 숨겨도 사용량은 사라지지 않습니다. max_tokens는 추론과 텍스트를 합친 상한이며 그 안에서 정확히 끝낸다는 보장이 아닙니다. 한도에 도달해 중단되었다면 이어가기 전에 실패한 시도의 비용도 기록하세요. 이를 빼면 작업 비용이 실제보다 낮아집니다.

5분 캐시와 1시간 캐시는 몇 번부터 이득일까?

다른 사용량을 제외하고 공통 접두부 100,000토큰만 계산합니다. 캐시 없이 N번 보내면 $0.20N입니다. 5분 캐시를 한 번 쓰고 N−1번 실제로 읽으면 $0.25 + $0.02(N−1)입니다. 두 번만 호출해도 $0.27로 일반 입력 $0.40보다 저렴합니다. 1시간 캐시는 $0.40 + $0.02(N−1)이므로 두 번은 $0.42로 조금 비싸고, 세 번은 $0.44로 일반 입력 $0.60보다 저렴합니다.

이 손익분기점은 쓰기가 한 번이고 이후 모두 읽기에 성공한다고 가정합니다. 호출 시간 간격만으로 적중을 보장할 수 없으며 실제 usage에서 쓰기와 읽기를 세야 합니다. 열 번 모두 5분 캐시를 다시 만들면 $2.50로 캐시 없는 $2.00보다 비쌉니다. 유지 시간이 긴 캐시는 줄어드는 재생성 비용이 높은 생성 단가를 상쇄할 때 유용합니다.

접두부만 계산한 가상 패턴비용의미
캐시 없이 10번 입력$2.00호출당 100K 입력 기준선
5분 쓰기 1회 + 적중 9회$0.43한 번 생성한 내용 재사용
1시간 쓰기 1회 + 적중 9회$0.58생성은 비싸고 읽기 요율은 같음
매번 5분 쓰기, 총 10회$2.50적중하지 못하면 캐시가 더 비쌀 수 있음

정말 안정적인 자료를 바뀌는 작업 입력 앞에 놓으세요. 단, 적중률을 올리려고 필수 맥락을 삭제해서는 안 됩니다. 무관한 저장소 덩어리를 캐시해도 컨텍스트는 낭비됩니다. 관련 부분만 적게 보내는 일반 입력이 더 나을 수도 있습니다. 모델을 바꿀 때 이전 캐시가 공유된다고 가정하지 마세요. 서비스의 지원과 과금 방식이 확인되기 전에는 모델 간 재사용을 예산에 반영하지 않습니다.

직접 검산할 수 있는 세 가지 월간 예산

아래는 표준 동기 Claude API 요율이며 캐시, Batch 할인, 별도 도구 비용은 제외합니다. 예산용 합성 사례로, 모델 실행 결과나 일반적인 사용량 예측이 아닙니다.

작업량 가정작업당 계산월 작업 수토큰 비용 소계
짧은 추출: 입력 4K, 출력 500$0.008 + $0.005 = $0.01310,000$130
초안 작성: 입력 12K, 출력 4K$0.024 + $0.040 = $0.0641,000$64
코딩 루프: 4턴, 매번 입력 30K와 출력 2K4 × ($0.060 + $0.020) = $0.32500$160

코딩 행은 매 턴의 입력을 따로 셉니다. 이전 대화를 다시 보내면 뒤쪽 입력이 늘 수 있으므로 네 턴의 사용량이 같다는 것은 단순화한 가정입니다. 예측에 쓰기 전에 각 턴의 실제 usage로 바꾸세요. 도구 결과는 다음 턴 입력이 될 수 있습니다. 모델이 생성한 도구 호출과 도구 실행 자체의 별도 요금 역시 서로 다른 비용입니다.

500개 중 100개 작업이 $0.08짜리 한 턴을 추가로 쓰면 $8을 더해 총 $168입니다. 최종적으로 480개만 검수를 통과했다면 합격 작업당 토큰 비용은 $168 / 480 = $0.35입니다. 실패 20개도 보고서에 남겨야 합니다. 합격률은 96%이며 500개를 완수한 것이 아닙니다. 사람의 검토, 호스팅, 외부 도구 비용은 여전히 소계 밖에 있습니다.

예상보다 높은 청구액을 진단하는 순서

가장 큰 비용부터 확인합니다. 출력이 크면 effort, 실제 thinking 사용량, 한도 중단, 불필요한 장문을 봅니다. 입력이 크면 반복된 이력과 과도한 검색 자료를 봅니다. 캐시 생성이 크면 설정 여부가 아니라 쓰기와 읽기 이벤트를 비교합니다. 재시도가 많으면 잘못된 요청, 도구 실패, 결과 불합격을 나눕니다. 스키마 오류에는 클라이언트 수정이 필요하고, 형식은 맞지만 불충분한 답에는 작업 설계나 모델 검토가 필요합니다.

요청당 출력 상한과 별도로 애플리케이션에서 전체 작업 예산을 제한하세요. 예산을 소진하면 중단하고 미완료 상태를 표시합니다. 자체 예산을 공식 호출 제한이라고 설명하거나, 기록에 기존 모델을 남긴 채 저렴한 모델로 몰래 바꾸면 안 됩니다. Batch를 선택하기 전에는 비동기 완료를 받아들일 수 있는지, 해당 서비스 조건에 맞는지 확인하세요. 단가가 낮다고 지연 응답이 대화형 사용자에게 적합한 것은 아닙니다.

다음으로 확인할 항목

요금표는 이해했지만 청구액을 설명하기 어렵다면 공급사를 바꾸기 전에 실제 출력 토큰, 캐시 적중, 재시도 횟수를 비교하세요. 설정 조정은 Sonnet 5.5 effort 가이드, 모델 선택은 코딩 작업의 Sonnet과 Opus 비교에서 이어집니다.

Ofox를 통해 연결할 때는 Claude Sonnet 5.5 모델 페이지에서 모델 ID, 현재 공급사, 가격과 지원 프로토콜을 확인하세요. 위 계산 예시는 Anthropic이 공개한 요금을 사용하며, 모든 공급사가 Anthropic의 전체 기능을 지원한다는 뜻은 아닙니다.

자주 묻는 질문

Sonnet 5보다 토큰 단가가 낮아졌나요?
아니요. 현재 공식 문서상 단가는 같습니다. 다만 작업에 필요한 토큰 수가 늘거나 줄면 단가 변화 없이도 총비용이 달라집니다.
Claude Pro나 Team 구독에 API 크레딧이 포함되나요?
구독 사용 한도를 API 크레딧으로 취급하지 마세요. 클라이언트의 결제 경로를 확인하고, 해당 요금제와 Claude API 요금표를 따로 검토해야 합니다.
max가 작업을 끝내는 가장 저렴한 방법인가요?
일반적으로 보장할 수 없습니다. 여러 effort 설정에서 재시도와 소요 시간을 포함해 통과한 결과를 비교하세요. 합격률은 높아지지 않으면서 출력만 훨씬 많아질 수 있습니다.