모델을 낮추면 정말 저렴할까요? 캐시 비용과 배분 정책 비교
캐시 읽기와 모델 전환 비용을 나눠 계산해, 자기 환경에서 모델을 바꿀지 판단할 수 있어요.
공개일 · 갱신일
무엇을 비교하나요
먼저 밝혀 둘게요. 이 글은 비교 결과가 아니라 비교 설계와 비용 계산 가이드예요. 통제된 비교 실험은 아직 한 번도 하지 못했어요. 대신 어떤 정책을 무엇으로 재야 하는지, 그리고 캐시 비용을 어떻게 계산하면 자기 환경에서 판단할 수 있는지를 정리했어요.
비교할 정책은 세 가지예요.
- 3층 배분 — 판단 / 실행 / 기계로 나누고, 난이도가 아니라 "틀렸을 때 뒤에서 잡아주는가"로 층을 골라요.
- 단일 최상위 — 제일 좋은 모델 하나로 전부 처리해요.
- 막히면 전환 — 최상위로 시작해 한도에 걸리면 아래로 내려가요.
1년 운영하고 정정한 게 하나 있어요. 저 기준은 작업의 속성이 아니라 출력이 흘러가는 곳의 속성이에요. 같은 필드명 변경도 내부 코드로 끝나면 테스트가 잡아주지만, 외부 JSON 스키마로 나가면 아무도 못 잡아요(silent failure = 틀려도 경고 없이 지나가는 실패).
참고로 문헌 쪽은 이렇게 확인했어요. 브리핑이 참고한 TMLR 2026 라우팅 서베이에서는 '검증가능성 기반 라우팅'을 별도 축으로 확인하지 못했어요(서베이의 축은 난이도·불확실성·선호·클러스터링·RL이에요). 관련 연구가 없다는 뜻은 아니고, 제가 본 범위에서 못 찾았다는 뜻이에요. 가장 가까운 실측은 Large Language Monkeys 논문이에요. SWE-bench Lite 과제에서 검증기가 있으면 작은 모델이 250샘플로 15.9%→56%까지 오르고(당시 SOTA 43%) 없으면 정체한다는 결과인데, 이 글의 3층 정책을 직접 비교한 실험은 아니에요.
원장으로 확인한 것 — 규칙은 살아남고 증거는 안 남았어요
| 규율 | 문서 | 원장 |
|---|---|---|
| 저가 레인 (연 $360 선납, 주 8,000프롬프트) | 기계 작업 담당 | 27일간 0건 |
| 소진 사다리 4단 (절약→승계→무판단→저가스택) | 순서대로 하강 | 2단까지만, 구축 후 22일간 0건 |
| 교차 가족 크리틱 | 다른 가족이 채점 | 6건 전부 같은 가족 |
마지막 줄이 제일 아팠는데, 여기서는 확정된 것과 추정한 것을 나눠서 써야 해요.
- 확정 — 교차 가족 크리틱으로 처리한 6건의 실제 사용 모델은 모두 Claude Opus였어요. 다른 모델 가족을 쓰겠다는 조건을 충족하지 못한 셈이에요.
- 추정 — 프록시 부재에 따른 폴백으로 추정하지만, 원인을 확정하려면 당시 요청·라우팅 로그가 필요해요.
- 표현 — 그래서 "자가 채점"이 아니라 "같은 가족의 모델로 검토"라고 써요. 확인된 건 모델 가족이 같았다는 사실까지예요.
경고는 한 번도 안 떴어요. 교차 채점 자리에서 같은 가족 검토가 조용히 대신 일어난 거예요.
캐시가 배분과 충돌하는 지점
지난 30일 원장에서 입력 토큰의 90.8%(110.2M 중 100.1M)가 캐시 히트였어요. 이건 입력량의 구성이고, 총비용에서 캐시 읽기가 차지하는 비중은 따로 계산해야 해요(출력과 캐시 생성이 빠져 있으니까요). 그래도 캐시 프리픽스(대화 앞부분을 저장해 뒀다 다음 턴에 싸게 다시 읽는 구간)가 크다는 건 분명해요. 여기서 세 가지가 배분 규율과 충돌해요.
- 모델을 바꾸면 캐시가 전부 재작성돼요. 우회로는 없어요.
- 하위 모델이 캐시 읽기는 더 비싸요. Fable 5.1은 0.025배($0.25/M), Opus 5는 0.1배($0.50/M) — 신규 입력은 싸지만 캐시 읽기는 2배예요.
- 캐시가 걸리는 최소 토큰이 모델마다 들쭉날쭉해요. 512(Fable 5.1·Opus 5) / 1,024(Sonnet 5) / 4,096(Haiku 4.5·Opus 4.6). 3K 프리픽스는 Opus 5에선 캐시되고 Haiku 4.5에선 에러 없이 그냥 안 돼요.
크로스오버를 직접 계산해요
크로스오버는 어느 쪽이 싸지는지 뒤집히는 지점이에요. 계산에 쓴 단가를 먼저 펼쳐 둘게요(2026-09-14 조회분).
| 신규 입력 | 캐시 읽기 | 출력 | |
|---|---|---|---|
| Fable 5.1 | $10/M | $0.25/M (0.025×) | $50/M |
| Opus 5 | $5/M | $0.50/M (0.1×) | $25/M |
이 비교는 두 모델의 캐시 읽기가 모두 적중하는 턴을 가정해요. 캐시 생성 비용은 별도로 계산해요. 캐시 프리픽스 C, 턴당 신규 입력 I, 출력 O(단위는 모두 백만 토큰)일 때 턴당 비용은 이렇게 돼요.
- Fable 5.1 =
0.25C + 10I + 50O - Opus 5 =
0.50C + 5I + 25O
Fable 5.1 쪽이 저렴한 조건은 0.25C + 10I + 50O < 0.50C + 5I + 25O, 정리하면 0.25C > 5I + 25O, 양변을 0.25로 나누면 C > 20I + 100O예요. I=2K, O=1K를 넣으면 20×2,000 + 100×1,000 = 140,000 — 프리픽스가 140K를 넘는 순간 "싼 모델"이 더 비싸져요.
왕복 전환 비용은 이렇게 봐 주세요. 200K 프리픽스에서 내려갔다 올라오는 왕복 전환 1회 약 $3.75는 산정 조건(캐시 생성 단가·유효기간·양방향 재작성 가정)을 더 확인해야 하는 추정치예요. 이 금액을 가정한다면, 비교 대상인 캐시 읽기 쪽은 산술로 떨어져요. 200K를 캐시로 읽는 비용이 0.2M × $0.25/M = $0.05니까, $3.75는 캐시 읽기 75턴치예요.
수정된 규칙 3개
- 세션 중에는 모델을 고정해요. 다만 세션 중 전환은 원래 캐시 생성 비용과 남은 턴의 예상 절감액을 비교한 뒤 결정하는 게 맞아요. 이 사례에서는 세션 고정을 기본 운영 규칙으로 채택했지만, 항상 더 저렴한지는 측정하지 못했어요.
- 싼 레인은 갈아타지 말고 분리해요. 서브에이전트나 포크로 띄우면 원래 세션의 캐시가 안 깨져요.
- 굳이 바꾸려면 경계에서 바꿔요. /compact 직후나 세션 경계는 어차피 프리픽스가 새로 쌓이는 자리예요.
아직 검증 안 된 것
- 3층이 2층·1층보다 낫다는 비교가 없어요. 1년을 3층으로 운영했지만 통제된 비교를 한 번도 안 했어요.
- 산출물 1건당 총비용을 측정하지 못했어요. 위 계산은 캐시 단가 산술이지 실제 청구서 비교가 아니에요.
- 구독 한도의 캐시 토큰 차감 배수가 공개돼 있지 않아요. 그래서 구독 레인 쪽 크로스오버는 계산 자체가 안 돼요.
변별력이 0이었던 파일럿 하나
2026-08-25 결함주입 파일럿은 후보 3종 전원 11/11·오경보 0으로 변별력이 0이었어요. 과제가 쉬웠거나 채점이 둔감했다는 뜻이고, 어느 쪽인지도 못 갈랐어요. 원자료는 머신을 매각하면서 소실됐고 요약본 자기인용만 남아 있어서, 다시 들여다볼 수도 없어요.
킬 기준 — 비교를 어떻게 설계하나요
세 정책(3층 배분 / 단일 최상위 / 한도 도달 후 전환)을 같은 작업 묶음에 적용하고, 품질 기준과 기한을 먼저 정해요. 그 다음 정책별로 API 달러, 구독 한도 사용량, 사람 검수 시간을 각각 기록해요. 이 셋은 환산 없이 섞지 않아요(섞는 순간 원하는 답이 나와요).
그래서 폐기 조건도 이렇게 써요. 같은 품질·같은 기한에서 다른 정책의 총비용이 더 낮으면 3층 배분을 폐기해요. 다만 비용을 환산하지 않는 한, 어느 지표를 우선할지 정하기 전에는 총비용의 승자를 선언하지 않아요.
실행일·도구 버전
원장 집계는 2026-09-14 기준 지난 30일 구간이에요. 캐시 단가·최소 캐시 토큰은 같은 날 조회한 공식 가격·프롬프트 캐싱 문서 기준이라 바뀔 수 있어요. 저가 레인 0건은 2026-08-16, 교차 크리틱 6건은 2026-09-13 확인분이에요. 이 글은 다른 가족 모델의 반론 20건 중 17건을 반영했고, 그 과정에서 제가 틀리게 써 둔 사실 오류 5건이 잡혔어요.
근거
- 발제 자료 facts-ledger §O/§P/§Q — 저가 레인 사용 0건, 사다리 단계 기록, 교차 크리틱 6건
- 하네스 CLAUDE.md 라우팅 절 — 모델 3층 배분과 소진 사다리 원문
- 프록시 사용 원장 — 지난 30일 입력 토큰 집계
- Anthropic 공식 가격·프롬프트 캐싱 문서 (2026-09-14 조회)