Fable 5.1 vs Fable 5: Is Fable 5.1 Cheaper Than Fable 5? We Measured 57 Runs
Quick Summary
Fable 5.1은 캐시 읽기가 많은 작업에서는 Fable 5보다 저렴하지만, 출력·추론 토큰 증가로 캐시 사용이 적은 작업에서는 완료 비용이 더 높아질 수 있다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Fable 5.1은 캐시 읽기가 많은 작업에서는 Fable 5보다 저렴하지만, 출력·추론 토큰 증가로 캐시 사용이 적은 작업에서는 완료 비용이 더 높아질 수 있다.
📌 핵심 요약
- Fable 5.1은 캐시 읽기 가격을 100만 토큰당 $1.00에서 $0.25로 75% 낮췄다. 입력 $10, 출력 $50, 캐시 쓰기 $20은 그대로이며, 같은 아키텍처를 조정한 업데이트다.
- Anthropic은 기본 effort의 자체 운영 트래픽에서 25%, 일부 에이전트 작업에서는 최대 45%의 절감을 주장했다. Artificial Analysis는 캐시를 거의 사용하지 않는 max effort 평가에서 작업당 비용이 $3.14에서 $3.69로 18% 증가했고, 출력 토큰은 83M에서 140M으로 늘었다고 측정했다.
- 총 $26.00이 청구된 57회 API 실행에서 Fable 5.1의 출력 토큰은 Fable 5 대비 low 1.37배, high 1.12배, max 1.30배였다. max에서는 추론 토큰이 4,205에서 6,725로 늘고 표시되는 텍스트 토큰은 3,522에서 3,301로 줄어, 텍스트는 6% 적지만 청구 토큰은 30% 많았다.
- 샌드박스에서 수행한 에이전트 빌드 6건에서는 캐시 할인 효과가 청구액에 나타났다. Fable 5.1의 한 빌드는 캐시 토큰 1.69M을 다시 읽고 $0.42를 냈고, Fable 5의 한 빌드는 1.34M에 $1.34를 냈다. 할인되지 않는 캐시 쓰기 비용 때문에 실제 절감은 청구액의 15~30%였다.
- effort 설정은 비용 비교의 핵심 변수다. Artificial Analysis에서 Fable 5.1은 low의 작업당 $0.77·Intelligence Index 58에서 max의 $3.69·66까지 비용이 4.8배 달라졌다. Claude Code의 기본값은 High이고 Claude Cowork와 Claude.ai는 Medium이며, Fable 5.1의 추론은 항상 활성화되고 effort가 추론량을 조절하는 유일한 수단이다.
🧩 주요 포인트
- 캐시 읽기만 가격 인하 → Fable 5.1의 경제성은 입력 크기 자체보다 동일 문맥을 반복해서 읽는 횟수와 청구액의 토큰 구성에 좌우된다.
- 보이는 텍스트 감소와 추론 토큰 증가가 동시 발생 → 답변 길이만으로 비용을 판단하기 어렵고, Fable 5와 Fable 5.1은 같은 effort 조건에서 비교해야 한다.
- 작업 명세의 구체성에 따라 Opus 5와의 비용 우위 전환 → 원문의 시험에서 구체적인 명세는 Opus 5가 매번 더 저렴했지만, 열린 과제에서는 Opus 5가 평균 $11.83, Fable 5.1이 $7.00이었다.
🧠 상세 정리
1. 같은 아키텍처에서 달라진 세 가지
Fable 5.1은 2026년 9월 1일 출시됐으며, 6월 9일 나온 Fable 5 이후 3개월이 채 지나지 않은 시점의 업데이트다. 원문은 이를 새로운 모델 세대가 아니라 동일한 아키텍처를 조정한 버전으로 설명하며, 문맥 창 1M 토큰, 최대 출력 128K 토큰, low부터 max까지의 effort 범위는 유지됐다고 정리한다. 달라진 항목은 캐시 읽기 가격의 75% 인하, 신뢰할 수 있는 지식 기준 시점의 2026년 1월에서 6월로의 이동, 장시간 여러 단계를 수행하는 에이전트 동작의 안정성 개선이다. 입력과 출력의 표면적인 가격은 그대로이므로, 버전 번호의 변화만으로 모든 작업이 더 저렴해졌다고 해석하기는 어렵다. 원문은 저렴해진 캐시 읽기와 장기 작업의 안정성 개선을 함께 보면, 같은 큰 문맥을 반복해서 읽는 긴 에이전트 세션에 초점을 맞춘 업데이트라고 해석한다.
2. 25% 절감과 18% 비용 증가가 함께 성립하는 이유
Anthropic의 '25% 저렴하며 에이전트 작업에서는 최대 45% 저렴하다'는 주장과 Artificial Analysis의 '작업당 18% 더 비싸다'는 결과는 서로 다른 작업과 설정을 측정한 것이다. Anthropic은 2026년 8월 자체 운영 트래픽을 기본 effort에서 측정했고, Artificial Analysis는 캐시를 거의 쓰지 않는 Intelligence Index를 max effort에서 수행한 비용을 계산했다. 두 모델의 100만 토큰당 입력 가격은 $10, 출력 가격은 $50, 캐시 쓰기는 $20으로 같고, 캐시 읽기만 Fable 5의 $1.00에서 Fable 5.1의 $0.25로 내려갔다. 따라서 캐시 읽기가 청구액에서 큰 비중을 차지하면 할인이 유리하게 작용하지만, 캐시 사용이 적고 출력 토큰이 늘면 완료 결과당 비용은 올라갈 수 있다. 원문이 제시하는 논쟁의 핵심은 가격표의 산술이 아니라, 각 평가에서 어떤 종류의 토큰이 비용을 지배했는지다.
3. 57회 API 실행의 방법과 출력 토큰 변화
글의 자체 측정은 Claude Team API 계정으로 수행한 57회 실행과 총 $26.00의 청구액을 바탕으로 하며, 비용은 API가 반환한 사용량 필드에 각 모델의 공개 요율을 적용해 계산했다. 프롬프트는 claude -p --output-format json으로 실행하고 웹 도구를 껐으며, 에이전트 빌드는 sandbox-exec에서 쓰기 범위를 빌드 디렉터리로 제한하고 --effort high로 settings.json의 effortLevel을 덮어썼다. 자료 수집에는 Firecrawl의 /search와 /scrape를 사용해 Anthropic의 Fable 및 Mythos 5.1 발표와 Artificial Analysis의 모델 페이지를 참고했다. 측정에서 Fable 5.1의 출력 토큰은 Fable 5보다 low에서 1.37배, high에서 1.12배, max에서 1.30배 많았고, max의 추론 토큰은 4,205에서 6,725로 늘어난 반면 표시되는 텍스트 토큰은 3,522에서 3,301로 줄었다. 원문은 작업 명세의 구체성도 두 기관이 측정하지 않은 변수라고 지적하며, 자체 시험에서는 구체적인 명세일 때 Opus 5가 매번 비용에서 이겼지만 열린 과제에서는 Opus 5가 평균 $11.83, Fable 5.1이 $7.00이었다고 보고한다.
4. 캐시는 크기보다 재사용 횟수가 중요하다
원문은 모델이 턴 사이에 기억을 유지하지 않으므로 시스템 프롬프트, 열어 본 파일, 앞선 대화 등 필요한 문맥을 매번 다시 보내야 한다고 설명한다. 프롬프트 캐싱은 첫 전송 이후 그 텍스트를 Anthropic 측에 저장해 두고, 후속 턴에서 저장된 사본을 읽으며 전체 입력 가격 대신 캐시 읽기 가격을 지불하게 한다. 다만 처음 저장할 때의 캐시 쓰기는 100만 토큰당 $20으로 입력 가격의 두 배이며, Fable 5.1에서도 할인되지 않았기 때문에 문맥이 크다는 사실만으로 큰 절감이 생기지는 않는다. 샌드박스 에이전트 빌드 6건에서는 할인 효과가 확인됐고, Fable 5.1의 한 빌드는 1.69M 캐시 토큰 재읽기에 $0.42를, Fable 5의 한 빌드는 1.34M에 $1.34를 지불했다. 그러나 실제 절감은 청구액의 15~30%로, 원문은 캐시를 만들고 두 번 정도 읽는 경우보다 동일 문맥을 여러 번 다시 읽는 긴 세션에서 할인 효과가 커진다고 설명한다.
5. Artificial Analysis의 완료 비용과 혼합 가격
Artificial Analysis는 토큰 단가보다 작업을 완료하는 데 든 비용으로 모델을 비교하며, Intelligence Index 완료에 Fable 5.1은 출력 토큰 140M, Fable 5는 83M을 사용했다고 보고했다. 가장 비싼 토큰 유형이 69% 늘었고 캐싱은 거의 사용하지 않았기 때문에, 작업당 비용은 $3.14에서 $3.69로 18% 상승했다. 한편 이 기관의 혼합 가격은 Fable 5의 100만 토큰당 $7.70에서 Fable 5.1의 $7.17로 내려가, 캐시 읽기 단가 인하 자체와는 일치한다. 이 혼합 가격은 캐시 읽기 7, 입력 2, 출력 1의 토큰 비율을 가정하며, 원문은 $7.17에서 역산한 캐시 읽기 가격이 정확히 $0.25라고 설명한다. 출력이 혼합 가격의 65%를 차지하므로 캐시 읽기 단가를 75% 내려도 전체 혼합 가격은 약 7%만 낮아지며, 작업당 18% 증가라는 결과는 두 모델 모두 가장 비싼 max effort에서 측정됐다는 조건과 함께 읽어야 한다.
6. 성능 개선은 긴 도구 사용 작업에 집중됐다
Anthropic의 발표 수치에서 Fable 5.1의 개선은 범위가 명확한 추론보다 긴 도구 사용 작업에서 크게 나타났으며, Terminal-Bench-Science 0.1은 Fable 5의 24.7%에서 52.6%로, AutomationBench는 17.1%에서 31.4%로 올랐다. Terminal-Bench 4.0은 42.0%에서 55.8%, OSWorld 2.0의 엄격 평가에서는 36.1%에서 41.7%, CursorBench 3.2.0에서는 70.5%에서 73.4%로 상승했다. GDPval-AA v2의 Elo는 1,723에서 1,853으로, 도구를 사용하지 않는 Humanity's Last Exam은 57.8%에서 60.9%로 높아졌으며, 비교표의 Opus 5는 해당 순서대로 29.0%, 26.9%, 52.3%, 39.6%, 70.0%, 1,824, 56.6%였다. 다만 이 수치는 운영 환경의 안전장치를 켠 공급업체 자체 평가이므로, 원문은 확정적인 증거보다 개선 방향을 보여 주는 자료로 해석하라고 강조한다. Terminal-Bench-Science의 표준오차는 ±3.5~4.5점으로 보고돼 작은 차이를 과대해석하기 어렵지만, 과학 연구와 자동화에서 큰 폭으로 개선되고 기존에 잘 처리하던 코딩 평가에서는 약 3점만 오른 분포가 핵심 신호라는 설명이다. 독립적인 보강 근거로는 Artificial Analysis의 max effort Intelligence Index에서 Fable 5.1이 66, Opus 5가 63, Fable 5가 62를 기록한 결과가 제시된다.
7. effort 설정이 만드는 비용 차이
effort는 답변 전에 모델이 얼마나 추론할지 정하는 예산 조절 수단이며, API의 output_config에서 low, medium, high, xhigh, max 중 하나로 설정한다. Artificial Analysis의 Fable 5.1 측정에서 Intelligence Index와 작업당 비용은 low 58·$0.77, medium 60·$1.00, high 62·$1.43, xhigh 65·$2.65, max 66·$3.69였다. 즉 low에서 max로 올리면 점수는 8점 높아지지만 비용은 4.8배가 되므로, 모델 이름만 비교하면 설정이 만든 큰 차이를 놓칠 수 있다. 기본값도 제품마다 달라 Claude Code는 High, Claude Cowork와 Claude.ai는 Medium이며, 원문은 예상 밖 비용의 상당 부분이 모델 선택보다 물려받은 기본 설정에서 나온다고 설명한다. Anthropic의 절감 수치는 기본 effort, Artificial Analysis의 비용 증가는 max에서 측정됐으므로 두 결과를 해석할 때 이 조건을 함께 고려해야 하며, 추가 추론은 청구서에서 출력 토큰으로 계산된다.
8. 보이지 않는 추론 비용과 API 변경
추론 토큰은 모델 내부의 사고 과정으로, 사용자가 읽는 응답에는 나타나지 않지만 표시되는 텍스트와 동일하게 100만 토큰당 $50의 출력 요율로 청구된다. Fable 5.1에서는 추론이 항상 활성화되므로 thinking 매개변수는 생략해야 하고, budget_tokens를 지정하면 400 오류가 반환되며, 추론량을 조절하는 수단은 effort뿐이다. 원문은 스킬이나 간소화한 전역 CLAUDE.md가 표시되는 출력은 줄일 수 있어도 내부 추론량을 바꾸지는 못하므로, 프롬프트 조정만으로 추론 청구를 없앨 수 없다고 설명한다. 이는 max에서 Fable 5.1이 텍스트를 6% 적게 작성하면서도 전체 청구 토큰을 30% 더 사용한 측정과 연결되며, 답변이 짧아졌다는 사실이 비용 절감을 뜻하지 않음을 보여 준다. 개발자용 API에서는 강제 도구 사용의 동작도 달라졌고 budget_tokens가 조용히 조정되는 대신 오류를 반환하므로, 직접 API를 호출하는 경우에는 Anthropic의 마이그레이션 안내를 검토할 필요가 있으며 Claude Code나 호스팅 제품을 이용하는 경우에는 실행 환경이 이러한 변경을 처리한다고 원문은 설명한다.
🧾 핵심 주장 / 시사점
- Fable 5.1의 캐시 읽기 할인과 작업당 비용 증가는 동시에 성립한다. 절감 여부는 할인율 하나보다 반복 읽기 비중과 추가 출력·추론 비용의 균형으로 판단해야 한다.
- 성능과 비용을 함께 비교하려면 effort 조건을 맞춰야 한다. 기본 effort의 운영 트래픽과 max effort의 평가 결과를 직접 대조하면 설정 차이를 모델 차이로 오해할 수 있다.
- 원문의 시험에서는 작업 명세의 구체성에 따라 Opus 5와 Fable 5.1의 비용 우위가 바뀌었다. 이 결과는 모델 선택에 과제의 개방성도 고려할 근거가 되지만, 모든 작업에 동일하게 적용된다는 증거는 아니다.
✅ 액션 아이템
- Fable 5.1과 Fable 5의 비용 비교에는 캐시 읽기 반복 횟수, 출력·추론 토큰 증가, 할인되지 않는 캐시 쓰기 $20을 함께 반영한다.
- Claude Code의 High와 Claude Cowork·Claude.ai의 Medium 기본값을 확인하고, Fable 5와 Fable 5.1을 같은 effort 조건에서 비교한다.
- Opus 5와 Fable 5.1의 선택에는 작업 명세의 구체성을 반영하고, 열린 과제에서 관측된 평균 $11.83과 $7.00의 비용 차이를 참고한다.
❓ 열린 질문
- 해당 작업의 캐시 읽기 반복 횟수와 토큰 구성에서 Fable 5.1의 75% 할인은 추가 출력·추론 비용을 상쇄하는가?
- Fable 5.1의 low $0.77·Intelligence Index 58과 max $3.69·66 중 필요한 성능과 비용에 맞는 effort는 어느 수준인가?
- 해당 작업의 명세는 구체적인가, 열린 과제에 가까운가, 그리고 그 조건에서 Opus 5와 Fable 5.1 중 어느 모델의 완료 비용이 더 낮은가?