Introducing Claude Fable 5.1 and Claude Mythos 5.1
Quick Summary
Anthropic은 동일한 기반 모델에 서로 다른 보호장치를 적용한 Claude Fable 5.1과 Claude Mythos 5.1을 공개하며, 코딩·지식 작업·과학 연구 성능 향상과 비용·개인정보 보호·오탐 개선을 제시했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Anthropic은 동일한 기반 모델에 서로 다른 보호장치를 적용한 Claude Fable 5.1과 Claude Mythos 5.1을 공개하며, 코딩·지식 작업·과학 연구 성능 향상과 비용·개인정보 보호·오탐 개선을 제시했다.
📌 핵심 요약
- Claude Fable 5.1과 Claude Mythos 5.1은 동일한 기반 모델이지만 보호장치 수준이 다르며, Fable 5.1은 일반 제공되고 Mythos 5.1은 사이버보안·생명과학용 신뢰 기반 접근 프로그램으로 제한된다.
- Claude Fable 5.1은 캐시 읽기 가격 인하로 토큰 과금형 일반 작업에서 Fable 5보다 비용이 약 25% 낮아지고, 고도 에이전트형 작업에서는 최대 약 45% 절감될 수 있다.
- EFS는 데이터를 Anthropic이 아닌 고객 통제형 클라우드 인프라에 저장해 제로 데이터 보존과 같은 수준의 개인정보 보호를 제공하며, 올가을 후반부터 기업 고객에게 단계적으로 제공될 예정이다.
- 사이버보안 보호장치의 오탐은 이전보다 60% 감소했고, Claude Fable 5.1은 소프트웨어 취약점 발견에는 사용할 수 있지만 익스플로잇 개발은 허용되지 않으며 Claude Mythos 5.1의 고급 생물학 기능은 별도 접근 프로그램으로 제공된다.
- Claude Fable 5.1은 여러 코딩·추론·업무 벤치마크에서 Fable 5를 앞섰고, Low·Medium effort에서도 더 낮은 비용으로 유사하거나 더 높은 결과를 보였으며 파트너 평가에서는 장기 작업의 가독성, 근본 원인 분석, 자율 연구 역량이 강조됐다.
🧩 주요 포인트
- 동일한 기반 모델을 일반 제공형 Claude Fable 5.1과 제한 접근형 Claude Mythos 5.1로 구분한 구조는 모델 성능보다 보호장치와 사용 목적이 접근 범위를 결정한다는 의미를 갖는다.
- 캐시 읽기 가격 인하와 Low·Medium effort의 성능 유지는 Claude Fable 5.1의 개선이 최고 점수뿐 아니라 장시간 에이전트형 작업의 비용 효율에도 초점을 맞췄음을 보여준다.
- 벤치마크 우위와 파트너 사례는 복잡한 코딩·연구 작업의 진전을 나타내지만, 보호장치 개입과 측정 오차가 점수에 영향을 줬다는 평가 조건도 함께 고려해야 한다.
🧠 상세 정리
1. 두 모델의 관계와 접근 구조
Anthropic은 Claude Fable 5.1과 Claude Mythos 5.1을 코딩과 지식 작업에 초점을 둔 신형 모델로 소개하며, 연구 역량이 인공지능의 과학 발전 기여 가능성을 미리 보여준다고 설명한다. 두 제품은 서로 다른 모델이 아니라 동일한 기반 모델이며, 차이는 적용된 보호장치의 수준과 접근 방식에 있다. Claude Fable 5.1은 일반 이용이 가능하지만 Claude Mythos 5.1은 신뢰 기반 접근 프로그램을 통해서만 제공되고, 후자의 보호장치는 사이버보안과 생명과학 작업을 지원하도록 설계됐다. 따라서 이번 발표의 핵심 구조는 성능 등급이 다른 두 모델을 내놓는 것이 아니라, 같은 역량을 사용 목적과 위험 수준에 따라 서로 다른 조건으로 개방하는 데 있다.
2. 가격 인하와 effort별 비용 효율
Claude Fable 5.1은 토큰 단위로 과금되는 일반적인 작업에서 Fable 5보다 예상 비용이 약 25% 낮아진다. 직접적인 원인은 이미 처리해 저장한 입력을 다시 읽는 캐시 읽기 가격을 낮춘 것이며, 반복적으로 큰 문맥을 사용하는 작업일수록 영향을 받을 수 있다. 고도 에이전트형 작업에서는 절감 폭이 더 커져 최대 약 45%에 이를 수 있다고 Anthropic은 설명한다. 또한 Low 또는 Medium effort로 설정한 Fable 5.1은 Fable 5와 비슷하거나 더 나은 결과를 더 낮은 비용으로 달성한 것으로 제시됐다. 기본 설정은 제품별로 달라 Claude Code에서는 High effort, Claude Cowork와 Claude.ai에서는 Medium effort가 적용된다.
3. EFS와 제로 데이터 보존
새로운 Enterprise Frontier Safeguards인 EFS는 제로 데이터 보존 정책과 같은 수준의 완전한 개인정보 보호를 제공하면서 적대적 사용도 방지하는 체계로 소개됐다. 핵심 방식은 고객 데이터를 Anthropic의 인프라가 아니라 고객이 전적으로 통제하는 클라우드 인프라에 저장하는 것이다. 이에 따라 데이터 보관 위치와 통제권을 고객에게 두면서도 보호장치를 함께 운영하는 방식을 지향한다. EFS는 올가을 후반부터 기업 고객을 대상으로 단계적으로 제공될 예정이어서 모든 대상이 동시에 사용할 수 있는 상태는 아니다. EFS가 제공되기 전까지는 자격을 갖춘 고객이 Claude Fable 5.1을 제로 데이터 보존 조건으로 사용할 수 있도록 한다.
4. 사이버보안과 생물학 보호장치
Anthropic은 정상적인 내용을 위험하다고 판단하는 오탐을 줄이기 위해 보호장치를 개선했으며, 사이버보안 분야에서는 최신 보호장치의 오탐이 이전보다 60% 감소했다고 밝혔다. 이 변화로 Claude Fable 5.1은 소프트웨어 취약점을 발견하는 작업에는 사용할 수 있지만, 발견한 취약점을 이용하는 익스플로잇 개발은 허용되지 않는다. 즉 방어적 분석의 유용성을 넓히면서 공격적 활용에는 명시적인 제한을 유지하는 방식이다. 생물학에서는 미국 정부와 협력해 Claude Mythos 5.1의 고급 생물학 역량을 이용할 수 있는 별도 접근 프로그램을 마련했다. 과학자를 위한 등록은 곧 열릴 것으로 예상된다고 밝혔지만, 구체적인 개시일이나 자격 기준은 원문에 제시되지 않았다.
5. 코딩·추론·업무 벤치마크 성과
Claude Fable 5.1은 Terminal-Bench-Science 0.1에서 52.6%를 기록해 Fable 5의 24.7%, Opus 5의 29.0%, GPT-5.6 Sol의 22.4%를 웃돌았다. Terminal-Bench 4.0에서는 Fable 5.1이 55.8%, 동일 기반 모델인 Mythos 5.1이 60.9%였으며, Fable 5는 42.0%였다. Humanity’s Last Exam에서는 도구 없이 60.9%, 도구 사용 시 65.0%를 기록했고, CursorBench 3.2.0에서는 73.4%로 제시됐다. AutomationBench 점수는 31.4%로 Fable 5의 17.1%보다 높았으며, OSWorld 2.0에서는 부분 기준 77.9%, 엄격 기준 41.7%였다. GDPval-AA v2에서도 Fable 5.1은 1853점을 기록해 비교 대상인 Fable 5의 1723점과 Opus 5의 1824점을 상회했다.
6. 평가 조건과 보호장치의 영향
Claude Fable 5.1의 평가는 실제 배포용 보호장치를 활성화한 상태에서 수행됐으므로, 표의 수치는 순수한 기반 모델 능력만을 나타내지는 않는다. 보호장치가 개입한 OSWorld 2.0 작업에서는 Fable 5.1과 Fable 5가 0점을 받았고, AutomationBench의 해당 작업에서는 Fable 5가 0점을 받았다. 다른 보호장치 개입 사례 가운데 사이버보안 작업은 Claude Opus 4.8이, 생물학 작업은 Claude Opus 5가 완료했으며, 원문은 이러한 조건이 Fable 5.1과 Fable 5의 점수를 낮췄을 가능성이 있다고 설명한다. Terminal-Bench 4.0에서 Fable 5.1과 Mythos 5.1 사이의 차이도 이전의 덜 정밀한 사이버보안 보호장치가 개입한 작업에서 발생한 것으로 해석됐다. Terminal-Bench-Science 0.1에는 모델별 ±3.5~4.5점의 표준오차가 제시돼 있어 일부 비교는 측정 잡음까지 고려해야 한다.
7. 근본 원인 분석과 장기 에이전트 작업
원문은 Claude Fable 5.1이 품질을 낮추는 지름길을 피하고 소프트웨어 문제의 표면적 증상보다 근본 원인을 수정하는 데 강점이 있다고 설명한다. Millennium 사례에서는 약 100만 번 실행당 한 번 발생하고 엔지니어와 다른 모델들이 수년간 설명하지 못했던 희귀 충돌의 원인을 찾아냈다. 모델은 외부 공급업체 라이브러리를 역어셈블하고 코어 덤프와 대조해 해당 라이브러리의 버그까지 추적했다. Red Hat은 모든 effort 수준에서 테스트한 고장 난 빌드의 근본 원인을 정확히 식별했다고 평가했고, Jane Street Capital은 긴 다단계 작업에서도 결과가 읽기 쉬운 상태로 유지됐다고 밝혔다. MongoDB에서는 서비스 코드와 문서를 조사한 뒤 복잡한 프로토타입을 약 3일 동안 구축하고, 여러 시간 무인 실행하면서 검증 결과와 시각적 설명을 남긴 사례가 제시됐다.
8. 연구·업무 파트너의 활용 평가
초기 접근 파트너들은 벤치마크 점수뿐 아니라 연구 방식, 의사소통, 토큰 효율과 결과물의 완성도에서도 개선을 관찰했다고 밝혔다. IMC는 기존 모델이나 인간 연구자와 다른 축의 새로운 해법이 이전 성능 한계를 넘어섰다고 평가했고, Rakuten은 다른 세 모델이 승인한 임상 연구에서 누락된 문제를 발견한 뒤 새로운 가설과 연구 방향을 제안했다고 전했다. Ramp는 38시간 동안 무인으로 실행된 기계학습 작업에서 기존 결과를 레이블 오류로 진단하고 이를 수정한 후 6개의 병렬 실험을 수행한 사례를 소개했다. Canva는 글이 더 이해하기 쉽고 지침을 잘 따랐다고 평가했으며, Hebbia는 프레젠테이션 구성과 금융 문서 사실 회상, 복합 질문의 모든 항목에 답하는 완전성을 강조했다. Plaid는 3개 코드베이스와 8개가 넘는 서비스에 걸친 흐름을 함수와 데이터베이스 행 수준까지 정확히 추적했다고 밝혔다. 이러한 평가는 Claude Fable 5.1이 장기 코딩, 개방형 연구, 복합 업무 흐름에서 조정자 역할을 수행할 가능성을 보여주는 사례로 제시됐다.
🧾 핵심 주장 / 시사점
- Claude Fable 5.1과 Claude Mythos 5.1이 동일한 기반 모델인데도 일부 점수가 달랐다는 사실은 보호장치의 정밀도가 실제 작업 성능과 이용 가능 범위에 직접 영향을 줄 수 있음을 보여준다.
- 약 25%의 일반 비용 절감과 고도 에이전트형 작업의 최대 약 45% 절감은 모델 경제성이 단순 출력 단가뿐 아니라 캐시 재사용과 effort 설정에 의해 달라짐을 시사한다.
- 희귀 충돌 분석과 장시간 무인 연구 사례는 근본 원인 탐색과 장기 실행 역량의 향상을 보여주지만, 기업 증언과 보호장치가 개입한 벤치마크라는 평가 맥락을 함께 봐야 한다.
✅ 액션 아이템
- Claude Fable 5.1의 Low·Medium effort별 비용과 Fable 5 대비 성능의 워크로드 단위 비교 검증.
- EFS 제공 전 제로 데이터 보존 적용 자격과 제공 후 고객 통제형 클라우드 저장 조건 확인.
- Claude Fable 5.1의 소프트웨어 취약점 발견 허용과 익스플로잇 개발 금지 제약을 반영한 사용 범위 점검.
❓ 열린 질문
- Claude Fable 5.1의 최대 약 45% 비용 절감은 어떤 고도 에이전트형 작업과 사용 패턴에서 재현되는가?
- EFS는 올가을 후반부터 기업 고객에게 어떤 순서와 일정으로 단계 제공되는가?
- Claude Mythos 5.1의 생물학 접근 프로그램은 과학자에게 언제, 어떤 자격 조건으로 등록을 여는가?