YouTubeCaleb Writes Code·2026년 9월 3일·0

Fable 5.1, is it that good..?

Quick Summary

Fable 5.1은 벤치마크 선두라는 이유만으로 최고의 선택이 되지는 않으며, 실제 가치는 하네스 조합과 작업 비용, 구독 한도까지 함께 따져야 한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Fable 5.1, is it that good..? 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Fable 5.1, is it that good..?의 핵심 내용을 4단계로 요약한 인포그래픽
Fable 5.1, is it that good..? 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Fable 5.1은 벤치마크 선두라는 이유만으로 최고의 선택이 되지는 않으며, 실제 가치는 하네스 조합과 작업 비용, 구독 한도까지 함께 따져야 한다.

📌 핵심 요점

  1. 영상은 Fable 5.1이 Artificial Analysis에서 1위를 차지했다고 소개하지만, 이 순위는 9개 평가를 합친 종합점수다. 개별 평가에서는 2위·6위·7위도 나타나므로 모든 분야의 우위를 뜻하지 않는다.
  2. 코딩 성능도 평가 구조에 따라 의미가 달라진다. 영상은 SciCode를 모델이 생성한 코드를 실행해 평가하는 방식으로, Terminal Bench 등은 모델을 하네스 안에서 평가하는 방식으로 설명한다.
  3. 같은 벤치마크라도 하네스와 실행 조건이 다르면 점수를 직접 비교하기 어렵다. Fable 5와 Terminus 2 조합은 공식 Terminal Bench에서 80.5%, Artificial Analysis에서 84%로 소개되며, 반복 횟수·시간·환경 차이가 원인으로 제시된다.
  4. 영상에 따르면 Fable 5.1은 월 20달러 Pro 구독의 기본 이용 대상에서 빠져 추가 사용료나 상위 요금제가 필요하다. Max의 20x 표기도 주간·월간 총량이 아니라 5시간 사용 구간에 관한 설명이라고 지적한다.
  5. 토큰 효율과 비용 효율은 별개다. 영상은 Fable 5의 119,000개 출력 토큰·70%와 GPT 5.6 Soul의 60,000개·73%를 비교하며, 실무에서는 점수뿐 아니라 작업당 비용과 사용 가능량이 중요하다고 주장한다.

🧩 배경과 문제 정의

영상은 Anthropic이 Artificial Analysis 상위 세 자리를 차지하고 Fable 5.1이 1위에 올랐다는 소개에서 출발한다. 핵심 질문은 이 순위가 곧 사용자에게 가장 좋은 모델이라는 뜻인지다.

이를 검토하기 위해 종합점수의 구성, 모델을 감싸는 실행 도구인 하네스, 평가 예산의 차이를 살핀다. 후반부에는 구독 접근성과 토큰·비용 효율을 연결해, 벤치마크 성적과 실제 이용 가치 사이의 간극을 설명한다. 아래 수치와 상품 조건은 모두 영상의 설명을 기준으로 정리했다.

🕒 시간순 섹션별 상세정리

1. 종합 1위와 개별 코딩 성능의 차이

  • 영상은 Fable 5.1의 Artificial Analysis 1위를 소개한 뒤, 지능 점수가 9개 벤치마크의 합성 결과이며 개별 항목에서는 순위가 달라진다고 보여준다. [00:31]
  • SciCode와 Terminal Bench에서는 1위라고 소개하지만, 다른 소프트웨어 공학 평가 점수는 발표문이나 블로그에서 찾기 어렵다고 지적한다. [00:51]
  • 212쪽 시스템 카드의 168쪽에서 67.4%를 찾았다고 설명하며 GPT 5.6 Luna·Grok 4.6 부근의 성적이라고 해석한다. 다만 이어지는 내용에서 평가 조건의 비교 가능성이 문제로 제기된다. [01:25]

2. 모델 단독 평가와 하네스를 포함한 평가

  • 영상은 사용자가 모델을 하네스라는 외부 실행 계층을 통해 이용한다고 설명하고, SciCode는 생성된 코드를 실행해 성공·실패를 판단하는 평가로 보여준다. [02:03]
  • Terminal Bench와 전사상 ‘디프 스위트’ 계열 평가는 하네스 안에서 모델을 평가한다. 하네스를 고정하면 모델 차이를 통제해 비교할 수 있지만, 사용자가 경험하는 전체 코딩 시스템의 성능을 모두 설명하지는 못한다. [02:45]
  • 공식 Terminal Bench에서는 모델과 하네스 조합이 달라지는 반면, Artificial Analysis의 Terminal Bench는 Terminus 2를 고정하고 모델을 바꾼다고 보여준다. [03:06]

3. 같은 평가 이름 아래 달라지는 수치와 조건

  • Fable 5·Terminus 2 조합이 공식 평가에서 80.5%, Artificial Analysis에서 84%로 묶인다. 영상은 각각 최소 5회와 3회의 반복 실행, 시간 제한과 환경 등 조건 차이를 짚어 본다. [03:57]
  • 다른 평가에서는 Mini Sweet Agent를 고정한다고 설명하며, Anthropic이 발표한 67.4%를 공식 점수와 바로 비교하기 어렵다고 결론짓는다. 사용자는 모델뿐 아니라 도구와 벤치마크 버전도 살펴야 한다. [05:00]
  • 구독 문제를 예고한 뒤 Surfshark 후원 광고로 전환한다. 여러 기기 지원, CleanWeb, Alternate ID와 프로모션을 보여준다. [06:12]

4. 구독 접근성과 토큰·비용 효율

  • 영상에 따르면 Fable 5 출시 약 3개월 뒤 나온 Fable 5.1은 월 20달러 Pro에 포함되지 않아 추가 사용료나 상위 구독이 필요하다. 같은 가격의 ChatGPT Plus에 GPT 5.6이 포함된다는 비교도 제시한다. [06:59]
  • 토큰 효율과 비용 효율을 구분하면서 GPT 5.6 Luna·DeepSeek V4 Pro를 낮은 작업 비용의 사례로 든다. 출력 토큰 비교에서는 Fable 5의 119,000개·70%와 GPT 5.6 Soul의 60,000개·73%를 제시한다. [07:46]
  • Gemini 3.8 Flash도 비용 비교 사례로 보여준다. 이어 Fable 5.1이 사용 한도를 빠르게 소모한다며, Anthropic 문서상 Max에서도 주간 할당량의 최대 50%를 사용할 수 있다는 설명을 인용한다. [08:20]

5. 사용 한도의 해석과 좋은 모델의 새로운 기준

  • 월 200달러 Max의 20x는 주간·월간 총량 20배가 아니라 5시간 구간의 사용 여유를 뜻한다고 보여준다. 실제 주간 할당량은 Pro의 약 6배라는 추정도 소개하며 상품 설명의 혼란을 비판한다. [08:59]
  • 영상은 다른 모델이 2~4배 저렴하거나 토큰 효율이 더 높다면, 지능이 더 높은 모델도 실무에서 비경제적일 수 있다고 주장한다. 초기 추론 모델 시절에는 지능 우위만으로 높은 가격을 정당화하기 쉬웠다고 대비한다. [09:50]
  • 마지막에는 경쟁사들의 빠른 추격과 도구 중심의 사용 환경을 강조한다. Fable의 장점을 인정하면서도 좋은 모델의 기준은 벤치마크 점수를 넘어 실제 활용성과 비용까지 포함하게 됐다고 마무리한다. [10:18]

🧾 결론

  • Fable 5.1의 종합 1위는 강점을 보여주는 지표지만, 모든 코딩 작업에서 가장 적합하다는 증거는 아니다.
  • 모델 선택의 실질적인 비교 단위는 모델과 하네스, 실행 예산을 포함한 전체 작업 환경이다.
  • 영상의 최종 주장은 좋은 모델의 기준이 지능 중심에서 실용성·효율·접근성까지 넓어졌다는 것이다.

📈 투자·시사 포인트

  • 영상의 논리를 따르면 경쟁 모델의 성능 추격과 낮은 작업 비용은 고가 모델의 가격 프리미엄을 유지하기 어렵게 만드는 요인이다.
  • 최상위 모델을 어떤 구독에 포함하는지, 한도를 얼마나 명확히 설명하는지가 서비스 선택에 영향을 줄 수 있다.
  • 개발 도구와 하네스의 조합이 성능에 개입하므로, 모델 순위만으로 서비스 경쟁력을 판단하기 어렵다.
  • 영상에는 매출·이익·기업가치 자료가 없다. 제시된 비교는 제품 경쟁력에 관한 시사점이며 특정 기업의 투자수익을 뒷받침하지 않는다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 전사에는 Fable 5.1과 Stable 5.1, Deep Seek·Deep Sweet·Deep Sweep처럼 명칭이 일관되지 않은 대목이 있다. 특히 67.4%가 제시된 평가의 정확한 이름과 버전은 원자료 확인이 필요하다.
  • 67.4%, 80.5%, 84% 등은 영상이 인용한 수치다. 하네스·실행 예산·반복 횟수가 완전히 일치하는지 확인하지 않으면 직접적인 우열 비교가 어렵다.
  • Pro 제외, Max의 주간 할당량 최대 50% 사용, 20x 요금제의 실제 주간 한도가 약 6배라는 설명은 적용 시점과 조건을 확인해야 한다. 특히 약 6배는 영상에서도 추정치로 제시된다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 비교하려는 점수마다 모델 버전, 벤치마크 버전, 하네스, 반복 횟수, 시간 제한을 기록한다.
  • 영상이 지목한 212쪽 시스템 카드의 168쪽에서 67.4%의 평가 명칭과 실행 조건을 확인한다.
  • 실제 사용하는 코딩 도구와 대표 작업으로 후보 모델의 성공률, 출력 토큰, 작업당 비용을 함께 비교한다.
  • 구독 변경 전에 모델 포함 여부, 추가 과금, 5시간 한도와 주간 한도의 관계를 확인한다.

❓ 열린 질문

  • 동일한 하네스와 실행 예산을 적용해도 Fable 5.1의 성능 우위가 유지되는가?
  • Fable 5.1의 추가 비용을 정당화할 만큼 성공률이나 작업 품질이 개선되는 업무는 무엇인가?
  • 영상에서 소개한 구독 한도와 효율 비교는 어떤 이용 조건과 측정 시점을 기준으로 하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.