Fable 5.1 is the BEST Model so far (but is it worth the cost?)
Quick Summary
Fable 5.1은 영상 제작자가 지금까지 본 최고의 시각 구현 결과를 보여줬지만, 높은 실사용 비용 때문에 계획 수립에 집중해 활용할 가치가 있다는 평가다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Fable 5.1은 영상 제작자가 지금까지 본 최고의 시각 구현 결과를 보여줬지만, 높은 실사용 비용 때문에 계획 수립에 집중해 활용할 가치가 있다는 평가다.
📌 핵심 요점
- 발표 자료상 코딩·연구·장기 에이전트 작업이 개선됐다. 제작자는 Terminal Bench 4.0에서 GPT-5.6 Soul보다 18% 높다고 소개하지만, 비교 조건과 수치 산식은 영상에 제시되지 않는다.
- 시각 구현에서는 Helm’s Deep의 성벽과 진입로 분리, Hogwarts 비행의 충돌 회피, 중국 건축 조립의 완성된 지붕과 노후화 표현이 돋보였다. 캐릭터 표시 오류와 어색한 균열 표현 등 한계도 남았다.
- 일반 작업에서 Fable 5보다 비용이 25% 적다는 추정과 제작자의 체감 비용은 달랐다. Cursor 사용 한도 안에서 이전에는 시각 벤치마크를 9회 실행했지만, 이번에는 3회 만에 한도를 소진했다고 한다.
- 캐시 읽기 비용이 낮아져도 추론량·출력 길이·도구 호출·재시도가 늘면 총비용은 커질 수 있다. 제작자는 더 철저한 계산과 검증이 결과물의 품질과 비용을 함께 높였다고 해석한다.
- 선택한 모델과 실제 작업을 수행한 모델을 구분해야 한다는 것이 후반부의 핵심이다. 제작자는 Opus 폴백 여부를 기록으로 확인하고, Fable 5.1로 계획과 handoff.md를 만든 뒤 GPT-5.6 Soul에 구현을 맡기는 방식을 유지한다.
🧩 배경과 문제 정의
이 영상은 Fable 5.1의 성능 향상과 그 성능을 얻기 위해 지불하는 비용을 함께 평가한다. 제작자는 발표 자료의 벤치마크와 비용 절감 주장을 소개한 뒤, Cursor에서 수행한 세 가지 시각 구현 사례를 보여준다. 핵심 문제는 좋은 결과물이 실제로 비용을 정당화하는지, 그리고 선택한 모델이 작업 전체를 수행했는지 확인할 수 있는지다. 후반부에는 폴백 관찰 방법과 계획·구현을 분담하는 사용 전략을 제시한다.
🕒 시간순 섹션별 상세정리
1. 뛰어난 첫인상과 두 가지 평가 축
- 제작자는 Fable 5.1을 비싸지만 매우 인상적인 모델로 소개하며, Helm’s Deep 시각 벤치마크를 대표 사례로 제시한다. [00:12]
- 코딩·연구·장기 에이전트 작업의 개선과 캐시 읽기 비용 절감이라는 발표 내용에 더해, 출시 후 성능 유지와 Opus 라우팅 문제를 함께 다루겠다고 예고한다. [00:59]
2. 벤치마크 우위와 체감 비용의 차이
- Terminal Bench 4.0에서 GPT-5.6 Soul보다 18% 높다는 비교와 내부 코딩·트레이딩 직관 평가를 보여준다. 제작자는 Pine Script와 백테스트 일관성을 직접 시험하고 싶다고 드러낸다. [02:36]
- 일반 작업 비용이 Fable 5보다 25% 적다는 추정을 소개하지만, 본인은 Cursor 한도 내 시각 벤치마크 실행 횟수가 9회에서 3회로 줄었다고 보고한다. [03:06]
- 비용에는 캐시뿐 아니라 추론 노력, 출력 길이, 도구, 재시도도 영향을 준다고 설명하며, 이번 모델이 검증을 더 철저히 수행했다고 관찰한다. [03:49]
3. Helm’s Deep과 Hogwarts 구현의 성과와 오류
- Helm’s Deep에서는 횃불, 비 표현, 진입로와 성벽의 분리 등을 높이 평가한다. 제작자는 제공된 아트 자산 없이 책과 웹 이미지 검색을 참고해 구현했다고 보여준다. [04:45]
- Fable 5 결과와 비교해 외부 구조가 더 잘 표현됐다고 평가하고, 진입로 이동과 동굴·성 내부 공간을 살펴본다. [05:31]
- Hogwarts 비행 시뮬레이터에서는 충돌 회피 계산과 속도 패널을 긍정적으로 보지만, 캐릭터의 SVG 표시 오류와 충분히 크지 않은 성의 규모도 지적한다. [06:33]
4. 중국 건축 조립에서 확인한 시각적 완성도
- 중국 건축 조립 사례에서는 부재가 튀어나오지 않는 완성된 지붕과 조립 애니메이션을 특히 높게 평가한다. [07:10]
- 화면을 가리는 라벨과 X-ray 보기를 살펴본 뒤, 노후화 과정의 질감 변화를 호평한다. 다만 균열처럼 보여야 할 표현은 실제 균열과 다소 다르다고 인정한다. [07:49]
5. 폴백 주장과 실제 수행 모델 확인 방법
- 제작자는 Fable을 Mythos에 보호 장치를 적용한 버전이라고 설명하며, 사이버보안·생물학 관련 코딩 요청이 Opus 5로 전환될 수 있다고 드러낸다. 향후 임의 성능 조정 가능성은 우려로 제기한다. [08:46]
- 새 대화에서 메시지 표시 시 모델을 전환하는 설정을 끄면 전환 대상 요청이 대신 멈춘다고 보여준다. 비교 실험은 이전 유발 요청의 영향을 피하도록 별도 세션에서 하라고 제안한다. [09:26]
- 모델에게 정체를 묻기보다 API의 최상위 모델, 폴백 블록, usage iterations를 확인하라고 권한다. 일반 터미널 작업도 라우팅되는 것 같다는 발언은 제작자의 느낌으로 드러난다. [10:11]
6. 반복 작업의 경제성과 최종 활용 전략
- 제작자는 X의 반응이 혼재하지만 긍정 쪽에 가깝다고 전해진다. 같은 도구와 상세한 지시문을 반복 사용하는 작업은 캐시 절감 효과를 얻을 수 있다고 보여준다. [10:38]
- 참고 자료가 적은 시각 창작은 도구와 추론 사용을 늘려 비용을 높일 수 있다며, 다른 사용자의 경험을 관찰하고 보수적으로 사용하겠다고 드러낸다. [11:07]
- 최종적으로 Fable 5.1은 계획과 handoff.md 작성에 사용하고 GPT-5.6 Soul에 구현을 맡기는 습관을 유지하겠다고 밝힌 뒤 영상을 마무리한다. [11:42]
🧾 결론
- 영상의 강한 긍정 평가는 세 가지 시각 구현 사례에 근거한다. 모든 코딩·연구 작업에서 최고라는 결론으로 확대하기에는 근거가 제한적이다.
- 비용 대비 가치는 캐시 할인 자체보다 작업당 총사용량과 완성도에 따라 판단해야 한다.
- 제작자의 최종 선택은 Fable 5.1을 보수적으로 사용하면서 계획 수립에 배치하고, 구현은 GPT-5.6 Soul에 맡기는 것이다.
📈 투자·시사 포인트
- AI 도입 비용을 평가할 때는 토큰 단가와 함께 작업 완료까지 필요한 추론·도구·재시도 비용을 살펴볼 필요가 있다.
- 같은 도구와 상세한 지시문을 반복 사용하는 작업은 캐시 재사용의 이점을 얻을 가능성이 있다. 반면 참고 자료가 적은 창작 작업은 추가 계산이 절감 효과를 상쇄할 수 있다.
- 계획과 구현을 서로 다른 모델에 배분하는 방식은 고성능 모델의 활용 범위와 예산을 조절하는 사례로 해석할 수 있다.
- 내부 평가에서 언급된 트레이딩 직관 성능은 실제 투자 수익의 증거가 아니다. 제작자도 Pine Script 작성과 진입 모델 백테스트의 일관성을 앞으로 확인하고 싶다고 말한다.
⚠️ 불확실하거나 확인이 필요한 부분
- Terminal Bench 4.0의 18% 우위와 일반 작업 비용 25% 절감은 영상이 소개하는 주장이다. 원점수, 평가 설정, 비용 산정 조건은 제공되지 않는다.
- Cursor 한도 내 실행 횟수 3회와 9회는 제작자의 경험이다. 작업별 사용량과 설정을 통제한 비교가 아니므로 비용이 정확히 세 배라고 단정할 수 없다.
- 사이버보안·생물학 관련 요청의 Opus 폴백과 이를 확인하는 설정·응답 필드는 제작자의 설명이다. 영상에는 해당 정책이나 실제 로그를 검증할 충분한 자료가 없다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 동일한 과제와 설정으로 모델별 결과물의 완성도, 오류, 수정 횟수와 총비용을 함께 기록한다.
- 반복 작업과 시각 창작 작업을 나누어 캐시 재사용, 출력 길이, 도구 호출, 재시도가 비용에 미치는 영향을 비교한다.
- 실제 사용 환경에서 영상이 설명한 모델 전환 설정과 로그 필드가 제공되는지 확인하고, 지원된다면 최상위 모델·폴백 블록·usage iterations를 기록한다.
- 라우팅 비교는 새 대화에서 수행해 이전 요청의 맥락이 결과에 영향을 주는지 점검한다.
❓ 열린 질문
- 캐시 재사용이 어느 정도일 때 추가 추론과 검증 비용을 상쇄할 수 있는가?
- 세 가지 시각 구현 사례에서 관찰된 품질 개선이 일반적인 코딩 작업에서도 반복되는가?
- 실제 폴백의 발생 조건과 빈도는 무엇이며, 작업 결과와 비용에 어떤 영향을 주는가?