YouTubeChase AI·2026년 9월 5일·0

I Tested GPT 6 Astra vs Fable 5.1 (No Hype Assessment)

Quick Summary

GPT 6 Astra와 Fable 5.1을 직접 비교한 영상에서 평가자는 Astra에 3승·1무를 줬지만, 네 번의 단일 시도만으로 모델의 우열을 확정하기보다 자신의 프로젝트와 비용 조건으로 검증하라고 권한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

I Tested GPT 6 Astra vs Fable 5.1 (No Hype Assessment) 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

I Tested GPT 6 Astra vs Fable 5.1 (No Hype Assessment)의 핵심 내용을 4단계로 요약한 인포그래픽
I Tested GPT 6 Astra vs Fable 5.1 (No Hype Assessment) 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

GPT 6 Astra와 Fable 5.1을 직접 비교한 영상에서 평가자는 Astra에 3승·1무를 줬지만, 네 번의 단일 시도만으로 모델의 우열을 확정하기보다 자신의 프로젝트와 비용 조건으로 검증하라고 권한다.

📌 핵심 요점

  1. 공개 벤치마크와 실제 작업을 구분해야 한다. 평가자는 공개 수치상 GPT-6가 앞선다고 설명하면서도, 점수 차이를 실제 작업 능력의 차이로 그대로 해석해서는 안 된다고 강조한다.
  2. 비용 대비 성능이 주요 비교축이다. 영상이 인용한 OpenAI 자료에서 Terminal Bench 4.0의 최고 성능은 Fable 5.1 55.8%, Astra 56.7%로 비슷하지만, 해당 조건의 비용은 각각 19.50달러와 10.35달러로 제시된다.
  3. 게임 제작과 여행 랜딩페이지에서는 Astra가 좋은 평가를 받았다. Fortnite형 브라우저 게임은 조작과 구현 완성도에서, 랜딩페이지는 이미지 활용과 정돈된 구성에서 Astra가 우세하다는 판단이다.
  4. 외부 도구를 활용한 애니메이션은 무승부였다. 같은 Higgsfield MCP와 애니메이션 스킬로 인터넷 메시지 전달을 설명하는 15초 영상을 만들었으며, 평가자는 두 결과 모두 좋다고 평가했다.
  5. 화려함보다 사용성과 수정 부담이 최종 선택에 영향을 줬다. 3D 지구본 앱에서도 Astra의 명료함을 선호했지만, 마지막에는 플랫폼 친숙도·이미지 생성·사용 한도·개인 프로젝트 경험까지 함께 보라고 정리한다.

🧩 배경과 문제 정의

평가자는 GPT 6 Astra에 조기 접근한 경험을 바탕으로 Fable 5.1과 직접 비교한다. 문제의식은 공개 벤치마크의 높은 점수가 실제 제작 업무에서도 더 좋은 결과와 경제성으로 이어지는지 확인하는 것이다.

비교 과제는 Fortnite형 브라우저 게임, AI 여행 서비스 랜딩페이지, 인터넷 메시지 전달을 설명하는 애니메이션, 3D 지구본 여행 앱이다. 각 결과는 단일 시도 중심으로 소개되며, 작업마다 기능·미감·외부 도구 활용 등 평가 초점이 다르다. 따라서 영상은 제한된 실사용 사례를 보여주는 비교로 읽는 것이 적절하다.

🕒 시간순 섹션별 상세정리

1. 비교 목적과 실사용 중심의 접근

  • 평가자는 Astra가 점진적으로 공개되는 상황에서 조기 접근 권한을 얻었다고 설명하며, Fable 5.1과 직접 시험해 사용자에게 적합한 도구를 가려보겠다고 드러낸다. [00:23]
  • 인터페이스, 애니메이션, 웹 앱, 장시간 게임 제작 과제를 통해 어느 도구에 시간을 투자할지 판단할 근거를 제공하려 한다. [00:50]

2. 공개 벤치마크의 우위와 해석 한계

  • 평가자는 Anthropic의 공개 지표가 상대적으로 부족하다고 지적하고, 제시된 수치에서는 GPT-6가 앞선다고 보여준다. 다만 특정 벤치마크 점수 차이를 같은 비율의 능력 차이로 해석하지는 않는다. [01:40]
  • GPT-6는 이전 GPT 모델 대비 큰 진전으로, Fable 5.1은 이미 강력했던 Fable 5의 장점을 개선한 모델로 요약한다. [02:12]

3. 비슷한 최고 성능에서 드러난 비용 차이

  • OpenAI 보도자료의 Terminal Bench 4.0 비교를 인용하며 최고 정확도를 Fable 5.1 55.8%, Astra 56.7%로 제시한다. [02:58]
  • 해당 최고 성능 조건의 비용은 Astra 10.35달러, Fable 5.1 19.50달러라고 설명하고, 점수뿐 아니라 그 성능에 도달하는 비용을 봐야 한다고 강조한다. [03:25]

4. 자체 교육 홍보와 게임 제작 과제 설정

  • Chase AI Plus의 도구 활용 강의를 홍보하며 초보자도 실제 프로젝트에 적용할 수 있는 교육이라고 보여준다. [04:02]
  • 참고 영상과 여러 이미지를 바탕으로, 99개 봇과 다양한 무기를 갖춘 Fortnite형 브라우저 게임을 두 모델에 요청한다. [04:33]

5. Astra 게임의 기능과 제작 시간

  • Astra 결과에서는 모드 선택, 배틀버스, 낙하산, 무기 수집, 방어막 회복, 재장전, 인벤토리와 지도 등을 살펴본다. 카메라 흔들림은 있지만 전반적으로 좋은 결과라고 평가한다. [06:14]
  • Codex의 제작 시간은 약 45분이었다고 하며, 조기 접근 환경 때문에 정확한 토큰 사용량은 확인하지 못했다고 드러낸다. [06:40]
  • 건축과 구조물 위 이동도 확인한 뒤, 추가 수정 없는 한 번의 시도로는 준수한 결과라고 정리한다. [07:04]

6. Fable 게임의 구현 문제와 첫 판정

  • Fable 결과는 약 1시간 30분과 약 75만 토큰을 사용했다고 보여준다. 로비에는 눌러도 작동하지 않는 요소가 있고, 카메라 조작과 낙하 효과음도 불편하다고 평가한다. [08:06]
  • 나무 제거 애니메이션, 건축물 통과, 조준과 탄착 위치의 차이 등을 지적하며 전체적으로 덜 정교하다고 본다. [08:58]
  • 참고 영상의 결과가 몇 번의 시도로 만들어졌는지는 알 수 없다고 덧붙이면서, 이번 단일 시도 비교에서는 Codex의 승리라고 판단한다. [09:21]

7. Astra 여행 랜딩페이지의 정돈된 구성

  • 목적지를 입력하면 여행 일정을 만드는 서비스의 랜딩페이지를 요청하며, 자유로운 검색과 도구 사용을 허용한다. Astra가 사용한 이미지의 생성·검색 여부는 확인하지 않았다고 한다. [09:55]
  • 백엔드 기능 대신 외관을 평가한다. 이미지, 서비스 설명, FAQ와 푸터가 깔끔하게 구성됐으며, 창의적 지시가 많지 않았는데도 목적에 맞는 결과라고 평가한다. [10:58]

8. Fable 랜딩페이지와 사용자 지시 역량

  • 같은 프롬프트의 Fable 결과는 전형적인 좌우 배치, 둥근 카드, 단조로운 색감으로 구성됐다고 설명하며 Astra보다 낮게 평가한다. [12:13]
  • 참조 이미지, 구성요소 지정, 외부 컴포넌트 라이브러리 활용에 능숙할수록 모델 선택의 영향이 줄어들 수 있다고 드러낸다. 간단한 요청으로 얻는 초기 결과 기준에서는 Astra를 승자로 꼽는다. [13:00]

9. 동일한 외부 도구로 만든 애니메이션

  • 두 모델을 Higgsfield MCP에 연결하고 같은 애니메이션 스킬로 인터넷 메시지 전달 원리를 설명하는 15초짜리 2D 영상을 요청한다. [13:21]
  • 두 결과 모두 좋다고 평가하며 무승부로 판정한다. 외부 도구를 호출하고 생성 도구에 프롬프트를 전달하는 능력이 양쪽 모두 충분하다는 설명이다. [14:08]

10. Astra의 3D 지구본 앱 Orbit

  • 마지막 과제는 시각적 창의성을 발휘할 수 있는 3D 지구본 대시보드다. Astra의 Orbit에서 출발지와 목적지를 선택하고 지도와 여행 정보를 확인한다. [15:10]
  • 도시 설명, 활동 제안, 여행 저장과 골든아워 위치를 보여주는 기능을 소개하며, 창의적 요소와 단순하고 깔끔한 구성이 함께 있다고 평가한다. [15:45]

11. Fable의 Arclight와 시각 효과의 한계

  • Arclight는 밝은 효과, 여러 서체, 가격 표시 등 시각적 요소가 풍부하지만 화면이 복잡하고 Astra보다 덜 정돈됐다고 평가한다. [16:30]
  • 시간 조절과 도시 이동 애니메이션은 흥미롭지만 강한 배경 밝기가 정보 가독성을 떨어뜨린다고 지적한다. [17:14]
  • Astra 결과는 더 적은 수정으로 활용할 수 있어 보인다며, 지구본 앱 비교에서도 Astra를 승자로 선택한다. [17:53]

12. 네 가지 실험의 종합 결과와 유보

  • 최종 판정은 Astra 3승과 애니메이션 무승부다. 평가자는 공개 지표와 토큰 비용 측면에서도 Astra가 유리하다고 설명하지만, 네 번의 단일 시도였다는 한계를 강조한다. [18:20]
  • 내장 이미지 생성의 필요성, 플랫폼 친숙도, 두 모델 병행 여부를 함께 고려하라고 제안한다. Fable 5.1도 매우 좋은 모델이며 이번 과제가 그 역량을 과소평가했을 수 있다고 드러낸다. [18:55]

13. 사용 한도와 구독 선택, 개인 검증으로 마무리

  • 평가자는 Anthropic의 사용 한도 운영에 불만을 표하고 OpenAI가 상대적으로 더 많은 사용 여지를 제공한다고 주장하지만, 익숙한 Anthropic 구독을 즉시 해지할 정도의 차이라고 보지는 않는다. [20:05]
  • 한 업체의 높은 배수 요금제 대신 두 업체의 낮은 배수 요금제를 병행하는 방안을 제시한다. 어떤 영상이나 벤치마크도 자신의 프로젝트에서 직접 써보는 경험을 대신할 수 없다고 강조한다. [20:35]
  • 마지막에는 강의를 다시 안내하고, Astra의 공개 확대에 관한 게시물을 봤다며 시청자의 활용 결과와 의견을 요청한다. [20:57]

🧾 결론

  • 영상의 판정은 게임, 랜딩페이지, 3D 지구본 앱에서 Astra 승리, 애니메이션에서 무승부다. 이는 평가자의 네 가지 실험에 한정된 결과다.
  • 평가자는 Astra의 결과가 전반적으로 매끄럽고 추가 수정이 적어 보인다고 설명한다. 동시에 이번 실험이 Fable 5.1의 역량을 충분히 드러내지 못했을 가능성도 인정한다.
  • 익숙한 서비스를 즉시 해지할 만큼 결정적인 차이라고 보지는 않는다. 실제 업무에서 두 도구를 비교하는 경험을 최종 판단 기준으로 제안한다.

📈 투자·시사 포인트

  • 도구 예산은 성능 점수와 함께 평가해야 한다. 영상이 제시한 비용 차이는 비슷한 성능을 얻는 데 필요한 지출이 다를 수 있음을 보여준다. 다만 벤치마크 비용을 구독료나 모든 작업의 비용으로 일반화할 수는 없다.
  • 첫 결과 이후의 수정 시간이 생산성을 좌우한다. 게임 조작 오류나 과도한 시각 효과를 고치는 부담까지 고려하면, 생성 속도 외에 실제 사용 가능한 상태에 도달하는 시간도 비교 기준이 된다.
  • 모델과 도구 환경을 함께 봐야 한다. 이미지 활용, 외부 생성 도구 호출, 플랫폼 사용 경험이 결과물에 영향을 주므로 모델 이름만으로 구매 결정을 내리기 어렵다.
  • 구독 분산은 검토 가능한 선택지다. 평가자는 한 업체의 높은 배수 요금제 대신 두 업체의 낮은 배수 요금제를 병행하는 방안을 제시한다. 영상의 금액과 한도 주장은 실제 결제 조건을 확인한 뒤 판단해야 한다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 네 가지 과제를 각각 한 번씩 수행한 비교다. 반복 실행의 편차, 과제 선정 효과, 평가자의 미적 취향을 분리할 자료가 없다.
  • 비용 대비 성능 수치는 평가자가 OpenAI 보도자료를 보고 설명한 것이다. 동일 조건의 독립 검증이나 전체 벤치마크 설정은 이 전사만으로 확인할 수 없다.
  • Astra 게임 제작의 정확한 토큰 사용량은 조기 접근 환경 때문에 확인하지 못했다고 한다. 따라서 Fable의 약 75만 토큰과 직접적인 사용량 비교는 불가능하다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 자신의 대표 업무에서 게임·화면 제작·외부 도구 호출 등 비교할 과제를 선정하고, 같은 프롬프트와 참조 자료로 두 모델을 반복 시험한다.
  • 실행 시간, 사용 토큰, 실제 청구 비용, 오류 수, 수정 횟수를 기록해 사용 가능한 결과까지의 총비용을 비교한다.
  • 디자인 평가와 기능 검증을 나누고, 버튼 작동·카메라 조작·충돌 처리·가독성·데이터 연동을 직접 확인한다.
  • 이미지와 외부 도구에 대한 접근 조건을 기록해 결과 차이가 모델 자체와 도구 환경 중 어디에서 발생했는지 살핀다.

❓ 열린 질문

  • 같은 과제를 여러 번 실행하거나 수정 프롬프트를 허용해도 Astra의 우세가 유지될까?
  • 동일한 이미지 도구와 디자인 참조를 제공하면 랜딩페이지의 결과 차이는 얼마나 줄어들까?
  • 코드 유지보수와 장기 수정 작업에서도 첫 생성 결과와 같은 순위가 나타날까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.