I Tested GPT 6 Astra vs Fable 5.1 (No Hype Assessment)
Quick Summary
GPT 6 Astra와 Fable 5.1을 직접 비교한 영상에서 평가자는 Astra에 3승·1무를 줬지만, 네 번의 단일 시도만으로 모델의 우열을 확정하기보다 자신의 프로젝트와 비용 조건으로 검증하라고 권한다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
GPT 6 Astra와 Fable 5.1을 직접 비교한 영상에서 평가자는 Astra에 3승·1무를 줬지만, 네 번의 단일 시도만으로 모델의 우열을 확정하기보다 자신의 프로젝트와 비용 조건으로 검증하라고 권한다.
📌 핵심 요점
- 공개 벤치마크와 실제 작업을 구분해야 한다. 평가자는 공개 수치상 GPT-6가 앞선다고 설명하면서도, 점수 차이를 실제 작업 능력의 차이로 그대로 해석해서는 안 된다고 강조한다.
- 비용 대비 성능이 주요 비교축이다. 영상이 인용한 OpenAI 자료에서 Terminal Bench 4.0의 최고 성능은 Fable 5.1 55.8%, Astra 56.7%로 비슷하지만, 해당 조건의 비용은 각각 19.50달러와 10.35달러로 제시된다.
- 게임 제작과 여행 랜딩페이지에서는 Astra가 좋은 평가를 받았다. Fortnite형 브라우저 게임은 조작과 구현 완성도에서, 랜딩페이지는 이미지 활용과 정돈된 구성에서 Astra가 우세하다는 판단이다.
- 외부 도구를 활용한 애니메이션은 무승부였다. 같은 Higgsfield MCP와 애니메이션 스킬로 인터넷 메시지 전달을 설명하는 15초 영상을 만들었으며, 평가자는 두 결과 모두 좋다고 평가했다.
- 화려함보다 사용성과 수정 부담이 최종 선택에 영향을 줬다. 3D 지구본 앱에서도 Astra의 명료함을 선호했지만, 마지막에는 플랫폼 친숙도·이미지 생성·사용 한도·개인 프로젝트 경험까지 함께 보라고 정리한다.
🧩 배경과 문제 정의
평가자는 GPT 6 Astra에 조기 접근한 경험을 바탕으로 Fable 5.1과 직접 비교한다. 문제의식은 공개 벤치마크의 높은 점수가 실제 제작 업무에서도 더 좋은 결과와 경제성으로 이어지는지 확인하는 것이다.
비교 과제는 Fortnite형 브라우저 게임, AI 여행 서비스 랜딩페이지, 인터넷 메시지 전달을 설명하는 애니메이션, 3D 지구본 여행 앱이다. 각 결과는 단일 시도 중심으로 소개되며, 작업마다 기능·미감·외부 도구 활용 등 평가 초점이 다르다. 따라서 영상은 제한된 실사용 사례를 보여주는 비교로 읽는 것이 적절하다.
🕒 시간순 섹션별 상세정리
1. 비교 목적과 실사용 중심의 접근
- 평가자는 Astra가 점진적으로 공개되는 상황에서 조기 접근 권한을 얻었다고 설명하며, Fable 5.1과 직접 시험해 사용자에게 적합한 도구를 가려보겠다고 드러낸다. [00:23]
- 인터페이스, 애니메이션, 웹 앱, 장시간 게임 제작 과제를 통해 어느 도구에 시간을 투자할지 판단할 근거를 제공하려 한다. [00:50]
2. 공개 벤치마크의 우위와 해석 한계
- 평가자는 Anthropic의 공개 지표가 상대적으로 부족하다고 지적하고, 제시된 수치에서는 GPT-6가 앞선다고 보여준다. 다만 특정 벤치마크 점수 차이를 같은 비율의 능력 차이로 해석하지는 않는다. [01:40]
- GPT-6는 이전 GPT 모델 대비 큰 진전으로, Fable 5.1은 이미 강력했던 Fable 5의 장점을 개선한 모델로 요약한다. [02:12]
3. 비슷한 최고 성능에서 드러난 비용 차이
- OpenAI 보도자료의 Terminal Bench 4.0 비교를 인용하며 최고 정확도를 Fable 5.1 55.8%, Astra 56.7%로 제시한다. [02:58]
- 해당 최고 성능 조건의 비용은 Astra 10.35달러, Fable 5.1 19.50달러라고 설명하고, 점수뿐 아니라 그 성능에 도달하는 비용을 봐야 한다고 강조한다. [03:25]
4. 자체 교육 홍보와 게임 제작 과제 설정
- Chase AI Plus의 도구 활용 강의를 홍보하며 초보자도 실제 프로젝트에 적용할 수 있는 교육이라고 보여준다. [04:02]
- 참고 영상과 여러 이미지를 바탕으로, 99개 봇과 다양한 무기를 갖춘 Fortnite형 브라우저 게임을 두 모델에 요청한다. [04:33]
5. Astra 게임의 기능과 제작 시간
- Astra 결과에서는 모드 선택, 배틀버스, 낙하산, 무기 수집, 방어막 회복, 재장전, 인벤토리와 지도 등을 살펴본다. 카메라 흔들림은 있지만 전반적으로 좋은 결과라고 평가한다. [06:14]
- Codex의 제작 시간은 약 45분이었다고 하며, 조기 접근 환경 때문에 정확한 토큰 사용량은 확인하지 못했다고 드러낸다. [06:40]
- 건축과 구조물 위 이동도 확인한 뒤, 추가 수정 없는 한 번의 시도로는 준수한 결과라고 정리한다. [07:04]
6. Fable 게임의 구현 문제와 첫 판정
- Fable 결과는 약 1시간 30분과 약 75만 토큰을 사용했다고 보여준다. 로비에는 눌러도 작동하지 않는 요소가 있고, 카메라 조작과 낙하 효과음도 불편하다고 평가한다. [08:06]
- 나무 제거 애니메이션, 건축물 통과, 조준과 탄착 위치의 차이 등을 지적하며 전체적으로 덜 정교하다고 본다. [08:58]
- 참고 영상의 결과가 몇 번의 시도로 만들어졌는지는 알 수 없다고 덧붙이면서, 이번 단일 시도 비교에서는 Codex의 승리라고 판단한다. [09:21]
7. Astra 여행 랜딩페이지의 정돈된 구성
- 목적지를 입력하면 여행 일정을 만드는 서비스의 랜딩페이지를 요청하며, 자유로운 검색과 도구 사용을 허용한다. Astra가 사용한 이미지의 생성·검색 여부는 확인하지 않았다고 한다. [09:55]
- 백엔드 기능 대신 외관을 평가한다. 이미지, 서비스 설명, FAQ와 푸터가 깔끔하게 구성됐으며, 창의적 지시가 많지 않았는데도 목적에 맞는 결과라고 평가한다. [10:58]
8. Fable 랜딩페이지와 사용자 지시 역량
- 같은 프롬프트의 Fable 결과는 전형적인 좌우 배치, 둥근 카드, 단조로운 색감으로 구성됐다고 설명하며 Astra보다 낮게 평가한다. [12:13]
- 참조 이미지, 구성요소 지정, 외부 컴포넌트 라이브러리 활용에 능숙할수록 모델 선택의 영향이 줄어들 수 있다고 드러낸다. 간단한 요청으로 얻는 초기 결과 기준에서는 Astra를 승자로 꼽는다. [13:00]
9. 동일한 외부 도구로 만든 애니메이션
- 두 모델을 Higgsfield MCP에 연결하고 같은 애니메이션 스킬로 인터넷 메시지 전달 원리를 설명하는 15초짜리 2D 영상을 요청한다. [13:21]
- 두 결과 모두 좋다고 평가하며 무승부로 판정한다. 외부 도구를 호출하고 생성 도구에 프롬프트를 전달하는 능력이 양쪽 모두 충분하다는 설명이다. [14:08]
10. Astra의 3D 지구본 앱 Orbit
- 마지막 과제는 시각적 창의성을 발휘할 수 있는 3D 지구본 대시보드다. Astra의 Orbit에서 출발지와 목적지를 선택하고 지도와 여행 정보를 확인한다. [15:10]
- 도시 설명, 활동 제안, 여행 저장과 골든아워 위치를 보여주는 기능을 소개하며, 창의적 요소와 단순하고 깔끔한 구성이 함께 있다고 평가한다. [15:45]
11. Fable의 Arclight와 시각 효과의 한계
- Arclight는 밝은 효과, 여러 서체, 가격 표시 등 시각적 요소가 풍부하지만 화면이 복잡하고 Astra보다 덜 정돈됐다고 평가한다. [16:30]
- 시간 조절과 도시 이동 애니메이션은 흥미롭지만 강한 배경 밝기가 정보 가독성을 떨어뜨린다고 지적한다. [17:14]
- Astra 결과는 더 적은 수정으로 활용할 수 있어 보인다며, 지구본 앱 비교에서도 Astra를 승자로 선택한다. [17:53]
12. 네 가지 실험의 종합 결과와 유보
- 최종 판정은 Astra 3승과 애니메이션 무승부다. 평가자는 공개 지표와 토큰 비용 측면에서도 Astra가 유리하다고 설명하지만, 네 번의 단일 시도였다는 한계를 강조한다. [18:20]
- 내장 이미지 생성의 필요성, 플랫폼 친숙도, 두 모델 병행 여부를 함께 고려하라고 제안한다. Fable 5.1도 매우 좋은 모델이며 이번 과제가 그 역량을 과소평가했을 수 있다고 드러낸다. [18:55]
13. 사용 한도와 구독 선택, 개인 검증으로 마무리
- 평가자는 Anthropic의 사용 한도 운영에 불만을 표하고 OpenAI가 상대적으로 더 많은 사용 여지를 제공한다고 주장하지만, 익숙한 Anthropic 구독을 즉시 해지할 정도의 차이라고 보지는 않는다. [20:05]
- 한 업체의 높은 배수 요금제 대신 두 업체의 낮은 배수 요금제를 병행하는 방안을 제시한다. 어떤 영상이나 벤치마크도 자신의 프로젝트에서 직접 써보는 경험을 대신할 수 없다고 강조한다. [20:35]
- 마지막에는 강의를 다시 안내하고, Astra의 공개 확대에 관한 게시물을 봤다며 시청자의 활용 결과와 의견을 요청한다. [20:57]
🧾 결론
- 영상의 판정은 게임, 랜딩페이지, 3D 지구본 앱에서 Astra 승리, 애니메이션에서 무승부다. 이는 평가자의 네 가지 실험에 한정된 결과다.
- 평가자는 Astra의 결과가 전반적으로 매끄럽고 추가 수정이 적어 보인다고 설명한다. 동시에 이번 실험이 Fable 5.1의 역량을 충분히 드러내지 못했을 가능성도 인정한다.
- 익숙한 서비스를 즉시 해지할 만큼 결정적인 차이라고 보지는 않는다. 실제 업무에서 두 도구를 비교하는 경험을 최종 판단 기준으로 제안한다.
📈 투자·시사 포인트
- 도구 예산은 성능 점수와 함께 평가해야 한다. 영상이 제시한 비용 차이는 비슷한 성능을 얻는 데 필요한 지출이 다를 수 있음을 보여준다. 다만 벤치마크 비용을 구독료나 모든 작업의 비용으로 일반화할 수는 없다.
- 첫 결과 이후의 수정 시간이 생산성을 좌우한다. 게임 조작 오류나 과도한 시각 효과를 고치는 부담까지 고려하면, 생성 속도 외에 실제 사용 가능한 상태에 도달하는 시간도 비교 기준이 된다.
- 모델과 도구 환경을 함께 봐야 한다. 이미지 활용, 외부 생성 도구 호출, 플랫폼 사용 경험이 결과물에 영향을 주므로 모델 이름만으로 구매 결정을 내리기 어렵다.
- 구독 분산은 검토 가능한 선택지다. 평가자는 한 업체의 높은 배수 요금제 대신 두 업체의 낮은 배수 요금제를 병행하는 방안을 제시한다. 영상의 금액과 한도 주장은 실제 결제 조건을 확인한 뒤 판단해야 한다.
⚠️ 불확실하거나 확인이 필요한 부분
- 네 가지 과제를 각각 한 번씩 수행한 비교다. 반복 실행의 편차, 과제 선정 효과, 평가자의 미적 취향을 분리할 자료가 없다.
- 비용 대비 성능 수치는 평가자가 OpenAI 보도자료를 보고 설명한 것이다. 동일 조건의 독립 검증이나 전체 벤치마크 설정은 이 전사만으로 확인할 수 없다.
- Astra 게임 제작의 정확한 토큰 사용량은 조기 접근 환경 때문에 확인하지 못했다고 한다. 따라서 Fable의 약 75만 토큰과 직접적인 사용량 비교는 불가능하다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 자신의 대표 업무에서 게임·화면 제작·외부 도구 호출 등 비교할 과제를 선정하고, 같은 프롬프트와 참조 자료로 두 모델을 반복 시험한다.
- 실행 시간, 사용 토큰, 실제 청구 비용, 오류 수, 수정 횟수를 기록해 사용 가능한 결과까지의 총비용을 비교한다.
- 디자인 평가와 기능 검증을 나누고, 버튼 작동·카메라 조작·충돌 처리·가독성·데이터 연동을 직접 확인한다.
- 이미지와 외부 도구에 대한 접근 조건을 기록해 결과 차이가 모델 자체와 도구 환경 중 어디에서 발생했는지 살핀다.
❓ 열린 질문
- 같은 과제를 여러 번 실행하거나 수정 프롬프트를 허용해도 Astra의 우세가 유지될까?
- 동일한 이미지 도구와 디자인 참조를 제공하면 랜딩페이지의 결과 차이는 얼마나 줄어들까?
- 코드 유지보수와 장기 수정 작업에서도 첫 생성 결과와 같은 순위가 나타날까?