I Tested Sonnet 5.5 vs Opus 5.5 vs GPT 6 Astra (No Hype)
Quick Summary
Sonnet 5.5·Opus 5.5·GPT 6 Astra를 네 가지 제작 과제로 비교한 영상은 Opus를 종합 우승으로 평가하지만, 실제 모델 선택에는 작업별 품질·사용성·단가·토큰 소비를 함께 고려해야 한다고 결론짓는다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Sonnet 5.5·Opus 5.5·GPT 6 Astra를 네 가지 제작 과제로 비교한 영상은 Opus를 종합 우승으로 평가하지만, 실제 모델 선택에는 작업별 품질·사용성·단가·토큰 소비를 함께 고려해야 한다고 결론짓는다.
📌 핵심 요점
- 벤치마크 순위와 실제 제작 결과는 구분해야 한다. 영상에서 소개한 다섯 지표 중 Opus가 네 개에서 앞섰지만, Terminal Bench 4-0에서는 가장 작은 모델인 Sonnet이 우세했다.
- 낮은 단가가 낮은 작업 총비용을 보장하지는 않는다. 영상은 Sonnet의 단가를 Opus의 절반, Astra의 5분의 1로 소개하지만, 실제 과제에서는 Astra가 지속적으로 더 적은 토큰을 사용했다.
- JavaScript 설명 애니메이션과 호텔 랜딩 페이지에서는 진행자가 Opus를 선호했다. 애니메이션은 Sonnet도 근접했으며, 호텔 페이지에서는 Astra의 첫 화면을 가장 깔끔하다고 평가했다.
- 여행 대시보드는 평가 기준에 따라 승자가 달라졌다. 실용성에서는 Astra, 시각적 표현에서는 Opus를 1위로 꼽았고, Sonnet은 화려하지만 요구에서 지나치게 벗어났다고 봤다.
- 브라우저 탱크 게임은 세 모델이 대체로 비슷해 무승부로 평가했다. 토큰 소비는 Sonnet 약 75만, Opus 약 50만, Astra 약 30만으로 달랐으며, 진행자는 마지막에 자신의 작업으로 직접 비교하라고 권했다.
🧩 배경과 문제 정의
진행자는 최근 출시된 것으로 소개한 GPT-6 Astra, Claude Opus 5.5, Sonnet 5.5를 놓고 어떤 모델을 사용해야 하는지 묻는다. 큰 모델이 항상 작은 모델을 압도하는 것은 아니라는 문제의식에서 출발해, 일부 벤치마크와 가격을 살펴본 뒤 애니메이션·호텔 웹페이지·여행 대시보드·브라우저 게임을 비교한다.
핵심은 점수 하나로 승자를 정하는 일이 아니라, 실제 결과물의 품질과 사용성에 비용을 함께 대입하는 것이다. 아래 정리는 제공된 자막의 주장과 진행자의 평가를 기준으로 한다.
🕒 시간순 섹션별 상세정리
1. 세 모델 중 무엇을 사용할 것인가
- 진행자는 AI 발전이 둔화됐다는 주장에 의문을 제기하며 Astra, Opus 5.5, Sonnet 5.5를 비교 대상으로 보여준다. [00:12]
- Sonnet이 더 큰 Opus보다 에이전트 코딩 평가에서 좋은 결과를 보이는 사례를 들어, 실제 과제로 모델 선택의 기준을 찾겠다고 보여준다. [00:45]
2. 벤치마크와 가격의 출발점
- 소개한 다섯 벤치마크 중 Opus가 네 개에서 우세하고, Terminal Bench 4-0에서는 Sonnet이 세 모델 중 가장 앞선다고 보여준다. [01:08]
- Sonnet은 입력 2달러·출력 10달러이며 Opus의 절반 가격, Astra는 Sonnet의 다섯 배 가격이라고 보여준다. 자막에는 과금 단위가 제시되지 않는다. [01:30]
3. JavaScript 설명 애니메이션 비교
- 세 모델에 같은 프롬프트로 Claude의 서브에이전트 작동 방식을 설명하는 15초짜리 손그림풍 JavaScript 영상을 요청한다. 이미지·영상 생성 도구를 쓰지 않는 코드 기반 과제다. [02:08]
- Sonnet은 소리와 화면 변화의 동기화가 좋지만 일부 장면이 너무 빠르다고 평가한다. Opus를 더 선호하며, Astra는 움직임과 소리가 상대적으로 단조롭다고 본다. [03:58]
- Sonnet과 Opus는 각각 약 30만 토큰, Astra는 약 7만 토큰을 사용했다. 이 과제의 선택은 Opus이며 Sonnet이 근접한 2위다. [04:12]
4. 호텔 랜딩 페이지의 조건과 Sonnet 결과
- 작은 호텔인 Don House의 랜딩 페이지를 만들게 한다. 자체 이미지 생성이 가능한 Astra와 비교하기 위해 Sonnet과 Opus에는 Higgs Field API 접근을 제공한다. [04:35]
- 진행자는 Higgs Field의 사용량 기반 과금과 할인 혜택을 보여준다. 이어 Sonnet의 큰 대표 이미지와 예약 가능 여부 확인 UI는 긍정적으로 보고, 글꼴과 버튼 배경은 비판한다. [05:26]
- Sonnet은 이미지 중심의 구성과 큰 배경 이미지를 활용한 하단부를 만들었다. 진행자는 구체적인 지시가 적었던 점을 고려하면 결과가 좋다고 평가한다. [06:12]
5. Opus 호텔 페이지의 차별화
- Opus는 호텔 이름의 독특한 표현, 개선된 예약 확인 UI, 마우스 반응이 있는 로고, 유리 느낌의 디자인과 색상 전환을 적용한다. [06:53]
- 숫자 애니메이션, 마우스를 올리면 멈추는 배너, 이미지 움직임과 개별 숙소의 날짜·예약 가능 여부 확인을 보여준다. 진행자는 Sonnet과 닮았지만 더 독창적이고 완성도가 높다고 평가한다. [07:50]
6. Astra 호텔 페이지와 두 번째 과제의 판정
- Astra의 첫 화면을 세 모델 중 가장 깔끔하고 마음에 드는 구성으로 평가하며, 전체 페이지도 Sonnet보다 선호한다고 드러낸다. [08:26]
- 전체적으로는 Opus를 승자로 선택하지만 Astra는 Opus와 비슷한 수준이며, 세 결과물 사이에 큰 격차는 없다고 보여준다. 디자인 평가의 주관성도 인정한다. [08:56]
- 토큰 소비는 Sonnet과 Opus 각각 약 20만, Astra 약 12만 5천으로 제시한다. [09:03]
7. 자기 홍보와 자유도가 높은 여행 앱 과제
- Chase AI Plus의 Claude Code·Codex 교육과 자신의 에이전트 시스템을 소개하는 자기 홍보가 들어간다. [09:31]
- 세 번째 과제는 SF 영화처럼 보이는 3D 여행 대시보드다. 창작 자유를 넓게 주고 Anthropic 모델에는 다시 Higgs Field API 접근을 제공한다. [09:57]
- Sonnet은 확대 가능한 지구 화면, 도시 이미지와 설명, 예상 비용·기온·직항 정보, 도시 간 이동 가격과 배경 음악을 보여준다. 진행자는 시각적으로 인상적이지만 처음에는 무엇을 보는지 알기 어렵다고 드러낸다. [11:08]
8. 여행 앱의 시각적 표현과 실용성
- Opus는 도시별 정보와 출발 공항 변경, 지구를 펼쳐 평면처럼 보여주는 기능을 구현한다. 진행자는 이런 추가 기능 때문에 Sonnet보다 선호한다. [12:21]
- Astra는 출발지, 여행 날짜, 인원, 좌석 등급을 바로 선택하게 한다. 진행자는 실제 사용성에서는 Astra를 1위, 시각적 표현에서는 Opus를 1위로 평가하며, 원래 프롬프트가 외형을 강조했다는 점도 짚어 본다. [13:28]
- Sonnet과 Opus는 각각 약 30만 토큰, Astra는 그 절반 정도를 사용했다고 보여준다. [13:36]
9. 브라우저 탱크 게임의 Sonnet과 Opus
- 마지막 과제는 자막에서 3.js로 표기한 기술을 이용해 브라우저에서 실행되는 World of Tanks식 게임을 만드는 것이다. [13:47]
- Sonnet은 탱크 선택, 능력치, 봇, 탄종 전환, 확대 조준과 재장전 등을 구현한다. 진행자는 준비된 에셋 묶음을 쓰지 않았으며 게임이 잘 작동했다고 보여준다. [14:53]
- Opus도 비슷한 게임을 만들었고 UI 일부가 겹치는 문제가 보인다. 토큰 소비는 Sonnet 약 75만, Opus 약 50만이며, 진행자는 두 게임의 동작이 거의 같다고 평가한다. [15:54]
10. Astra 게임과 무승부 판정
- Astra는 약 30만 토큰을 사용했다. 탱크 선택 UI는 더 단순하지만 진행자는 지도와 게임 중 UI를 더 선호하며, 카메라는 조금 더 민감하다고 드러낸다. [16:32]
- 타격 방향과 각도에 따른 도탄 표시를 보여준다. 전체적으로 세 게임의 차이는 작고, Opus와 Sonnet은 사실상 같은 제품이라고 평가한다. [17:15]
- 게임 결과는 무승부로 보되 Astra의 적은 토큰 소비를 장점으로 꼽는다. Sonnet은 가장 많은 토큰을 사용하고 완료에도 가장 오래 걸렸다고 보여준다. [17:27]
11. 종합 선택과 마지막 권고
- 모든 과제를 종합하면 Opus 5.5를 승자로 선택하지만 Astra와 Sonnet도 근접했다고 드러낸다. Sonnet의 낮은 가격과 이전 버전 대비 개선을 강조한다. [17:46]
- 진행자는 Astra를 매일 사용한다고 밝히며 OpenAI와 Anthropic의 경쟁을 긍정적으로 평가한다. 최종 선택은 각자의 작업에서 직접 시험해 판단하라고 권한다. [18:15]
- 마지막으로 Chase AI Plus의 Claude Code·Codex 강의를 다시 안내하고 영상을 마친다. [18:26]
🧾 결론
- 진행자의 종합 선택은 Opus 5.5였지만, Sonnet과 Astra도 크게 뒤처지지 않았다는 평가다.
- Sonnet은 낮은 단가와 개선된 제작 능력이 장점으로 제시됐다. 다만 게임 과제에서는 토큰을 가장 많이 사용하고 완료 시간도 가장 길었다.
- Astra는 애니메이션에서 상대적으로 낮은 평가를 받았지만, 여행 앱의 사용성과 전 과제의 적은 토큰 소비에서 강점을 보였다.
- 디자인 선호와 실제 사용성은 서로 다른 기준이다. 이 영상의 결과는 특정 과제와 진행자의 판단에 따른 비교로 읽는 것이 적절하다.
📈 투자·시사 포인트
- AI 도입 비용을 비교할 때는 표시 단가에 실제 토큰 소비와 외부 도구 비용을 함께 반영해야 한다. 이 영상의 정보만으로 작업별 최종 청구액을 확정할 수는 없다.
- 외부 이미지 생성 API 접근 여부도 결과물에 영향을 줄 수 있다. 모델 성능뿐 아니라 연결 가능한 도구와 그 비용을 조달 기준에 포함필요가 있다.
- 제작 품질의 차이가 작다면 사용성, 수정 부담, 완료 시간 같은 운영 기준이 모델 선택에서 더 중요해질 수 있다.
- 진행자는 OpenAI와 Anthropic의 경쟁이 결과물 품질 개선에 도움이 됐다고 해석한다. 영상은 개별 기업의 실적이나 투자수익률을 판단할 자료는 제시하지 않는다.
⚠️ 불확실하거나 확인이 필요한 부분
- Sonnet의 입력 2달러·출력 10달러라는 가격 설명에는 과금 단위가 명시되지 않는다. 가격의 기준일, 적용 조건, 입력·출력 토큰 구성도 확인이 필요하다.
- 반복 실행 횟수, 모델 설정, 수정 과정, 실행 환경이 충분히 제시되지 않는다. 네 가지 시연을 일반적인 성능 순위로 확대하기는 어렵다.
- 디자인 평가는 진행자의 취향에 크게 의존한다. 여행 앱에서도 실용성과 시각적 표현을 기준으로 삼을 때 순위가 달라졌다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 영상에서 안내한 고정 댓글의 프롬프트와 자료를 확인하고, 자신의 대표 작업으로 세 모델을 비교한다.
- 실행 전에 시각적 품질, 기능 완성도, 사용성, 완료 시간의 평가 기준을 정한다.
- 입력·출력 토큰, 재시도, 외부 API 사용료를 기록해 작업당 총비용을 계산한다.
- 모델 설정과 도구 접근 조건을 맞추고 같은 과제를 반복 실행해 결과의 일관성을 확인한다.
❓ 열린 질문
- 동일한 설정과 도구 조건으로 반복 실행해도 Opus의 종합 우위와 Astra의 적은 토큰 소비가 유지될까?
- 입력·출력 비중과 외부 API 비용까지 반영하면 과제별 비용 순위는 어떻게 달라질까?
- 여행 앱 프롬프트에 실용성과 필수 기능을 더 구체적으로 요구하면 Sonnet과 Opus의 결과도 달라질까?