I Tested Sonnet 5.5 vs Opus 5.5. What You Need to Know.
Quick Summary
Sonnet 5.5와 Opus 5.5의 실무 비교에서는 목표와 검증 기준이 명확할수록 Sonnet의 경제성이, 모호한 목표와 창의적 판단이 필요할수록 Opus의 완성도가 돋보였다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Sonnet 5.5와 Opus 5.5의 실무 비교에서는 목표와 검증 기준이 명확할수록 Sonnet의 경제성이, 모호한 목표와 창의적 판단이 필요할수록 Opus의 완성도가 돋보였다.
📌 핵심 요점
- 모델 선택은 목표의 명확성과 검증 가능성에서 출발한다. 평가자는 결과를 확인하기 쉬운 작업에는 Sonnet부터 시도하고, 목표 자체를 함께 정해야 하는 작업에는 Opus를 선택한다. 영상에 제시된 100만 토큰당 입력·출력 가격은 Sonnet 2·10달러, Opus 4·20달러다.
- 시각적 매력과 결과물의 충실도는 따로 평가해야 한다. 랜딩 페이지에서 Sonnet은 상호작용이 인상적이었지만 실제 제품 이미지를 재현하지 못했다. Opus 결과가 전반적으로 더 좋았어도 추가 비용을 고려한 승리는 Sonnet에 돌아갔다. 모션 쇼릴에서는 브랜드 해석과 모션·사운드 디자인을 이유로 Opus가 선택됐다.
- 모호한 요청을 실행 과제로 바꾸는 데는 Opus가 강점을 보였다. 성장 계획은 실제 업무에 옮기기 쉬웠고, 투자자 자료에서는 두 모델의 품질 차이가 뚜렷하지 않은 가운데 Opus가 더 빠르고 저렴했다. 높은 토큰 단가가 모든 작업의 높은 총비용을 뜻하지는 않았다.
- 명확한 스킬은 결과물 차이를 줄였다. 리소스 가이드에서는 두 모델의 구성이 매우 비슷했고, Sonnet은 약 절반의 시간으로 작업하면서 1.40달러를 절약했다. 다만 로컬 AI 설명과 콘텐츠 도구에서 추가 요청으로 Sonnet을 개선할 수 있다는 평가는 실제 재실행으로 확인되지 않았다.
- 일곱 과제의 최종 점수는 Sonnet 4승, Opus 3승이었다. Opus는 합계 약 46분 더 걸리고 입력 토큰을 약 3,800만 개 더 사용했으며, 총비용은 약 16달러 더 들었다. 이 점수는 첫 결과물의 품질뿐 아니라 비용과 예상 개선 가능성까지 반영한 평가다.
🧩 배경과 문제 정의
- 영상은 Sonnet 5.5가 Sonnet 5보다 30% 빠르고 대부분의 작업에서 비용을 30% 줄인다는 설명을 출발점으로, 실제 업무 결과를 Opus 5.5와 비교한다.
- 비교의 핵심은 결과물의 완성도뿐 아니라 실행 시간, 토큰 사용량, 비용을 함께 고려했을 때 어떤 모델을 선택할지 판단하는 것이다.
- 목표와 검증 기준이 명확한 작업, 창의성과 판단이 필요한 작업을 구분하고, 추가 프롬프트로 저렴한 모델의 결과를 개선할 가능성도 살핀다.
🕒 시간순 섹션별 상세정리
1. 토큰 단가와 목표의 명확성이 모델 선택의 출발점이다
- 100만 토큰당 입력 가격은 Sonnet 2달러, Opus 4달러이고, 출력 가격은 각각 10달러와 20달러다. Opus의 토큰 단가는 Sonnet의 두 배이므로, 추가 비용에 상응하는 품질 차이가 있는지가 비교 기준이다. [01:06]
- 영상에 인용된 선택 지침은 일상적인 코딩·버그 수정·문서·슬라이드·스프레드시트에는 Sonnet을, 신중한 판단과 장기적인 에이전트 작업이 필요한 어려운 문제에는 Opus를 권한다. 평가자는 목표와 결과 검증 방법이 명확하면 Sonnet부터 시도하고, 목표 자체를 함께 정해야 하는 주관적인 작업에는 Opus를 선택한다. [01:55]
2. Sonnet의 랜딩 페이지는 상호작용이 강하지만 제품 이미지가 부정확하다
- PerkForm 랜딩 페이지의 첫 결과물은 등장하는 텍스트와 마우스 움직임에 반응하는 3D 캔으로 강한 첫인상을 만든다. 다만 캔은 실제 제품 이미지를 정확히 재현한 결과가 아니라 임의로 만든 형태여서, 시각 효과와 제품 충실도 사이에 문제가 생겼다. [03:02]
- 드래그로 캔을 회전시키고 첫 화면에서 맛을 바꿀 수 있다. 스크롤에 따라 커피와 단백질 음료가 하나의 캔으로 합쳐지고, 운동 가방·휴대전화·열쇠가 있는 일상 장면으로 이어져 제품 사용 상황을 구성한다. [03:37]
3. Opus의 랜딩 페이지는 전반적으로 낫지만 비용 차이를 정당화하지 못한다
- 두 번째 결과물은 첫 화면의 인상이 약하고 일부 스크롤 연출도 덜 만족스럽지만, 브랜드 가이드에 있는 제품 이미지를 사용하고 이미지 확대 애니메이션을 구현했다. 평가자는 전체적으로 이 결과물을 더 선호했으며, 두 번째는 Opus, 첫 번째는 Sonnet 결과였다. [05:16]
- Sonnet은 28분 동안 입력 2,000만·출력 13만 4,000토큰을, Opus는 52분 동안 입력 3,700만·출력 14만 8,000토큰을 사용했다. 영상에서는 Opus의 실행 시간과 비용이 거의 두 배였지만 결과가 두 배 좋지는 않았다고 평가한다. [05:46]
4. 모션 쇼릴에서는 Opus의 브랜드 해석과 사운드 디자인이 우세하다
- Glydo 쇼릴 제작에는 자체 조사와 브랜드·타이포그래피의 일관성이 요구됐다. Sonnet은 제품의 실제 사용 모습을 표현하고, 픽셀로 만든 ‘G’를 AI 생성 영상으로 전환해 예상보다 좋은 결과를 냈다. 음성 제작 도구가 ElevenLabs였는지는 확실하지 않다. [08:24]
- Opus는 배경과 애니메이션에서 Glydo의 분위기를 더 잘 살렸고 문구도 더 좋다는 평가를 받았다. 웹사이트의 실제 인용문을 가져와 결과물에 반영한 점도 장점이었다. [09:20]
5. Sonnet의 성장 계획은 보기 좋지만 즉시 실행하기에는 부족하다
- How They AI의 구독자를 1,000명으로 늘리기 위한 연구 기반 90일 계획이 과제였다. 두 모델 모두 먼저 Markdown을 만들었고, 읽기 쉬운 문서로 바꾸라는 동일한 추가 요청에 Sonnet은 로컬 HTML, Opus는 Claude 아티팩트를 제공했다. [10:30]
- Sonnet은 11월 2일 출시를 제안하고, 에피소드·구독자 목표·이메일 발송·커뮤니티 게시물·단계별 마일스톤·유입 경로를 배치했다. 다만 상호작용 기능보다는 계획의 모습을 보여주는 문서에 가까웠다. [11:24]
6. Opus는 모호한 성장 목표를 더 명확한 실행 과제로 바꾼다
- Opus는 10월 1일부터 12월 29일까지의 90일 계획을 구성해 현재 사업 상황에 더 잘 맞췄다. 시작 전 오디션·게스트 신청·공지·에피소드 녹화부터 Shorts·이메일·커뮤니티 게시까지의 일정이 더 쉽게 읽혔다. [12:25]
- 월별 단계를 구축·출시·성장으로 나누고 이메일 목록·YouTube 자연 유입·Nate의 채널 등 구독자 유입 경로를 정리했다. 전체 계획을 열면 구체적인 작업 목록으로 연결되어 실제 업무로 옮기기 쉬웠다. [12:55]
7. Opus의 투자자 자료는 수식으로 연결된 재무 모델이 강점이다
- 가상 회사 데이터를 바탕으로 Excel과 투자자용 피치 덱을 만드는 과제에서 Opus는 18장짜리 덱을 구성했다. 문제·제품·고객·성과·사업 모델과 생성 이미지를 포함했지만, 글꼴과 숫자 표현은 기대만큼 고급스럽지 않다는 평가다. [15:04]
- Excel에는 대시보드·입력·월별 지표·분기 손익과 시각화가 들어갔다. 여러 셀을 수식으로 연결해 입력 데이터를 바꾸면 전체 시트가 갱신되도록 구성했다. [15:27]
8. 투자자 자료의 품질이 비슷할 때는 더 저렴하고 빠른 Opus가 이긴다
- Sonnet의 피치 덱은 회사 개요·문제·제품·고객·사업 모델·성과의 구조와 외관이 Opus와 매우 비슷했고, 슬라이드는 더 많았다. 아티팩트 제공 여부도 앞선 과제와 달라져 모델별로 고정된 차이라고 보기 어렵다. [16:30]
- Sonnet의 Excel에도 대시보드·월별 데이터·손익·SaaS 지표·가정·예측과 수식·조회 기능이 포함됐다. 파이프라인·고객·마케팅·인력 탭까지 있었지만, 가상 데이터이므로 이 구성이 실제로 얼마나 필요한지는 확실히 판단할 수 없었다. [17:08]
9. 로컬 AI 설명에서는 시각적 매력과 이해를 돕는 깊이가 갈린다
- 현재 PC에서 실행할 수 있는 모델을 초보자에게 설명하는 과제에는 HTML Explainer 스킬이 사용됐다. Opus는 그래픽카드·메모리·프로세서·저장장치를 구분하고, 32GB 그래픽 메모리를 기준으로 43GB 모델은 어려울 수 있지만 20GB 모델은 실행할 수 있다는 간단한 기준과 설치·용도별 선택·시작 방법을 제시했다. [18:42]
- Sonnet은 ‘로컬’의 의미부터 설명하고, 모델을 두는 위치를 책상·선반·창고에 비유했다. 실행 가능 여부를 초록·노랑·빨강으로 표현했지만, 메모리 용량 때문에 차이가 생기는 이유는 충분히 설명하지 못했다. 속도·작업별 선택·시험 실행 방법은 포함했다. [19:30]
10. 추가 질문으로 개선할 가능성을 고려하면 Sonnet의 경제성이 높아진다
- 로컬 AI 설명 과제에서 Sonnet 비용은 Opus의 절반이었다. 평가자는 이해되지 않은 부분을 구체적으로 다시 질문하면 Sonnet의 설명을 개선할 수 있을 것으로 예상했다. [20:05]
- 해당 스킬은 아직 충분히 다듬어지지 않은 상태였다. Sonnet을 다시 프롬프트하면 Opus가 3달러에 제공한 것보다 좋은 결과를 얻을 수 있다는 예상에 따라 최종 점수는 Sonnet에 주어졌다. 실제 재요청으로 확인한 결과는 아니다. [20:23]
11. Sonnet의 뉴스 대시보드는 수집한 정보를 콘텐츠 계획으로 연결한다
- X에서 당일 뉴스를 수집하는 과제에 Sonnet은 로컬 대시보드를 만들었다. 마지막 수집 시점과 새로고침 버튼을 표시하고, 수집한 676개 게시물 중 386개를 추적했다. 주요 뉴스·트렌드와 채널 적합성 표시, 다룬 게시물이나 고정 게시물을 숨기는 기능도 제공했다. [20:57]
- 화제성 점수와 상세 내용을 확인하고 원문 게시물을 열 수 있었다. 뉴스를 이미 다룬 것으로 표시하거나 계획에 추가하면 콘텐츠 계획 목록으로 연결됐다. [21:19]
12. 콘텐츠 도구에서 드러난 창의성과 비용의 절충
- X 데이터를 가져오는 도구는 진행 표시와 함께 시간당 AI 관련 게시물 수, 인기가 오르거나 식는 게시물, 주간 보기, 콘텐츠 계획과 원본 피드를 제공한다. 화제성 점수와 ‘루머·출시·논의’ 태그로 게시물을 분류하며, 콘텐츠 계획에 추가하거나 원본 게시물을 X에서 열 수 있다. 이 화면 구성은 더 매력적이고 유용하다는 평가를 받는다. [22:16]
- 원하는 결과가 명확하면 Sonnet이 잘 대응할 가능성이 높고, 창의성이 필요한 모호한 목표에서는 Opus가 더 낫다는 판단이다. 이번 작업에서 Opus는 약 7분 더 걸리고 6달러 더 들었다. 목표가 명확했다면 Sonnet도 네 차례 더 수정하거나 출력 비용을 8달러까지 사용해 같은 수준에 도달했을 것이라는 평가지만, 스스로 요구 범위를 넓혀 더 나은 경험을 만드는 데는 Opus가 앞섰다. [23:03]
13. 명확한 스킬이 결과물 차이를 줄이고 모델 선택 기준을 바꾼다
- 마지막 과제는 두 모델에 유튜브 영상 링크를 주고 리소스 가이드를 만드는 것이다. 좋은 결과물의 기준을 정의한 스킬을 적용하자, 두 가이드는 길이와 제목·헤더뿐 아니라 개요, 규칙, 벤치마크, 구축 과정, 날짜별 작업과 최종 결과 등 구성도 매우 비슷했다. Sonnet 결과물은 약 7쪽이며 큰 여백이 있다. [24:10]
- 가이드의 품질 차이가 뚜렷하지 않은 상황에서 Sonnet은 약 절반의 시간으로 작업하고 1달러 40센트를 절약해 승리한다. 이 결과는 반복적으로 사용하는 스킬이 요구사항을 명확히 전달하면 Sonnet도 지시를 정확하게 따라 충분한 결과를 낼 수 있음을 보여준다. [24:48]
🧾 결론
- 목표·요구사항·검증 기준이 명확한 반복 작업은 Sonnet부터 시험할 근거가 있다.
- 브랜드 해석, 창의적 구성, 모호한 목표의 구체화가 중요한 작업에서는 Opus의 추가 비용이 유용한 결과로 이어질 수 있다.
- 모델 선택은 전체 승패보다 자신의 스킬·프롬프트·작업 과정에서 측정한 품질, 시간, 실제 비용에 따라 내려야 한다.
📈 투자·시사 포인트
- AI 도입 비용은 토큰 단가와 작업별 사용량을 함께 봐야 한다. 이번 투자자 자료 과제처럼 단가가 높은 Opus의 총비용이 더 낮아지는 경우도 있었다.
- 반복 업무의 요구사항을 스킬로 명확히 전달하는 작업은 비용 절감의 후보가 된다. 리소스 가이드 비교에서는 품질 차이가 줄면서 Sonnet의 시간·비용 이점이 나타났다.
- 창의적 업무에서는 첫 결과물의 품질과 추가 수정에 드는 비용을 함께 평가할 필요가 있다. 이번 영상의 여러 판정은 Sonnet의 개선 가능성을 가정했으므로 실제 수정 비용까지 확인해야 한다.
- 투자자 자료는 외관뿐 아니라 재무 모델의 갱신 가능성도 살펴야 한다. 입력값과 여러 탭을 수식으로 연결한 결과물은 반복 수정의 부담을 줄이는 장점을 보였다.
⚠️ 불확실하거나 확인이 필요한 부분
- Sonnet을 추가로 프롬프트하면 Opus 수준에 도달할 수 있다는 주장은 일부 과제의 예상이다. 실제 재요청 결과와 누적 비용은 확인되지 않았다.
- 일곱 과제의 승패에는 평가자의 선호와 비용 가중치가 반영됐다. 동일한 프롬프트와 높은 노력 수준을 사용했지만, 이 결과만으로 모든 업무의 우열을 확정할 수는 없다.
- 영상에 제시된 가격과 Sonnet 5 대비 속도·비용 개선 설명은 제공된 자료 밖에서 검증되지 않았다. 구독 플랜의 사용률과 API 청구액도 같은 기준으로 해석하면 안 된다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 사용할 업무의 목표, 필수 산출물, 통과 기준을 먼저 적고 Sonnet과 Opus에 동일하게 전달한다.
- 같은 프롬프트·스킬·노력 수준으로 비교하고, 품질·실행 시간·입출력 토큰·API 비용을 기록한다.
- Sonnet 결과에서 부족한 부분을 구체적으로 다시 요청한 뒤, 개선된 품질과 누적 비용을 Opus의 첫 결과와 비교한다.
- 반복 업무는 좋은 결과물의 기준을 스킬에 반영하고, 투자자 자료는 입력값 변경 시 수식과 관련 시트가 함께 갱신되는지 확인한다.
❓ 열린 질문
- 실제 추가 요청까지 포함하면 Sonnet의 비용 우위가 유지되는 업무는 무엇인가?
- 모호한 목표와 창의적 판단이 필요한 작업에서 Opus의 추가 비용을 정당화할 품질 기준은 무엇인가?
- 스킬을 더 명확하게 다듬으면 성장 계획·투자자 자료·콘텐츠 도구에서도 두 모델의 결과 차이가 줄어드는가?