YouTube코드팩토리·2026년 9월 29일·0

Opus 5.5보다 맛있게 나온 Sonnet 5.5?

Quick Summary

Sonnet은 일부 코딩 지표와 한국어 글쓰기에서 Opus보다 매력적으로 평가되지만, Max 설정의 실제 작업에서는 시간이 더 걸려 용도별 선택이 핵심이다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Opus 5.5보다 맛있게 나온 Sonnet 5.5? 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Opus 5.5보다 맛있게 나온 Sonnet 5.5?의 핵심 내용을 4단계로 요약한 인포그래픽
Opus 5.5보다 맛있게 나온 Sonnet 5.5? 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Sonnet은 일부 코딩 지표와 한국어 글쓰기에서 Opus보다 매력적으로 평가되지만, Max 설정의 실제 작업에서는 시간이 더 걸려 용도별 선택이 핵심이다.

📌 핵심 요점

  1. 영상은 Sonnet을 Opus와 같은 프롬프트로 비교한다. 다만 제목에는 5.5, 본문에는 주로 3.5가 등장하므로 정확한 모델 버전은 확인이 필요하다.
  2. 소개된 에이전트 코딩 점수는 Sonnet 70.6%, Opus 66.4%다. 발표자는 이를 높게 평가하면서도 벤치마크 최적화와 과제별 편차를 경계한다.
  3. 영상에서 제시한 Sonnet의 입력·출력 토큰 가격은 Opus의 절반이고 캐시 읽기 가격은 같다. 기존 Sonnet 3 대비 속도와 가격이 각각 30% 개선됐다는 설명은 별도의 비교다.
  4. Max 설정으로 수행한 모션 그래픽, 서울 오픈월드 게임, 자기소개 웹사이트, 단편소설 작업은 모두 Sonnet이 더 오래 걸렸다. 시각적 결과물은 Opus에 근접했지만 일부 연출과 랜드마크가 빠졌다.
  5. 한국어 소설에서는 Sonnet이 번역투가 덜하고 자연스럽다는 주관적 평가를 받았다. 발표자는 한국어 콘텐츠 작업에 Sonnet을 활용해 볼 의향을 밝힌다.

🧩 배경과 문제 정의

영상은 새 Sonnet이 더 낮은 비용으로 일부 영역에서 Opus를 앞설 수 있다는 주장에 실제 작업 결과를 대조한다. 발표자는 이전 Opus 리뷰에서 사용한 프롬프트를 그대로 적용해 경복궁 모션 그래픽, 서울 오픈월드 게임, 자기소개 웹사이트, 단편소설을 비교한다.

핵심 문제는 벤치마크 점수와 토큰 단가만으로 실무 효율을 판단할 수 있느냐는 것이다. 특히 추론 강도를 높인 Max 설정에서 품질, 비용, 작업 완료 시간이 어떻게 달라지는지 살펴본다. 제목과 본문의 모델 버전 표기는 서로 달라, 아래 정리는 모델명을 중심으로 영상의 주장과 관찰을 구분한다.

🕒 시간순 섹션별 상세정리

1. Sonnet 업데이트와 비교 과제 소개

  • 발표자는 Sonnet이 일부 영역에서 Opus보다 강하면서 비용과 속도에서도 유리하다고 소개하고, 같은 프롬프트로 모션 그래픽·게임·웹사이트·소설을 비교하겠다고 보여준다. [00:27]
  • Anthropic의 설명을 먼저 검토하며 기존 Sonnet 3 대비 속도 30% 향상과 가격 30% 인하를 언급한다. 일부 성능에서는 Opus를 앞설 수 있다는 것이 비교의 출발점이다. [01:27]

2. 코딩 벤치마크와 추론 강도의 역효과

  • 에이전트 코딩 점수는 Sonnet 70.6%, 기존 Sonnet 10.3%, Opus 66.4%로 묶인다. 발표자는 성과를 인정하면서도 최신 모델의 벤치마크 최적화 가능성을 경고한다. [02:28]
  • 터미널 작업과 단순 글쓰기에서는 최고 성능이 항상 필요하지 않다며, Haiku 같은 모델도 낮은 비용으로 충분한 결과를 낼 수 있다고 보여준다. [04:00]
  • Frontier Code 1.1 차트에서는 Sonnet의 추론 강도를 높일 때 점수가 소폭 하락하고 비용은 크게 증가하는 모습에 주목한다. 이를 확인하려고 실제 작업을 Max 설정으로 실행했다고 드러낸다. [04:40]

3. 토큰 가격과 속도 설명

  • 협력사 인용과 Cursor 벤치마크 언급에 이어, Sonnet의 입력·출력 토큰 가격은 Opus의 절반이고 캐시 읽기 가격은 같다고 보여준다. 캐시 가격을 인프라 비용의 하한과 연결하는 부분은 발표자의 해석이다. [05:41]
  • 발표자는 응답이 빨라졌다는 체감을 전하면서 Max 대신 X-Hi를 쓰면 속도와 성능의 균형이 나을 수 있다고 제안한다. 안전장치 관련 설명을 끝으로 발표 내용 검토를 마친다. [06:09]

4. Max 설정에서 네 프로젝트의 소요 시간 비교

  • 실제 비교는 Sonnet Max로 진행했다. 모션 그래픽의 정확한 시간 수치는 전사에서 혼재하지만, 발표자는 Opus보다 오래 걸렸다고 평가한다. [07:01]
  • 서울 게임은 Opus 약 1시간 45분, Sonnet 약 1시간 54분이고, 웹사이트는 각각 1시간 5분 9초와 약 1시간 16분이다. 소설도 약 1시간 4분과 1시간 7분으로 Sonnet이 더 오래 걸렸다. [07:31]
  • 서버 상황의 영향을 인정하면서도, 더 높은 추론 수준이 필요하다면 Opus로 올라가는 편이 낫다는 판단을 제시한다. [08:02]

5. 모션 그래픽과 서울 게임의 구현 품질

  • 모션 그래픽은 부드럽고 Opus에 근접하지만, 조각이 분리되는 연출이 빠져 화면 전환으로 처리됐다. 추가 프롬프트로 개선할 여지가 있다는 의견을 덧붙인다. [09:01]
  • 서울 게임은 인체 관절, 한글 간판, 차량 이동, 다리, 배달·추격 관련 요소를 구현했다. 발표자는 이전에 살펴본 다른 모델의 결과보다 현실감이 높다고 평가한다. [09:57]
  • 남산타워 같은 일부 랜드마크는 빠졌지만 야간 조명이 켜지는 세부 표현은 구현됐다. 첫 시도 결과로는 우수하되 전체적인 현실감은 Opus가 조금 낫다고 정리한다. [10:29]

6. 자기소개 웹사이트의 상호작용과 완성도

  • 웹사이트에서는 입자 움직임, 마우스 반응, 클릭 파동, 스크롤 연동이 자연스럽게 작동하고 추가·삭제 기능도 구현됐다고 보여준다. [11:02]
  • 발표자는 애니메이션과 전체 완성도를 Opus에 거의 근접한 수준으로 평가하면서도, 제작 시간이 더 길었던 점을 아쉬워한다. [11:27]

7. 한국어 소설 평가와 최종 선택 기준

  • 소설의 첫 문단을 읽으며 Opus보다 직역 느낌이 덜하고 한국어 문장이 자연스럽다고 평가한다. 이어지는 계절·골목 묘사에도 긍정적인 반응을 보인다. [12:15]
  • 발표자는 자신이 본 Anthropic 모델 가운데 한국어 능력을 가장 높게 평가하며, 한국어 콘텐츠 작업 일부를 Sonnet에 맡겨 볼 의향을 드러낸다. [12:44]
  • 다른 모델 비교 영상도 참고해 자신의 작업에 적합한 모델을 고르라고 권하고, 구독·좋아요·댓글 안내와 함께 영상을 마친다. [13:12]

🧾 결론

  • Sonnet이 Opus를 전반적으로 넘어섰다고 단정하기보다, 일부 코딩 지표와 한국어 표현에서 강점을 보인 비교로 읽는 것이 적절하다.
  • 낮은 토큰 단가와 빠른 응답에 대한 설명이 실제 프로젝트의 짧은 완료 시간을 보장하지는 않는다. 이번 Max 설정 비교에서는 네 작업 모두 시간이 늘었다.
  • 모션 그래픽·게임·웹사이트의 완성도는 대체로 Opus에 가까웠고, 세부 구현에서는 차이가 남았다.
  • 한국어 글쓰기의 우위는 발표자의 발췌문 평가다. 자신의 문체와 작업에서도 재현되는지 확인할 가치가 있다.

📈 투자·시사 포인트

  • AI 서비스의 비용 경쟁력은 입력·출력 단가뿐 아니라 캐시 비용, 추론 설정, 실제 작업 완료 시간을 함께 봐야 판단할 수 있다.
  • 추론 강도를 높여도 점수가 떨어지고 비용이 늘어나는 사례는 최고 설정을 기본값으로 삼는 운영 방식의 효율을 점검하게 한다.
  • 작업에 따라 Sonnet·Opus·Haiku를 선택하는 접근은 성능과 비용의 균형을 맞추는 실무 전략으로 제시된다.
  • 한국어 콘텐츠 제작에서는 코딩 벤치마크와 별개로 문체의 자연스러움이 모델 선택의 중요한 기준이 될 수 있다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 제목의 Sonnet·Opus 5.5와 본문의 반복적인 3.5 표기가 일치하지 않는다. 본문 후반에도 Opus 5.5가 등장하므로 이 자료만으로 정확한 버전을 확정할 수 없다.
  • 모션 그래픽 소요 시간은 1시간 45분과 3시간 45분 21초가 연이어 언급돼 수치가 불명확하다. 정확한 시간 차이는 확정하지 않고, 발표자의 종합 평가인 Sonnet의 작업 시간 증가만 반영했다.
  • 비교는 같은 프롬프트를 사용했지만 반복 측정이나 동일한 서버 환경을 확인할 정보가 없다. 발표자도 서버 상황의 영향을 인정한다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 원본 화면이나 모델 표기를 확인해 제목과 본문의 버전 불일치를 해소한다.
  • 자신의 대표 작업에 같은 프롬프트를 적용하고, 모델·추론 설정별 완성도와 전체 소요 시간을 기록한다.
  • 입력·출력·캐시 사용량을 나눠 기록해 단가와 실제 작업당 비용을 비교한다.
  • Max와 X-Hi 설정을 비교해 추가 추론이 품질 개선으로 이어지는지 확인한다.

❓ 열린 질문

  • 실제 비교에 사용된 Sonnet과 Opus의 정확한 버전은 무엇인가?
  • X-Hi 설정으로 같은 네 작업을 수행하면 Max보다 시간과 비용을 줄이면서 품질을 유지할 수 있는가?
  • Sonnet의 한국어 강점은 소설 외에 설명문이나 업무 문서에서도 나타나는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.