YouTube편집자P·2026년 9월 29일·0

[시즌 4] 소넷 5.5는 얼마나 일을 잘할까? 쏟아지는 모델 속에서 정신을 잃지 않으려면?

Quick Summary

소넷 5.5는 일반 업무와 웹 제작에서 개선된 모습을 보이지만, 쏟아지는 모델 속에서 제대로 선택하려면 최고 점수보다 실제 추론 설정의 품질·시간·비용을 함께 봐야 한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

[시즌 4] 소넷 5.5는 얼마나 일을 잘할까? 쏟아지는 모델 속에서 정신을 잃지 않으려면? 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

[시즌 4] 소넷 5.5는 얼마나 일을 잘할까? 쏟아지는 모델 속에서 정신을 잃지 않으려면?의 핵심 내용을 4단계로 요약한 인포그래픽
[시즌 4] 소넷 5.5는 얼마나 일을 잘할까? 쏟아지는 모델 속에서 정신을 잃지 않으려면? 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

소넷 5.5는 일반 업무와 웹 제작에서 개선된 모습을 보이지만, 쏟아지는 모델 속에서 제대로 선택하려면 최고 점수보다 실제 추론 설정의 품질·시간·비용을 함께 봐야 한다.

📌 핵심 요점

  1. 발표자는 소넷 5.5 출시 직후 웹사이트를 만들어 보고 벤치마크를 검토했다. 영상의 중심은 신모델의 우승 여부보다 벤치마크 용어와 비교 조건을 읽는 방법이다.
  2. 모델의 일을 잘하는 정도는 성능·속도·가격의 조합으로 평가해야 한다. 발표자가 소개한 문서는 깊은 판단과 복잡한 작업에는 오퍼스, 범위가 명확한 작업에는 소넷을 권한다.
  3. 벤치마크마다 측정 대상이 다르다. 터미널 작업의 완주, 실무에 사용할 코드의 품질, 복잡한 편집 작업, 사무·지식 업무를 하나의 점수처럼 해석하면 선택을 그르칠 수 있다.
  4. 소넷의 일부 우세 점수에는 Max처럼 자원을 많이 쓰는 설정이 포함된다. 발표자는 비용 대비 성능 그래프와 실제 사용하는 Medium·High·Extra High 구간을 살펴봐야 한다고 강조한다.
  5. 웹 제작 실험에서는 Medium도 단순 랜딩 페이지를 만들었지만, 모호하고 복잡한 3D 과제에서는 기능 오류가 나타났다. 높은 설정은 더 풍부한 결과를 냈으나 시간이 크게 늘었고, 토큰 수치는 영상 중 여러 차례 정정돼 정확한 비교에 주의가 필요하다.

🧩 배경과 문제 정의

발표자는 오퍼스 5.5가 나온 지 일주일도 지나지 않아 소넷 5.5가 등장했고, 일부 벤치마크에서 오퍼스를 앞선다는 이야기가 나왔다고 소개한다. 이를 직접 살펴보기 위해 짧은 시간에 만들 수 있는 웹사이트 과제를 실행했다.

영상이 다루는 문제는 신모델의 강조된 점수만 보고 사용 도구를 바꾸기 쉽다는 점이다. 발표자는 벤치마크가 무엇을 측정하는지, 어떤 추론 설정과 비용으로 얻은 점수인지 읽는 기준을 제시하고, 웹 제작 결과를 통해 완성과 실제 작동의 차이를 보여준다.

비교 자료는 발표자가 소개한 문서·그래프와 소넷의 설정별 웹 제작 실험이다. 오퍼스와 소넷의 웹사이트를 직접 대조하는 실험은 하지 않았으며, 토큰 사용량에는 정정과 집계 혼선이 남아 있다.

🕒 시간순 섹션별 상세정리

1. 빠른 모델 출시와 웹 제작 첫인상

  • 오퍼스 5.5 출시 직후 소넷 5.5가 등장했고, 일부 벤치마크에서 앞선다는 이야기를 직접 확인하려고 작업을 시작했다. [00:24]
  • 제품 소개, 고급 자동차 판매, 3D 역량을 활용하는 사이트를 요청했다. 결과가 의미 있다고 느꼈지만 산출물 수준에 따라 시간과 토큰 사용이 달라져 비교가 필요하다고 보여준다. [01:15]

2. 모델 평가의 기준을 성능·속도·가격으로 확장

  • 오늘의 목표는 문서와 벤치마크 용어를 읽고, 강조된 마케팅 요소 중 무엇에 집중할지 판단하는 기준을 익히는 것이다. [01:49]
  • 일을 잘한다는 것은 성능만이 아니라 속도와 가격까지 조합한 평가이며, 벤치마크도 이 기준과 함께 봐야 한다고 강조한다. [02:20]

3. 작업의 명확성과 모델 선택 지침

  • 발표자가 소개한 문서는 오퍼스를 깊은 판단과 복잡한 작업에, 소넷을 범위가 명확한 작업에 적합한 모델로 보여준다. 발표자는 이를 지시를 명확히 내릴 수 있는지의 문제로 풀어낸다. [02:52]
  • 소넷 가격이 오퍼스의 절반이라는 소개도 실제 조건을 더 살펴봐야 한다고 드러낸다. 점수표에서 강조된 부분만 보고 소넷으로 갈아타는 태도를 경계한다. [03:21]

4. 코딩 벤치마크마다 다른 측정 대상

  • Terminal Bench를 터미널 환경에서 개발·버그 수정·테스트 등을 거쳐 작업을 끝까지 수행하는 능력으로 보여준다. 소넷의 약 4% 개선 주장도 평가 내용을 함께 읽어야 한다고 드러낸다. [04:04]
  • 전사상 'Frontier Code'는 코드의 실무 사용 가능성을 보는 평가로 묶인다. 더 깊이 추론하는 Max에서 점수가 낮아지는 사례를 들어, 추론량 증가가 품질 향상을 보장하는지 의문을 제기한다. [04:35]
  • Cursor 평가는 모호하고 복잡한 작업을 처리하는 능력으로 묶인다. 발표자는 오퍼스가 높게 나타나지만 소넷의 개선 정도도 세부적으로 살펴봐야 한다고 보여준다. [05:00]

5. 사무·지식 업무와 상대평가 점수의 해석

  • GDP Value AA는 9개 산업과 44개 직무 범주의 실무 과제를 평가한다고 묶인다. 두 모델의 대결로 순위를 매기는 상대평가이므로 높은 점수만으로 절대적인 업무 품질을 확정할 수 없다고 보여준다. [06:10]
  • AA Briefcase는 장기 지식 업무, 전사상 'Humanity Rest Exam'은 전문 학문 분야의 문제를 평가하는 것으로 묶인다. 전체적으로 오퍼스가 조금 높고 소넷도 상당히 근접했다는 해석을 제시한다. [06:35]

6. 컴퓨터 사용·차트 해석과 추론 설정의 숨은 조건

  • 컴퓨터 사용은 실제 화면을 조작하는 능력, 차트 인식은 시각 자료를 해석하는 능력으로 구분한다. 소개된 표에서는 두 모델의 차이가 크지 않다고 보여준다. [07:04]
  • 점수표의 effort 조건을 살펴봐야 한다며, 최대 설정은 중간 설정보다 토큰을 훨씬 많이 쓴다고 주장한다. 오퍼스의 비교 설정은 추가 확인이 필요하다고 스스로 드러낸다. [07:39]
  • 일반 사용자가 항상 Max를 쓰지는 않는다는 점을 들어, 실제 문서의 성능·비용 그래프를 함께 보자고 제안한다. [08:26]

7. 최대 점수와 비용 대비 코드 품질의 차이

  • 터미널 작업 그래프에서는 소넷 Max의 점수가 높지만 시도당 비용도 가장 높다고 해석한다. 앞서 약 4%라고 설명했던 개선 폭을 여기서는 약 6%로 언급한다. [09:06]
  • 실무 코드 품질을 보는 그래프에서는 소넷 Max의 점수가 떨어진다고 보여준다. 약 20달러에 46%, 약 6달러에 54%라는 비교를 제시하며 비용과 품질의 균형을 강조한다. [09:51]
  • 사용자가 주로 쓰는 Extra High·High 구간까지 고려하면 오퍼스가 더 안정적인 선택이라는 판단을 제시한다. [10:10]

8. 복잡한 작업과 일상 업무를 구분한 선택

  • Cursor의 복잡한 다중 파일 작업과 지식 업무 관련 그래프를 검토하며, 발표자는 오퍼스가 더 낮은 비용으로 좋은 결과를 내는 구간이 있다고 보여준다. [10:48]
  • 소넷 70.6%와 오퍼스 66.4%라는 수치도 서로 다른 설정을 비교한 결과로 의심한다. 최고 설정보다 실제 사용하는 Medium·High 성능을 봐야 한다고 강조한다. [11:22]
  • 소넷 Medium의 일반 지식 업무는 오퍼스와 비슷해졌다고 평가한다. 웹 제작은 겉으로 차이가 잘 드러나지 않아 오퍼스와 직접 비교하지 않았다고 드러낸다. [11:56]

9. 동일한 자동차 사이트 과제의 설정별 결과

  • Medium·Extra High·Max에서 같은 과제를 두 번씩 실행했다고 보여준다. 고급 자동차 소개 사이트를 만들고 이미지 생성용 API를 사용해 사이트를 실행하도록 요청했다. [12:26]
  • Medium은 일상적인 랜딩 페이지에 충분한 수준으로 평가한다. Extra High는 화면 활용과 그리드, 상담 요청 요소가 더 풍부하지만 극적인 차이는 아니라고 드러낸다. [13:31]
  • Max는 스크롤 상호작용과 섹션별 표현을 추가했다. 다만 Extra High와 디자인이 비슷해 큰 차이를 느끼지는 못했다고 보여준다. [14:07]

10. 실행 시간 증가와 토큰 집계 혼선

  • 자동차 사이트의 소요 시간은 Medium 1분 46초, Extra High 15분, Max 38분으로 드러난다. 초기 설명에서는 토큰 사용량을 각각 약 5만 4천·20만·73만으로 보여준다. [14:39]
  • 높은 설정이 더 많은 시간과 토큰을 사용했고, 명확하고 상세한 지시를 준 자동차 과제에서는 결과의 기본 방향이 비슷했다고 정리한다. [15:36]
  • 이후 토큰 수치를 다시 확인하면서 20만·73만·47만을 언급하고 중복계산도 지적한다. 전사만으로 모드별 최종 사용량을 확정하기 어려운 구간이다. [16:56]

11. 모호한 3D 과제에서 드러난 완성과 작동의 차이

  • 복잡하면서도 균형 잡힌 상호작용과 3D 효과를 넣으라는 모호한 지시를 주고, 구체적인 구현은 모델에 맡겼다. [17:26]
  • Medium 결과는 도전적인 외형을 보였지만 커서가 움직이지 않는 등 기능이 작동하지 않았다. 이를 작업을 끝낸 것과 실제 사용할 수 있는 결과를 만든 것의 차이로 연결한다. [18:05]
  • Extra High는 행성과 드래그 등 다양한 3D 상호작용을 만들었다. 발표자는 이런 사이트에서는 도전적인 요청이 풍부한 표현을 끌어낼 수 있다고 평가한다. [18:39]

12. Max가 만든 세부 상호작용과 결과의 풍부함

  • Max 결과에는 커서 효과, 소리, 우주 탐색 표현과 여러 모델링 요소가 포함됐다. 클릭에 따라 구성이 바뀌는 판매 사이트 형태도 보여준다. [19:22]
  • 시간 속도 조절과 음악 등 작은 요소들이 사이트의 상호작용과 결합돼, 처음에는 비슷해 보여도 세부적으로 더 잘 만든 결과라고 평가한다. [20:01]

13. 복잡한 3D 결과를 얻는 데 든 자원

  • 기능 오류가 있던 Medium 결과는 약 7만 토큰과 2분 30초를 사용했다고 보여준다. 복잡한 과제를 빠르게 처리해도 품질이 충분하지 않을 수 있다는 사례로 제시한다. [20:19]
  • Extra High는 검증·디버깅을 포함해 34분이 걸렸다고 보여준다. 토큰 사용량은 처음 약 35만이라고 말했다가 약 57만으로 정정한다. [20:41]
  • Max는 58분과 거의 100만 토큰을 사용했다고 보여준다. 발표자는 이를 컨텍스트 창 전체 사용과 연결하지만, 전사에는 해당 해석을 확인할 집계 자료가 없다. [21:05]

14. 신모델 선택 원칙과 영상의 최종 판단

  • 신모델이 나오면 벤치마크를 확인하고, 시간이 없다면 최소한 그래프를 보라고 권한다. 소넷도 Max에서 복잡한 사이트를 만들지만, 비용 이점과 모델 전환의 번거로움을 함께 고려해야 한다고 드러낸다. [21:59]
  • 일반 업무에서는 소넷이 좋은 선택이 될 수 있다고 평가하면서도, 코딩과 High·Extra High 성능, 사용 편의성을 종합하면 자신은 오퍼스를 계속 쓰는 편이 낫다고 결론짓는다. [22:40]
  • 벤치마크 용어와 성능 비교를 함께 다룬 이유는 필요한 정보를 제대로 전달하기 위해서였다고 설명하며 영상을 마친다. [23:05]

🧾 결론

  • 소넷의 개선과 오퍼스의 상대적 강점은 함께 존재한다. 발표자는 일반 업무에서는 소넷이 유용해졌다고 보면서도, 복잡한 코딩과 여러 작업을 계속 처리하는 상황에서는 오퍼스를 선호한다.
  • 화면이 보기 좋거나 작업이 끝났다는 사실만으로 실무 품질을 판단할 수 없다. 커서·클릭·스크롤 등 실제 기능이 작동하는지 확인해야 한다.
  • 높은 추론 설정의 추가 품질이 대기 시간과 자원 사용을 감수할 만큼 필요한지 판단하는 것이 핵심이다. 이번 실험에서 설정을 올린 효과는 과제의 성격에 따라 달랐다.
  • 영상의 선택 권고는 발표자의 그래프 해석과 제한된 웹 제작 실험에 기반한다. 이를 모든 업무에 적용되는 확정적인 모델 서열로 받아들이기는 어렵다.

📈 투자·시사 포인트

  • AI 도구의 경제성은 토큰 단가와 작업당 총사용량을 함께 봐야 한다. 저렴하다고 소개된 모델도 높은 설정에서 많은 자원을 쓰면 실제 작업비의 이점이 줄어들 수 있다.
  • 도입 판단에는 산출물 품질뿐 아니라 완료 시간과 검증·수정 부담을 포함해야 한다. 빠르게 만든 사이트에 기능 오류가 있으면 후속 작업이 필요하다.
  • 신모델의 강조된 점수보다 비교한 추론 설정과 비용 조건이 실사용 가치에 더 직접적인 영향을 준다. 자신의 사용 구간에서 성능이 개선됐는지가 중요한 확인 대상이다.
  • 모델을 업무별로 바꾸는 번거로움도 선택 비용이다. 발표자는 비용 차이가 크지 않은 상황이라면 오퍼스를 계속 사용하는 편의성을 높게 평가한다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 모델별 공식 권고, 가격 차이, 벤치마크 점수는 발표자가 소개한 내용이다. 제공된 전사에는 원문 문서나 그래프가 없어 비교 조건을 독립적으로 확인할 수 없다.
  • 전사에는 모델명과 벤치마크명이 불안정하게 기록돼 있다. 특히 'Frontier Code', 'Cursor Benz', 'GDP Value AA' 등의 정확한 명칭과 평가 범위는 원자료 확인이 필요하다.
  • 벤치마크의 소넷 우세 폭은 약 4%와 약 6%로 다르게 언급된다. 퍼센트 변화인지 퍼센트포인트 차이인지도 명확하지 않다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 새 모델의 점수표를 볼 때 평가 과제, 추론 설정, 작업당 비용을 함께 기록한다.
  • 자신의 대표 업무를 명확한 지시 과제와 모호한 지시 과제로 나누고, 실제 사용할 설정에서 결과를 비교한다.
  • 생성된 웹사이트의 커서·클릭·스크롤·드래그 등 핵심 기능을 직접 확인한다.
  • 토큰 사용량은 사용 기록에서 입력·출력·캐시·중복 집계 여부를 구분해 확인한다.

❓ 열린 질문

  • 동일한 비용 또는 동일한 추론 설정으로 비교하면 소넷과 오퍼스의 성능 차이는 어떻게 달라질까?
  • Medium에서 발생한 3D 기능 오류를 수정하는 데 필요한 시간과 자원까지 포함하면 어떤 설정이 가장 경제적일까?
  • 명확한 지시와 모호한 지시의 차이가 결과 품질에 미치는 영향은 반복 실험에서도 유지될까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.