[시즌 4] 소넷 5.5는 얼마나 일을 잘할까? 쏟아지는 모델 속에서 정신을 잃지 않으려면?
Quick Summary
소넷 5.5는 일반 업무와 웹 제작에서 개선된 모습을 보이지만, 쏟아지는 모델 속에서 제대로 선택하려면 최고 점수보다 실제 추론 설정의 품질·시간·비용을 함께 봐야 한다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽
![[시즌 4] 소넷 5.5는 얼마나 일을 잘할까? 쏟아지는 모델 속에서 정신을 잃지 않으려면? 내용을 설명하는 본문 이미지](/_next/image?url=%2Fpage-asset%2Fyoutube%2Fsonnet-work-performance%2F4253.poster.png%3Fv%3Dc3be8d8963b84c71&w=1536&q=75)
🖼️ 4컷 인포그래픽
![[시즌 4] 소넷 5.5는 얼마나 일을 잘할까? 쏟아지는 모델 속에서 정신을 잃지 않으려면?의 핵심 내용을 4단계로 요약한 인포그래픽](/_next/image?url=%2Fpage-asset%2Fyoutube%2Fsonnet-work-performance%2F4253.4cut.png%3Fv%3Dc3be8d8963b84c71&w=1536&q=75)
💡 한 줄 결론
소넷 5.5는 일반 업무와 웹 제작에서 개선된 모습을 보이지만, 쏟아지는 모델 속에서 제대로 선택하려면 최고 점수보다 실제 추론 설정의 품질·시간·비용을 함께 봐야 한다.
📌 핵심 요점
- 발표자는 소넷 5.5 출시 직후 웹사이트를 만들어 보고 벤치마크를 검토했다. 영상의 중심은 신모델의 우승 여부보다 벤치마크 용어와 비교 조건을 읽는 방법이다.
- 모델의 일을 잘하는 정도는 성능·속도·가격의 조합으로 평가해야 한다. 발표자가 소개한 문서는 깊은 판단과 복잡한 작업에는 오퍼스, 범위가 명확한 작업에는 소넷을 권한다.
- 벤치마크마다 측정 대상이 다르다. 터미널 작업의 완주, 실무에 사용할 코드의 품질, 복잡한 편집 작업, 사무·지식 업무를 하나의 점수처럼 해석하면 선택을 그르칠 수 있다.
- 소넷의 일부 우세 점수에는 Max처럼 자원을 많이 쓰는 설정이 포함된다. 발표자는 비용 대비 성능 그래프와 실제 사용하는 Medium·High·Extra High 구간을 살펴봐야 한다고 강조한다.
- 웹 제작 실험에서는 Medium도 단순 랜딩 페이지를 만들었지만, 모호하고 복잡한 3D 과제에서는 기능 오류가 나타났다. 높은 설정은 더 풍부한 결과를 냈으나 시간이 크게 늘었고, 토큰 수치는 영상 중 여러 차례 정정돼 정확한 비교에 주의가 필요하다.
🧩 배경과 문제 정의
발표자는 오퍼스 5.5가 나온 지 일주일도 지나지 않아 소넷 5.5가 등장했고, 일부 벤치마크에서 오퍼스를 앞선다는 이야기가 나왔다고 소개한다. 이를 직접 살펴보기 위해 짧은 시간에 만들 수 있는 웹사이트 과제를 실행했다.
영상이 다루는 문제는 신모델의 강조된 점수만 보고 사용 도구를 바꾸기 쉽다는 점이다. 발표자는 벤치마크가 무엇을 측정하는지, 어떤 추론 설정과 비용으로 얻은 점수인지 읽는 기준을 제시하고, 웹 제작 결과를 통해 완성과 실제 작동의 차이를 보여준다.
비교 자료는 발표자가 소개한 문서·그래프와 소넷의 설정별 웹 제작 실험이다. 오퍼스와 소넷의 웹사이트를 직접 대조하는 실험은 하지 않았으며, 토큰 사용량에는 정정과 집계 혼선이 남아 있다.
🕒 시간순 섹션별 상세정리
1. 빠른 모델 출시와 웹 제작 첫인상
- 오퍼스 5.5 출시 직후 소넷 5.5가 등장했고, 일부 벤치마크에서 앞선다는 이야기를 직접 확인하려고 작업을 시작했다. [00:24]
- 제품 소개, 고급 자동차 판매, 3D 역량을 활용하는 사이트를 요청했다. 결과가 의미 있다고 느꼈지만 산출물 수준에 따라 시간과 토큰 사용이 달라져 비교가 필요하다고 보여준다. [01:15]
2. 모델 평가의 기준을 성능·속도·가격으로 확장
- 오늘의 목표는 문서와 벤치마크 용어를 읽고, 강조된 마케팅 요소 중 무엇에 집중할지 판단하는 기준을 익히는 것이다. [01:49]
- 일을 잘한다는 것은 성능만이 아니라 속도와 가격까지 조합한 평가이며, 벤치마크도 이 기준과 함께 봐야 한다고 강조한다. [02:20]
3. 작업의 명확성과 모델 선택 지침
- 발표자가 소개한 문서는 오퍼스를 깊은 판단과 복잡한 작업에, 소넷을 범위가 명확한 작업에 적합한 모델로 보여준다. 발표자는 이를 지시를 명확히 내릴 수 있는지의 문제로 풀어낸다. [02:52]
- 소넷 가격이 오퍼스의 절반이라는 소개도 실제 조건을 더 살펴봐야 한다고 드러낸다. 점수표에서 강조된 부분만 보고 소넷으로 갈아타는 태도를 경계한다. [03:21]
4. 코딩 벤치마크마다 다른 측정 대상
- Terminal Bench를 터미널 환경에서 개발·버그 수정·테스트 등을 거쳐 작업을 끝까지 수행하는 능력으로 보여준다. 소넷의 약 4% 개선 주장도 평가 내용을 함께 읽어야 한다고 드러낸다. [04:04]
- 전사상 'Frontier Code'는 코드의 실무 사용 가능성을 보는 평가로 묶인다. 더 깊이 추론하는 Max에서 점수가 낮아지는 사례를 들어, 추론량 증가가 품질 향상을 보장하는지 의문을 제기한다. [04:35]
- Cursor 평가는 모호하고 복잡한 작업을 처리하는 능력으로 묶인다. 발표자는 오퍼스가 높게 나타나지만 소넷의 개선 정도도 세부적으로 살펴봐야 한다고 보여준다. [05:00]
5. 사무·지식 업무와 상대평가 점수의 해석
- GDP Value AA는 9개 산업과 44개 직무 범주의 실무 과제를 평가한다고 묶인다. 두 모델의 대결로 순위를 매기는 상대평가이므로 높은 점수만으로 절대적인 업무 품질을 확정할 수 없다고 보여준다. [06:10]
- AA Briefcase는 장기 지식 업무, 전사상 'Humanity Rest Exam'은 전문 학문 분야의 문제를 평가하는 것으로 묶인다. 전체적으로 오퍼스가 조금 높고 소넷도 상당히 근접했다는 해석을 제시한다. [06:35]
6. 컴퓨터 사용·차트 해석과 추론 설정의 숨은 조건
- 컴퓨터 사용은 실제 화면을 조작하는 능력, 차트 인식은 시각 자료를 해석하는 능력으로 구분한다. 소개된 표에서는 두 모델의 차이가 크지 않다고 보여준다. [07:04]
- 점수표의 effort 조건을 살펴봐야 한다며, 최대 설정은 중간 설정보다 토큰을 훨씬 많이 쓴다고 주장한다. 오퍼스의 비교 설정은 추가 확인이 필요하다고 스스로 드러낸다. [07:39]
- 일반 사용자가 항상 Max를 쓰지는 않는다는 점을 들어, 실제 문서의 성능·비용 그래프를 함께 보자고 제안한다. [08:26]
7. 최대 점수와 비용 대비 코드 품질의 차이
- 터미널 작업 그래프에서는 소넷 Max의 점수가 높지만 시도당 비용도 가장 높다고 해석한다. 앞서 약 4%라고 설명했던 개선 폭을 여기서는 약 6%로 언급한다. [09:06]
- 실무 코드 품질을 보는 그래프에서는 소넷 Max의 점수가 떨어진다고 보여준다. 약 20달러에 46%, 약 6달러에 54%라는 비교를 제시하며 비용과 품질의 균형을 강조한다. [09:51]
- 사용자가 주로 쓰는 Extra High·High 구간까지 고려하면 오퍼스가 더 안정적인 선택이라는 판단을 제시한다. [10:10]
8. 복잡한 작업과 일상 업무를 구분한 선택
- Cursor의 복잡한 다중 파일 작업과 지식 업무 관련 그래프를 검토하며, 발표자는 오퍼스가 더 낮은 비용으로 좋은 결과를 내는 구간이 있다고 보여준다. [10:48]
- 소넷 70.6%와 오퍼스 66.4%라는 수치도 서로 다른 설정을 비교한 결과로 의심한다. 최고 설정보다 실제 사용하는 Medium·High 성능을 봐야 한다고 강조한다. [11:22]
- 소넷 Medium의 일반 지식 업무는 오퍼스와 비슷해졌다고 평가한다. 웹 제작은 겉으로 차이가 잘 드러나지 않아 오퍼스와 직접 비교하지 않았다고 드러낸다. [11:56]
9. 동일한 자동차 사이트 과제의 설정별 결과
- Medium·Extra High·Max에서 같은 과제를 두 번씩 실행했다고 보여준다. 고급 자동차 소개 사이트를 만들고 이미지 생성용 API를 사용해 사이트를 실행하도록 요청했다. [12:26]
- Medium은 일상적인 랜딩 페이지에 충분한 수준으로 평가한다. Extra High는 화면 활용과 그리드, 상담 요청 요소가 더 풍부하지만 극적인 차이는 아니라고 드러낸다. [13:31]
- Max는 스크롤 상호작용과 섹션별 표현을 추가했다. 다만 Extra High와 디자인이 비슷해 큰 차이를 느끼지는 못했다고 보여준다. [14:07]
10. 실행 시간 증가와 토큰 집계 혼선
- 자동차 사이트의 소요 시간은 Medium 1분 46초, Extra High 15분, Max 38분으로 드러난다. 초기 설명에서는 토큰 사용량을 각각 약 5만 4천·20만·73만으로 보여준다. [14:39]
- 높은 설정이 더 많은 시간과 토큰을 사용했고, 명확하고 상세한 지시를 준 자동차 과제에서는 결과의 기본 방향이 비슷했다고 정리한다. [15:36]
- 이후 토큰 수치를 다시 확인하면서 20만·73만·47만을 언급하고 중복계산도 지적한다. 전사만으로 모드별 최종 사용량을 확정하기 어려운 구간이다. [16:56]
11. 모호한 3D 과제에서 드러난 완성과 작동의 차이
- 복잡하면서도 균형 잡힌 상호작용과 3D 효과를 넣으라는 모호한 지시를 주고, 구체적인 구현은 모델에 맡겼다. [17:26]
- Medium 결과는 도전적인 외형을 보였지만 커서가 움직이지 않는 등 기능이 작동하지 않았다. 이를 작업을 끝낸 것과 실제 사용할 수 있는 결과를 만든 것의 차이로 연결한다. [18:05]
- Extra High는 행성과 드래그 등 다양한 3D 상호작용을 만들었다. 발표자는 이런 사이트에서는 도전적인 요청이 풍부한 표현을 끌어낼 수 있다고 평가한다. [18:39]
12. Max가 만든 세부 상호작용과 결과의 풍부함
- Max 결과에는 커서 효과, 소리, 우주 탐색 표현과 여러 모델링 요소가 포함됐다. 클릭에 따라 구성이 바뀌는 판매 사이트 형태도 보여준다. [19:22]
- 시간 속도 조절과 음악 등 작은 요소들이 사이트의 상호작용과 결합돼, 처음에는 비슷해 보여도 세부적으로 더 잘 만든 결과라고 평가한다. [20:01]
13. 복잡한 3D 결과를 얻는 데 든 자원
- 기능 오류가 있던 Medium 결과는 약 7만 토큰과 2분 30초를 사용했다고 보여준다. 복잡한 과제를 빠르게 처리해도 품질이 충분하지 않을 수 있다는 사례로 제시한다. [20:19]
- Extra High는 검증·디버깅을 포함해 34분이 걸렸다고 보여준다. 토큰 사용량은 처음 약 35만이라고 말했다가 약 57만으로 정정한다. [20:41]
- Max는 58분과 거의 100만 토큰을 사용했다고 보여준다. 발표자는 이를 컨텍스트 창 전체 사용과 연결하지만, 전사에는 해당 해석을 확인할 집계 자료가 없다. [21:05]
14. 신모델 선택 원칙과 영상의 최종 판단
- 신모델이 나오면 벤치마크를 확인하고, 시간이 없다면 최소한 그래프를 보라고 권한다. 소넷도 Max에서 복잡한 사이트를 만들지만, 비용 이점과 모델 전환의 번거로움을 함께 고려해야 한다고 드러낸다. [21:59]
- 일반 업무에서는 소넷이 좋은 선택이 될 수 있다고 평가하면서도, 코딩과 High·Extra High 성능, 사용 편의성을 종합하면 자신은 오퍼스를 계속 쓰는 편이 낫다고 결론짓는다. [22:40]
- 벤치마크 용어와 성능 비교를 함께 다룬 이유는 필요한 정보를 제대로 전달하기 위해서였다고 설명하며 영상을 마친다. [23:05]
🧾 결론
- 소넷의 개선과 오퍼스의 상대적 강점은 함께 존재한다. 발표자는 일반 업무에서는 소넷이 유용해졌다고 보면서도, 복잡한 코딩과 여러 작업을 계속 처리하는 상황에서는 오퍼스를 선호한다.
- 화면이 보기 좋거나 작업이 끝났다는 사실만으로 실무 품질을 판단할 수 없다. 커서·클릭·스크롤 등 실제 기능이 작동하는지 확인해야 한다.
- 높은 추론 설정의 추가 품질이 대기 시간과 자원 사용을 감수할 만큼 필요한지 판단하는 것이 핵심이다. 이번 실험에서 설정을 올린 효과는 과제의 성격에 따라 달랐다.
- 영상의 선택 권고는 발표자의 그래프 해석과 제한된 웹 제작 실험에 기반한다. 이를 모든 업무에 적용되는 확정적인 모델 서열로 받아들이기는 어렵다.
📈 투자·시사 포인트
- AI 도구의 경제성은 토큰 단가와 작업당 총사용량을 함께 봐야 한다. 저렴하다고 소개된 모델도 높은 설정에서 많은 자원을 쓰면 실제 작업비의 이점이 줄어들 수 있다.
- 도입 판단에는 산출물 품질뿐 아니라 완료 시간과 검증·수정 부담을 포함해야 한다. 빠르게 만든 사이트에 기능 오류가 있으면 후속 작업이 필요하다.
- 신모델의 강조된 점수보다 비교한 추론 설정과 비용 조건이 실사용 가치에 더 직접적인 영향을 준다. 자신의 사용 구간에서 성능이 개선됐는지가 중요한 확인 대상이다.
- 모델을 업무별로 바꾸는 번거로움도 선택 비용이다. 발표자는 비용 차이가 크지 않은 상황이라면 오퍼스를 계속 사용하는 편의성을 높게 평가한다.
⚠️ 불확실하거나 확인이 필요한 부분
- 모델별 공식 권고, 가격 차이, 벤치마크 점수는 발표자가 소개한 내용이다. 제공된 전사에는 원문 문서나 그래프가 없어 비교 조건을 독립적으로 확인할 수 없다.
- 전사에는 모델명과 벤치마크명이 불안정하게 기록돼 있다. 특히 'Frontier Code', 'Cursor Benz', 'GDP Value AA' 등의 정확한 명칭과 평가 범위는 원자료 확인이 필요하다.
- 벤치마크의 소넷 우세 폭은 약 4%와 약 6%로 다르게 언급된다. 퍼센트 변화인지 퍼센트포인트 차이인지도 명확하지 않다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 새 모델의 점수표를 볼 때 평가 과제, 추론 설정, 작업당 비용을 함께 기록한다.
- 자신의 대표 업무를 명확한 지시 과제와 모호한 지시 과제로 나누고, 실제 사용할 설정에서 결과를 비교한다.
- 생성된 웹사이트의 커서·클릭·스크롤·드래그 등 핵심 기능을 직접 확인한다.
- 토큰 사용량은 사용 기록에서 입력·출력·캐시·중복 집계 여부를 구분해 확인한다.
❓ 열린 질문
- 동일한 비용 또는 동일한 추론 설정으로 비교하면 소넷과 오퍼스의 성능 차이는 어떻게 달라질까?
- Medium에서 발생한 3D 기능 오류를 수정하는 데 필요한 시간과 자원까지 포함하면 어떤 설정이 가장 경제적일까?
- 명확한 지시와 모호한 지시의 차이가 결과 품질에 미치는 영향은 반복 실험에서도 유지될까?