The Sol 6.1 Benchmarks Are STUPID, So I Tested It vs Sonnet 5.5
Quick Summary
Sol 6.1과 Sonnet 5.5를 직접 비교한 결과, 벤치마크 점수만으로는 부족했고 Sol은 토큰 효율에서, Sonnet은 일부 결과물의 완성도와 속도에서 강점을 보였다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Sol 6.1과 Sonnet 5.5를 직접 비교한 결과, 벤치마크 점수만으로는 부족했고 Sol은 토큰 효율에서, Sonnet은 일부 결과물의 완성도와 속도에서 강점을 보였다.
📌 핵심 요점
- 공개 벤치마크의 승자는 지표마다 달랐다. 영상에 따르면 Artificial Analysis에서는 Sonnet이 대체로 앞섰고, 코딩 중심의 Deep Suite에서는 Sol이 4.2점, Automation Bench에서는 Sonnet이 8.7점 우세했다.
- 토큰 단가가 같아도 작업 비용은 달라진다. 영상은 두 모델의 단가를 100만 토큰당 입력 2달러·출력 10달러로 소개하면서, 동일한 52% 성과를 기록한 비교에서는 Sol의 작업당 비용이 약 4분의 1이었다고 설명한다. Sonnet의 속도는 보고된 수치상 약 두 배였다.
- JavaScript 설명 영상에서는 Sonnet의 장면 구성과 음향·시각 요소의 조화가 더 좋다는 평가가 나왔다. Sol은 약 7만 토큰, Sonnet은 약 30만 토큰을 사용해, 결과물의 완성도와 토큰 소비가 서로 다른 방향을 보였다.
- 호텔 랜딩 페이지는 종합적으로 무승부였지만, 여행 대시보드는 Sonnet이 우세했다. 토큰 사용량은 각각 Sol 약 10만 9천 대 Sonnet 약 20만, Sol 약 15만 대 Sonnet 약 40만으로 두 작업 모두 Sol이 적었다.
- 브라우저 탱크 게임은 대체로 대등했다. 다만 Sol은 두 시간 넘게, Sonnet은 약 한 시간 걸렸으며, Sonnet이 약 70만 토큰을 쓰는 동안 Sol은 그 절반 정도를 사용했다. 최종 선택 기준은 점수뿐 아니라 예산, 대기 시간, 원하는 품질이다.
🧩 배경과 문제 정의
영상은 OpenAI 개발자 행사에서 발표됐다는 6.1 모델의 높은 벤치마크 성적과 효율을 출발점으로 삼는다. 발표자는 직전 모델에 대한 실망과 짧은 출시 간격을 언급하면서, 공개 점수가 실제 작업에서도 체감되는 개선을 뜻하는지 묻는다.
검증 방식은 Sonnet 5.5와의 직접 비교다. JavaScript 설명 영상, 가상 호텔 랜딩 페이지, 여행 대시보드, 브라우저 탱크 게임을 만들어 결과물과 토큰 사용량을 살핀다. 핵심 문제는 어떤 모델이 무조건 우월한지가 아니라, 품질·비용·속도를 함께 고려했을 때 자신의 작업에 어떤 모델이 적합한가이다. 모델명은 제목의 Sol 6.1을 기준으로 표기한다.
🕒 시간순 섹션별 상세정리
1. 높은 벤치마크 성적을 실사용으로 검증하려는 이유
- 발표자는 개발자 행사에서 공개됐다는 6.1 모델이 일부 지표에서 GPT6 Astra보다 훨씬 적은 비용으로 좋은 성적을 냈다고 보여준다. 직전 모델과의 짧은 출시 간격도 의문으로 제시한다. [00:43]
- 이전 영상에서 사용한 과제에 Sol을 투입해 Sonnet 5.5와 직접 비교하고, 공개 벤치마크와 실제 결과물 사이의 관계를 살피겠다고 보여준다. [01:18]
2. 벤치마크 점수와 비용·속도의 엇갈린 비교
- Artificial Analysis에서는 Sonnet이 대체로 앞선다고 보여준다. 코딩 중심 지표에서는 Deep Suite가 Sol에 4.2점, Automation Bench가 Sonnet에 8.7점의 우위를 보여 승자가 나뉜다. [01:46]
- 두 모델의 토큰 단가는 같다고 소개하지만 Sonnet은 보고된 속도가 약 두 배이고, Sol은 토큰 효율 덕분에 일부 조건에서 비용이 크게 낮다고 보여준다. 중간 비용 사례는 단위가 혼재하며, 동일한 52% 성과에서는 Sol의 작업당 비용이 약 4분의 1이었다고 정리한다. [02:58]
- 발표자는 공개 지표가 실제 사용과 같지는 않다고 선을 긋고, 200달러 구독의 사용량 배수가 줄었다는 주장과 연결해 효율의 중요성을 강조한 뒤 실사용 테스트로 넘어간다. [03:22]
3. JavaScript 설명 영상의 완성도와 토큰 소비
- 첫 과제는 Claude의 하위 에이전트 사용 방식을 설명하는 15초 세로형 JavaScript 영상이다. 별도의 AI 영상 생성 도구 대신 코드로 영상을 만드는 방식이다. [03:45]
- Sol의 결과물은 시각적으로 이해할 만했지만 음향이 어울리지 않아 평범하다고 평가한다. Sonnet은 여러 장면과 음향·시각 요소가 맞물려 더 일관된 이야기로 보였다고 평가한다. [04:48]
- 사용한 토큰은 Sol 약 7만, Sonnet 약 30만으로, Sonnet의 완성도 우위와 Sol의 토큰 절약이 동시에 나타났다. [04:54]
4. 호텔 페이지 과제와 이미지 생성 도구의 차이
- 두 모델에 가상의 부티크 호텔 Dune House 랜딩 페이지를 요청한다. Sol은 이미지 생성 도구에 직접 접근할 수 있고, Sonnet에는 Higsfield API를 사용할 수 있도록 안내했다. [05:23]
- 중간에 외부 API의 사용량 기반 결제와 월간 구독 크레딧 재설정 행사를 보여준다. 행사 안내는 영상 당시의 상대적 시점을 기준으로 제시됐다. [05:56]
5. 호텔 페이지는 디자인과 기능을 나눠 평가
- Sol의 페이지는 큰 대표 이미지와 깔끔한 구성이 장점이지만, 첫 화면에서 날짜와 인원으로 객실 가용성을 확인하는 기능이 부족하다고 지적한다. Astra와 비교해 큰 도약은 아니지만 저렴한 모델로서 받아들일 만하며 약 10만 9천 토큰을 사용했다고 보여준다. [07:15]
- Sonnet은 가용성 확인 기능과 이미지 배치에서 장점을 보였으나 버튼과 글꼴 선택에는 아쉬움이 있다고 평가한다. 하단의 큰 이미지는 고급스러운 인상을 준다고 드러낸다. [08:10]
- 발표자는 디자인 취향으로는 Sol에 약간 기울지만 기능에서는 Sonnet의 장점을 인정하며 무승부로 정리한다. Sonnet의 토큰 사용량은 약 20만이었다. [08:26]
6. 여행 대시보드는 Sonnet의 시각적 표현이 우세
- Sol의 대시보드는 3차원 지구본, 경로 변화, 날씨와 일부 정보를 보여준다. 그러나 깜박이는 검은 사각형과 도시별 정보 부족을 지적하며, 이전 Astra 결과물보다 내용이 빈약하다고 평가한다. [09:32]
- Sonnet은 도시 선택 시 이미지와 정보를 보여주고 음향과 지구본 전환 효과를 더했다. 발표자는 실용성이 아주 높지는 않지만, 시각적 인상을 중시한 요청에는 더 잘 맞는다고 판단한다. [10:35]
- 이 과제는 Sonnet에 우위를 주되, Sol 약 15만 대 Sonnet 약 40만이라는 토큰 사용량 차이도 강조한다. 앞선 과제들에서도 Sol의 토큰 효율은 일관되게 높았다고 정리한다. [10:54]
7. 브라우저 탱크 게임은 비슷한 품질과 다른 실행 비용
- 마지막 과제는 World of Tanks와 비슷한 게임을 3JS로 만들어 브라우저에서 실행하는 것이다. Sol은 탱크 선택, 탄종, 지도와 상태 표시를 구현했지만 확대 조작이 어색하고 사망 후에도 움직이는 문제가 관찰됐다. [12:05]
- Sonnet은 탱크 통계, 더 큰 지도, 빠른 이동과 편한 확대 조작을 보여준다. 발표자는 Sol의 UI와 Sonnet의 지도·조작감에 각각 장점을 인정하며 전체적으로 대등하다고 평가한다. [13:09]
- Sol은 완료까지 두 시간 넘게, Sonnet은 약 한 시간 걸렸다. Sonnet이 약 70만 토큰을 사용했고 Sol은 그 절반 정도를 사용해, 시간과 토큰 소비가 반대 방향으로 움직였다. [13:22]
8. 실사용 결과를 종합한 모델 선택 기준
- 발표자는 Sol이 Sonnet보다 전반적으로 약간 뒤처지지만 훨씬 효율적이며, 더 저렴한 대신 느리다는 특성으로 비교를 요약한다. [13:35]
- 대부분의 현실적인 업무에서 Sol도 충분한 선택지가 될 수 있다고 평가한다. 어떤 모델을 쓸지는 사용 방식과 예산에 달려 있으며, 관찰된 효율이 계속 유지되는지가 중요하다고 덧붙인다. [14:00]
- 일부 벤치마크에서 같은 성과를 약 4분의 1 비용으로 얻었다는 점은 결과물의 작은 차이와 별도로 평가할 가치가 있다고 강조한다. [14:14]
9. 구독 제한의 맥락과 최종 평가
- 발표자는 OpenAI의 200달러 상품이 20배에서 10배로 바뀌었다고 주장하면서, Anthropic의 20배 표기는 주간 한도보다 5시간 한도와 연결된다는 설명을 제시한다. 두 상품을 배수만으로 비교하는 데 문제를 제기한다. [14:38]
- 이어 구독 제한에 관한 논쟁에서도 원시 점수보다 토큰 효율과 제한의 적용 범위를 봐야 한다고 강조한다. 경쟁사의 주간 사용 조건과 투명성에 관한 해석은 발표자의 주장으로 드러난다. [15:12]
- 마지막으로 Sol을 강력하고 토큰 효율이 높은 모델이라고 평가하며, 모델 선택지에서 무시하지 말라는 메시지로 끝맺는다. [15:23]
🧾 결론
- 이 영상의 네 가지 실사용 과제에서 Sol의 일관된 강점은 적은 토큰 소비였다. 모든 과제에서 가장 좋은 결과물을 만들었다는 뜻은 아니다.
- Sonnet은 설명 영상과 여행 대시보드에서 우세했고, 호텔 페이지와 게임은 대체로 비슷했다. 발표자는 전체적으로 Sol이 Sonnet보다 약간 뒤처지지만 효율적인 선택지라고 평가한다.
- Sol을 도구 목록에 추가할 근거는 충분하다는 것이 발표자의 결론이다. 다만 출시 때 관찰한 효율이 이후에도 유지되는지는 조건으로 남는다.
- 구독 상품의 사용량 배수는 제한이 적용되는 시간 범위까지 함께 봐야 한다. 영상은 5시간 제한과 주간 제한을 구분하지 않은 비교가 오해를 부를 수 있다고 강조한다.
📈 투자·시사 포인트
- AI 도입의 경제성은 토큰 단가보다 원하는 품질에 도달하는 작업당 비용으로 비교필요가 있다. 영상의 사례에서는 같은 단가에도 토큰 사용량 차이가 컸다.
- 빠른 완료와 높은 완성도가 필요한 작업에서는 Sonnet의 장점이, 대기 시간을 허용하고 토큰 소비를 줄이려는 작업에서는 Sol의 장점이 선택에 영향을 줄 수 있다.
- 모델 경쟁은 벤치마크 순위뿐 아니라 효율, 도구 접근성, 구독 제한으로도 드러난다. 내장 이미지 생성과 외부 API 사용의 차이도 실제 작업 환경에 포함해야 한다.
- 영상이 제공하는 근거는 모델 선택과 AI 사용 예산에 관한 것이다. 특정 기업의 실적이나 주가 방향을 판단할 직접적인 자료는 제시하지 않는다.
⚠️ 불확실하거나 확인이 필요한 부분
- 제목은 Sol 6.1이라고 표기하지만 전사에는 Soul, GPT, GBT 등의 표현이 섞여 있다. 이 노트는 제목에 맞춰 Sol 6.1로 통일했으며, 정확한 모델 명칭과 버전은 확인이 필요하다.
- 벤치마크 점수, 가격, 속도, 구독 제한은 영상에서 소개한 주장이다. 제공된 전사만으로 원자료의 측정 조건이나 현재 적용 여부를 검증할 수 없다.
- 02:29~02:37의 비용 설명은 작업당 72센트와 60초당 7.60달러가 혼재해 비교 단위와 대상이 불명확하다. 이를 확정적인 비용표로 재구성하기 어렵다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 자주 수행하는 작업으로 동일한 프롬프트와 완료 기준을 정하고 두 모델의 결과물을 직접 비교한다.
- 입력·출력 토큰, 실제 청구액, 완료 시간, 수정에 든 시간을 함께 기록해 작업당 비용을 계산한다.
- 설명 영상의 음향 조화, 호텔 페이지의 예약 기능, 대시보드의 정보량, 게임의 조작과 사망 처리처럼 과제별 핵심 기능을 점검한다.
- 이미지 생성과 외부 API 비용을 포함해 비교하고, 도구 접근 조건의 차이를 기록한다.
❓ 열린 질문
- Sol의 토큰 효율은 다른 업무와 반복 실행에서도 유지되며, 출시 이후에도 같은 수준일까?
- Sol에 추가 수정이나 더 높은 노력 수준을 적용하면 Sonnet과의 완성도 차이를 줄이면서 비용 우위도 유지할 수 있을까?
- 동일한 이미지 생성 도구와 실행 조건을 제공하면 호텔 페이지와 여행 대시보드의 평가가 달라질까?