First Look at Opus 5.5 & GPT-6 Sol: Frontier Performance, Lower Cost
Quick Summary
Opus 5.5와 GPT 6 Sol의 첫 비교에서 Opus는 시각적 완성도, Sol은 낮은 비용과 사용량 부담이 강점으로 나타났으며, 최상위급 성능을 저렴하게 활용할 수 있다는 기대는 과제별 검증이 필요하다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Opus 5.5와 GPT-6 Sol의 첫 비교에서 Opus는 시각적 완성도, Sol은 낮은 비용과 사용량 부담이 강점으로 나타났으며, 최상위급 성능을 저렴하게 활용할 수 있다는 기대는 과제별 검증이 필요하다.
📌 핵심 요점
- 발표자는 최고 성능 자체보다 일상 업무에서 오래 쓸 수 있는 유능한 모델을 원한다. Fable과 Astra의 사용 한도, 기존 대체 모델의 오류 경험이 이번 비교의 출발점이다.
- 영상은 Opus 5.5의 입력·출력 가격을 각각 100만 토큰당 4달러·20달러로 소개한다. Sol은 2달러라는 가격을 제시하지만, 해당 발언만으로 전체 요금 구조나 실제 작업비가 정확히 절반이라고 단정할 수 없다.
- 제트기 게임과 벚꽃 분재 장면에서는 Opus의 입체감·조명·디테일을 높게 평가한다. Sol의 분재는 단순하고 확대 조작이 작동하지 않았지만, 발표자는 비용과 속도도 함께 고려한다.
- 랜딩 페이지에서는 풍부한 상호작용을 보여준 결과물을 높게 평가하지만, 초반 모델 호칭이 뒤 설명과 충돌한다. 마지막 플랫폼 게임에서는 Sol이 약 10분 만에 플레이 가능한 결과를 만들었고, Opus는 약 22분 만에 더 풍부한 구성을 만들었으나 진행을 막는 것으로 보이는 장애물 문제가 있었다.
- 발표자는 두 모델을 일상 작업에 적극 사용하고 Fable·Astra는 복잡한 코딩과 엔지니어링에 남겨두겠다고 결론짓는다. 다만 이번 시연은 장기 코딩 신뢰성을 직접 입증하는 반복 실험은 아니다.
🧩 배경과 문제 정의
발표자는 Fable과 Astra를 선호하지만 사용 한도 때문에 다른 모델을 써야 하는 상황을 겪었다. 기존 Opus 5와 Sol 5.6은 복잡한 작업에서 믿고 맡길 실행 모델로 충분하지 않았다는 것이 개인적인 문제의식이다. 따라서 이번 비교의 핵심은 가장 강력한 모델을 찾는 것뿐 아니라, 일상 업무를 감당할 성능을 더 낮은 비용으로 확보할 수 있는지에 있다.
영상은 출시 소개 자료와 벤치마크를 먼저 설명한 뒤, 같은 지시와 자산을 활용한 시각적 제작 과제를 비교한다. 도입의 제트기 게임, 벚꽃 분재 3D 장면, 랜딩 페이지, 플랫폼 게임이 주요 사례다. 아래 정리는 제공된 전사만을 근거로 하며, 발표 자료의 주장·발표자의 관찰·확인되지 않은 사항을 구분한다.
🕒 시간순 섹션별 상세정리
1. 제트기 게임으로 제시한 첫인상
- 제트기로 구체를 모으고 적을 피하는 게임을 두 모델에 요청했다. 위쪽 결과물은 조명·입체 표현·카메라 움직임이 풍부하고 아래쪽은 요구사항을 구현한 단순한 형태라고 보여준다. [00:34]
- 발표자는 위쪽을 Opus 5.5, 아래쪽을 제목상 GPT-6 Sol로 소개하며 Opus의 시각적 결과를 더 높게 평가한다. [00:42]
2. 사용 한도와 기존 Opus에 대한 불만
- Opus 5.5가 Fable 5.1과 대부분의 작업에서 비슷한 성능을 내고 Opus 5보다 운영 비용이 40% 낮다는 소개를 전하며, 사실이라면 반가운 변화라고 드러낸다. [01:05]
- 100달러 Claude 구독에서 Fable 한도를 소진한 뒤 Opus를 사용해 왔으며, 기존 Opus 5가 복잡한 작업에 새 오류를 만들어 다른 모델로 고쳐야 했다고 회고한다. [01:43]
3. 두 모델을 직접 비교하는 이유
- 발표자는 같은 날 OpenAI가 Astra와 함께 Sol·Luna를 추가했다고 설명하고, Codex에서도 상위 모델 사용 부담 때문에 대체 모델이 필요했다고 드러낸다. [02:25]
- Fable이나 Astra의 추가 성능 향상보다, 오랫동안 쓸 수 있는 유능한 Sol과 Opus가 일상 업무에 더 유용할 수 있다는 것이 비교의 동기다. [03:01]
4. 지식 자료 서비스 소개와 슬라이드 과제
- Agent Wikis의 무료 자료와 유료 맞춤 기술·자료, 향후 자동화 워크플로 등을 홍보한다. 전사의 유료 가격 표기는 소수점과 통화가 명확하지 않다. [03:44]
- 두 모델에 각자의 소개 블로그를 바탕으로 발표 자료를 만들게 했으며, 제품 설명과 함께 슬라이드 제작 능력도 살펴보겠다고 한다. [04:09]
5. Opus의 가격과 응답 방식 개선 주장
- Opus 5.5의 입력 가격은 100만 토큰당 4달러, 출력은 20달러이며 출력 속도가 30% 빨라졌다고 보여준다. Sonnet 5.5와 Haiku 5.5의 후속 출시 전망도 언급한다. [04:34]
- 기존 Opus가 지시를 무시하거나 요청하지 않은 일을 했다는 불만과 함께, 새 모델은 핵심 정보를 먼저 제시하는 더 명료한 응답을 지향한다고 보여준다. [05:10]
6. Opus 벤치마크 소개와 적용 범위
- Terminal Bench 4.0, Cursor Bench 등의 결과를 인용해 코딩 성능과 비용 효율을 긍정적으로 평가한다. 다만 비교표마다 추론 수준이 다르다는 점도 언급한다. [05:57]
- 지식 업무에서는 강점을 보이지만 과학 성능에서는 Astra에 뒤처진다고 설명하며, 전체적으로는 Fable급 성능을 더 낮은 비용에 제공한다는 기대를 강조한다. [06:30]
7. Sol의 낮은 가격과 작업당 비용
- Sol의 2달러 가격을 제시하며 Opus보다 저렴하고 이전 Sol의 4.20달러보다 낮다고 보여준다. 이를 OpenAI와 Anthropic의 가격 경쟁으로 해석하되 지속 여부는 알 수 없다고 덧붙인다. [07:19]
- 소개된 그래프에서는 Fable 5.1에 근접한 성능을 설명하고, 장기 코딩 평가에서는 성공률 68.8%와 Fable 5 대비 작업당 비용 80% 감소라는 수치를 전해진다. [08:09]
8. 상위 모델과 실행 모델의 역할 분담
- 발표자는 최상위 모델로 상세 계획과 작업 조정을 수행하고, 더 저렴한 모델을 신뢰할 수 있는 실행 담당으로 쓰고 싶다고 보여준다. [08:39]
- 낮은 비용으로 더 많이 시도할 수 있다는 점을 강조하며 Luna는 단순 자동화에 고려하지만, 이번 영상은 Sol에 집중한다고 정리한다. [08:54]
9. 벚꽃 분재 3D 장면 제작
- 확대 가능한 벚꽃 분재 장면을 3.js로 만드는 긴 프롬프트를 가져와 Claude Code의 Opus와 Codex의 Sol에 같은 지시를 전달한다. [10:11]
- Opus 결과물의 나무껍질·꽃·장면 디테일을 높게 평가하고 시간대별 조명을 확인한다. 조작 지연이 코드 때문인지 오래된 기기 때문인지는 판단하지 못한다. [11:47]
- Sol은 더 단순한 장면을 만들었고 확대 조작이 되지 않았다. 발표자는 사실감 차이를 지적하면서도 Sol이 더 빨랐고 가격이 낮다는 점을 함께 고려한다. [13:15]
10. 랜딩 페이지의 요구사항과 제작 시간
- 기존 공룡 영상과 이미지를 활용한 랜딩 페이지를 요청한다. 재미있는 시각 구성, 스크롤 연동 영상, 최소 세 가지 추가 상호작용, 브라우저에서의 매끄러운 동작이 조건이다. [14:18]
- 같은 과제를 준 뒤 Claude는 약 11분, Codex는 약 18~19분 걸렸다고 보여준다. 평소 Sol이 더 빠르다는 자신의 예상과 다른 결과라고 드러낸다. [14:43]
11. 첫 랜딩 페이지의 풍부한 상호작용
- 첫 페이지는 움직이는 글자·도형과 커서 효과, 부드럽게 재생되는 스크롤 영상을 보여준다. 다만 첫 소개의 Codex 호칭과 이후 Claude 언급이 충돌해 모델 귀속 확인이 필요하다. [16:01]
- 도형 맞추기, 알을 여러 번 눌러 깨기, 색상별 영상 등 다양한 요소를 시험한다. 일부 윤곽 정합성과 빈 화면에는 의문을 제기한다. [17:37]
- 발표자는 색상과 첫 화면, 기술 요소의 구현을 높게 평가하며 이번 과제에서는 앞서 경험한 Fable 5.1보다 더 재미있다고 판단한다. [18:05]
12. Sol 랜딩 페이지의 성과와 한계
- 이어 GPT-6 Sol의 Codex 결과물이라고 명시한 페이지를 보여준다. 디자인은 간결하고 서체와 스크롤 영상 재생은 긍정적으로 평가한다. [18:58]
- 색상 선택 등 일부 상호작용은 작동 방법을 찾지 못하거나 반응하지 않았고, 발표자가 기대한 독특함과 재미는 부족했다고 보여준다. [20:22]
- Opus 결과에 대한 기대가 커졌으며, 따로 시험한 Fable의 벚꽃 장면도 Opus와 비슷한 수준이었다는 개인적 관찰을 덧붙인다. [20:48]
13. 마지막 과제와 Sol의 플랫폼 게임
- 기존 스프라이트를 활용해 메가맨풍의 한 스테이지 플랫폼 게임을 만들도록 요청한다. 창작 방향은 자유롭게 두되 멋지고 재미있으며 소리가 없어야 한다는 조건을 제시한다. [21:32]
- Sol은 약 10분 만에 게임을 완성했다. 점프·사격·대시를 시험하고 보스를 쓰러뜨린 뒤 출구까지 진행한다. [22:57]
- 발표자는 이번 영상에서 본 Sol 결과 중 가장 만족스러웠으며 제작 시간도 짧았다고 평가한다. [23:08]
14. Opus 게임의 풍부함과 진행 문제
- Opus는 약 22분이 걸렸고, 슬라이딩·컨베이어·사다리 등 더 다양한 요소를 구현했다. 발표자는 실제 게임처럼 보인다며 시각적 완성도를 높게 평가한다. [24:06]
- 가시 구간을 뛰어넘기 어려워 보이는 문제를 발견해 게임 논리에 결함이 있을 수 있다고 지적한다. 그래도 구성 요소와 외형은 Sol보다 풍부하다고 평가한다. [24:48]
15. 구독 사용량과 과제별 종합 평가
- 약 두 시간의 작업 뒤 사용량 표시가 한쪽은 90%에서 92%, 다른 쪽은 주간 기준 70%에서 76%로 늘었다고 보여준다. 둘 다 100달러 구독이며 Sol의 사용량 부담이 작다고 해석하지만, 이는 전력 측정이나 동일 기준의 비용 실험은 아니다. [25:25]
- Sol의 도입 게임과 벚꽃 장면에는 실망했지만 랜딩 페이지는 이전보다 개선됐고 마지막 플랫폼 게임이 가장 인상적이었다고 정리한다. [26:01]
16. 일상 모델로의 채택과 마무리
- 발표자는 이번 시험에서 Opus가 Fable 5.1과 비슷한 수준이라는 인상을 받았고, 앞으로 Opus와 Sol을 자주 쓰겠다고 드러낸다. [26:32]
- Fable과 Astra는 매우 복잡한 코딩·엔지니어링에 활용할 계획이며, Opus의 성능과 Sol의 활용 가능성을 긍정적으로 평가한다. 시청자의 첫인상을 요청하며 영상을 마친다. [27:02]
🧾 결론
- 발표자의 종합 평가는 Opus 5.5에 더 우호적이다. 특히 시각적 디테일과 상호작용의 풍부함에서 높은 만족도를 보인다.
- Sol도 마지막 플랫폼 게임에서는 빠르고 충분히 즐길 만한 결과를 냈다. 비용을 고려한 실행 모델로서의 활용 가능성이 영상의 중요한 결론이다.
- 더 화려한 결과가 곧 더 안정적인 결과를 뜻하지는 않는다. Opus 게임의 진행 문제와 Sol의 일부 조작 실패는 기능 검증을 별도로 해야 한다는 근거다.
- Fable 수준이라는 평가는 발표자의 제한된 시연 경험에 따른 판단이다. 모든 작업에서의 동등한 성능이나 보편적인 우열로 확대할 수 없다.
📈 투자·시사 포인트
- 영상이 제시하는 경쟁의 방향은 최고 성능뿐 아니라 비용 대비 작업 성과의 개선이다. 가격 인하가 지속되는지는 별도로 관찰해야 한다.
- 모델 선택에서는 토큰 단가와 함께 성공한 작업당 비용, 수정 횟수, 완료 시간, 구독 한도 소모를 비교필요가 있다.
- 복잡한 계획·조정은 상위 모델에 맡기고 반복 실행은 상대적으로 저렴한 모델에 맡기는 역할 분담이 제안된다. 실제 절감 효과는 실행 결과의 신뢰성에 달려 있다.
- 이 영상에는 기업 실적·수익성·가치평가 자료가 없으므로, 제품 시연을 특정 기업의 투자 매력이나 주가 전망으로 바로 연결하기는 어렵다.
⚠️ 불확실하거나 확인이 필요한 부분
- 모델명 표기가 일관되지 않는다. 제목의 GPT-6 Sol을 본문 표기로 사용했지만, 전사에는 Soul·GBT 등의 표기가 섞여 있다. 출시 시점과 제품 사양은 영상 속 주장으로 취급해야 한다.
- Opus의 비용 40% 감소·출력 속도 30% 향상, Sol의 장기 코딩 성공률 68.8%·작업당 비용 80% 감소 등은 소개 자료를 전달한 수치다. 원문 평가 조건과 독립 검증 결과는 제공되지 않는다.
- 랜딩 페이지 첫 결과물을 14분대에는 Codex라고 부르지만, 이어지는 설명은 Claude를 언급하고 18분대에는 다시 Codex 결과물을 소개한다. 첫 결과물의 모델 귀속은 화면 확인이 필요하다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 원본 화면과 소개 자료에서 모델명, 가격 단위, 벤치마크 이름·조건을 확인하고 발표 수치와 직접 관찰 결과를 구분한다.
- 동일한 프롬프트·자산·실행 환경으로 분재, 랜딩 페이지, 플랫폼 게임을 반복 제작하고 품질·시간·비용을 함께 기록한다.
- 확대·축소, 스크롤 영상, 색상 선택, 게임 장애물 통과와 최종 클리어 여부를 기능별로 점검한다.
- 랜딩 페이지 시연의 화면 전환과 모델 표시를 확인해 결과물 귀속을 정리한다.
❓ 열린 질문
- Opus의 시각적 우위가 기존 코드베이스 수정이나 장기 코딩에서도 유지될까?
- Sol의 낮은 단가와 사용량 부담은 수정·재시도를 포함해도 비용 우위로 이어질까?
- Opus 플랫폼 게임의 진행 문제는 간단한 수정으로 해결될까, 설계 전반의 검증이 필요할까?