I Tested Opus 5.5 vs. GPT-6 Sol on 10 Real Use Cases
Quick Summary
Opus 5.5와 GPT 6 Sol의 실제 작업 10종 비교에서는 Opus가 창의적 결과물의 완성도로 앞섰고, Sol은 대규모 코드 검토·수정에서 비용 대비 강점을 보였다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Opus 5.5와 GPT-6 Sol의 실제 작업 10종 비교에서는 Opus가 창의적 결과물의 완성도로 앞섰고, Sol은 대규모 코드 검토·수정에서 비용 대비 강점을 보였다.
📌 핵심 요점
- 집계 결과는 Opus 7승, Sol 1승이다. 공유 파일 간섭이 발생한 두 시험은 제외됐다. 이 점수는 해당 작업과 평가 기준에서의 결과이며, 모든 용도의 성능 순위를 뜻하지 않는다.
- Opus는 시각적 구성과 창의적 판단에서 우세했다. 웹사이트, 행사 영상, 인스타그램 릴, 3D 학습 세계, Canva 재현에서 더 좋은 평가를 받았다. 다만 릴은 약 11달러 대 3달러, 3D 세계는 60달러 대 8.55달러로 비용 차이도 컸다.
- Sol은 대규모 코드 검토·수정에서 앞섰다. 조정된 프롬프트로 진행한 시험에서 Sol은 30개 검사 전체 통과로 100점, Opus는 한 검사를 놓쳐 97점을 받았다. Sol의 비용은 약 1달러로 Opus의 20분의 1이었지만, 도중 중단과 프롬프트 수정이라는 개입이 있었다.
- 가격과 속도만으로 작업별 우열을 예측하기 어렵다. 회의 기록 검색에서는 Opus가 정답을 찾았고, 브라우저 강좌 생성에서는 완성도가 비슷한 가운데 Opus가 더 빠르고 저렴했다. 여행 계획에서는 Sol의 질문 방식과 일정 정보, Opus의 지도 상호작용과 조사 품질이 각각 돋보였다.
- 비용 집계와 실험 독립성을 함께 확인해야 한다. 영상 말미 총계는 Opus 8시간 40분·213달러, Sol 5시간 51분·74.46달러지만, 별도 정정에는 Sol 총비용에서 19달러를 빼야 한다고 적혀 있다. 같은 예산으로 Sol을 반복 개선했을 때의 결과는 검증되지 않았다.
🧩 배경과 문제 정의
- Opus 5.5와 GPT-6 Sol을 웹사이트 제작, 영상 편집, 데이터 분석, 게임 등 실제 작업에 적용해 결과물의 품질·시간·비용을 비교한다. 전체 실험은 10개 사용 사례로 구성되지만, 제공 구간은 여행 계획 실험의 도입까지다.
- 핵심 질문은 높은 가격이 더 좋은 결과로 이어지는지, 같은 예산을 썼을 때 어느 모델이 더 큰 가치를 주는지다. 첫 결과물의 완성도와 저렴한 모델을 반복 개선할 가능성도 함께 고려한다.
- 동일한 프롬프트를 사용했지만, 일부 실험에서는 두 모델이 같은 저장소의 파일을 수정해 결과가 섞였다. 해당 결과는 독립적인 성능 비교로 보기 어렵고, 비용·시간의 사후 정정도 반영해야 한다.
🕒 시간순 섹션별 상세정리
1. 두 배의 모델 가격과 동일 예산의 가치 비교
- 자막에 제시된 Opus의 입력·출력 가격은 각각 4달러·20달러이고, Sol은 2달러·10달러다. Opus의 가격이 두 배라는 점이 더 높은 품질을 기대하게 하는 출발점이다 [00:21]
- 평가 기준은 단순히 더 좋은 결과를 내는 모델뿐 아니라, 각각 100달러를 썼을 때 더 좋은 결과와 가치를 제공하는 모델이 무엇인지다. 가격과 성능의 관계는 실험으로 확인할 대상으로 남는다 [00:49]
2. 회의 기록 검색에서 드러난 속도와 정확도의 차이
- 사전 과제는 최근 Fireflies 통화 두 건의 자막을 위키에 추가하고, 기존 Q&A에서 특정 언급을 찾는 작업이다. 두 통화는 합쳐 약 4시간 분량이며, 링크·색인과 문서 간 연결까지 필요하다 [01:20]
- Sol은 통화 처리와 Q&A 검색을 병렬로 진행해 초반에 더 빠르게 진척됐다. 그러나 마지막 언급 날짜를 8월 17일로 답했고, Opus가 찾은 9월 14일이 정답으로 확인됐다 [02:09]
3. 제품 웹사이트의 시각적 완성도는 Opus가 우세
- 모든 사용 사례에는 두 모델에 동일한 프롬프트를 적용했다. 첫 웹사이트는 마우스 움직임에 따른 레이어 분리, 캔을 여는 효과, 텍스트 등장과 제품 회전 등으로 풍부한 시각적 경험을 구성했다 [02:56]
- 두 번째 웹사이트는 비슷한 브랜드 메시지를 유지했지만, 약한 대표 이미지와 실제 제품 대신 패키지 중심 이미지를 사용한 점이 낮게 평가됐다. 디자인 승자는 첫 결과물을 만든 Opus 5.5였다 [03:52]
4. 행사 홍보 영상은 편집의 에너지와 리듬이 승부를 결정
- 과제는 Frame.io에 있는 행사 영상 100GB를 활용해 다음 행사를 홍보할 30초짜리 하이라이트 영상을 만드는 것이다. 장면을 나열하는 데 그치지 않고 이야기와 활기 있는 분위기를 구성해야 했다 [05:10]
- Opus 영상은 일부 정적인 부분이 있었지만 음악, 효과음, 속도감과 레이어 구성이 좋은 평가를 받았다. Sol 영상도 인상적이었으나 다음 행사에 대한 기대감을 높이는 에너지와 빠른 전개는 상대적으로 약했다 [06:04]
5. 인스타그램 릴의 완성도와 반복 개선 비용의 쟁점
- 두 모델에는 같은 영상과 프롬프트를 제공하고 Hyperframes를 이용한 편집을 요청했다. Sol 결과물에는 배경의 이상한 웅웅거림이 있었고, 음악과 흥미로운 애니메이션이 부족해 그대로 게시하기 어렵다는 평가가 나왔다 [08:02]
- Opus 결과물은 훨씬 낫다는 평가를 받았지만, 시간은 두 배이고 비용은 거의 네 배였다. Opus는 약 11달러, Sol은 약 3달러를 사용했다 [09:48]
6. 데이터 기반 산출물의 구성과 시각적 품질
- Opus 결과물로 처음 제시된 Google Sheets에는 MRR·고객 수·매출총이익률 등의 지표와 손익, SaaS 지표, 현금·런웨이, 단위 경제성, 가격, 고객 관련 탭이 있었다. 짙은 파랑과 주황을 활용한 일관된 디자인이 특징이다 [10:35]
- 피치 덱은 로고와 데이터 시각화를 갖췄지만 설명의 깊이나 고급스러움은 제한적이었다. 분석 대시보드는 시트와 같은 데이터를 사용하며 탭과 모드를 전환할 수 있어, 기능적으로 작동하는 것으로 보였다 [11:15]
7. 공유 저장소 간섭으로 무효화된 비교와 비용 정정
- Sol의 덱이 Opus의 덱과 사실상 같아 보이면서 결과물 혼합 문제가 드러났다. 같은 프로젝트 폴더에서 서로의 작업을 수정했을 가능성 때문에 이 실험에는 승자를 정하지 않았다 [12:47]
- 처음에는 Sol이 8분 더 오래 실행되고 3달러 더 들었다고 계산했지만, 사후 확인 결과 Codex의 실제 사용량은 3.60달러와 약 9분으로 정정됐다. 영상 끝의 Sol 총비용에서도 19달러를 빼야 한다는 수정이 추가됐다 [14:09]
8. 박물관 게임의 조작 결함과 반복된 파일 간섭
- Sol 버전으로 처음 제시된 ‘Small Hours’는 폐관하는 미니어처 박물관과 할머니의 작품을 소재로 한 게임이다. 이동·둘러보기·상호작용과 효과음이 구현됐고, 이야기와 디자인은 긍정적인 평가를 받았다 [16:05]
- 마우스 포인터가 화면 안에 고정되지 않아 프레임 밖으로 나가면 시점 조작이 멈췄다. 360도 회전이 어려워 실제 플레이를 지속하기 힘들었고, 이야기와 진행이 괜찮아도 조작 결함 때문에 테스트를 중단했다 [16:54]
9. Opus의 3D 학습 세계는 개념을 놀이로 연결
- 여섯 번째 과제는 최근 YouTube 영상 100개를 바탕으로 영상 속 개념을 설명하는 탐험 가능한 3D 세계를 만드는 것이다. 이 실험에서는 두 모델이 같은 산출물을 함께 수정하지 않았다 [18:46]
- Opus는 만화풍 공간에서 이동하고 안내 캐릭터와 대화하며 토큰과 모델 하네스 등을 살펴보게 했다. 공을 떨어뜨려 다음 단어 선택을 이해하는 장치도 있었지만, 공이 자주 끼는 문제가 관찰됐고 한꺼번에 많이 넣은 것이 원인일 가능성이 제기됐다 [19:11]
10. Sol의 3D 세계는 저렴하지만 탐험 경험에서 열세
- Sol의 ‘Idea Atlas’는 분수 안을 통과할 수 있는 등 이동의 현실감이 떨어졌고, 닫히지 않는 오버레이와 복잡한 인터페이스가 문제였다. 개념 설명을 읽는 상호작용도 매끄럽지 않았다 [21:34]
- Opus 세계에서는 약 15분을 보낼 수 있을 것 같다는 주관적 평가와 달리, Sol 세계는 빠르게 지루해졌다는 평가를 받았다. 앞선 박물관 게임 역시 코드와 디자인의 상당 부분을 Opus가 만들었다는 설명이 추가됐다 [22:14]
11. 모호한 여행 희망을 탐험 가능한 계획으로 바꾸는 과제
- 다음 과제의 조건은 10월 1일부터 30일까지 시카고에서 출발해 해외도 방문하고, AI 행사와 자연경관을 함께 즐기는 여행이다. 구체적인 일정 대신 대략적인 희망을 입력으로 제공했다 [22:59]
- 목표는 여행 계획을 직접 돌아다닐 수 있는 3D 세계로 바꾸는 것이다. 모호한 요구에서 얼마나 좋은 경험을 만들 수 있는지가 평가 대상이며, 제공 구간에는 결과물 비교나 승패 판단까지 나오지 않는다 [23:10]
12. 여행 계획에서는 Sol의 질문 방식과 Opus의 지도·조사 품질이 두드러진다
- Sol은 Opus 5.5보다 질문이 많다. 질문은 요구 파악에 유용하지만 목표가 명확하면 방해가 될 수도 있다. 이번 Codex 사용에서는 질문을 채팅에 남긴 뒤 답변을 기다리는 동안에도 작업을 계속해 긍정적인 평가를 받았다. [23:50]
- Sol의 30일 여행 계획은 시카고에서 샌프란시스코로 출발해 여러 지역을 연결하고, 지구본에서 날짜별 일정을 확인하며 항공편·호텔·입장권 링크로 이동할 수 있게 했다. 일정과 예약 정보는 충실했지만, 3D 지구본 경험은 기대에 못 미쳤으며 초기 요청 자체도 구체적이지 않았다는 단서가 붙었다. [24:59]
13. 대규모 코드 검토·수정에서는 Sol이 낮은 비용으로 앞선다
- Astra가 비교 대상의 정체를 모르는 상태에서 설계한 대규모 코드베이스 분석·수정 시험에서 Sol은 100점과 30개 검사 전체 통과를 기록했다. Opus는 검사 하나를 놓쳐 97점을 받았으며, 비용은 20배, 소요 시간은 두 배였다. [27:03]
- Sol은 도중에 사이버 보안 또는 안전 관련 문제로 작업을 멈췄다. 비교를 위해 두 작업을 모두 중단하고 조정된 프롬프트를 양쪽에 적용했으며, Opus 자체에는 같은 중단 문제가 없었다. 이런 개입을 거친 뒤 Sol은 약 1달러로 작업을 끝냈다. [27:31]
14. 브라우저 강좌 생성에서는 비슷한 완성도에 Opus가 더 빠르고 저렴하다
- 두 모델은 영상과 설명을 포함한 동일한 강좌 구조를 받아 교육 플랫폼에 강좌를 만들었다. Sol은 1~15번 영상을 각각 초안으로 구성하고 설명·핵심 요점·인용·자료 링크를 넣었으며, 화면에서 확인한 범위에서는 대체로 올바르게 업로드된 것으로 보였다. [29:04]
- Opus는 개별 페이지 대신 강좌 전체를 초안으로 만들었고, 이 방식은 더 적절하다는 평가를 받았다. 내용 구성은 비슷했지만 일부 자료 링크를 중복 삽입한 결함이 있었다. [29:41]
15. Canva 이미지 재현에서는 Opus의 품질 우위와 추가 비용이 함께 드러난다
- 과제는 평가자와 애덤 샌들러가 등장하는 AI 생성 참고 이미지를 Canva의 드로잉·페인팅 도구로 재현하는 것이었다. Opus 결과는 기대를 크게 웃돌았고, 과거 Fable 및 몇 주 전 Astra로 수행한 결과보다도 좋다는 평가를 받았다. [30:45]
- Sol은 처음에 그림 도구로 재현하는 대신 이미지를 생성하려 했다. 수정 프롬프트를 적용하고 새 세션에서도 다시 시도했지만 결과가 계속 나빴다. Astra와 비교해 왜 이런 차이가 생겼는지는 확인되지 않았으며, 이 과제에서는 Opus의 승리가 명확하다고 평가됐다. [31:25]
16. 최종 선택은 창의적 판단과 정해진 절차의 실행을 구분한다
- 전체 시험에서 Opus는 8시간 40분과 213달러, Sol은 5시간 51분과 74.46달러가 들었다. Opus는 더 오래 걸리고 약 세 배 비쌌지만, 집계된 시험에서는 더 자주 좋은 결과를 냈다. [32:14]
- 평가자는 Opus 5.5를 Opus 5 대비 큰 개선으로, GPT-6 Sol을 5.6 Sol 대비 다소 후퇴한 모델로 느꼈다. Sol이 향후 GPT-6 Luna처럼 느껴진다는 표현도 실제 제품 분류가 아닌 주관적 인상이며, 창의성과 의사결정에서는 Claude Opus를 더 신뢰하겠다는 결론이다. [33:28]
🧾 결론
- 이번 비교는 첫 결과물의 완성도와 창의적 판단을 중시할 때 Opus를 선택할 근거를 제공한다. 추가 비용의 가치는 작업별 품질 차이에 달려 있다.
- Sol의 코드 시험 성과는 분명하지만, 회의 기록 검색의 오답과 다른 과제의 결함까지 고려하면 단일 시험을 전체 역량으로 확대하기 어렵다.
- Opus가 작업을 지휘하고 Sol이 구체적인 지시를 실행하는 조합은 제안된 가능성이다. 이 조합의 실제 비용과 품질은 이번 비교에서 검증되지 않았다.
📈 투자·시사 포인트
- AI 도입 예산은 모델의 표시 가격과 함께 게시·납품 가능한 결과물을 얻는 데 드는 수정 비용을 기준으로 판단필요가 있다. 이번 실험은 동일 예산의 반복 개선 비교까지 수행하지 않았다.
- 작업별 모델 배치가 비용 관리의 핵심 검토 대상이다. 창의적 결과물과 코드 검토에서 서로 다른 강점이 나타났으므로, 조직의 대표 업무로 재평가할 가치가 있다.
- 브라우저 강좌 생성처럼 표시 가격이 높은 모델이 실제로 더 저렴하게 끝낸 사례가 있다. 단가뿐 아니라 실행 방식과 완료 시간도 측정해야 한다.
- 이 결과만으로 특정 기업의 투자 매력이나 시장 지배력을 판단하기는 어렵다. 여기서 확인된 것은 제한된 작업에서의 결과물 품질과 실행 비용이다.
⚠️ 불확실하거나 확인이 필요한 부분
- 웹사이트·영상·그림의 품질 평가는 평가자의 취향과 기대에 영향을 받는다. 반복 실행에 따른 결과 변동이나 평가자 간 일치도는 제시되지 않았다.
- 데이터 산출물과 박물관 게임은 두 모델이 같은 파일을 수정했다. 각 모델의 기여도와 결함 원인을 분리할 수 없어 독립적인 성능 근거로 쓰기 어렵다.
- Sol 총비용 74.46달러와 19달러 차감 정정의 반영 관계를 확인해야 한다. 차감 전 수치라면 산술상 55.46달러지만, 이를 확정 총비용으로 단정할 수는 없다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 모델별 저장소·출력 폴더·세션을 분리하고 동일한 초기 자료로 비교한다.
- 업무별 성공 기준을 먼저 정한다. 창작물은 게시 가능 여부, 코드는 검사 통과, 검색은 원문 근거와 정답 여부를 기록한다.
- 첫 결과물 비교와 동일 예산의 반복 개선 비교를 따로 진행하고, 수정 횟수·사용량·완료 시간을 함께 남긴다.
- 영상의 비용 정정과 실행 로그를 대조해 실패·재시작 비용의 포함 여부를 확인한다.
❓ 열린 질문
- Sol에 Opus와 같은 예산과 수정 기회를 주면 창작물의 품질 격차가 얼마나 줄어들까?
- 파일 간섭을 없애고 여러 번 반복하면 7대 1이라는 집계와 작업별 우위가 유지될까?
- Opus가 지휘하고 Sol이 실행하는 조합은 단일 모델보다 비용과 완료 품질을 개선할까?