I Had Opus 5.5 Build me the Same App at Every Effort Level
Quick Summary
Opus 5.5로 같은 앱을 에포트별로 제작한 이번 비교에서는 최고 설정인 Max보다 Extra가 상호작용과 비용 대비 완성도에서 더 좋은 평가를 받았다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Opus 5.5로 같은 앱을 에포트별로 제작한 이번 비교에서는 최고 설정인 Max보다 Extra가 상호작용과 비용 대비 완성도에서 더 좋은 평가를 받았다.
📌 핵심 요점
- 동일한 프롬프트와 105GB의 AIS Live 녹화 자료로 여러 방·트랙·무대를 탐색하는 3인칭 3D 콘퍼런스를 제작했다. 창의성·디자인·물리 구현과 함께 시간·환산 비용·토큰·검증 횟수를 비교했다.
- Low는 16분 43초와 API 환산 비용 3.91달러로 행사 구조를 구현했지만 브랜딩과 영상 재생이 부족했다. Medium은 실제 영상과 자료를 공간에 연결했고, High는 출입 절차와 세부 공간을 추가했다. High는 Medium보다 빨랐지만 비용은 더 높았다.
- Extra는 대화, 착석, 입장 시 영상 재생, 워크시트 활용 등 참여 경험을 확장했다. 1시간 30분과 25.92달러를 사용했으며, 한 번의
/goal실행 결과를 기준으로 최종 선택을 받았다. - Max는 2시간 28분과 50.38달러, 118만 토큰을 사용했다. 검증도 51회 수행했지만 영상 재생·이동·착석 오류가 남아 추가 자원 투입에 상응하는 품질 향상을 보여주지 못했다.
- Ultra Code는 1시간 35분과 18.69달러로 자연스러운 이동과 안내, 자료 활용 기능을 구현했지만 이동·착석 결함도 있었다. 기대했던 동적 워크플로는 로그 확인과 여러 시도에서도 관찰되지 않았고, 확인한 실행에서는 서브에이전트 사용도 없었다.
🧩 배경과 문제 정의
- 같은 모델에 동일한 앱 제작 프롬프트를 주더라도 에포트 수준에 따라 결과물의 품질과 자원 사용량이 달라질 수 있다. Opus 5.5의 Low부터 Ultra Code까지 결과를 비교한다.
- 제작 과제는 105GB 규모의 가상 행사 녹화 자료를 활용해, 여러 방·트랙·무대를 직접 돌아다니는 3인칭 3D 기술 콘퍼런스를 구현하는 것이다.
- 창의성·디자인·물리적 상호작용·공간의 완성도와 함께 실행 시간, API 과금 기준 환산 비용, 토큰 사용량, 검증 횟수, 사용자에게 한 질문 수를 비교한다. 실제 실행에는 구독을 사용했다.
🕒 시간순 섹션별 상세정리
1. 동일한 행사 자료와 개방적인 제작 조건으로 에포트를 비교한다
- 모든 에이전트에 같은 프롬프트를 제공하고, Frame.io에 보관된 105GB의 AIS Live 녹화 자료를 실제 대면 행사처럼 탐색할 수 있는 3D 공간으로 전환하도록 요구했다. 여러 방과 트랙, 무대를 갖추는 것이 핵심 조건이다. [01:17]
- 필요한 이미지·영상 생성 도구와 기존 프로젝트 자원을 사용할 수 있도록 허용했다. 평가 기준은 창의성, 디자인, 물리 구현, 직접 돌아다닐 때의 전반적인 경험이며, 세부 구현 방식은 폭넓게 열어 두었다. [01:25]
2. Low는 행사 구조를 재현하지만 브랜딩과 재생 품질이 부족하다
- 시작 화면에 실제 로고와 행사 색상이 반영되지 않았다. 반면 내부 지도에는 로비·엑스포·VIP 라운지·메인 무대가 있고, 실제 행사 일정과 가상 행사에 있었던 부스도 포함됐다. [02:46]
- 이동하면 사람들이 사라지는 문제가 반복됐다. 워크숍 화면은 정지 이미지였고, 메인 무대도 잠깐 움직이는 듯했으나 실제 영상 재생보다는 슬라이드쇼처럼 보였다. [03:25]
3. Medium은 실제 영상과 행사 자료를 연결해 완성도를 높인다
- 행사 색상과 브랜드 가이드라인을 반영한 시작 화면과 명찰이 등장했다. 워크숍에서는 실제 영상이 재생되고 참석자들이 노트북을 사용했으며, Low에서 보였던 인물 깜빡임도 해당 장면에서는 나타나지 않았다. [05:04]
- 부스에는 관련 영상이 재생되고, 발표 슬라이드와 행사 후 제공한 자료도 배치됐다. 트랙별 교육 공간, 올라갈 수 있는 메인 무대, 질의응답 영상이 재생되는 VIP 라운지까지 구현돼 행사 자료와 공간의 연결이 강화됐다. [06:50]
4. 후원 구간은 로컬 결과물을 온라인에 배포하는 문제를 다룬다
- Hostinger Connector는 편집기와 호스팅 계정을 연결하는 무료 확장 기능으로 묶인다. 한 번 로그인하면 에이전트가 편집기 안에서 사이트 배포, 도메인 연결, DNS 설정, VPS 확인을 수행할 수 있다는 설명이다. [07:44]
- 광고 조건으로 모든 Hostinger 플랜의 Connector 무료 제공, Unlimited 플랜의 할인 코드 적용 시 10% 할인, 1년 무료 도메인과 비즈니스 이메일이 제시됐다. [08:10]
5. High는 출입 조건과 세부 공간을 추가하면서 Medium보다 빨리 완료된다
- 브랜드 로고와 배경 효과를 갖춘 시작 화면, 연사별 깃발, 자동 유리문이 구현됐다. 방문 장소를 기록하는 패스포트와 자료 벽도 추가됐고, 부스에서는 실제 영상이 재생됐다. [09:03]
- VIP 구역에는 손목밴드 확인 절차와 개별 브레이크아웃 룸이 있다. 애프터파티는 실제 녹화 영상, 댄스 플로어, DJ 부스를 결합했지만 일부 그래픽 오류가 남았다. 메인 무대에서는 발언 자막도 표시됐다. [10:00]
6. Extra는 대화·착석·자료 활용으로 참여 경험을 확장한다
- 등장인물과 행사 내용에 관해 대화할 수 있고, 극장에서는 다음 세션을 안내한다. 다만 외부 배너는 연사별 구분 없이 반복되며, 지도도 이전 결과물보다 장소 설명이 부족하다. [11:25]
- 워크숍은 입장하면 영상이 시작되고, 빈자리에 앉거나 일어나 다른 자리로 옮길 수 있다. 사진 촬영 공간에서는 포즈를 취할 수 있으며, VIP 공간에서는 워크시트를 받아 가격 책정에 활용하는 등 단순 관람보다 구체적인 상호작용이 가능하다. [13:19]
7. Max는 기능과 검증 횟수가 늘어도 품질 향상을 보장하지 못한다
- 브랜드에 맞는 시작 화면과 입장 애니메이션이 있지만, 걷는 동작이 부자연스럽고 입장 시 그림자가 급격히 바뀐다. 사진 저장 기능과 대표자·슬라이드를 갖춘 부스는 좋은 평가를 받았으나, 지도 설명이 부족하고 일부 극장 영상은 재생되지 않았다. [15:09]
- 메인 무대에서는 세션을 바꾸고 관객석에 앉을 수 있으며, VIP 층으로 가는 에스컬레이터와 배지 확인 절차도 있다. 반면 이동 경로를 인물이 막고, VIP 작업 공간에서는 착석이 되지 않으며, 공간이 비정상적으로 드러나는 오류도 발생했다. 최종적으로 당시 가장 선호하는 결과물은 Extra로 정리됐다. [17:09]
8. Ultra Code의 초반부는 자연스러운 이동과 명확한 안내가 돋보인다
- 호스트용 전체 접근 배지와 시작 화면을 갖췄고, 걷는 동작은 현실적이라는 평가를 받았다. 로고에는 작은 빨간 점이 빠졌지만, 지도는 장소 이름을 더 명확하게 표시했다. [18:00]
- VIP 손목밴드를 받은 뒤에는 로비 동쪽 벽의 게이트에서 스캔하라는 구체적인 안내가 나온다. VIP 룸에서는 영상과 발언 자막이 함께 표시되고 오디오도 재생된다. [18:22]
9. 행사장 분위기와 부가 기능은 풍부하지만 이동·착석에는 결함이 있다
- 애프터파티에서는 질문·답변 영상이 재생되고, 엑스포에는 여러 부스와 던질 수 있는 농구공이 있다. 메인 무대에 들어가면 재생이 시작되고 통로 옆 좌석에도 앉을 수 있지만, 무대 위에 사람이 없는 점은 이전 버전보다 아쉽다 [20:07]
- 사람들과 대화할 수 있고 워크숍의 발표 음성도 들리지만, 기초 트랙에서는 앉기가 작동하지 않는다. 이동 중에도 걷기가 막히는 문제가 나타나 공간 탐색의 완성도를 떨어뜨린다 [20:45]
10. Ultracode는 비교적 저렴했지만 기대한 실행 방식은 확인되지 않는다
- 이번 Ultracode 실행은 1시간 35분, 18.69달러가 들었다. Max보다 훨씬 빠르고 저렴하며 High보다는 조금 비싸고 Extra보다는 저렴했다. 토큰은 60만 6천 개를 사용했고, 추가 질문 없이 검사 42회를 수행했다 [21:36]
- 확인한 실행 중 서브에이전트를 사용한 사례는 없었다. 작업을 위임하지 않았으므로 토큰 사용은 해당 세션에서 발생한 것으로 드러난다 [21:49]
11. 노력 수준을 높이면 자원 소모는 늘지만 품질 우위가 보장되지는 않는다
- 최저·최고 비용은 약 3.98달러와 50.38달러로 회고되며, 비용 격차는 12.9배, 검사 횟수 격차는 2.3배로 드러난다. 여섯 번의 실행에 든 총비용은 127달러다 [23:08]
- Low는 빠르고 저렴하고 Max는 느리고 비싸다. 전반적으로 노력 수준이 올라갈수록 실행 시간, API 비용, 토큰 사용량, 검사 횟수도 증가하지만, 빠르고 저렴하다는 이유만으로 최선의 결과물이라고 판단할 수는 없다 [24:07]
12. Extra가 상호작용과 비용 대비 완성도에서 최종 선택을 받는다
- Extra는 사람들과 대화하고 원하는 곳에 앉았다 일어날 수 있으며, 모의 디스커버리 콜 공간과 기념품·토트백도 갖췄다. 다만 VIP 애프터파티는 없는 것으로 보이고, VIP 공간은 앉을 수 있는 방들 외에는 다른 결과물보다 특별한 경험을 주지 못한다 [25:35]
- 최종 승자는 Extra다. 시간과 비용이 Max의 약 절반인데도 더 만족스러웠으며, Max의 추가 비용에 상응하는 개선은 느끼지 못했다. High는 프롬프트 한두 번을 더 주면 나아질 가능성이 있지만, 한 번의
/goal실행 결과로는 Extra가 특히 좋은 평가를 받는다 [25:57]
🧾 결론
- 이번 과제의 최종 선호는 Extra였다. Max보다 비용과 시간이 적게 들면서도 대화와 착석 등 핵심 상호작용에서 더 만족스러웠다.
- 에포트 상승은 품질의 일관된 상승을 보장하지 않았다. 검증 횟수 역시 실제 사용 중 드러나는 결함을 대신 평가해 주지 못했다.
- 영상은 일반 지식 작업에서는 Medium을 유용하게 보면서도, 여러 자료를 하나의 공간 경험으로 구성하는 이번 작업은 Extra에서 이어가겠다고 결론 내렸다.
📈 투자·시사 포인트
- AI 개발 도구의 경제성은 토큰 투입량보다 원하는 기능을 어느 수준까지 완성했는지와 함께 평가할 필요가 있다. 이번 사례에서는 가장 비싼 결과물이 최종 선택을 받지 못했다.
- 작업별 에포트 선택이 비용 관리의 변수다. 일반 지식 작업과 복잡한 가상 공간 제작에 동일한 설정을 적용하기보다, 요구하는 상호작용과 완성도를 기준으로 비교할 수 있다.
- 모델뿐 아니라 실행 환경의 실제 동작도 살펴야 한다. Ultra Code의 동적 워크플로가 확인되지 않아, 이번 결과만으로 해당 방식의 효과를 판단하기 어렵다.
- 제시된 비용은 실제 구독 지출이 아니라 API 과금 기준 환산치다. 도입 예산에 적용하려면 사용 중인 요금 체계와 구분해야 한다.
⚠️ 불확실하거나 확인이 필요한 부분
- 동일 과제의 비교이지만 설정별 반복 실험과 결과 분산은 제시되지 않았다. Extra의 우위를 다른 앱이나 작업에도 일반화하기 어렵다.
- Low 비용은 개별 결과에서 3.91달러, 마지막 회고에서 약 3.98달러로 다르게 나온다. 여섯 실행의 총비용 127달러도 반올림된 회고 수치로 구분해 볼 필요가 있다.
- Ultra Code의 동적 워크플로 미작동 원인은 확정되지 않았다. Claude Code 하네스 문제인지 Opus 5.5와의 조합 문제인지는 추가 확인이 필요하다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 같은 자료와 프롬프트로 Medium·High·Extra를 비교하고, 필요한 기능의 성공 여부를 기준으로 시작 설정을 선택한다.
- 영상 재생, 이동 방해, 벽 통과, 착석, 출입 조건을 직접 확인하는 사용자 동선 점검표를 만든다.
- 실행 시간·토큰·API 환산 비용과 실제 구독 지출을 구분해 기록한다.
- Ultra Code를 평가할 때 로그에서 동적 워크플로와 서브에이전트 실행 여부를 확인한다.
❓ 열린 질문
- High에 후속 프롬프트를 한두 번 추가하면 Extra보다 적은 총비용으로 비슷한 완성도에 도달할 수 있을까?
- 동적 워크플로가 정상 작동하는 Ultra Code는 이번 결과와 비교해 품질·시간·비용이 어떻게 달라질까?
- 검증 횟수를 늘리는 대신 이동·착석·재생 같은 실제 사용자 동선에 검증을 집중하면 남은 결함을 더 잘 줄일 수 있을까?