YouTubeNick Saraev·2026년 10월 8일·0

I Spent 24 Hours Testing Haiku 5.5: Here Are The Results

Quick Summary

Haiku 5.5를 24시간 시험한 결과, 낮은 비용으로 실용적인 결과를 얻었지만 시각 완성도와 오류는 과제에 따라 달랐다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

I Spent 24 Hours Testing Haiku 5.5: Here Are The Results 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

I Spent 24 Hours Testing Haiku 5.5: Here Are The Results의 핵심 내용을 4단계로 요약한 인포그래픽
I Spent 24 Hours Testing Haiku 5.5: Here Are The Results 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Haiku 5.5를 24시간 시험한 결과, 낮은 비용으로 실용적인 결과를 얻었지만 시각 완성도와 오류는 과제에 따라 달랐다.

📌 핵심 요점

  1. 700달러 이상을 사용해 Haiku 5.5, Sonnet 5.5, Opus 5.5를 실제 제작 과제로 비교했다. 같은 프롬프트에서도 결과가 달랐으며, 평가 기준은 품질·생성 속도·비용이었다.
  2. Haiku는 저렴한 비용으로 작동하는 게임과 앱을 만들었다. 복셀 샌드박스는 약 20센트, 개인 재무 앱 Ledgerly는 약 50센트였지만, 지형 탈출과 테마 글자색 같은 문제가 남았다. 낮은 제작비와 완성된 사용 경험은 구분해야 한다.
  3. 시각 품질에서는 상위 모델의 이점이 있었지만 일관된 승자는 없었다. Opus는 시계 출시 사이트와 FPS에서 좋은 결과를 냈고, Sonnet은 교육 영상과 개인 재무 앱에서 더 좋은 평가를 받았다. 일부 과제에서는 Sonnet이 Opus보다 비쌌다.
  4. 부정 회계 조사에서는 세 모델 모두 CSV에 심어 둔 사례 8개를 전부 발견했다. 이 과제에서는 속도·정확도의 뚜렷한 차이가 관찰되지 않았고, Opus 비용은 Haiku의 약 4~5배였다. 다만 이 결과만으로 다른 텍스트 업무에서도 성능이 같다고 단정할 수는 없다.
  5. 최상위 모델이 계획을 세우고 Haiku가 요약·분류·조회·값 검색을 맡는 역할 분담이 제안됐다. 낮은 단가로 같은 예산에서 처리량을 늘리자는 전략이지만, 캐시와 10만 토큰 가격 구간을 활용한 비용 절감 폭은 실제 청구 조건을 확인해야 한다.

🧩 배경과 문제 정의

  • 700달러 이상을 들여 Haiku 5.5, Sonnet 5.5, Opus 5.5의 결과물을 비교한다. 핵심 기준은 품질, 생성 속도, 비용이다.
  • 게임과 3D 세계뿐 아니라 제품 출시 웹사이트, 개인 재무 앱, 부정 회계 조사, 교육 영상까지 실제 제작 과제를 사용한다.
  • 같은 프롬프트를 사용해도 모델별 표현 방식과 완성도가 달라진다. 높은 시각 품질이 추가 비용을 정당화하는지, 저렴한 모델로도 충분한 결과를 얻을 수 있는지가 핵심 문제다.
  • 시연에는 그래픽 설정, 실행 환경의 지연, 한 번의 생성에서 남은 오류가 영향을 준다. 짧은 플레이에서 확인한 기능과 추정에 머문 부분을 구분해야 한다.

🕒 시간순 섹션별 상세정리

1. MOBA 게임에서 드러난 그래픽·비용·실행 부담의 차이

  • 동일한 프롬프트로 만든 Haiku의 게임은 10달러 미만, 약 3시간 46분, 9천만 토큰 이상을 사용했다. 챔피언 선택, 그래픽 설정, 스킬 강화와 사용, 회복 등의 기능이 있으며, 시연에서는 백그라운드 작업 때문에 최저 그래픽 설정을 사용했다. [02:29]
  • Sonnet은 Haiku보다 훨씬 정교한 그래픽을 구현했지만, 미니언 등장 이후 프레임 지연이 발생했다. 전체 게임의 플레이 가능성은 추정에 머물렀으며, Opus는 캐릭터 선택 화면과 주문 효과가 더 정교해도 전체 외형이 Sonnet보다 확실히 낫지는 않았다. [03:55]

2. 서사형 게임에서는 인물 품질보다 세계와 접근성이 만족도를 좌우한다

  • 브레이킹 배드에서 영감을 받은 Haiku 게임은 암 진단을 받은 화학 교사의 이야기에 대화 선택, 우편 확인, 가족과의 상호작용을 결합했다. 집 주변 환경과 목재 질감은 정교했지만, 인물 외형은 배경보다 크게 떨어졌다. [05:55]
  • Sonnet은 뉴멕시코에 더 가까운 분위기와 현금·가족 등의 상태 표시를 구현했다. 다만 일부 상태 지표의 의미는 불분명했고, 정교한 얼굴 이미지와 실제 게임 캐릭터 사이의 품질 차이도 눈에 띄었다. [07:11]

3. 시계 출시 사이트에서 확인한 고급 3D 연출의 가치

  • Haiku는 스크롤에 따라 시계가 분해되고 내부 기구가 드러나는 사이트를 만들었다. 시각 자산도 직접 생성했으며 예약과 FAQ를 갖췄지만, 이탤릭체와 세리프체를 사용하는 익숙한 Claude풍 디자인이 남았다. [09:29]
  • Sonnet은 시계 분해 표현과 부품 확대가 더 정교했다. 앞선 사례들을 함께 보면 Sonnet과 Opus의 품질 차이는 예상보다 작아 보였지만, Sonnet 역시 Haiku보다 높은 품질에 더 많은 비용을 사용했다. [10:03]

4. 부정 회계 조사에서는 세 모델의 실질적 성과가 같았다

  • 대량의 CSV 자료에 심어 둔 부정 회계 사례를 찾는 과제에서 세 모델 모두 8개 중 8개를 발견했다. Haiku는 매입채무 검사와 위험 금액 등을 포함한 감사 결과를 작성했으며, 표현 디자인이 뛰어나지는 않아도 탐지 과제를 완수했다. [11:38]
  • Sonnet과 Opus도 같은 조사 결론에 도달했고, 더 빠르거나 더 정확하다는 뚜렷한 차이는 없었다. Opus의 결과 표시가 조금 더 보기 좋았지만, Haiku와 Sonnet의 비용 차이는 약 20센트였고 Opus 비용은 Haiku의 약 4~5배였다. [12:05]

5. FPS 게임에서는 Opus의 시각 품질과 Sonnet의 높은 비용이 대비된다

  • 모던 워페어에서 영감을 받은 Haiku의 FPS는 적 사격, 수류탄, 섬광탄, 지도 등의 기본 기능을 갖췄다. 다만 수류탄 동작 애니메이션이 없고 텍스처 품질이 낮았으며, 조명과 음영은 비교적 잘 구현됐다. [13:31]
  • Sonnet은 그래픽, 적의 반격, 점프 애니메이션이 더 좋았지만 건물 주변에 시각적 오류가 남았다. 한 번의 생성에서 모든 오류를 없애는 능력보다는 여러 실제 결과의 평균적인 수준을 비교하는 실험이다. [14:23]

6. 비행사 교육 영상에서는 Sonnet이 가장 설득력 있는 시각 결과를 냈다

  • 연과 글라이더부터 수직 착륙하는 재사용 로켓까지 다루는 2분 영상에서 Haiku는 1달러 미만으로 음성과 실시간 SVG 애니메이션을 구현했다. 비행의 역사를 전달했지만, 일부 문장은 소리 내 읽기 어려울 정도로 빠르게 지나갔다. [16:31]
  • Sonnet은 도입부, 다빈치의 노트에 선이 그려지는 장면, 비행기와 로켓 표현이 더 정교했다. 일부 시각적 오류가 있었지만 Haiku보다 높은 시각 완성도를 보였다. [17:15]

7. 복셀 샌드박스는 저렴한 기본 구현과 고급 세계 표현의 격차를 보여 준다

  • Haiku는 약 20센트, 13분, 220만 토큰으로 마인크래프트풍 세계를 만들었다. 블록 설치가 가능하고 기본 외형도 유사했지만, 지형에서 빠져나오기 어려운 상황이 생겼다. [18:52]
  • Sonnet은 더 큰 세계와 원작에 가까운 표현을 구현했고, 손에 든 블록 표시와 블록 변경·설치를 지원했다. 세계 크기가 커진 이유로 메모리 최적화 가능성이 언급됐지만 확인되지는 않았다. [19:34]

8. 개인 재무 앱에서는 Haiku의 실용성과 Sonnet의 디자인 완성도가 갈린다

  • Haiku는 약 50센트, 거의 17분, 700만 토큰으로 Ledgerly를 만들었다. 지출 추가, 분류 변경, 밝은·어두운 테마 전환, 데모 초기화가 가능했지만, 테마를 바꿀 때 일부 글자색이 잘못 표시되는 문제가 있었다. [21:25]
  • Sonnet은 그래프, 저축 목표, 거래 표, 글꼴 조합이 더 정교했고 CSV 내보내기, 오류 상태 시뮬레이션, 데모 데이터와 거래 추가를 제공했다. Haiku보다 훨씬 높은 완성도를 보였지만 비용도 약 5배였다. [22:24]

9. 갓 오브 워풍 액션 게임은 그래픽과 전투 설계에서 차이가 난다

  • Haiku는 약 10달러로 공격·점프·점프 공격이 가능한 게임을 만들었다. 캐릭터에 검은 직사각형처럼 보이는 이상한 표현이 있었고, 강한 점프 공격을 계속 반복하는 것이 유리해 전투 균형이 무너졌다. [24:05]
  • 약 34달러를 사용한 Sonnet은 게임 내 컷신과 더 나은 그래픽, 방어·받아치기·슬로모션을 구현했다. Haiku처럼 점프 공격을 반복하기는 어려웠지만, 공중에 계속 머무를 수 있는 문제가 있었다. [24:57]

10. 진격의 거인과 마인크래프트의 결합에서 Haiku의 품질 편차가 드러난다

  • Haiku의 결합형 게임은 복셀 세계에서 케이블을 이용한 공중 이동과 거인 전투를 구현했다. 앞선 Haiku 샌드박스에 없던 그림자가 생겨 외형이 좋아졌지만, 가스가 떨어진 뒤 보충 방법은 확인되지 않았고 케이블이 끊어지는 위험도 있었다. [26:32]
  • Haiku는 7,200만 토큰을 사용하고도 약 5달러에 이 게임을 만들었다. Sonnet은 도시와 그림자가 더 정교했고 거인 공격도 가능했으며, Haiku보다 적은 토큰으로 약 4.5~5달러를 사용했다. [27:32]

11. 게임의 조작감과 플레이 환경에서 드러난 품질 차이

  • 현재 게임에는 앞선 게임들에 없었던 튜토리얼이 있으며, 조작 반응도 더 빠르고 경쾌하다. 나무 사이를 자유롭게 이동하지 못하는 문제는 게임 자체보다 플레이 숙련도 때문일 수 있다는 평가다. [28:13]
  • 원하는 게임을 직접 만들어 계속 즐길 수 있다는 점은 매력적이다. 앞으로 두세 달 뒤에는 기술이 더 발전하고 게임의 몰입성도 높아질 수 있다는 기대가 계속된다. [28:34]

12. 낮은 단가를 활용한 연구 위임과 반복 작업 전략

  • 제시된 100만 토큰당 입력·출력 가격은 Fable 5.1이 10달러·50달러, Opus 5.5가 4달러·20달러, Sonnet 5.5가 2달러·10달러, Haiku 4.5가 1달러·5달러, Haiku 5.5가 10센트·50센트다. 게임 생성 결과에서는 가격만큼 큰 품질 차이가 보이지 않았으며, Opus의 결과가 Haiku보다 40배 좋다고 보기는 어렵다는 평가다. [30:03]
  • Haiku 5.5는 10만 토큰에 도달하면 입력·출력 가격이 10센트·50센트에서 50센트·250센트로 상승한다. 캐시 읽기 가격이 일반 가격의 10분의 1이고, 같은 세션의 후속 호출은 10만 토큰 이내에서 입력 1센트·출력 5센트가 된다는 설명을 전제로, 약 5,000토큰의 짧은 초기 호출 후 연구를 위임하는 전략이 나온다. 하위 에이전트가 약 10만 토큰에 도달하면 결과를 압축해 새 에이전트로 넘기는 방식으로, Haiku 4.5 대비 비용을 100분의 1 수준까지 낮추고 연구·중간 분석의 품질도 높일 수 있다는 전망이다. [31:52]

🧾 결론

  • Haiku는 저렴한 초안 제작과 반복적인 텍스트 처리에 활용할 가능성을 보여 줬다. 기본 기능을 구현한 뒤 오류를 점검하는 과정이 필요하다.
  • 시각 연출과 디자인이 중요한 과제에서는 추가 비용을 지불할 이유가 있었다. 다만 가장 비싼 모델이 항상 가장 좋은 결과를 내지는 않았다.
  • 모델 선택은 과제별 성공 기준에 맞춰야 한다. 그래픽, 조작감, 탐지 정확도, 처리 시간, 총비용을 따로 비교해야 실용적인 판단이 가능하다.

📈 투자·시사 포인트

  • 영상에 제시된 단가가 실제 사용 조건에서도 적용된다면, 비용 때문에 제한했던 연구와 데이터 처리를 늘릴 여지가 있다. 핵심은 단가 인하가 유효한 결과의 증가로 이어지는지다.
  • 여러 SEO 사이트나 기본 앱을 제작하는 용도에서는 Haiku의 낮은 생성비가 유리할 수 있다. 다만 수정과 검수에 드는 비용까지 포함해 경제성을 판단해야 한다.
  • 고급 3D 연출과 디자인에서는 상위 모델의 가치가 남아 있다. 이 비교는 과제에 따라 저렴한 모델과 상위 모델을 조합하는 운영 전략을 검토할 근거를 제공한다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 시연에는 그래픽 설정, 백그라운드 작업, 실행 환경의 지연이 영향을 줬다. 짧은 플레이와 한 번의 생성 결과만으로 안정성이나 장기 사용 품질을 판단하기 어렵다.
  • 가격표와 캐시 전략은 영상에서 제시한 설명이다. 특히 캐시 읽기 할인과 후속 호출의 출력 가격을 함께 낮게 설명한 부분은 적용 조건을 확인해야 하며, Haiku 4.5 대비 비용을 100분의 1로 낮춘다는 전망도 검증된 결과로 볼 수 없다.
  • 같은 예산을 Haiku에 더 투입했을 때 상위 모델과의 품질 차이가 얼마나 줄어드는지는 확인되지 않았다. 과제별 비용 차이를 고정된 모델 간 배수로 일반화하기도 어렵다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 실제 업무와 가까운 과제를 골라 세 모델에 같은 프롬프트를 제공하고, 기능 성공 여부·오류·처리 시간·비용을 기록한다.
  • 게임과 앱은 시연된 기능 외에도 반복 사용, 테마 전환, 이동과 탈출, 전투 균형 등을 점검한다.
  • 영상의 가격표와 캐시 설명을 실제 적용 가격 및 청구 내역과 대조하고, 10만 토큰 전후의 비용을 확인한다.
  • 상위 모델의 계획과 Haiku의 실행을 결합해 보고, 요약·인계 과정의 정보 손실과 수정 비용까지 비교한다.

❓ 열린 질문

  • 같은 예산으로 Haiku를 반복 생성·수정하면 Sonnet이나 Opus의 시각 품질과 사용 경험에 얼마나 가까워질 수 있을까?
  • 심어 둔 사례를 찾는 과제에서 나타난 동등한 성과가 더 복잡하거나 정답이 불분명한 조사에서도 유지될까?
  • 짧은 초기 호출과 에이전트 간 결과 압축이 실제로 비용을 얼마나 줄이며, 그 과정에서 연구 품질은 유지될까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.