YouTubeCraig Hewitt·2026년 9월 24일·0

Don''t Buy a $12,000 Mac Studio M5 Ultra for Local AI (Do This Instead)

Quick Summary

로컬 AI용 1만 2,000달러 Mac Studio M5 Ultra를 바로 사기보다, GPU를 빌려 실제 업무의 품질과 대기 시간을 시험한 뒤 구매를 판단하자는 영상이다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Don''t Buy a $12,000 Mac Studio M5 Ultra for Local AI (Do This Instead) 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Don''t Buy a $12,000 Mac Studio M5 Ultra for Local AI (Do This Instead)의 핵심 내용을 4단계로 요약한 인포그래픽
Don''t Buy a $12,000 Mac Studio M5 Ultra for Local AI (Do This Instead) 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

로컬 AI용 1만 2,000달러 Mac Studio M5 Ultra를 바로 사기보다, GPU를 빌려 실제 업무의 품질과 대기 시간을 시험한 뒤 구매를 판단하자는 영상이다.

📌 핵심 요점

  1. 구매보다 실험이 먼저다. 발표자는 Vast AI에서 96GB 메모리의 RTX Pro 6000을 임대해, 전사에서 ‘Qwen 3.8 27B’로 소개한 모델이 자신의 업무를 처리할 수 있는지 확인한다.
  2. 앞선 두 과제는 결과가 비슷하고 속도는 달랐다. 고객지원 이메일과 주간 업무계획에서 발표자는 Qwen과 Claude Opus 5.5의 결과를 대체로 동등하게 평가했지만, Qwen의 대기 시간이 길었다.
  3. 불완전한 데이터로 판단하는 과제에서는 차이가 드러났다. 마케팅 예산 배분에서 두 모델의 권고가 갈렸고, 제3의 모델을 통한 평가에서는 Opus가 수치 비창작과 제약 준수에서 더 낫다는 판정이 나왔다.
  4. 로컬 모델의 적합성은 업무의 시간 민감도에 달려 있다. 발표자는 즉각적인 협업보다 비용 분류, 분석, 전사 같은 반복·비동기 작업에 활용할 가능성을 높게 본다.
  5. 최신 장비만이 선택지는 아니다. GPU 임대, 구형 Mac Studio, 단일 고용량 GPU, 여러 GPU 구성을 비교하되 메모리 용량·대역폭·구성 복잡도·실제 사용시간을 함께 보자는 제안이다.

🧩 배경과 문제 정의

발표자는 로컬 AI를 위해 고가의 Mac Studio를 사고 싶지만, 실제 업무에서 원하는 결과를 얻을 수 있을지 먼저 확인하려 한다. 문제는 단순히 모델을 실행할 수 있느냐가 아니라, 출력 품질과 대기 시간이 구매비를 정당화하느냐다.

이를 알아보기 위해 Vast AI에서 RTX Pro 6000을 임대하고, Open Code에 연결한 Qwen과 Claude Opus 5.5에 세 가지 가상 업무를 맡긴다. 여기서 ‘로컬 모델’은 개인 컴퓨터에서 직접 실행한 시연이 아니라, 임대 GPU에 올려 구동한 모델을 가리킨다. 따라서 이 실험은 모델의 업무 적합성을 살피는 자료이며 Mac Studio의 실제 성능 검증과는 구분해야 한다.

🕒 시간순 섹션별 상세정리

1. 고가 장비를 사기 전에 확인할 질문

  • 발표자는 로컬 AI용 Mac Studio M5 Ultra에 관심을 보이면서도, 약 1만 2,000달러 지출을 실제 업무 성과가 정당화하는지 묻는다. 구매 전 시험이 이번 영상의 출발점이다. [00:34]
  • 대안으로 GPU를 임대해 Alibaba의 오픈 웨이트 모델로 소개한 Qwen 3.8 27B를 시험하고, Nvidia RTX 6000 계열 장비를 활용한다고 보여준다. [00:55]

2. 구매 가격과 메모리 구성 비교

  • RTX 6000의 판매가를 약 1만 5,670달러로 제시하며, 카드 외에도 본체와 냉각 등 추가 구성이 필요하다고 짚어 본다. [01:13]
  • Mac의 96GB 구성과 256GB 구성을 비교하면서 필요한 메모리 수준이 구매 가격을 크게 바꾼다고 보여준다. 가격·가용성은 영상 속 주장으로 드러난다. [01:36]

3. Vast AI에서 GPU를 임대하는 방식

  • Vast AI의 모델 라이브러리에서 모델을 선택하고 배포하는 흐름을 보여준 뒤, 미국에 있는 96GB RTX Pro 6000 인스턴스를 사용한다고 보여준다. [02:28]
  • 임대료를 시간당 약 1.5~2달러로 소개하고, 하루 몇 시간만 사용한다면 장비를 대부분의 시간 동안 놀리는 것보다 임대가 나을 수 있는지 따져본다. [03:00]

4. Open Code 연결과 첫 비교 준비

  • 발표자는 Codex에 브라우저와 컴퓨터 조작을 요청해 Vast 계정과 Open Code의 사용자 지정 모델 연결을 설정했다고 드러낸다. 구체적인 연결 절차를 직접 설명하지는 않는다. [03:48]
  • 첫 과제는 엄격한 규칙과 제목을 갖춘 고객지원 이메일 작성이다. 같은 입력을 Claude Opus 5.5에도 전달하고 Medium 설정으로 비교한다. [04:25]

5. 고객지원 이메일의 속도 차이

  • 정밀한 시간 측정 도구를 쓰지 않는 비교라고 밝히며, Claude가 먼저 이메일을 완성했다고 관찰한다. [04:50]
  • 환불 요구와 서비스 문제를 다룬 상황은 가상의 예시라고 보여준다. Qwen이 계속 실행되는 동안 임대 대시보드로 돌아간다. [05:43]
  • 대시보드 설명에는 앞선 요금과 다른 ‘24달러/시간’ 표현이 나오며, 인스턴스를 일시정지·종료·삭제할 수 있다고 덧붙인다. [06:15]

6. 첫 과제는 품질상 무승부로 평가

  • Qwen도 문제 인정, 환불 가능 범위, 대안, 고객 이탈 시 위험을 담은 답변을 작성한다. 발표자는 시간이 더 걸렸지만 결과는 Claude와 비슷하다고 평가한다. [07:13]
  • 고객지원처럼 몇 분의 지연을 허용할 수 있는 업무를 상정하고, Qwen의 소요 시간을 3분 12초로 언급하면서 첫 비교를 무승부로 정리한다. [07:33]

7. 주간 계획 과제와 Claude의 응답

  • 두 번째 과제는 정돈되지 않은 입력을 바탕으로 월요일부터 금요일까지 실행할 계획을 만드는 것이다. 제작 업무 20시간, 현금, 마케팅 예산, 돌발 상황 등이 나온다. [08:08]
  • Claude는 광고 수락 여부, 콘텐츠 제작 일정, 예산, 하지 않을 일과 미확인 사항을 정리한다. 발표자는 모르는 정보를 질문으로 남기는 점을 긍정적으로 본다. [10:07]

8. 기다리는 대화보다 비동기 작업에 주목

  • Qwen의 응답을 기다리며, 발표자는 로컬 모델을 대화창에서 계속 기다리는 방식보다 Hermes 같은 에이전트로 운영하는 것이 더 적합할 수 있다고 드러낸다. [10:50]
  • 비용 분류, 유튜브 채널 점검, SEO 분석, 월말 정산 등을 새벽에 처리하는 예를 든다. 즉각적인 상호작용이 필요한 작업에는 빠른 모델을 선호한다. [11:44]

9. 메모리 용량과 대역폭의 구분

  • 발표자는 M5 Ultra에 대한 기대의 이유로 메모리 대역폭을 들며, 영상 속 비교 수치로 614GB/s와 약 1.2TB/s를 제시한다. 이는 실제 기기 측정 결과로 제시된 것은 아니다. [12:29]
  • 양자화를 모델 크기를 줄이는 방법으로 간단히 소개하고, 시험 모델에 약 96GB가 필요하다고 보여준다. 이어 메모리가 많다고 반드시 빨라지는 것은 아니라며 대역폭을 강조한다. [13:09]

10. 두 번째 과제의 결과와 활용 범위

  • Qwen도 광고 판단, 주간 일정, 예산, 금지 목록과 미확인 질문을 생성한다. 발표자는 Claude와 전반적으로 비슷하며, 일부 계약자 메시지는 유용하다고 평가한다. [14:43]
  • 복잡한 계획 과제보다 분류, 전사 등 반복적이고 독립적으로 처리할 수 있는 작업을 주로 맡기고 싶다고 정리한다. [15:17]

11. 수치를 지어내지 않는 마케팅 판단 시험

  • 세 번째 과제는 주어진 숫자만으로 하나의 마케팅 권고를 내리는 것이다. CPM·CTR·전환율·LTV 등을 임의로 만들지 말고, 누락된 정보는 ‘모름’으로 표시하도록 요구한다. [16:08]
  • 먼저 답한 Opus는 500달러를 세 개의 정적 광고를 사용하는 하나의 Meta 캠페인에 투입하라고 권고하고, 판단을 바꿀 미확인 정보와 3시간 실행계획을 제시한다. [16:43]

12. GPU 구매의 다른 선택지

  • Qwen을 기다리며 RTX 5090 여러 장을 묶는 구성도 보여준다. 영상에서는 32GB 카드 세 장으로 96GB를 구성하는 비용 예시를 제시하지만 실제 가격 검증은 하지 않는다. [18:21]
  • Mac의 통합 메모리, 여러 GPU 사이의 전송 속도, 단일 RTX Pro 6000의 단순함과 용량 한계, GPU 추가에 따른 확장성을 비교한다. Vast에서 여러 GPU 구성도 임대할 수 있다고 드러낸다. [19:23]

13. 세 번째 과제에서 갈린 권고

  • Qwen은 새 정적 광고 세 개보다 성과가 확인된 기존 유기적 영상 하나에 500달러를 집중하고, 3시간을 추적 개선에 쓰라고 권고한다. 발표자는 처음의 반응을 수정해 Opus와 다른 답이라고 확인한다. [19:46]
  • 두 모델의 판단이 갈리자 원래 질문과 양쪽 응답을 제3의 모델에 전달해 어느 쪽이 더 정확하고 완전한지 평가받기로 한다. [20:57]

14. 제3의 모델 평가와 Opus 우세 판정

  • 원래 프롬프트와 두 응답을 Codex에 넣어 비교를 진행한다. 평가 기준은 제약 준수, 수학적 정확성, 추론의 강도, 증거가 권고를 뒷받침하는지 여부다. [22:39]
  • 평가 결과는 Opus가 더 낫다는 것이다. 영상에서 읽어주는 이유는 수치 비창작 규칙 준수, 비교 조건의 불일치 발견, 더 설득력 있는 실험 논리다. [23:36]
  • Qwen도 데이터 부족을 짚는 장점이 있지만 근거 없는 가정으로 이를 약화했다고 평가된다. 발표자는 전체 결과를 두 번의 무승부와 마지막 Opus 승리로 정리한다. [24:17]

15. 실험의 의미와 이전 세대 장비 검토

  • 발표자는 임대 GPU의 Qwen도 실무에 활용할 만하다고 결론 내린다. 다만 지출액을 ‘10달러 중 282달러’로 읽는 부분은 전사상 불일치가 있어 정확한 시험 비용을 확정하기 어렵다. [24:46]
  • 반복·비동기 업무에 로컬 모델을 활용할 이유로 비용, 프라이버시, 소유권과 주권을 든다. 1만 2,000달러 신형 대신 이전 세대 장비를 살 가능성이 높다고 드러낸다. [25:56]
  • 이어 M4 Mac Studio의 128GB 메모리·4TB 저장장치 구성을 약 7,000달러 사례로 검토하며, 속도가 덜 중요하다면 대안이 될 수 있다고 평가한다. [26:45]

16. 실제 업무로 시험한 뒤 결정하라는 마무리

  • 마지막 권고는 Vast 같은 서비스에서 장비를 한 시간 임대하고, Open Code나 Hermes·OpenClaw 같은 환경으로 자신의 실제 업무를 시험해 보라는 것이다. [27:18]
  • 이미지, 음성 전사, 영상 편집, 컴퓨터 사용 등은 이번 비교에 포함하지 않았다고 덧붙이고 후속 시연을 예고한다. 제공된 전사는 예고 도중 끝난다. [27:35]

🧾 결론

  • 영상의 핵심은 특정 장비의 구매 금지보다, 큰 지출 전에 자신의 업무로 모델을 검증하라는 것이다.
  • 세 가지 시연에서 발표자의 최종 평가는 두 번의 무승부와 한 번의 Opus 우세였다. 이를 모든 업무에서의 성능 동등성으로 확대할 수는 없다.
  • 응답을 기다려야 하는 대화형 작업과 밤사이 처리해도 되는 반복 작업은 서로 다른 속도 기준으로 평가할 필요가 있다.
  • 발표자는 최종적으로 고가 신형 구매에는 부정적이며, 이전 세대 Mac Studio와 단기 GPU 임대를 대안으로 제시한다.

📈 투자·시사 포인트

  • 장비 투자: 실제 가동시간이 짧다면 유휴 장비를 소유하는 비용과 필요할 때 임대하는 비용을 비교할 가치가 있다. 다만 영상의 요금 표기가 일관되지 않아 확정적인 손익분기점은 계산하기 어렵다.
  • 업무 운영: 모든 작업을 가장 빠른 모델에 맡기기보다, 지연을 허용할 수 있는 반복 작업을 별도로 분리하는 방식이 검토 대상이다.
  • 하드웨어 선택: 모델을 담을 메모리 용량과 처리 속도에 관련된 메모리 대역폭을 구분해야 한다. 영상은 여러 GPU를 연결할 때 전송 속도와 운영 복잡도도 고려한다.
  • 통제와 소유: 발표자는 로컬 모델의 장점으로 비용·프라이버시·소유권과 주권을 꼽는다. 그러나 이번 시연은 원격 데이터센터의 임대 GPU에서 진행돼, 개인 장비 내 실행과 같은 조건을 검증한 것은 아니다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 제품·모델 표기: Mac Studio M5 Ultra의 출시·배송 시점과 사양, Qwen 3.8 27B, Opus 5.5 등의 명칭은 제공된 전사의 표현이다. 전사 안에서도 Qwen·Quinn과 매개변수 표기가 흔들려 정확한 제품과 모델 식별이 필요하다.
  • 비용 불일치: 임대료는 시간당 약 1.5~2달러로 설명되지만 중간에는 24달러/시간, 마지막에는 10달러 충전액 중 282달러를 썼다는 표현이 나온다. 소수점이나 단위 오류 가능성이 있으나 원문만으로 정정할 수 없다.
  • 벤치마크 한계: 세 가지 가상 업무를 중심으로 한 시연이며, 정밀 시간 측정이나 반복 실험을 하지 않았다고 발표자가 밝힌다. 실제 Mac Studio를 구동한 비교도 아니다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 고객지원 답변, 주간 계획, 불완전한 데이터에 따른 의사결정처럼 자신의 실제 업무를 대표하는 입력을 준비한다.
  • GPU 임대 전에 정확한 모델명, 메모리 요구량, 실행 설정, 시간당 요금과 중지·삭제 시 과금 조건을 확인한다.
  • 같은 입력으로 출력 품질, 제약 준수, 계산 정확성, 응답 대기 시간을 기록하고 허용 기준과 비교한다.
  • 즉시 응답이 필요한 작업과 야간·비동기 처리가 가능한 작업을 나눠 각각의 활용 가능성을 판단한다.

❓ 열린 질문

  • 자신의 업무에서 어느 정도의 지연까지 허용할 수 있으며, 그 범위 안에서 Qwen의 결과가 충분히 정확한가?
  • 정확한 요금과 월간 사용시간을 적용하면 GPU 임대와 장비 구매의 비용 관계는 어떻게 달라지는가?
  • 같은 모델을 구매 후보 Mac Studio에서 실행하면 임대 RTX Pro 6000과 속도·운영 편의성이 얼마나 달라지는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.