YouTubeAlex Ziskind·2026년 9월 22일·0

M5 Ultra…Apple Wasn''t Messing Around

Quick Summary

영상에서 M5 Ultra는 M3 Ultra 대비 답변 생성 약 1.5배, 긴 프롬프트 처리 최대 약 4.2배의 성능을 보였지만, 구매 가치는 높은 가격과 전력·소음 부담을 감수할 작업량에 달려 있다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

M5 Ultra…Apple Wasn''t Messing Around 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

M5 Ultra…Apple Wasn''t Messing Around의 핵심 내용을 4단계로 요약한 인포그래픽
M5 Ultra…Apple Wasn''t Messing Around 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

영상에서 M5 Ultra는 M3 Ultra 대비 답변 생성 약 1.5배, 긴 프롬프트 처리 최대 약 4.2배의 성능을 보였지만, 구매 가치는 높은 가격과 전력·소음 부담을 감수할 작업량에 달려 있다.

📌 핵심 요점

  1. 비교 조건은 동일한 Llama CPP·MLX 빌드와 모델 파일이다. 리뷰용 M5 Ultra는 80코어 GPU, 256GB 메모리, 8TB 저장장치 구성으로, 발표자가 제시한 가격은 14,299달러다.
  2. GPU 메모리 대역폭 실측은 M3 Ultra 724GB/s, M5 Ultra 1,039GB/s로 약 1.4배 차이다. 여러 모델의 답변 생성 속도도 대체로 약 1.4~1.5배 개선됐다.
  3. 가장 큰 변화는 프롬프트 처리다. 영상에서 DeepSeek 계열 모델은 483→1,485토큰/초, GPT OSS 120B는 약 1,300→3,200토큰/초, 밀집 모델은 430→1,800토큰/초를 기록했다.
  4. 약 4배의 개선은 긴 입력에서 나타났다. 14,000토큰 입력 처리는 33초→8초였지만, 약 350토큰의 짧은 입력에서는 개선 폭이 약 1.6배였다. 일반 대화보다 여러 소스 파일을 읽는 코딩 에이전트에 의미가 크다는 평가다.
  5. 성능 향상에는 비용이 따른다. 생성 중 보고된 칩 전력은 36W→45W였고, 고강도 GPU 작업에서는 M5 Ultra의 전력·발열·팬 소음이 더 컸다. 일반 개발 작업만을 위한 구매는 과하다는 것이 발표자의 판단이다.

🧩 배경과 문제 정의

이 영상은 Apple이 제시했다는 M5 Ultra의 로컬 AI 최대 4.3배, 저장장치 2배, CPU 1.3배 성능 향상을 M3 Ultra와의 실기 비교로 살펴본다. 핵심 질문은 사양표의 개선이 개발 작업과 로컬 LLM 사용에서 어떤 시간 절감으로 이어지는가다.

발표자는 두 장비에 동일한 Llama CPP·MLX 빌드와 모델 파일을 사용했다고 설명한다. 분석의 중심은 입력을 읽는 프롬프트 처리와 답변을 만드는 토큰 생성의 구분이다. 영상은 전자를 GPU 연산, 후자를 메모리 대역폭과 주로 연결하며, 모델 구조와 입력 길이에 따른 차이를 확인한다. 아래 수치는 제공된 전사 속 주장과 측정 결과를 정리한 것이다.

🕒 시간순 섹션별 상세정리

1. 성능 주장과 비교 장비 소개

  • 발표자는 M5 Ultra의 로컬 AI 최대 4.3배, 저장장치 2배, CPU 1.3배 향상이라는 주장을 소개하고 실제 성능을 확인하겠다고 드러낸다. [00:18]
  • 테스트 구성은 80코어 GPU·256GB 메모리·8TB 저장장치이며, 구성 가격은 14,299달러로 드러난다. M5 Ultra는 Apple 대여 장비라고 공개한다. [00:57]
  • CPU는 총 36코어라고 설명하며, 비교의 공정성을 위해 같은 Llama CPP·MLX 빌드와 모델 파일을 사용했다고 드러낸다. [01:32]

2. 개발 작업과 저장장치 성능

  • Speedometer 점수는 47→60.2, 대규모 .NET 컴파일 시간은 71.7초→52.4초다. 발표자는 일반 개발 용도만으로는 이 장비가 과하다고 평가한다. [02:35]
  • Python 테스트는 10.25초→5.8초로 줄었다. 저장장치 순차 읽기는 M3 Ultra 약 6,500MB/s, M5 Ultra 14,888MB/s로 제시되며 큰 모델을 불러오는 시간과 연결된다. [04:02]
  • 편집자는 앞서 표시한 쓰기 속도가 지나치게 낮았다며 재측정을 알린다. 두 장비 모두 8TB 드라이브라는 조건은 확인되지만 수정된 속도는 전사에 없다. [04:18]

3. 로컬 LLM의 두 병목과 가속 경로

  • 프롬프트 처리는 입력을 읽는 단계로 GPU 연산의 영향을, 토큰 생성은 답변을 쓰는 단계로 메모리 대역폭의 영향을 주로 받는다고 보여준다. [04:51]
  • M5에서는 GPU 코어마다 신경망 가속기가 있으며, 동일한 Llama CPP 빌드에서도 이를 활용하는 실행 경로가 활성화된다고 보여준다. [05:40]
  • 개인정보 삭제 서비스의 후원 구간이 계속된다. 데이터 브로커 삭제 요청과 재확인을 소개하면서 정부 기록이나 소셜 게시물은 삭제 대상이 아니라고 설명한 뒤 본론으로 돌아온다. [06:53]

4. CPU와 GPU 메모리 대역폭 실측

  • CPU 기반 STREAM Triad 측정은 M3 Ultra 312.9GB/s, M5 Ultra 583.6GB/s다. 발표자는 이 결과가 GPU 측 대역폭 측정과 다르다고 구분한다. [07:32]
  • GPU 측 측정은 724→1,039GB/s로 약 1.4배 증가했다. 발표자는 이 차이가 토큰 생성 속도에도 반영될지 질문한다. [08:05]

5. 모델별 답변 생성과 입력 처리 비교

  • 영상에서 DeepSeek V4 Flash로 소개한 모델은 토큰 생성 37→53토큰/초, 프롬프트 처리 483→1,485토큰/초를 기록한다. [08:59]
  • GPT OSS 120B는 생성 90→130토큰/초, 프롬프트 처리 약 1,300→3,200토큰/초다. 기존 문맥 64,000토큰에 32,000토큰을 추가하는 작업은 80초→56초였다. [09:56]
  • 이어진 밀집 모델은 생성 37→54토큰/초, 프롬프트 처리 430→1,800토큰/초다. 14,000토큰 입력은 33초→8초로 줄었고, 발표자는 약 4.2배 개선이라고 평가한다. [11:22]

6. 입력 길이와 전력·소음의 제약

  • 프롬프트 처리 개선 폭은 약 350토큰에서 1.6배, 1,700토큰에서 3.4배이며, 약 4,500토큰부터 네 배 수준에 도달한다고 보여준다. 여러 파일을 입력하는 작업에서 차이가 더 뚜렷하다는 평가다. [12:04]
  • 생성 중 CPU·GPU 보고 전력은 36→45W이고 토큰당 전력 효율 개선은 약 12%라고 드러낸다. 고강도 GPU 부하에서는 M3 Ultra가 약 200W, M5 Ultra가 400W 이상으로 표시된다. [12:41]
  • 지속 부하에서 M5 Ultra의 팬 소리가 더 잘 들리고 발열도 크다고 관찰한다. 제시된 온도는 센서 위치가 전사에 명확히 설명되지 않는다. [13:24]

7. 메모리 용량과 최종 평가

  • 이날 실행한 모델은 모두 256GB에 들어갔다. 발표자는 더 큰 모델을 위한 512GB 구성과 클러스터링을 언급하며, 용량 확대에는 높은 비용이 따를 것이라고 드러낸다. [14:06]
  • 최종 평가는 토큰 생성 약 1.5배, 프롬프트 처리 2~4배 개선이다. 특히 코딩 에이전트에서 차이를 느낄 수 있다고 강조한다. [14:15]
  • 동시 요청 8개에서 75→134토큰/초라는 예비 결과를 제시하고, MLX·Llama CPP 및 8비트 모델의 추가 비교를 예고한다. 이후 M5 Max 관련 영상을 안내하며 마무리한다. [14:42]

🧾 결론

  • 영상의 측정 결과는 M5 Ultra의 로컬 AI 성능 향상을 뒷받침하지만, 모든 작업이 네 배 빨라진다는 의미는 아니다.
  • 답변 생성은 메모리 대역폭 증가에 가까운 개선을, 긴 입력 처리는 더 큰 개선을 보였다. 두 지표를 분리해야 체감 성능을 예측할 수 있다.
  • 이번 영상은 초기 리뷰다. 동시 요청 처리, MLX와 Llama CPP 비교, 8비트 모델에 대한 추가 검증이 예고됐다.

📈 투자·시사 포인트

  • 로컬 AI 장비의 경제성은 최대 성능보다 실제 입력 길이와 사용 빈도로 판단필요가 있다. 긴 문서·코드 입력이 반복될수록 처리 시간 단축의 가치가 커질 수 있다.
  • 하드웨어 가속 기능과 소프트웨어 지원의 결합이 중요하다. 영상은 M5 GPU의 신경망 가속기를 활용하는 Llama CPP 실행 경로를 성능 변화의 배경으로 설명한다.
  • 장비 예산에는 구매 가격뿐 아니라 메모리 용량, 지속 부하의 전력과 소음도 함께 반영해야 한다. 더 큰 모델을 실행하려면 속도보다 수용 가능한 메모리 용량이 먼저 문제가 될 수 있다.
  • 이 영상에는 판매량·수익성·주가 평가 자료가 없다. 제품 벤치마크만으로 Apple의 실적이나 투자 수익을 판단할 근거는 부족하다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 제품 출시 여부, 공식 사양과 가격은 제공된 전사 밖에서 확인되지 않았다. 특히 시작 가격이 전사에 '$54.99'로 표시되어 있어 이를 정상적인 제품 가격으로 인용하기 어렵다.
  • M3 Ultra의 초기 저장장치 쓰기 속도는 편집자가 너무 낮게 측정됐다고 정정한다. 재측정 값이 전사에 제시되지 않아 최초 수치로 쓰기 성능 배수를 확정할 수 없다.
  • 일부 모델명과 Python 테스트명이 불명확하게 전사됐다. 정확한 모델 버전, 양자화 설정, 실행 명령과 반복 측정 분산도 전사만으로는 재현하기 어렵다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 구매 판단 전에 공식 제품 정보에서 구성별 가격, 메모리 옵션과 공급 시점을 확인한다.
  • 자신의 대표 작업을 짧은 대화, 긴 코드 입력, 긴 기존 문맥에 추가 입력하는 경우로 나누고 처리 시간을 비교한다.
  • 동일 모델 파일과 실행 설정에서 프롬프트 처리량·답변 생성량·전체 대기 시간을 각각 기록한다.
  • 저장장치 재측정 결과와 정확한 모델명·양자화·벤치마크 명령을 확인한 뒤 수치를 재사용한다.

❓ 열린 질문

  • 동일 모델에서 MLX와 Llama CPP의 차이는 입력 길이와 양자화 설정에 따라 얼마나 달라지는가?
  • 동시 요청 8개의 처리량 증가는 개별 요청의 응답 지연과 메모리 사용량에 어떤 영향을 주는가?
  • 영상에서 예고한 512GB 구성은 더 큰 모델에서 어떤 성능과 비용 효율을 보일 것인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.