[LIVE] Mac Studio 2대 연결해서 돌려보기 with M5 Ultra, 512GB 통합 메모리
Quick Summary
Mac Studio 두 대를 연결한 M5 Ultra·M3 Ultra 합계 512GB 구성은 대형 GLM 모델 실행에 성공했지만, 메모리 확대가 속도 두 배를 보장하지는 않았다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽
![[LIVE] Mac Studio 2대 연결해서 돌려보기 with M5 Ultra, 512GB 통합 메모리 내용을 설명하는 본문 이미지](/_next/image?url=%2Fpage-asset%2Fyoutube%2Fconnect-two-mac-studio-machines%2F4107.poster.png%3Fv%3D7f23bb35e1194177&w=1536&q=75)
🖼️ 4컷 인포그래픽
![[LIVE] Mac Studio 2대 연결해서 돌려보기 with M5 Ultra, 512GB 통합 메모리의 핵심 내용을 4단계로 요약한 인포그래픽](/_next/image?url=%2Fpage-asset%2Fyoutube%2Fconnect-two-mac-studio-machines%2F4107.4cut.png%3Fv%3D7f23bb35e1194177&w=1536&q=75)
💡 한 줄 결론
Mac Studio 두 대를 연결한 M5 Ultra·M3 Ultra 합계 512GB 구성은 대형 GLM 모델 실행에 성공했지만, 메모리 확대가 속도 두 배를 보장하지는 않았다.
📌 핵심 요점
- 실제 구성은 각각 256GB 메모리를 갖춘 M5 Ultra와 M3 Ultra를 Thunderbolt 5로 연결한 것이다. M5 Ultra 두 대나 512GB 단일 장비의 실험이 아니며, 핵심 효용은 한 대에 들어가지 않는 모델을 나눠 적재하는 데 있다.
- 방송 최종 보고서에서 743B로 소개한 GLM 5.3의 4비트 양자화 모델은 두 대의 RDMA 분산 실행으로 초당 25.3토큰을 기록했다. 첫 측정 실패 뒤 재실행에 성공했지만, 후속 대화 시연에서는 로딩과 응답 대기가 있어 실시간 코딩에는 답답할 수 있다는 평가가 나왔다.
- 초기 Qwen 측정에서 생성 속도는 M5 Ultra 단독 19.8토큰/초에서 RDMA 연결 시 23.2토큰/초로 늘었다. 반면 프리필은 느린 M3 Ultra와 장비 간 동기화의 영향을 받았다. 긴 입력을 처리하는 작업과 긴 답변을 생성하는 작업은 유리한 구성이 다를 수 있다.
- 연결만으로 모든 모델이 분산 실행되지는 않는다. 모델과 실행 엔진의 텐서 병렬 지원이 필요하며, H3 영상 생성은 M5 한 대에서 실행됐다. H3는 메모리에 상주시킨 Turbo LoRA·4스텝 조건에서 5초 영상을 32.8초에 생성했지만, 720p·5초·4스텝 조건에서는 193초가 걸렸다.
- 방송에서 테스트한 M5 Ultra 한 대의 가격은 약 2,100만 원으로 제시됐다. 최종 구매 판단은 저렴한 전기료보다 실제 사용량과 보안 필요성에 무게를 뒀으며, 성능과 비용만 고려하면 클라우드 구독이 더 저렴하다는 평가로 정리됐다.
🧩 배경과 문제 정의
- 대형 오픈웨이트 AI 모델을 로컬에서 실행할 때 필요한 메모리 용량과 실제 추론 속도, 장비 비용을 검토한다. Mac Studio 두 대를 연결해 합계 512GB 메모리 구성에서 실행 가능한 모델과 성능을 확인하는 것이 핵심이다.
- 실험 장비는 각각 256GB 메모리를 갖춘 M5 Ultra와 M3 Ultra다. 서로 다른 세대를 연결하므로 메모리 용량 확대와 속도 향상이 같은 비율로 나타나는지 구분해야 한다.
- 단독 실행과 분산 실행을 비교하고, 입력을 처리하는 프리필과 답변을 생성하는 디코드의 성능 차이를 살핀다. 연결 방식과 느린 장비의 영향도 비교 대상이다.
- 자막에는 모델명과 일부 장비명이 일관되지 않게 등장한다. 초기 측정값, 출시 예정 정보, 전기요금 추정은 각각 확정된 최종 결과와 구분해 해석해야 한다.
🕒 시간순 섹션별 상세정리
1. Mac Studio 두 대로 대형 모델의 실행 한계 확인
- Mac Studio 두 대를 연결해 어떤 모델을 어느 속도로 실행할 수 있는지 시험한다. 구매를 고려하는 이용자가 성능을 판단할 수 있도록 실제 실행과 요청 모델 테스트를 진행할 계획이다 [01:19]
- M5 Ultra 장비는 Apple에서 대여받았으며, 자막상 출시 예정일은 9월 22일이다. 출시를 약 한 시간 앞두고 시험하는 상황이다 [02:10]
2. M5 Ultra와 M3 Ultra의 혼합 구성과 병목
- M5 Ultra 장비의 메모리는 256GB이며, 연결 상대는 같은 세대가 아닌 M3 Ultra다. 사전 시험에서는 두 장비가 연결됐지만 M3 Ultra가 성능을 제한하는 경향이 있었다 [02:51]
- DGX Spark의 통합 메모리는 128GB로 드러난다. 메모리 용량만 비교하면 두 대가 있어야 256GB Mac Studio 한 대에 해당한다 [03:41]
3. 메모리 확장성과 DGX Spark의 가격 비교
- DGX Spark 가격은 800만~950만 원대로 확인하며, 두 대 구성에 해당하는 비용을 대략 1,000만~2,000만 원 범위로 언급한다. Mac Studio와의 가격 차이는 실제 사양을 맞춰 검토해야 한다 [04:45]
- Mac Studio의 최대 통합 메모리는 512GB로 소개되지만, 대여 장비는 256GB다. 512GB 옵션은 추후 출시 예정이며, 현재 실험에서는 두 대를 연결해 합계 512GB를 활용한다 [05:11]
4. M5 계열의 성능 기대와 2,100만 원 구성
- LM Studio에서 M5 Max의 첫 토큰 생성 성능이 M1 Max 대비 10.7배 빠르다는 수치가 드러난다. 이는 이번 M5 Ultra 실험의 실측 결과가 아닌 제품 성능 소개에 해당한다 [06:08]
- 선택한 M5 Ultra 구성은 CPU 36코어, GPU 80코어, 메모리 256GB이며, 512GB 모델은 10월 말 출시 예정으로 나온다 [06:50]
5. 서버 GPU 대비 메모리 용량의 가치와 납기
- 비교 대상으로 든 H100은 메모리 약 80GB, 가격 4,000만~5,000만 원으로 나온다. Mac Studio의 큰 메모리는 가중치와 매개변수가 많은 모델을 담는 데 유리할 것으로 기대하지만, 실행 속도는 별도로 검증해야 한다 [07:50]
- 주문 시 배송까지 16~18주가 걸리는 것으로 확인한다. 연구소의 Mac mini 대량 구매 이야기도 나오지만, 이는 들은 소문 수준이다 [08:39]
6. Thunderbolt 5 연결과 로컬 실행의 비용 조건
- 두 장비는 Thunderbolt 5 케이블로 연결했다. 양쪽에서 Claude Code를 이용해 설정을 조정하고 재부팅한 뒤 연결이 작동했다 [09:23]
- Thunderbolt 5가 병목이 될 가능성은 아직 가설이며 측정으로 확인할 대상이다. 고가 장비 구매보다 API 이용이 저렴할 수 있지만, 로컬 모델을 지속적으로 실행하는 전문 용도에는 활용 가치가 있을 것으로 본다 [10:17]
7. 대용량 모델 다운로드와 접근 권한 준비
- 다운로드한 Qwen 2.5 72B는 약 51GB로 제시되며, 256GB 장비에서 여유 있게 실행할 수 있는 대상으로 분류한다 [11:41]
- Qwen-VL-Image 2.1, DeepSeek, Tencent Hunyuan, MiniMax 관련 모델도 시험 후보에 포함한다. DeepSeek은 483GB라는 용량을 거론하며 합계 512GB 구성에서 실행 가능한지 확인하려 한다 [12:14]
8. 소비자 GPU의 메모리 한계와 단독·분산 비교 착수
- 약 51GB 모델은 VRAM 약 32GB로 소개한 5090 한 장에 담기 어렵지만, 256GB 통합 메모리 장비에는 수용할 수 있다. 다만 이 대목에서는 앞서 72B로 부른 모델을 32B라고도 지칭해 모델명이 일치하지 않는다 [14:04]
- M5 Ultra 단독 실행과 M3 Ultra를 연결한 실행의 성능 차이를 비교하도록 요청한다. 두 대로 나누면 더 빨라질 것이라는 기대를 실제 측정으로 확인하는 단계다 [14:49]
9. Mac용 추론 패키지와 네 가지 벤치마크 조건
- MiniMax 관련 MLX 패키지와 Mac용 추론 구현을 확인한다. NVIDIA보다 추론이 느릴 가능성을 예상하지만, 별도 구현에서의 실제 속도는 아직 확인되지 않았다 [15:18]
- 실행 중인 모델은 이 시점에서 Qwen 3.8로 지칭한다. 비교 조건은 M5 Ultra 단독, M3 Ultra 단독, TCP 기반 텐서 병렬, RDMA 기반 두 대 연결의 네 가지이며, 4비트 버전으로 측정한다 [17:13]
10. RDMA의 역할과 추가 모델의 실행 가능성
- RDMA는 네트워크로 연결된 다른 컴퓨터의 메모리를 CPU나 운영체제의 개입 없이 직접 읽고 쓰는 고속 통신 기술로 드러난다. 적용 여부에 따른 성능 차이를 비교한다 [17:42]
- 4비트 변환은 완료됐지만 벤치마크 결과 파일은 아직 없으며, 작업은 정상 실행 중인 상태다 [18:42]
11. 초기 실측에서 확인한 단독 실행과 RDMA 성능
- 전체 32회 중 3회 측정이 끝난 시점에 전체 소요 시간을 30~40분으로 예상한다. 초기 결과에서 Qwen 3.8 27B의 M5 Ultra 단독 생성 속도는 초당 19.8토큰, 메모리 사용량은 54.9GB다 [19:52]
- M3 Ultra 단독 생성 속도는 초당 13.6토큰이며, 프리필은 초당 371토큰이다. 초기 비교에서는 M5 Ultra의 프리필 향상이 특히 두드러진다 [20:23]
12. Flash-Next의 분산 지원 제한과 프리필의 의미
- Flash-Next는 M5 Ultra 한 대에서 실행 가능하지만, 사용 중인 엔진이 두 대 분산 실행을 지원하지 않는 것으로 확인한다. 장비 연결 여부 외에 모델과 엔진의 지원 범위가 제약으로 작용한다 [21:45]
- 프리필은 답변 생성 전에 입력 프롬프트 전체를 처리하고 계산 결과를 KV 캐시에 저장하는 단계다. 이용자가 체감하는 첫 글자 출력까지의 대기 시간과 관련된다 [22:14]
13. 프리필과 디코드의 병목 차이가 바꾸는 장비 선택
- 디코드는 토큰을 생성할 때마다 모델 가중치를 읽어야 하므로 메모리 대역폭이 병목이라는 설명이 나온다. 이에 따라 GPU 계산 성능 향상이 프리필과 생성 속도에 동일하게 반영되지는 않는다 [23:16]
- 텐서 병렬에서는 두 Mac이 매 계층마다 서로를 기다려야 하므로, 혼합 구성의 프리필이 M3 Ultra에 제한된다. 두 대 연결이 M5 Ultra 단독보다 느려지는 결과도 이 특성과 연결한다 [24:09]
14. 후속 모델 실행 준비와 결과 확인 방식 조정
- Hugging Face 토큰 적용 여부에 따라 다운로드 속도 차이가 있어 토큰을 적용해 다시 다운로드한다. 후속 실행 대상으로 GLM 5.3과 Qwen 3.8 Flash-Next를 선택한다 [24:51]
- 관련 모델의 국가 선택과 이용 약관 동의를 진행하고 필요한 접근 권한을 확인한다. 이 구간에서는 후속 모델의 성능 결과가 아직 나오지 않는다 [25:20]
15. 상시 로컬 추론의 경제성과 전기요금 추정
- 초기 장비 비용을 지불한 뒤 전기요금을 부담하며 로컬 모델을 계속 실행하는 사용 방식을 제안한다. 특히 하루 종일 토큰을 생성하고 보안이 중요한 업무에서 구매 가치가 있을 것으로 본다 [27:44]
- LLM을 하루 종일 실행할 때의 전기요금을 추정하도록 요청한다. 500W라는 언급은 나오지만, 이 구간에 실제 소비전력을 측정한 결과는 없다 [28:14]
16. 로컬 서버의 경제성은 전기료보다 사용량과 보안 수요에 달려 있다
- 간헐적으로 에이전트 작업을 실행하면 월 전기료가 약 1만 원, 24시간 가동하면 약 8만~9만 원이라는 추정이 나온다. 두 대를 최대 부하로 돌려도 약 10만 원이라는 설명이지만, 실제 청구액을 검증한 결과는 아니다 [30:23]
- 장비 구매에는 약 2천만 원이 필요하므로 먼저 토큰 사용량을 계산해야 한다. 외부 서버로 보낼 수 없는 민감한 작업을 얼마나 수행하는지가 비용 대비 효용을 좌우한다 [30:53]
17. 기업용 장비 선택과 소형 모델의 단일 장비 실행
- 기업의 로컬 AI 장비 후보로 DGX Spark, H100 같은 서버 GPU, Mac Studio가 비교된다. Mac Studio의 주요 가격 경쟁력은 큰 통합 메모리에 있다 [31:25]
- 비교 구성에는 각각 256GB 통합 메모리를 가진 장비 두 대와 Thunderbolt 5 연결이 등장한다. 연결 대역폭은 설명 도중 비트와 바이트 단위가 혼동돼 확정 수치로 받아들이기 어렵다 [32:04]
18. 생성 속도와 프리필은 서로 다른 병목을 가진다
- 토큰 생성은 메모리 대역폭의 영향을 크게 받아 분산의 이점이 생길 수 있지만, 프리필은 연산 성능의 영향을 받아 M3 Ultra가 병목이 될 수 있다. 모델이 가벼울수록 통신 비용도 상대적으로 커진다 [33:47]
- 효율적인 연결에는 RDMA가 중요하다는 설명이 계속된다. 같은 칩 두 대라면 성능이 두 배에 가까워질 수 있다는 기대가 나오지만, M5 두 대 구성의 실측 결과는 아니다 [34:08]
19. 두 대를 연결하는 핵심 목적은 대형 모델을 메모리에 올리는 것이다
- 분산 실행의 실제 목표는 27B급 모델의 가속보다 한 대에 들어가지 않는 GLM 5.3과 DeepSeek 4.1 Flash를 두 장비에 나눠 올리는 데 있다 [34:37]
- DeepSeek 4.1 Flash의 메모리 사용량은 483GB로 나온다. 합계 512GB에서도 간신히 실행될 수 있는 한계에 가까운 크기라는 예상이며, 실행 가능 여부와 속도는 아직 확인되지 않는다 [34:51]
20. 다운로드 병목 때문에 이미지 모델 시험의 우선순위를 줄인다
- GLM과 이미지 모델을 준비하는 과정에서 다운로드가 병목이 된다. H3는 별도의 MLX 버전을 내려받도록 설정한다 [37:26]
- Qwen Image 2.1은 전날 공개된 최신 모델로 소개되지만 다운로드가 약 20분 더 남아 있다. Crea와 LTX는 제외하고 사용 빈도가 높은 H3를 먼저 시험하는 방향으로 범위를 줄인다 [38:36]
21. 이미지 모델의 강점은 투명 배경과 편집이며, 데모 해석에는 주의가 필요하다
- 이미지 모델 소개에서는 생성부터 투명 배경 편집까지 지원하며, 제시된 벤치마크상 Stable Diffusion보다 높다는 평가가 나온다. 다만 이 대목의 자막은 앞서 언급한 Qwen Image 2.1과 Hunyuan Image 2.1 명칭이 혼재한다 [39:46]
- 데모에는 투명 배경, 텍스트 표현, 개체 분리, 가상 착용, 국소 편집이 포함된다. 별도 편집 모델 없이 같은 2.1 모델로 편집까지 지원하는 것으로 이해하지만, 한국어 표현 품질은 아직 불확실하다 [40:49]
22. 창작물의 API 제약도 로컬 실행의 수요가 될 수 있다
- 영화 제작처럼 폭력적인 장면이 필요한 작업에서는 API의 생성 제한이 문제가 될 수 있다. 어떤 콘텐츠를 제작하느냐에 따라 로컬 모델을 운용할 필요가 생긴다는 사용 사례다 [42:08]
23. DGX Spark의 선택 이유는 추론 속도 외에 CUDA 생태계에 있다
- 기존 비교에서는 Mac Ultra의 추론 속도가 DGX Spark보다 빠르다는 평가가 나온다. DGX Spark는 큰 통합 메모리를 갖췄지만 GB10의 속도는 기대보다 느리다는 체감이 덧붙는다 [45:09]
- DGX Spark의 중요한 선택 이유는 CUDA 생태계다. 추론 속도만을 기준으로 하면 Mac이 더 빠를 수 있어, 필요한 소프트웨어 환경과 속도를 함께 따져야 한다 [46:04]
24. 기존 비교 자료에서는 M5 Ultra가 속도와 메모리 용량을 함께 확보한다
- 제시된 비교 자료에서 M5 Ultra의 추론 속도는 RTX 4090과 5090 사이로 읽힌다. 5090보다 느리더라도 큰 통합 메모리가 장점이며, 현재 사용하는 장비의 메모리는 256GB다 [47:31]
- 같은 자료에서 DGX Spark의 추론 속도는 M4 Pro Mac Mini와 비슷한 수준으로 드러난다. M5 Ultra는 M3 Ultra보다도 빠르다는 비교지만, 이 구간에는 모델이나 측정 조건의 상세 정보가 제시되지 않는다 [48:12]
25. 큰 가중치를 다룰 때는 GPU 속도보다 수용 가능한 메모리가 먼저다
- 다운로드가 끝난 GLM 가중치 조각부터 Thunderbolt로 다른 Mac에 복사한다. 두 장비에서 모델을 실행하기 위해 다운로드와 장비 간 복사를 겹쳐 진행하는 방식이다 [50:12]
- 96GB VRAM 안에 들어가는 모델에는 고성능 GPU가 유리할 수 있지만, GLM 5.3처럼 큰 가중치를 실행하려면 더 큰 메모리가 필요하다. Mac Studio 두 대 연결의 강점은 이런 모델을 수용할 메모리 공간이다 [50:46]
26. GLM과 DeepSeek의 평가는 종합 성능과 자동화 성능에서 갈린다
- Artificial Analysis 자료에서 GLM 5.3은 Grok 4.6보다 높은 수준이자 Qwen과 견줄 만한 상위권 오픈웨이트 모델로 평가된다. 이를 로컬에서 실행하면 장비와 전기 비용을 부담하면서 사용할 수 있다는 기대가 나온다 [52:28]
- 512GB Mac Studio가 10월 말 출시되면 최상위 오픈웨이트 모델을 한 대에서 실행할 수 있다는 전망이 드러난다. 이 시점에 해당 단일 장비 구성을 시험한 것은 아니다 [52:39]
27. 4비트 양자화는 메모리를 줄이는 대신 일부 성능을 희생한다
- 실행할 모델은 원본 전체 정밀도 모델이 아니라 4비트 양자화 모델로 파악된다. 로컬 실행 가능성을 평가할 때 양자화 여부도 함께 고려해야 한다 [53:40]
- 찾아본 자료에서는 Q4가 원본 대비 약 94% 수준의 성능을 유지하는 것으로 읽힌다. 원본보다 성능이 떨어진다는 점은 인정하지만, 자막에는 그 비율의 구체적인 평가 조건이 나오지 않는다 [55:01]
28. 로컬 실행의 핵심 가치는 데이터 통제와 반복 사용 비용이다
- 모델을 장비 안에서 실행하면 인터넷을 끊고도 작업할 수 있어 입력 데이터를 외부로 보내지 않는 구성이 가능하다. 기업 기밀처럼 외부 전송을 제한해야 하는 데이터가 주요 활용 대상으로 거론된다 [56:00]
- 장비를 확보한 뒤에는 호출할 때마다 토큰 요금을 내는 대신 전기료 등을 부담하며 반복 실행할 수 있다. 보안과 사용 비용이 클라우드 대화 서비스와 구분되는 핵심 가치다 [56:08]
29. 모델 교체 가능성과 벤치마크 편차를 함께 고려해야 한다
- API 가격 부담과 별개로 오픈웨이트 모델도 계속 개선되므로, 로컬 환경을 구축해 두면 이후 나오는 모델을 올려 사용할 수 있다는 기대가 나온다 [56:50]
- DeepSeek 4.1은 벤치마크별 편차가 크다. 특정 작업에 집중해 학습했을 가능성이 제기되며, 자동화 평가의 높은 점수가 모든 용도에 그대로 적용된다고 보기는 어렵다 [57:09]
30. 다운로드가 끝나도 대형 가중치 전송과 저장 공간이 남는다
- GLM 다운로드는 완료됐지만 두 장비 실행을 위한 가중치 복사가 계속된다. Thunderbolt 5로 전송 중인 용량은 266GB로, 연결 후에도 준비 시간이 상당히 필요하다 [58:18]
- 저장 공간이 512GB라면 대형 모델을 몇 개 내려받는 데도 제약이 생기므로 추가 SSD가 필요할 수 있다. 사용 중인 M5 장비 가격은 약 2,100만 원으로 나온다 [58:50]
31. 추가 LLM 다운로드를 취소하고 H3 영상 생성에 집중
- Qwen 계열의 추가 다운로드 대기를 취소하고, LLM은 GLM까지 시험한 뒤 H3를 실행하기로 한다. 제한된 대기 시간 안에 대형 언어 모델과 영상 생성 양쪽의 활용 가능성을 확인하려는 선택이다. [1:00:42]
- RTX 4090·5090에서도 영상 생성은 가능하지만, 큰 모델을 실행하려는 사용자는 Mac Studio를 고려할 수 있어 영상 생성 속도도 구매 판단의 기준이 된다. [1:01:21]
32. GPU 가격과 비교한 대용량 메모리의 가치
- 검색 화면에서 RTX 5090은 대략 600만~1천만 원, A100은 4천만 원, H100은 4천만~5,700만 원 수준으로 확인된다. 이는 방송 중 확인한 가격이며 제품별 조건을 맞춘 비교는 아니다. [1:02:19]
- Pro 6000은 2,600만~3천만 원과 96GB 메모리로 비교된다. 2천만 원에 256GB를 제공하는 Mac Studio는 큰 모델 가중치를 적재하는 용도에서 가격 대비 용량이 유리하다는 평가다. [1:03:16]
33. 초당 20토큰 안팎의 속도와 로컬 실행의 실용성
- 복사 스트림 수를 늘리자 전송 속도는 개선됐지만, Thunderbolt 5 연결에서 기대한 속도인지는 의문으로 남는다. 구성은 256GB M5 장비와 256GB M3 장비 한 대씩이다. [1:04:01]
- 앞서 확인한 약 20토큰/초, 또는 15~20토큰/초 수준은 실무 사용에 느릴 수 있다. API 비용을 지불하는 대안이 떠오르지만, 로컬 작업이 많거나 보안이 중요한 환경에서는 별도의 활용 목적이 있다. [1:04:34]
34. 클러스터 확장은 메모리보다 통신 효율이 제약
- Ex를 통한 연결에는 이론상 대수 제한이 없다는 정보를 확인하지만, 장비가 늘면 통신과 데이터 동기화 병목으로 효율이 떨어질 수 있다. [1:05:55]
- Mac Studio나 Mac mini 두~네 대가 안정적인 기본 구성으로 제시되며, 현실적인 운용 규모도 이 정도로 판단한다. [1:06:28]
35. Mac mini를 원격 에이전트 실행 장비로 활용
- Mac mini는 API를 연결해 쓰기에 가격 대비 가치가 좋지만, 로컬 모델 실행 성능에는 한계가 있다는 평가다. 실제로 상시 에이전트 실행 장비로 사용하고 있다. [1:08:45]
- Codey에 작업 환경을 준비해 두고 MacBook에서 원격 작업을 지정하면, MacBook을 닫은 뒤에도 Mac mini가 계속 실행한다. 원격 연결의 편리함과 기존 설정이 도구 선택의 이유다. [1:09:55]
36. GLM 병렬 측정 실패와 실행 충돌 가능성
- GLM 5.3의 텐서 병렬 측정을 백그라운드에서 시작하자 시스템이 느려지고 마우스 움직임에도 지연이 나타난다. 복사 작업도 진행 중이어서 자원 사용 상태를 확인할 필요가 생긴다. [1:11:40]
- 첫 GLM 측정은 실패한다. H3와의 동시 실행 충돌 가능성을 의심해 H3부터 실행하고 GLM을 다시 시험하기로 하지만, 원인은 아직 확정되지 않는다. [1:13:45]
37. 두 장비 모니터링으로 H3의 단일 GPU 사용 확인
- 모니터링 화면을 두 Mac Studio의 CPU·GPU·메모리를 함께 보는 형태로 확장한다. H3 실행 중 GPU 사용률은 높지만 메모리 사용량은 작게 나타난다. [1:16:03]
- H3 영상 생성은 M5 한 대의 GPU에서만 실행되고 M3 Ultra는 유휴 상태다. 두 장비를 연결한 구성이라고 해서 해당 영상 작업이 자동으로 분산되지는 않는다. [1:17:47]
38. 첫 H3 영상은 생성에 성공했지만 비교 조건이 다름
- 영상 생성 자체는 완료됐으나 마지막 영상 병합 단계에 필요한 설치가 빠져 약 1분 30초가 추가로 걸린 것으로 드러난다. 결과물은 약 5초 길이이며 소리도 재생된다. [1:18:20]
- 첫 영상의 생성 시간은 121초로 드러난다. 앞선 RTX Pro 시연의 5초대 결과와는 차이가 크지만, 이번에는 16스텝이고 이전 시연은 4스텝이어서 시간을 그대로 비교하기 어렵다. [1:19:11]
39. Turbo LoRA로 영상 생성 시간을 줄이는 방향
- 다음 실험으로 720p와 스텝 증가를 검토하는 동시에, Lightning LoRA 같은 최적화를 적용해 생성 시간을 줄이는 방법을 탐색한다. [1:20:01]
- Fast H3 프로필과 4·8스텝 Turbo LoRA가 후보로 드러난다. 최적화를 적용한 뒤 5초 영상을 만드는 데 얼마나 걸리는지 확인하는 것이 다음 목표다. [1:20:52]
40. GLM 재실행 성공과 두 GPU의 높은 사용률
- H3 최적화를 논의하는 동안 GLM이 실행에 성공한다. 초기 관찰에서는 앞서 약 20토큰/초였던 Qwen 27B보다 생성 속도가 빠르게 나타나지만, 프리필은 더 낮게 보인다. [1:21:24]
- 418GB를 적재할 때마다 약 10분이 걸려, 모델을 올린 상태에서 추가 GLM 측정을 진행한다. [1:22:43]
41. 대용량 메모리와 MoE 구조의 조합
- GLM이 빠른 이유로 MoE 구조가 거론된다. 전체 모델을 담을 메모리를 확보하면서 추론 때 일부 파라미터만 사용하는 방식이 Mac Studio의 대용량 메모리와 잘 맞을 수 있다는 해석이다. [1:23:27]
- 큰 파라미터 모델을 메모리에 적재하되 매번 일부만 사용하면 추론 부담을 줄일 수 있다는 점에서, 이 구성이 MoE 실행에 유리할 가능성이 제기된다. [1:23:56]
42. 다른 대형 모델의 적재 가능성은 실제 검증을 보류
- 코딩 에이전트 성능 자료와 Hugging Face의 397B 모델을 살펴보며, GGUF 형식으로 실행하거나 4비트를 넘어 8비트로도 적재할 수 있을 가능성을 검토한다. 이 구간에서 실제 실행한 결과는 없다. [1:24:53]
- Mac에서 오프라인 실시간 의사결정을 수행하는 별도 사례에는 M3 Max에서 질문 하나를 5ms에 처리한다는 수치가 등장한다. 대형 모델의 추가 다운로드는 오래 걸리므로 이날 실험은 GLM과 H3로 제한한다. [1:26:04]
43. 743B GLM을 두 대에 분산해 초당 25.3토큰 달성
- 최종 보고서에서 GLM 5.3은 743B 파라미터 모델로 드러난다. 한 대에는 들어가지 않아 Thunderbolt 5 RDMA로 두 대에 나눠 실행했으며, 생성 속도는 25.3토큰/초다. [1:26:58]
- 10월 말 512GB 모델이 나오면 한 대에서도 실행할 수 있을 것이라는 전망이 나온다. 현재 단일 장비에서 검증한 결과가 아니라, 노드별 메모리가 약 200GB였다는 관찰에 근거한 예상이다. [1:27:38]
44. 총 파라미터 수보다 토큰당 가중치 읽기량이 중요
- 700B가 넘는 GLM이 Qwen 27B보다 빠른 이유는 총 모델 크기보다 토큰마다 읽는 가중치 양에 달려 있다는 설명이다. 활성 파라미터 약 40B도 비교 요소로 등장한다. [1:28:01]
- 비교 대상인 dense BF16 모델은 토큰마다 약 54GB를 읽는다는 설명이 계속된다. 모델 규모뿐 아니라 구조와 정밀도에 따른 메모리 접근량을 함께 봐야 속도 차이를 이해할 수 있다. [1:28:31]
45. 스트리밍 체감 속도와 혼합 장비 구성의 한계
- 25토큰/초가 대화에서 어느 정도인지 확인하기 위해 텍스트를 실시간 스트리밍으로 표시하는 실험을 준비한다. 백그라운드의 H3 Turbo 버전은 조금 빨라졌다고 관찰되지만 구체적인 시간은 아직 제시되지 않는다. [1:28:47]
- 현재 구성은 M5 Ultra와 M3 Ultra가 섞여 있어 프리필 성능 차이가 클 것으로 예상한다. M3 때문에 프리필이 낮아졌을 가능성과 더 빠른 구성에서의 개선을 전망하지만, 이 구간에서 이를 검증한 추가 측정값은 없다. [1:29:39]
46. GLM 5.3은 실행되지만 실시간 코딩에는 대기 시간이 부담된다
- 모델 로딩에 약 2~3분이 걸리고 GPU 사용률은 100%까지 올라간다. 질문을 보낸 뒤에도 출력까지 기다려야 하며, 프리필이 느린지는 확정되지 않는다 [1:31:37]
- 출력 속도는 약 24.6~25토큰/초다. 이 속도를 감수하면 사용할 수 있지만 실시간 코딩에는 답답할 수 있다는 평가이며, 앞서 실행한 Qwen 27B보다 느리다 [1:32:51]
47. 512GB 한 대와 256GB 두 대의 선택은 속도와 편의성 사이의 절충이다
- 비교 조건은 GLM 5.3을 M5 Ultra 512GB 한 대에서 실행하는 경우와 256GB 두 대를 Thunderbolt 5로 연결하는 경우다. 구매 비용뿐 아니라 두 대 연결이 실제 추론 속도를 높이는지가 핵심이다 [1:34:22]
- Claude의 검색 기반 비교에서는 256GB 두 대가 더 빠르고, 512GB 한 대는 편의성과 호환성에서 유리하다는 결과가 드러난다. 512GB 모델은 10월 말 출시 예정이라 현재 구매 가능한 구성과도 차이가 있다는 설명이다 [1:35:10]
48. 두 대 연결의 효용은 모델의 분산 실행 지원에 좌우된다
- 두 대를 연결해 쓰려면 모델이 텐서 병렬 처리를 지원해야 한다는 제약이 있다. 별도로 운용할 때는 한 대에서 언어 모델을 실행하고 다른 한 대에서 이미지나 영상을 생성하는 활용이 가능하다 [1:36:30]
- GLM은 분산 실행을 지원하지만, 비교 답변에서는 DeepSeek V 4.1 Flash를 공식 MLX LM으로 두 대에 나눠 실행할 수 없다고 제시한다. 따라서 속도를 위해 장비를 추가하더라도 대상 모델의 지원 여부를 확인해야 한다 [1:37:03]
49. H3 벤치마크는 LoRA·스텝·품질 조건을 줄여 비교한다
- H3 비교 항목은 LoRA 적용 여부, 고품질·저품질 설정, 스텝 수다. 앞선 5초 영상 생성은 약 120초, LoRA 적용 시에는 110여 초였으며, 시도할 만하지만 아주 빠른 수준은 아니라는 평가다 [1:38:59]
- 열 가지 구성을 순서대로 실행하는 드라이버를 준비하지만, 전체 비교에 30~50분이 걸릴 것으로 예상되자 조건을 단순화해 보고서를 만들기로 한다 [100:57] [1:40:16]
50. 로컬 장비의 구매 근거는 구독 대비 비용보다 보안에 가깝다
- 3,000만 원을 1년 기준으로 나누면 월 250만 원이어서 여러 Max 계정의 구독료와 비교할 만한 규모다. 최신 모델이 계속 나오는 상황에서는 성능과 비용만 고려할 때 Claude나 GPT 구독이 더 저렴하다는 판단이다 [101:42] [1:48:39]
- 개인정보나 회사 기밀을 외부로 보내면 안 되는 경우에는 인터넷을 끊고 로컬에서 실행하는 방식이 유리하다. 장비가 자산으로 남는다는 반론도 있지만, 로컬 활용의 주된 강점은 보안으로 압축된다 [102:22] [1:48:54]
51. 여러 모델을 운용할 수 있고 H3의 메모리 요구량은 비교적 낮다
- Mac Studio는 단일 LLM 구독과 달리 여러 모델을 내려받아 운용할 수 있다는 활용 가치가 있다. H3 실행 중 메모리 사용량은 약 62GB로, 관찰된 조건에서는 96GB도 충분하다고 평가한다 [103:42] [1:49:24]
- 영상 생성은 GPU를 많이 사용하지만 메모리에는 여유가 있다. 로컬 모델도 도구를 연결하면 웹 검색이나 에이전트 작업을 수행할 수 있다 [104:14] [1:49:39]
52. 대용량 메모리의 자산 가치는 수요 확대를 전제로 한 전망이다
- AI 기업의 메모리 확보 경쟁이 심해지면 512GB Mac Studio의 자산 가치가 높아질 가능성은 인정한다. 다만 현재는 모든 기업이 로컬 AI를 반드시 써야 하는 상황이 아니고 클라우드 비용도 더 저렴하다는 판단이다 [104:57] [1:49:54]
- 수요가 충분히 커지면 중고 가격이 유지되거나 GPU처럼 상승할 수 있지만, Mac Studio가 그만큼의 수요를 확보할지는 불확실하다. NVIDIA GPU는 CUDA 생태계와 학습·연구·게임 등 폭넓은 용도가 있어 수요 기반이 다르다 [105:55] [1:50:09]
53. 메모리에 상주시킨 Turbo LoRA는 5초 영상을 32.8초에 생성한다
- Turbo LoRA를 메모리에 올려 둔 조건에서 4스텝으로 5초 영상을 생성하는 데 32.8초가 걸린다. 앞선 초기 실행보다 크게 짧아진 시간이다 [107:04] [1:50:39]
- 결과물은 프롬프트에 부합한다고 평가한다. 8스텝 결과는 다소 흐릿한 반면 Turbo LoRA는 4스텝에서도 선명하다는 관찰이어서, 이번 비교에서는 적은 스텝으로도 속도와 선명도를 함께 확보한다 [107:27] [1:50:54]
54. 256GB 한 대의 언어 모델 후보로 GLM 5.3 Flash를 검토한다
- 256GB에 들어가는 MoE 모델 후보로 GLM 5.3 Flash의 GGUF 버전을 살펴본다. Flash의 4비트 양자화 모델은 약 200GB 규모라는 설명에 따라 256GB 한 대에서 실행할 만한 후보로 판단한다 [108:30] [1:51:09]
- H3 영상 생성은 MLX 네이티브로 실행한 구성이다. 이후의 속도 비교는 이 Mac 최적화 실행 환경을 전제로 한다 [108:45] [1:51:24]
55. 반복 생성에서는 초기 로딩보다 메모리 상주 여부가 중요하다
- 최초 실행과 모델을 메모리에 유지한 반복 실행의 시간 차이가 크다. 비교 결과는 8스텝 약 47초, 메모리에 상주시킨 Turbo LoRA 약 33초로 압축된다 [109:12] [1:51:39]
- 같은 시드의 결과도 비교하며, 768 고해상도 설정은 생성 시간이 더 길어진다. 빠른 설정의 결과물은 영상 제작에 활용할 만하다는 평가다 [109:43] [1:51:54]
56. 고해상도 결과는 양호하지만 생성 시간이 약 3분으로 늘어난다
- 직접 확인한 결과물은 720p·5초·4스텝 영상이다. 품질은 괜찮다고 평가하지만 생성에는 193초가 걸려, 가장 빠른 약 33초 설정과 처리 시간 차이가 크다 [110:47] [1:52:09]
- 페이징이 발생하는 상황에서는 LoRA가 부담이 되고, 메모리에 올려 둔 상태에서 더 효과적이라는 해석이다. 약 11초의 고정 비용도 언급해 반복 실행 시간에도 기본 오버헤드가 있음을 짚어 본다 [111:06] [1:52:24]
57. 한 대 운용의 후보와 실제 구매 비용을 정리한다
- 두 대를 연결한 GLM 실행과 로컬 영상 생성 테스트를 마쳤으며, 한 대만 사용할 때는 GLM 5.3 Flash가 적합할 것이라는 결론이다. 이 추천은 해당 구간에서 Flash를 추가 실측한 결과는 아니다 [111:29] [1:52:39]
- 방송에서는 M5 Ultra Mac Studio가 당일 공식 출시됐고, 512GB 모델은 10월 말에 나올 예정이라고 보여준다. 로컬 모델을 많이 실행하려는 사용자를 구매 대상으로 본다 [111:59] [1:52:54]
🧾 결론
- 두 대 연결의 확인된 성과는 대용량 모델의 분산 실행이다. 작은 모델의 가속 효과를 모든 모델과 작업에 일반화하기는 어렵다.
- 생성 속도와 첫 출력까지의 대기 시간은 별도로 평가해야 한다. 초당 토큰 수가 높아도 모델 적재와 입력 처리 시간이 길면 대화형 작업의 체감은 달라진다.
- 장비 선택에는 메모리 용량뿐 아니라 모델 구조, 양자화, 실행 엔진, 통신 방식이 함께 작용한다. GLM의 속도는 MoE 구조와 토큰마다 읽는 가중치 양으로 설명됐다.
- 512GB 한 대의 실행 가능성과 GLM 5.3 Flash의 단독 실행 추천은 방송에서 제시한 전망이다. 이번 혼합 구성의 실측 결과와 구분해야 한다.
📈 투자·시사 포인트
- 대용량 통합 메모리는 큰 모델을 적재하려는 수요에 강점이 있다. 다만 메모리 용량 대비 가격이 유리하다는 평가가 전체 작업 성능이나 투자 회수의 우위를 뜻하지는 않는다.
- 로컬 장비의 구매 근거는 외부로 보낼 수 없는 개인정보·회사 기밀과 반복 실행 수요에서 찾아야 한다. 초기 구매비를 제외한 전기료만으로 API·구독 대비 경제성을 판단하기 어렵다.
- DGX Spark와 Mac Studio 비교에는 CUDA 지원과 필요한 소프트웨어 환경을 포함해야 한다. 방송의 속도 비교만으로 장비 선택을 끝내기에는 측정 조건이 부족하다.
- 메모리 수요 증가에 따른 Mac Studio 중고 가격 유지·상승은 조건부 전망이다. CUDA와 여러 활용처를 가진 NVIDIA GPU의 수요 기반을 그대로 적용할 근거는 제시되지 않았다.
⚠️ 불확실하거나 확인이 필요한 부분
- 자막에는 Qwen의 모델명·규모와 이미지 모델 명칭이 혼재한다. 초기에는 4비트 측정으로 설명하지만 후반에는 비교 모델을 dense BF16으로 설명하므로, 정확한 모델과 정밀도는 실행 기록으로 확인해야 한다.
- GLM의 최종 보고서 수치는 25.3토큰/초지만, 후속 시연에서는 약 24.6~25토큰/초와 함께 앞선 Qwen보다 느리다는 평가가 나온다. 초기 측정과 후속 체감 평가의 입력·로딩·실행 조건이 같은지는 확인되지 않는다.
- M5 Ultra 두 대, 512GB 한 대, DeepSeek 대형 모델의 실행 가능성과 속도는 이번 구성에서 직접 검증한 결과가 아니다. 출시 일정과 제품 사양도 방송에서 소개한 정보로 구분해야 한다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 실행하려는 모델의 정확한 버전, 양자화 형식, 필요 메모리와 엔진의 텐서 병렬·RDMA 지원 여부를 확인한다.
- 같은 모델·정밀도·입력·출력 길이로 단독 실행과 분산 실행을 비교하고, 모델 로딩 시간·첫 출력 대기·프리필·생성 속도를 따로 기록한다.
- GLM 실패 원인을 확인할 수 있도록 전체 로그를 보존하고, 가중치 복사나 영상 생성 같은 동시 작업을 분리해 재측정한다.
- 실제 토큰 사용량과 외부 전송 제한 업무를 정리한 뒤 장비 구매비·전기료·저장장치 비용을 API 및 구독 비용과 비교한다.
❓ 열린 질문
- 동일 세대 M5 Ultra 두 대에서는 혼합 구성의 프리필 병목이 얼마나 줄고, 추가 구매비에 걸맞은 성능 향상이 나타날까?
- 512GB 단일 장비와 256GB 두 대에서 같은 GLM 모델을 실행하면 속도·첫 응답 대기·운용 편의성은 어떻게 달라질까?
- 보안 요구와 실제 사용량이 어느 수준일 때 로컬 장비의 총비용이 API·구독보다 유리해질까?