I Plugged RTX Pro 6000 Into a Strix Halo... Didn''t Expect This
Quick Summary
RTX Pro 6000을 Strix Halo 미니 PC에 연결한 결과, Vulkan과 모델 레이어 분할로 AMD·Nvidia 메모리를 함께 사용해 단일 GPU에 담기지 않는 122B 모델까지 실용적인 속도로 구동할 수 있었다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
RTX Pro 6000을 Strix Halo 미니 PC에 연결한 결과, Vulkan과 모델 레이어 분할로 AMD·Nvidia 메모리를 함께 사용해 단일 GPU에 담기지 않는 122B 모델까지 실용적인 속도로 구동할 수 있었다.
📌 핵심 요점
- GMK Tech EVO X3의 Oculink 포트는 최대 63GB/s의 외부 PCIe 연결을 제공해 Strix Halo 미니 PC에 데스크톱 GPU를 추가할 수 있게 한다.
- 내장 GPU의 32B 모델 성능은 이전 X2의 약 11 tokens/s와 X3의 11.2 tokens/s가 거의 같아, 동일 칩 기반의 비교 기준이 유지됐다.
- RTX 5080은 모델이 16GB VRAM 안에 들어갈 때 내장 GPU보다 약 3배 빨랐지만, 용량을 초과하자 약 1.6 tokens/s로 급락해 11.2 tokens/s의 내장 GPU보다 느려졌다.
- 96GB VRAM의 RTX Pro 6000은 32B 모델에서 69 tokens/s를 기록했고, 활성 파라미터가 10B인 122B MoE Q4 모델에서는 121 tokens/s까지 도달했다.
- 130GB 크기의 122B Q8 모델은 Nvidia에 88GB, AMD에 34GB를 배치한 뒤 양쪽 GPU를 모두 통과시키는 방식으로 약 37~38 tokens/s를 기록했다.
🧩 배경과 문제 정의
Strix Halo는 CPU와 GPU가 최대 128GB의 공통 메모리 풀을 공유하는 APU로, 대형 LLM과 이미지 생성 모델을 미니 PC에서 실행할 수 있게 한다. GMK Tech의 EVO X3는 여기에 Oculink 포트를 추가해 데스크톱 Nvidia GPU를 외장으로 연결할 수 있도록 했다.
영상의 핵심 문제는 서로 다른 소프트웨어 스택을 사용하는 AMD와 Nvidia GPU가 하나의 AI 모델을 동시에 처리할 수 있는지, 그리고 두 장치의 메모리를 합쳐 어느 정도 큰 모델까지 실용적인 속도로 실행할 수 있는지 검증하는 것이다.
🕒 시간순 섹션별 상세정리
1. 224GB 혼합 GPU 구성 공개
- Strix Halo의 공유 메모리와 Nvidia GPU를 합친 224GB 그래픽 메모리 구성에서 단일 122B 모델이 실행되며, 두 장치 합산 약 33~34 tokens/s가 표시된다. [00:38]
- Strix Halo는 CPU와 GPU가 최대 128GB 메모리 풀을 공유하는 APU이며, 상당 부분을 GPU에 할당해 LLM과 이미지 생성에 사용할 수 있다고 보여준다. [01:04]
- EVO X3의 Oculink는 최대 63GB/s 외부 PCIe 연결로, 미니 PC에 실제 데스크톱 GPU를 추가하는 확장 통로가 된다. [01:38]
2. X2 기준 재검증과 RTX 5080의 한계
- Llama CPP로 32B 모델을 실행한 결과 X2의 약 11 tokens/s와 X3의 11.2 tokens/s가 거의 같아 이후 비교의 기준점이 확보된다. [03:18]
- 16GB RTX 5080은 모델이 VRAM에 들어갈 때 내장 GPU보다 약 3배 빠르지만, 용량을 초과하면 메모리와 GPU를 모두 사용하면서도 약 1.6 tokens/s로 떨어진다. [04:07]
- 큰 모델에서는 내장 8060이 11.2 tokens/s를 기록해, eGPU의 우위가 모델 적재 가능 여부에 달렸다는 결론이 나온다. [04:18]
3. 두 GPU의 개별 처리량과 다중 에이전트
- Windows에서도 AMD와 Nvidia GPU가 각각 같은 작업을 처리했으며, 단일 에이전트 기준 Nvidia는 87 tokens/s, AMD는 24 tokens/s를 기록한다. [04:59]
- 10개 에이전트를 동시에 실행하자 RTX 5080은 요청당 대체로 69~79 tokens/s를 유지한 반면 AMD는 약 21~22 tokens/s로 더 오래 실행된다. [05:58]
- 이 실험은 작은 모델의 다중 요청 처리에서는 Nvidia GPU가 높은 처리량을 제공하지만, 16GB VRAM은 대형 모델에 제한적이라는 점을 보여준다. [06:08]
4. RTX Pro 6000과 MoE의 성능
- 96GB RTX Pro 6000은 RTX 5080에서 급격히 느려진 32B 모델을 약 69 tokens/s로 처리하며, 내장 GPU보다 약 6배 빠른 성능을 보인다. [06:44]
- 76.5GB 크기의 122B Q4 모델은 121 tokens/s를 기록하는데, 총 122B 중 한 번에 10B만 활성화되는 MoE 구조 덕분에 32B dense 모델보다 빠르다. [07:28]
- 다만 GPU를 연결한 상태에서는 펌웨어가 부팅하지 못해 Linux 진입 후 카드를 켜고 연결하는 비권장 절차와 별도 스크립트가 필요했다. [08:14]
5. 130GB Q8 모델의 AMD·Nvidia 분할
- 단일 GPU에 들어가지 않는 130GB Q8 모델을 Nvidia와 AMD에 나눠 적재하며, Q8의 품질 우위는 기대 사항일 뿐 이 영상에서는 직접 검증하지 않았다고 드러낸다. [09:00]
- Nvidia에 88GB, AMD에 34GB를 배치한 혼합 구성은 약 37~38 tokens/s를 기록하고, 소비전력은 각각 약 150W와 70W로 표시된다. [09:41]
- CUDA와 ROCm은 직접 섞이지 않지만 양쪽 플랫폼에서 동작하는 Vulkan을 공통 런타임으로 사용해 혼합 추론을 구현한다. [10:43]
6. 레이어 분할의 병목과 구매 판단
- 모델 레이어의 약 70%를 Nvidia에, 나머지를 AMD에 배치하며 모든 토큰이 두 GPU를 통과하기 때문에 Oculink 연결 속도가 전체 성능을 제한한다. [11:05]
- 동시 요청 8개에서는 두 GPU 합산 처리량이 약 80 tokens/s까지 증가했고, 작업 중 Pro 6000은 약 130~150W, AMD 시스템은 약 76W를 사용했다. [12:09]
- X3는 Oculink 확장성을 제공하지만 포트 수가 줄고 배치가 다소 불안정하다. eGPU가 필요 없으면 포트가 많은 X2를 선택하라는 결론으로 영상이 끝난다. [13:45]
🧾 결론
- GPU 추론에서는 연산 성능뿐 아니라 모델 전체 또는 주요 레이어를 담을 수 있는 메모리 용량이 실제 처리 속도를 좌우한다.
- CUDA와 ROCm을 직접 결합하지 않아도 양쪽에서 동작하는 Vulkan을 사용하면 AMD·Nvidia 혼합 추론이 가능하다.
- 혼합 GPU 구성은 단일 장치의 메모리 한계를 넘길 수 있지만, 모든 토큰이 두 GPU와 Oculink 연결을 거치므로 인터커넥트가 병목이 된다.
- eGPU 확장이 필요하면 X3의 Oculink가 의미 있지만, 확장이 필요하지 않다면 포트가 더 많은 X2가 합리적인 선택이라는 것이 영상의 구매 결론이다.
📈 투자·시사 포인트
- AI 가속기 경쟁의 핵심 가치는 최고 연산량만이 아니라 VRAM 용량, 모델 적재 능력, 동시 요청 처리량, 소프트웨어 호환성의 조합으로 이동하고 있다.
- MoE 모델은 총 파라미터 규모에 비해 활성 파라미터가 작아, 대용량 메모리와 결합할 경우 더 큰 모델이 오히려 빠르게 실행되는 구조적 이점을 보여준다.
- Oculink가 탑재된 미니 PC는 초기에는 내장 APU를 활용하고 이후 외장 GPU를 추가하는 모듈형 로컬 AI 시스템으로 차별화될 수 있다.
- 다만 RTX Pro 6000의 높은 가격, 최대 600W급 설계, 부팅 호환성 문제는 이 구성을 대중적 완제품보다 고용량 로컬 추론 실험이나 전문 워크로드에 가까운 선택으로 만든다.
⚠️ 불확실하거나 확인이 필요한 부분
- Q8이 낮은 양자화 손실로 더 높은 품질을 제공할 것이라는 설명은 제시됐지만, 영상 제작자는 해당 Q8 모델의 출력 품질을 직접 검증하지 않았다고 밝혔다.
- RTX Pro 6000을 연결한 상태에서는 검은 화면과 부팅 실패가 발생했고, Linux 부팅 후 카드를 켜는 비권장 hot-plug 방식과 별도 스크립트가 필요했다.
- 성능 수치는 특정 모델, 프롬프트, Llama CPP 또는 Vulkan 설정에서 나온 결과이며 반복 횟수, 변동 폭, 출력 품질을 포함한 종합 비교는 제시되지 않았다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 실행하려는 모델의 실제 디스크·메모리 크기를 확인하고 16GB, 96GB 또는 분할 구성 중 어디에 적재할 수 있는지 먼저 계산한다.
- 단일 요청 속도뿐 아니라 여러 에이전트나 사용자를 가정한 동시 요청 처리량을 별도로 측정한다.
- Strix Halo BIOS에서 AMD GPU 메모리를 자동이 아닌 명시적 값으로 할당할 수 있는지 확인한다.
- 고성능 eGPU 구매 전 정상 부팅, Oculink 연결 순서, 운영체제와 Vulkan 런타임 호환성을 실제 장비에서 검증한다.
❓ 열린 질문
- 동일한 122B 모델에서 Q8이 Q4보다 실제 정확도와 응답 품질을 얼마나 개선하며, 37~38 tokens/s로 낮아지는 속도를 정당화할 수 있는가?
- Oculink보다 빠른 인터커넥트를 사용하면 AMD·Nvidia 레이어 분할 성능이 단일 RTX Pro 6000에 얼마나 가까워질 수 있는가?
- 장시간 연속 추론에서도 비권장 hot-plug 구성과 혼합 Vulkan 런타임이 동일한 안정성을 유지할 수 있는가?