YouTubeAlex Ziskind·2026년 9월 6일·0

All That VRAM Needs a Bigger Brain

Quick Summary

많은 VRAM을 갖춘 AI 머신도 여러 코딩 에이전트를 동시에 돌리려면 강한 CPU가 필요하며, 실제 성능은 모델 서버의 대기열까지 함께 살펴야 한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

All That VRAM Needs a Bigger Brain 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

All That VRAM Needs a Bigger Brain의 핵심 내용을 4단계로 요약한 인포그래픽
All That VRAM Needs a Bigger Brain 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

많은 VRAM을 갖춘 AI 머신도 여러 코딩 에이전트를 동시에 돌리려면 강한 CPU가 필요하며, 실제 성능은 모델 서버의 대기열까지 함께 살펴야 한다.

📌 핵심 요점

  1. 제작자는 RTX Pro 6000 네 장을 운용하기 위해 Threadripper 9975, DDR5 128GB, ASUS ProWRX90E Sage 기반 시스템을 조립했다. GPU는 Max-Q 두 장과 워크스테이션 에디션 두 장으로 구성했다.
  2. CPU 코어 수와 GPU 연결 확장성은 구분해야 한다. 영상에서 비교한 Pro CPU들은 PCIe 5.0 레인 128개를 공유하며, 상위 CPU의 추가 코어는 데이터 처리와 여러 작업의 동시 실행을 지원한다.
  3. 코딩 에이전트는 모델 호출 이후에도 컴파일, 테스트, 구문 트리 분석, 해시 계산 등을 수행한다. 제작자는 자신의 측정에서 한 턴의 71%가 GPU 밖에서 진행됐다고 설명한다.
  4. CPU 작업 비교에서 단일 워커는 9700X와 Threadripper가 비슷했지만, 높은 동시성에서는 차이가 커졌다. 제시된 최대 처리량은 각각 분당 568턴과 2,239턴이었다.
  5. 모델 호출을 포함하면 CPU 확장성만으로 해결되지 않았다. 제작자의 구성에서는 16워커를 넘기며 모델 지연이 크게 늘었고, 하나의 서버에 요청이 몰리는 현상을 병목으로 지목했다.

🧩 배경과 문제 정의

제작자는 보관 중이던 RTX Pro 6000과 기존 시스템의 GPU를 모아 네 장을 운용하는 AI 워크스테이션을 만든다. ASUS가 제공한 ET900 AX9 케이스와 ProWRX90E Sage 메인보드가 출발점이며, 이에 맞는 Threadripper Pro CPU를 고르는 과정에서 플랫폼 확장성과 CPU 코어 수의 역할을 설명한다.

문제의 중심은 LLM 활용이 모델 호출에서 코딩 에이전트의 반복 작업으로 넓어졌다는 점이다. GPU가 추론을 맡는 동안 CPU는 컴파일과 테스트 등 후속 작업을 처리한다. 영상은 조립과 부팅을 거쳐 CPU만의 처리 능력과 모델 호출을 포함한 동시 실행 성능을 따로 살펴보며, 비싼 CPU가 필요한 조건을 구분한다.

🕒 시간순 섹션별 상세정리

1. 네 장의 GPU를 위한 새 시스템

  • 보관 중이던 RTX Pro 6000 Max-Q를 꺼내고, 기존 빌드의 워크스테이션 에디션 두 장도 옮길 계획을 드러낸다. Max-Q의 최대 소비전력은 300W로 보여준다. [00:40]
  • ASUS가 제공한 케이스와 메인보드에는 Threadripper Pro가 필요하며, 지난 빌드 이후 LLM 사용 방식이 달라진 것이 업그레이드 배경이라고 보여준다. [01:10]

2. Pro 플랫폼과 CPU 선택 기준

  • 매장에서 일반형과 Pro를 구분하고, 추가 PCIe 레인과 메모리 확장성을 이유로 Pro를 선택한다. 기존 메모리를 재사용할 계획이다. [02:43]
  • 16코어는 입문용, 24코어는 데이터 로딩과 전처리, 32코어는 여러 GPU를 위한 균형점으로 보여준다. 64코어의 가치는 단일 모델의 토큰 속도 배증보다 무거운 처리와 다중 사용자 대응에 있다고 드러낸다. [03:43]

3. 레인 수와 코어 수를 구분하고 냉각기 선택

  • 비교 중인 Pro CPU들은 PCIe 5.0 레인 128개가 같으며, 상위 CPU는 GPU 연결 수보다 GPU를 지원하는 CPU 작업자를 늘리는 역할이라고 보여준다. [04:22]
  • 최대 350W를 소비하는 CPU에 맞는 냉각기를 찾는다. 책상 위 소음을 고려하면서도 성능과 기존 사용 경험을 이유로 SilverStone을 선택한다. [05:26]

4. 최종 구성 소개와 CPU 장착

  • PCIe 5.0 슬롯 일곱 개를 갖춘 보드에 메모리 128GB와 약 4,000달러의 Threadripper 9975를 장착하는 구성을 보여준다. [06:25]
  • 설명서를 확인하며 CPU를 프레임에 넣고 소켓에 고정한 뒤 지정된 순서로 나사를 조인다. [07:38]

5. 메모리 네 개와 SSD 설치

  • 여덟 메모리 채널을 모두 채우지 못해 기존 빌드에서 가져온 모듈 네 개를 사용한다. 장착 슬롯은 설명서를 보며 확인한다. [08:44]
  • 향후 8채널 구성을 희망한다고 밝히고, SSD 슬롯과 방열 패드의 보호 필름을 확인하며 저장장치를 설치한다. [09:43]

6. 전원공급장치 교체와 전력 여유 확보

  • 네 장의 GPU를 위해 메인보드 보조 전원까지 연결해야 한다고 보여준다. PSU 교체 시 기존 케이블을 그대로 쓰지 않고 새 제품의 케이블로 바꾼다. [10:43]
  • 워크스테이션 GPU 두 장은 각각 최대 600W를 소비하므로 전력 여유를 확보하려 한다. 후반에는 교체할 PSU를 3,000W라고 보여준다. [11:50]

7. 수랭 냉각기와 추가 팬 설치

  • SilverStone XC360 TR5를 소개하고, 팬 브래킷과 미리 도포된 서멀 페이스트를 확인하며 설치를 진행한다. [12:30]
  • 추가 Cooler Master 팬을 고르면서 소음, RGB 연결 여부와 금속 그릴을 살펴본다. [13:27]

8. 초기 GPU 장착과 전원 연결 준비

  • 우선 GPU를 장착하고 케이블 길이와 배치를 조정한다. [14:35]
  • 선택한 PSU에는 240V 전원이 필요하다고 보여준다. GPU 두 장으로 먼저 시작하고 정상 작동하면 나머지 두 장을 추가할 계획이다. [15:12]

9. 첫 부팅과 BIOS 점검

  • 초기 부팅에서는 큰 팬 소음이 들리고 메모리 트레이닝을 기다린다. 이후 BIOS를 플래시한 과정과 재부팅 뒤 조용해진 상태를 보여준다. [16:07]
  • BIOS에서 DDR5 128GB와 NVMe 용량이 올바르게 인식되는지 확인하고, 다중 GPU 구성을 위해 Resizable BAR 설정도 점검한다. [16:51]

10. 운영체제 설정과 네 번째 GPU 인식 문제

  • 운영체제 설치를 준비하며 Secure Boot와 Fast Boot를 끈다. 드라이버 갱신 등에 명령을 아는 에이전트를 활용한다고 보여준다. [17:41]
  • GPU를 추가한 뒤 세 장만 보이자 하단 슬롯 연결을 점검한다. 전면 USB·오디오 연결부와의 간섭으로 카드가 제대로 꽂히지 않았으며, 라이저 연결 후 네 장이 인식된다. [18:42]

11. 모델 처리량과 GPU 전력 제한

  • Deepseek V4 Flash를 FP4 전문가·FP8 어텐션 구성으로 실행한다. 영상에 제시된 처리량은 동시성 1에서 초당 33토큰, 2에서 62토큰, 4에서 116토큰, 16에서 364토큰이며 이후 감소한다. [19:21]
  • 네 GPU가 각각 별도의 PCIe 루트 컴플렉스를 사용한다고 보여준다. GPU 최대 소비전력 합계는 1,800W지만 실제 설정에서는 총 1,200W로 제한한다. [20:07]

12. 에이전트 한 턴에서 CPU가 하는 일

  • 실제 작업은 코딩 에이전트이며, 모델 호출 뒤에 스캐폴딩, 컴파일, 테스트, 구문 트리 분석, 해시 계산과 패키징이 이어진다고 보여준다. [20:32]
  • 모델 호출은 GPU가 담당하지만 나머지 단계는 CPU 작업이다. 제작자는 자신의 작업에서 한 턴의 71%가 GPU에서 실행되지 않았다고 제시한다. [21:17]

13. 단일 워커와 다중 워커의 CPU 성능 차이

  • 같은 Zen 5 아키텍처의 8코어 16스레드 AMD 9700X와 비교한다. 단일 워커는 분당 89.7턴 대 85.6턴으로 비슷해, 이 정도 작업이라면 비용을 아끼라고 드러낸다. [22:16]
  • 8워커에서 차이가 나타나고 16워커에서는 Threadripper의 총 소요 시간이 소비자용 CPU의 약 절반으로 드러난다. 최대 처리량은 9700X가 분당 568턴, Threadripper가 64워커에서 분당 2,239턴이다. [23:06]
  • 32워커 효율 지표에서도 차이가 난다고 설명하며 CPU 작업 비교를 마무리한다. [23:27]

14. 모델 호출을 다시 넣자 생긴 대기열

  • 모델 호출을 포함한 실험에서는 16워커를 넘으며 성능이 나빠지고, 평균 모델 지연이 약 0.5초에서 12초로 증가했다고 보고한다. [23:38]
  • CPU 작업은 64스레드에 분산되지만 모델 요청은 네 GPU를 공유하는 하나의 서버에 쌓인다고 해석한다. 다만 자신의 설정에 문제가 있을 가능성도 인정한다. [24:03]

15. 사용 방식에 맞춘 구매 판단과 마무리

  • 로컬 모델에는 GPU가 중요하지만, 클라우드 모델을 호출하는 로컬 에이전트에서는 CPU가 동시에 실행할 작업자 수를 좌우한다고 정리한다. [24:39]
  • 한 번에 하나만 실행한다면 8코어도 32코어와 비슷하므로 비용을 아끼라고 재차 강조한다. 시청자의 구성을 묻고 일반형 TRX 보드의 이전 빌드를 안내하며 끝낸다. [25:00]

🧾 결론

  • 제목의 ‘더 큰 두뇌’는 대용량 VRAM과 다중 GPU를 뒷받침하는 CPU 처리 능력을 뜻한다. 에이전트 작업에서는 모델 추론 외의 실행 단계도 성능을 좌우한다.
  • 단일 에이전트 중심이라면 고가의 다코어 CPU를 구매할 근거가 약하다. 영상의 단일 워커 비교에서는 소비자용 CPU도 비슷한 성능을 냈다.
  • 다수의 에이전트를 동시에 실행할 때는 CPU 코어 수뿐 아니라 모델 서버의 요청 처리 방식과 지연도 함께 확인해야 한다.
  • 네 장의 GPU 인식과 모델 실행에는 성공했지만, 라이저로 연결한 카드의 최종 수납은 해결 과제로 남았다.

📈 투자·시사 포인트

  • 장비 예산은 실제 동시 실행 규모에 맞춰 배분필요가 있다. 영상의 결과는 단일 워커 사용자와 수십 워커 사용자에게 같은 CPU 구매 기준을 적용하기 어렵다는 점을 보여준다.
  • 로컬 모델을 실행한다면 GPU가 우선적인 지출 대상이지만, 클라우드 모델을 호출하는 로컬 에이전트에서는 CPU의 작업 처리 능력이 더 직접적인 구매 판단 기준이 된다.
  • 다중 GPU 시스템의 비용은 그래픽카드에 그치지 않는다. 제작 과정에서는 전원 용량, 입력 전압, 냉각, 메모리 구성, 케이블과 슬롯 간섭까지 고려해야 했다.
  • 이 영상은 개별 시스템의 조립과 성능 실험이다. 제시된 결과만으로 특정 기업의 매출 성장이나 주식 투자 수익을 판단할 수는 없다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 벤치마크 코드, 작업별 입력 규모, 반복 측정과 분산, 모델 서버 설정은 전사에 충분히 제시되지 않는다. 71%의 비GPU 시간과 CPU 처리량 차이를 모든 에이전트 작업에 일반화하기 어렵다.
  • CPU 작업만 비교한 결과와 모델 호출을 포함한 결과는 구분해야 한다. 분당 2,239턴은 실제 모델 호출을 포함한 전체 에이전트 성능으로 제시된 수치가 아니다.
  • 전원공급장치 용량은 앞부분에서 ‘30,000 W’, 뒤에서는 ‘3,000 watts’로 다르게 전사된다. 내용 정리는 후반의 3,000W 설명을 따르되 실제 제품 사양 확인이 필요하다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 자신의 작업을 단일 에이전트 실행과 다중 에이전트 실행으로 나누고, 실제 필요한 동시 워커 수를 먼저 정한다.
  • 모델 호출 시간과 컴파일·테스트 등 CPU 작업 시간을 따로 측정해 업그레이드할 부품을 판단한다.
  • 동시성을 단계적으로 높이며 전체 처리량과 모델 응답 지연을 함께 기록하고, 처리량 증가가 둔화되는 지점을 찾는다.
  • 다중 GPU 조립 전 메인보드 설명서로 슬롯 배치, 메모리 장착 위치, 보조 전원 연결과 카드 간섭을 확인한다.

❓ 열린 질문

  • 동일한 모델과 작업에서 서버의 요청 처리 설정을 바꾸면 16워커 이후의 지연 증가를 얼마나 줄일 수 있을까?
  • 현재 네 개의 메모리 모듈을 사용하는 구성에서 8채널을 모두 채우면 실제 에이전트 처리량은 얼마나 달라질까?
  • GPU 총 전력 제한을 1,200W에서 바꾸면 모델 처리량과 전체 에이전트 턴 처리량은 각각 어떻게 달라질까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.