ArticleJesse Clayton·2026년 8월 24일·0

How XPUs Meet a World-Class AI Factory

Quick Summary

NVIDIA는 맞춤형 XPU를 검증된 네트워크·랙·소프트웨어와 연결하는 NVLink Fusion을 통해 반맞춤형 AI 팩토리의 성능 향상, 출시 기간 단축, 운영 위험 완화를 추진한다.

How XPUs Meet a World-Class AI Factory 관련 대표 이미지

🖼️ 인포그래픽

How XPUs Meet a World-Class AI Factory 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

How XPUs Meet a World-Class AI Factory의 핵심 내용을 4단계로 요약한 인포그래픽
How XPUs Meet a World-Class AI Factory 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

NVIDIA는 맞춤형 XPU를 검증된 네트워크·랙·소프트웨어와 연결하는 NVLink Fusion을 통해 반맞춤형 AI 팩토리의 성능 향상, 출시 기간 단축, 운영 위험 완화를 추진한다.

📌 핵심 요약

  • AI 팩토리의 경제성은 초당 토큰, 와트당 토큰, 토큰당 비용, 활용률과 가동 시간으로 결정되며, 맞춤형 XPU 개발에는 네트워크·랙·운영 소프트웨어·공급망을 포함한 전체 플랫폼 설계가 필요하다.
  • NVIDIA에 따르면 6세대 NVLink는 72-XPU 도메인에서 기성 이더넷 기반 대안보다 XPU 간 종단 지연 시간이 3분의 1이고 패킷 처리율은 10배이며, NVLink-C2C는 PCIe 인터페이스 대비 최대 6배의 에너지 효율을 제공한다.
  • NVLink Fusion은 설계·CPU·광연결 파트너 생태계와 NVIDIA MGX 랙 아키텍처 및 공급망을 제공해 맞춤형 XPU의 개발·통합·배포를 지원한다.
  • NVLink Fusion의 통합 아키텍처에서는 XPU 기반 시스템과 GPU 기반 시스템이 랙 설치 면적, 네트워크, 냉각, 전력 공급, 관리 시스템을 공유할 수 있어 시설 구축과 가속기 조합 결정을 분리할 수 있다.
  • NVIDIA DSX와 Omniverse DSX는 구축 전 시설·기술 통합 검증을 지원하며, 액체 냉각과 정비 가능한 트레이, NCCL·Dynamo·NIXL·Mission Control은 AI 팩토리의 지속 운영을 뒷받침한다.

🧩 주요 포인트

  1. 초당 토큰·와트당 토큰·토큰당 비용이 경제성의 기준 → XPU 단품 성능과 함께 네트워크 및 지속 운영 능력을 평가해야 한다.
  2. NVLink Fusion과 NVIDIA MGX의 검증된 구성 요소·공급망 활용 → 맞춤형 XPU 개발팀이 전체 플랫폼 통합 부담을 줄이고 핵심 설계에 집중할 수 있다.
  3. XPU·GPU 시스템의 공통 시설 기반과 구축 전 검증 → 가속기 개발 일정에 따른 시설 구축 위험과 운영 중 변경 부담을 완화할 수 있다.

🧠 상세 정리

1. AI 팩토리의 경제성과 전체 플랫폼 설계

원문은 AI 팩토리를 지속적으로 가동하면서 지능을 생산하는 시설로 설명하고, 경제성을 초당 토큰, 와트당 토큰, 토큰당 비용, 활용률과 가동 시간으로 정의한다. 이 기준을 충족하려면 개별 가속기뿐 아니라 시설 전체를 하나의 시스템으로 설계해야 한다. 맞춤형 XPU를 개발하는 하이퍼스케일러와 AI 전문 기업은 스케일업·스케일아웃 네트워크, 랙 구조, 운영 소프트웨어와 공급업체 생태계까지 함께 마련해야 한다. 원문은 이러한 복잡성과 비용을 빠른 시장 진입의 장애물로 지적한다. NVLink Fusion은 맞춤형 XPU에 성숙한 NVIDIA 인프라를 결합해 개발팀이 핵심 혁신에 집중하도록 지원하는 해법으로 제시된다.

2. 스케일업 네트워크의 성능과 성숙도

조 단위 매개변수 모델, 전문가 혼합 구조, 에이전트형 AI에서는 스케일업 네트워크가 연산 속도를 따라가지 못하면 활용률이 떨어지고 토큰당 비용이 높아진다. 원문은 네트워크의 평가 기준으로 종단 성능과 네트워크 내부 연산, 지속적인 상태 감시와 정비 가능성, 대규모 배포로 입증된 플랫폼 성숙도를 제시한다. NVIDIA에 따르면 6세대 NVLink는 72-XPU 도메인에서 기성 이더넷 기반 대안보다 XPU 간 종단 지연 시간이 3분의 1이고 패킷 처리율은 10배다. GB300 NVL72의 처리량과 상호작용 성능 개선도 제시되며, 향후 구성에는 최대 1,152개 가속기 도메인과 공동 패키징 광학 기술이 포함된다. NVLink-C2C는 XPU를 NVIDIA Vera CPU나 생태계의 다른 CPU에 연결하며 PCIe 인터페이스 대비 최대 6배의 에너지 효율을 제공한다고 설명한다.

3. 개발·통합·제조를 지원하는 생태계

맞춤형 XPU를 데이터센터에 배포하려면 고속 CPU 인터페이스 통합, 스케일업 네트워크 조달과 검증, 연산·스위치 트레이 설계 등 다양한 작업이 필요하다. 랙의 냉각과 전력 검증, 보안과 저장장치 통합, 공급업체 관리도 개발 범위에 포함된다. NVLink Fusion 생태계는 ASIC 설계, CPU, 설계 자산과 광연결 파트너를 통해 이러한 개발과 통합을 지원한다. 도입 기업은 NVIDIA MGX 랙 아키텍처와 Vera Rubin NVL72 등 MGX 기반 시스템에 사용되는 공급망을 활용할 수 있으며, 제조 파트너와 공급업체가 설계·통합 및 냉각·전력 구성 요소를 제공한다. QCT와 Quanta Computer 측은 Vera Rubin NVL72 제조의 거의 100% 자동화를 추진하고 있으며, XPU가 NVLink Fusion을 활용하면 해당 투자 대부분을 재사용할 수 있다고 설명한다.

4. 인프라 표준화와 가속기 선택의 유연성

AI 팩토리의 전력 조달, 시설 설계, 냉각, 랙 배치와 네트워크 계획은 최종 가속기 구성이 확정되기 전에 시작된다. 따라서 데이터센터가 특정 칩에 종속되면 해당 칩의 개발 일정이 시설 구축 일정의 위험으로 이어질 수 있다. 원문은 학습, 후속 학습, 추론, 검색과 서비스 제공 등 작업에 따라 XPU·GPU·CPU·LPU의 적합성이 달라질 수 있다고 설명한다. NVLink Fusion의 통합 아키텍처에서는 XPU와 GPU 기반 시스템이 랙 설치 면적, 네트워크, 냉각, 전력 공급과 관리 시스템을 공유할 수 있다. 운영자는 시설 구축을 먼저 진행하고 구체적인 가속기 조합은 나중에 결정하며, 작업 수요와 반도체 공급 및 사업 우선순위 변화에 따라 용량을 재배치할 수 있다.

5. 디지털 트윈을 통한 구축 전 검증

원문은 AI 팩토리 구축에 큰 비용이 들고 설계 실수가 비싼 재작업으로 이어질 수 있으므로, 건설 전에 인프라를 검증해야 한다고 강조한다. NVLink Fusion은 건물, 전력, 냉각, 연산과 네트워크를 공동 설계하는 NVIDIA DSX 참조 아키텍처에 맞춰진다. NVIDIA Omniverse DSX AI Factory Blueprint는 기가와트 규모 AI 팩토리를 위한 디지털 트윈과 개방형 참조 설계를 제공한다. 이를 통해 파트너는 배포 전에 시설과 기술을 함께 모델링할 수 있다. 이 접근은 가속기와 랙만 따로 검토하는 범위를 넘어, 실제 시설에 들어갈 전력·냉각·연산·네트워크 구성을 함께 검증하는 데 초점을 둔다.

6. 정비 가능한 랙과 통합 운영 소프트웨어

랙 수준에서는 정비 가능성도 성능의 일부로 다뤄진다. 참조 연산 트레이는 팬·케이블·호스 없는 100% 액체 냉각 구성이며, 랙의 나머지 부분을 가동한 상태에서 분리할 수 있다. NVLink Switch 트레이도 액체 냉각을 사용하고 정비 중 지속 운영을 지원한다. 소프트웨어 측에서는 NVIDIA NCCL이 분산 작업을, NVIDIA Dynamo와 NIXL이 기능 분리를, NVIDIA Mission Control이 클러스터 관리·원격 측정·디버깅을 지원한다. 원문은 이러한 하드웨어와 소프트웨어의 결합을 통해 운영자가 혼합 AI 인프라를 조율된 시스템으로 운영할 수 있다고 설명한다. 결론적으로 NVLink Fusion은 여러 기업의 강점을 결합한 통합 반맞춤형 AI 팩토리를 구현하는 기반으로 제시된다.

🧾 핵심 주장 / 시사점

  • 원문이 제시하는 경쟁력의 단위는 가속기 단품에서 AI 팩토리 전체로 확장되며, 연산 성능뿐 아니라 활용률과 가동 시간이 경제성을 좌우한다.
  • NVLink Fusion의 가치는 연결 성능에 그치지 않고, 이미 검증된 랙과 제조 생태계를 활용해 맞춤형 XPU의 배포 부담을 줄이는 데 있다.
  • 시설과 가속기 선택을 분리하는 공통 아키텍처는 구축 일정의 유연성을 제공하며, 사전 검증과 운영 소프트웨어가 이를 보완한다.

✅ 액션 아이템

  • 맞춤형 XPU 평가에 초당 토큰, 와트당 토큰, 토큰당 비용, 활용률과 가동 시간을 함께 반영.
  • NVLink Fusion과 NVIDIA MGX의 구성 요소·공급망이 맞춤형 XPU의 개발·통합 부담을 줄일 수 있는 범위 검토.
  • XPU·GPU 시스템의 공통 시설 기반과 NVIDIA DSX의 구축 전 검증을 활용해 시설 구축과 가속기 조합 결정을 분리할 수 있는지 검토.

❓ 열린 질문

  • 맞춤형 XPU에 NVLink Fusion을 적용할 때 초당 토큰, 와트당 토큰, 토큰당 비용과 활용률은 어떻게 달라지는가?
  • NVIDIA MGX의 구성 요소·공급망을 활용하면 맞춤형 XPU의 개발·통합 부담을 어느 범위까지 줄일 수 있는가?
  • XPU·GPU 시스템이 공유하는 시설 기반은 가속기 조합 결정을 어느 범위까지 늦출 수 있게 하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.