Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agents
Quick Summary
NVIDIA는 SemiAnalysis AgentX의 DeepSeek V4 Pro 초기 측정에서 Vera Rubin NVL72가 GB300 NVL72 대비 메가와트당 처리량 최대 30배와 100만 토큰당 비용 최대 35배 절감을 달성했다고 발표했으며, 결과는 SemiAnalysis 검토 대기 상태다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
NVIDIA는 SemiAnalysis AgentX의 DeepSeek V4 Pro 초기 측정에서 Vera Rubin NVL72가 GB300 NVL72 대비 메가와트당 처리량 최대 30배와 100만 토큰당 비용 최대 35배 절감을 달성했다고 발표했으며, 결과는 SemiAnalysis 검토 대기 상태다.
📌 핵심 요약
- OpenRouter 데이터에 따르면 에이전트형 AI 작업은 단순 채팅 요청보다 토큰을 15배 더 소비하며, 단계마다 문맥이 누적되어 입력이 수십만 토큰에 이를 수 있다.
- NVIDIA는 실제 코딩 세션의 문맥 증가, 도구 호출, 하위 에이전트 생성을 보존한 SemiAnalysis AgentX로 측정했다. DeepSeek V4 Pro에서 GB300 NVL72는 Hopper 대비 메가와트당 처리량 최대 15배, Vera Rubin NVL72는 GB300 NVL72 대비 최대 30배를 기록했다.
- Vera Rubin NVL72의 초기 결과는 SemiAnalysis 검토 대기 상태이며, 도구 호출을 위한 Vera CPU 성능은 아직 반영하지 않았다. NVIDIA는 지속적인 소프트웨어 최적화로 Vera Rubin NVL72와 GB300 NVL72의 성능이 개선될 것이라고 밝혔다.
- NVIDIA는 Vera Rubin NVL72의 100만 토큰당 비용이 GB300 NVL72 대비 최대 35배 낮다고 밝혔다. DSX MaxLPS는 GPU·랙·작업 수준의 전력 관리로 동일한 메가와트 예산에 최대 40% 더 많은 GPU를 배치하도록 지원한다.
- Vera Rubin NVL72는 프리필·디코드 분리, 전문가 병렬화, KV 캐시 관리, CUDA 커널, NVFP4 및 NVLink를 하드웨어·소프트웨어 공동 설계로 결합한다. NVIDIA에 따르면 Vera Rubin은 본격 생산 중이며 파트너 생태계 전반으로 확대되고 있다.
🧩 주요 포인트
- 문맥 누적과 토큰 소비 15배 증가 → 에이전트형 AI의 성능 평가는 단일 추론 요청에서 전체 작업 흐름으로 확장되어야 함.
- 메가와트당 처리량 최대 30배와 100만 토큰당 비용 최대 35배 절감 → 전력 제약이 있는 AI 팩토리의 매출과 이익률에 연결되지만, SemiAnalysis 검토 대기라는 측정 한계를 함께 해석해야 함.
- 프리필·디코드 분리와 KV 캐시 관리를 NVLink 및 소프트웨어와 공동 설계 → 긴 문맥의 재계산과 GPU 대기를 줄이고 에이전트 추론 효율을 높이는 구조.
🧠 상세 정리
1. 에이전트 작업이 늘리는 토큰 수요와 문맥 길이
OpenRouter 데이터에 따르면 에이전트형 AI 작업은 단순 채팅 요청보다 토큰을 15배 더 소비한다. 원문은 투자 판단을 위해 기업을 조사하는 에이전트가 금융 데이터베이스와 뉴스·공시를 검색하고, 하위 에이전트에 동종 기업 비교와 가치평가를 맡긴 뒤 결과를 종합하는 사례를 든다. 작업이 끝날 때까지 추론이 이어지고 이전 단계의 토큰이 다음 단계의 입력에 누적되므로 긴 문맥 처리가 핵심이 된다. 일반적인 채팅이나 문서 요약의 입력·출력은 보통 1천~8천 토큰이지만, 에이전트 세션의 입력은 수십만 토큰에 이를 수 있고 요청별 길이도 크게 달라진다. 이러한 패턴은 소프트웨어 개발, 고객 서비스, 심층 조사에 공통으로 나타나므로 개별 요청뿐 아니라 전체 작업 흐름을 반영한 성능 평가가 필요하다는 설명이다.
2. 실제 코딩 작업을 이용한 성능 비교와 측정 한계
NVIDIA는 실제 에이전트 코딩 세션을 기록한 SemiAnalysis AgentX를 사용해 추론 처리량을 측정했으며, 문맥 증가와 도구 호출, 하위 에이전트 생성 과정을 보존했다. 원문은 Blackwell이 Kimi K3, MiniMax M3, GLM5.3, Qwen3.5, DeepSeek V4 Pro 등 여러 모델에서 선도적인 성능을 보인다고 설명한다. 구체적으로 DeepSeek V4 Pro에서 GB300 NVL72는 Hopper 대비 메가와트당 처리량이 최대 15배 높았고, Vera Rubin NVL72는 GB300 NVL72 대비 최대 30배 높았다. NVIDIA는 GB300의 향상을 더 큰 스케일업 GPU 영역과 공동 설계된 소프트웨어의 효과로 설명하며, Vera Rubin이 파레토 곡선 전반의 성능을 높였다고 밝혔다. 다만 Vera Rubin의 초기 측정은 SemiAnalysis 검토 대기 상태이고 도구 호출에 쓰이는 Vera CPU 성능을 아직 반영하지 않았으며, 두 플랫폼 모두 향후 소프트웨어 최적화에 따른 개선이 예정되어 있다.
3. 전력 예산과 토큰 비용이 만드는 경제적 효과
원문은 전력 제약이 있는 AI 팩토리에서 메가와트당 처리량이 같은 전력 규모로 수행할 수 있는 에이전트 작업량을 결정한다고 설명한다. NVIDIA가 발표한 최대 30배의 처리량 향상은 이 조건에서 같은 에너지 규모로 최대 30배의 작업을 수행한다는 의미로 제시된다. 또한 Vera Rubin NVL72의 100만 토큰당 비용은 GB300 NVL72보다 최대 35배 낮아, 에이전트를 대규모로 지속 운영하는 경제성과 연결된다고 주장한다. 별도로 DSX MaxLPS는 GPU, 랙, 작업 수준에서 전력을 관리해 동일한 메가와트 예산에 최대 40% 더 많은 GPU를 배치하도록 지원한다. 원문은 메가와트당 처리량을 AI 팩토리의 매출에, 100만 토큰당 비용을 해당 매출의 이익률에 연결하며 두 지표를 함께 강조한다.
4. 추론 단계 분리와 문맥 재사용을 통한 효율 개선
Vera Rubin NVL72의 최적화는 문맥을 처리하는 프리필과 응답을 생성하는 디코드를 분리해 각 단계를 독립적으로 확장하는 방식에서 출발한다. 처리 속도 정합은 프리필 GPU와 디코드 GPU의 토큰 처리 속도를 맞추어 효율을 높이며, 대규모 전문가 병렬화는 전문가 혼합 모델의 하위 네트워크를 스케일업 GPU 영역에 분산한다. 분산 KV 캐싱은 해당 영역 전체로 메모리 활용 범위를 넓히고, KV 캐시 오프로딩은 덜 활성화된 문맥을 호스트와 스토리지 계층으로 옮겨 재계산 없이 접근할 수 있도록 한다. KV 인식 라우팅은 필요한 문맥이 이미 캐시된 GPU로 요청을 보내 긴 세션에서 중복 연산을 줄인다. MegaMoE 같은 융합 CUDA 커널은 여러 계산과 GPU 간 통신을 한 번의 실행으로 결합해 GPU가 데이터를 기다리는 시간을 줄이는 역할을 한다.
5. 연산 정밀도와 GPU 연결을 함께 설계한 기반
Rubin GPU의 향상된 5세대 Tensor Core와 3세대 Transformer Engine은 프리필과 디코드 양쪽의 추론을 가속한다. NVIDIA는 NVFP4 양자화가 모델 가중치를 4비트 정밀도로 압축해 출력 품질을 희생하지 않으면서 메모리 사용량을 줄이고 처리량을 높인다고 설명한다. Vera Rubin과 Grace Blackwell에 공통으로 적용되는 NVL72 스케일업 영역은 대규모 전문가 병렬화와 분산 KV 캐싱에 필요한 높은 대역폭과 낮은 지연의 GPU 간 통신을 제공한다. 이를 위한 6세대 NVLink와 NVLink Switch는 기성 이더넷 대안 대비 패킷 처리율이 10배 높고 지연은 3분의 1 수준이라고 제시된다. 최적화된 CUDA 커널, TensorRT LLM 추론 런타임, Dynamo 서빙 프레임워크도 하드웨어와 공동 설계되어 이러한 추론 최적화를 지원한다.
6. 전체 플랫폼 구성과 생산 확대
원문은 앞서 제시한 수치가 현재 Vera Rubin NVL72의 성능을 반영하며, 전체 플랫폼은 에이전트를 대규모로 배포하는 AI 팩토리를 위해 설계된 7개 칩 아키텍처라고 설명한다. 이 구성에는 Rubin GPU 외에 Vera CPU, Groq 3 LPU, NVLink 6 Switch, BlueField-4 DPU, Spectrum-6 SPX, ConnectX-9 SuperNIC가 포함된다. 따라서 현재 공개된 측정 결과와 전체 플랫폼의 구성 범위는 구분해서 읽어야 하며, 특히 Vera CPU의 도구 호출 성능은 해당 초기 결과에 포함되지 않았다. NVIDIA는 이러한 공동 설계가 플랫폼 내부의 하드웨어와 소프트웨어를 넘어 파트너와의 공동 엔지니어링으로도 이어진다고 밝혔다. 마지막으로 Vera Rubin이 본격 생산 중이고 생태계 전반으로 확대되고 있다고 설명하며, 현재의 성능 수치와 함께 플랫폼 공급 확대 상황을 제시한다.
🧾 핵심 주장 / 시사점
- 에이전트형 AI에서는 문맥이 단계마다 누적되므로, 실제 작업 흐름을 보존하는 평가가 단일 요청의 처리 성능만으로 드러나지 않는 효율 차이를 보여주는 근거가 된다.
- 전력 제약이 있는 AI 팩토리에서는 처리량과 토큰 비용이 각각 매출과 이익률에 연결되므로, 두 지표를 함께 보아야 경제적 의미를 해석할 수 있다.
- 최대 성능 수치는 공동 설계의 효과를 보여주는 초기 근거지만, SemiAnalysis 검토 대기와 Vera CPU 성능 미반영이라는 범위 안에서 해석해야 한다.
✅ 액션 아이템
- Vera Rubin NVL72의 최대 30배 처리량을 DeepSeek V4 Pro·SemiAnalysis AgentX 측정 조건과 검토 대기 상태를 함께 반영해 평가.
- 전력 제약이 있는 AI 팩토리의 경제성 검토에 메가와트당 처리량과 100만 토큰당 비용을 함께 적용.
- 에이전트형 AI 성능 평가에서 문맥 누적과 토큰 소비 15배 증가를 고려해 전체 작업 흐름을 기준으로 비교.
❓ 열린 질문
- SemiAnalysis 검토가 완료된 뒤에도 Vera Rubin NVL72의 메가와트당 처리량 최대 30배 결과가 유지되는가?
- 도구 호출을 위한 Vera CPU 성능이 반영되면 Vera Rubin NVL72의 전체 작업 흐름 성능은 어떻게 달라지는가?
- 전력 제약이 있는 AI 팩토리에서 처리량 최대 30배와 100만 토큰당 비용 최대 35배 절감은 매출과 이익률에 각각 어느 정도 영향을 주는가?