ArticleStuart Pitts·2026년 9월 30일·0

From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI

Quick Summary

NVIDIA와 CoreWeave는 Vera Rubin NVL72와 Vera CPU, CoreWeave Forge를 통해 에이전트 AI의 학습·평가·운영을 연결하고, 운영에서 얻은 신호를 다시 모델 개선에 활용하는 통합 환경을 확대하고 있다.

From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI 관련 대표 이미지

🖼️ 인포그래픽

From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI의 핵심 내용을 4단계로 요약한 인포그래픽
From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

NVIDIA와 CoreWeave는 Vera Rubin NVL72와 Vera CPU, CoreWeave Forge를 통해 에이전트 AI의 학습·평가·운영을 연결하고, 운영에서 얻은 신호를 다시 모델 개선에 활용하는 통합 환경을 확대하고 있다.

📌 핵심 요약

  • CoreWeave는 거의 10년에 걸친 NVIDIA와의 공동 설계를 바탕으로 Spectrum-X 102.4T Ethernet 네트워킹을 갖춘 NVIDIA Vera Rubin NVL72의 클라우드 제공을 발표했다. Cognition은 이 시스템에서 실제 운영 워크로드를 실행하는 첫 고객이며, 기존 NVIDIA V100 GPU도 여전히 고객 워크로드에 사용되고 있다.
  • Devin 개발사 Cognition은 FrontierCode 일부 과제로 구성한 소프트웨어 엔지니어링 워크로드의 초기 테스트에서 Vera Rubin NVL72의 SWE-2 추론 총 토큰 처리량이 GB200 NVL72 대비 최대 4.8배 증가했다고 밝혔다. 회사는 이를 더 빠른 실시간 코드 생성과 다단계 추론의 응답성 개선으로 연결하며, 긴 컨텍스트·높은 동시성·토큰당 비용을 중요한 조건으로 제시했다.
  • CoreWeave가 제공할 NVIDIA Vera CPU는 랙 하나에 CPU 128개와 코어 11,264개를 구성해 코어 하나씩 사용하는 동시 환경 11,000개 이상을 지원한다. CoreWeave 테스트에서는 에이전트 샌드박스 시작 속도가 3배 이상 빨라졌고, Terminal-Bench의 모든 통과 과제에서 1.7배의 성능 향상이 관찰됐다.
  • CoreWeave Forge는 Weights & Biases, OpenPipe의 후속 학습 전문성, marimo를 연결해 운영 신호를 학습과 평가에 반영한다. 원문에 따르면 Agent Lens는 실패 탐지를 20% 개선하고 문제 해결 비용을 절반으로 낮추며, 서버리스 RL은 자체 관리 환경보다 1.4배 빠르고 비용이 40% 낮다. NVIDIA Dynamo 기반 RL Rollouts는 비공개 프리뷰 상태로, 실행 중인 배포에 새 체크포인트를 적용해 재배포 없이 강화학습을 이어가도록 한다.
  • Canva, Capital One, MasterClass는 Forge를 활용하는 초기 기업에 포함되며, NVIDIA Nemotron 공개 모델은 에이전트용 추론·멀티모달 모델의 맞춤화와 배포를 지원한다. 약 50,000명의 고도 돌봄 필요 Medicare 환자를 15개 주에서 지원하는 Ennoble Care는 임상 AI 추론을 위해 CoreWeave를 선택했고, 예약된 NVIDIA RTX PRO 6000 GPU 용량을 활용할 예정이다.

🧩 주요 포인트

  1. 기존 NVIDIA V100의 지속 사용과 Vera Rubin NVL72의 도입 → 세대별 인프라를 워크로드에 맞게 배치하면서 장기간 투자 가치를 유지한다는 플랫폼 전략을 보여준다.
  2. SWE-2의 최대 4.8배 처리량과 NVIDIA Vera의 샌드박스 성능 개선 → 에이전트의 응답성과 대규모 실행 환경을 함께 강화하지만, 초기 테스트 결과를 실제 적용 조건과 구분해 해석할 필요가 있다.
  3. CoreWeave Forge의 운영 신호·후속 학습·평가 연결 → 도구 간 인계에서 신호가 유실되는 문제를 줄이고 지속적인 개선을 지원하며, 구성 기능별 제공 상태와 비용·성능 주장의 적용 범위가 도입 판단의 핵심이다.

🧠 상세 정리

1. 공동 설계의 축적과 차세대 인프라 도입

CoreWeave는 거의 10년에 걸친 NVIDIA와의 공동 설계를 통해 컴퓨팅, 네트워킹, 소프트웨어를 AI 전용 클라우드에 통합해 왔다. 샌프란시스코에서 열리는 CoreWeave Fully Connected에서는 Spectrum-X 102.4T Ethernet 네트워킹을 갖춘 NVIDIA Vera Rubin NVL72의 제공을 발표했으며, 에이전트용 NVIDIA Vera CPU도 제공할 예정이다. NVIDIA의 Ian Buck은 Volta 출시 후 거의 10년이 지난 시점에도 CoreWeave의 NVIDIA V100 GPU가 고객 워크로드를 실행하고 있다고 설명했다. 그의 주장은 새 세대 도입과 기존 장비 활용을 함께 이어가면서, 워크로드마다 적합한 GPU를 선택하고 인프라의 투자 가치를 오랫동안 유지할 수 있다는 것이다. 원문은 이러한 인프라 확장과 함께 모델·에이전트의 학습, 평가, 개선을 연결하는 CoreWeave Forge 출시를 전체 발표의 또 다른 축으로 제시한다.

2. Cognition의 운영 도입과 최대 4.8배 처리량

AI 소프트웨어 엔지니어 Devin을 개발한 Cognition은 CoreWeave에서 학습, 강화학습, 운영 추론을 수행하며, 9개월 만에 사용 규모를 수천 개 GPU로 확대했다. CoreWeave가 이달 초 첫 Vera Rubin NVL72 운영용 랙을 받은 뒤, Cognition은 FrontierCode에서 일부 과제를 추출하고 AI 에이전트가 이를 해결하도록 해 실제 소프트웨어 엔지니어링 워크로드를 구성했다. 이 워크로드를 사용한 초기 테스트에서 SWE-2 추론의 총 토큰 처리량은 GB200 NVL72 기준 대비 최대 4.8배 증가했으며, Cognition은 이를 Devin의 실시간 코드 생성 속도와 다단계 추론 응답성 개선으로 해석했다. Cognition의 Silas Alberti는 긴 컨텍스트, 높은 동시성, 많은 토큰 사용량과 토큰당 비용이 제품 제공 범위를 결정하며, 한 플랫폼에서 양사의 엔지니어와 문제를 해결하는 점을 강조했다. CoreWeave는 공동 설계를 바탕으로 며칠 만에 Cognition용 운영 클러스터를 구축했고, 고객은 CoreWeave Kubernetes Service, SUNK, Mission Control, Sandboxes, Inference를 통해 용량을 운영할 수 있다. 다만 최대 4.8배라는 수치는 특정 워크로드의 초기 테스트 결과이므로, 원문이 모든 추론 작업에서 동일한 향상을 입증한 것은 아니다.

3. Vera CPU가 지원하는 대규모 에이전트 실행 환경

원문은 에이전트 AI가 인프라에 두 가지 요구를 동시에 제기한다고 설명한다. 운영 중인 에이전트에는 대규모 저지연 컴퓨팅이 필요하고, 후속 학습으로 에이전트를 개선하려면 수천 개의 격리 환경을 동시에 실행해야 한다. NVIDIA Vera CPU는 이러한 워크로드를 위해 설계됐으며, CoreWeave의 구성은 랙 하나에 CPU 128개와 코어 11,264개를 넣어 코어 하나씩 할당하는 동시 환경 11,000개 이상을 지원한다. CoreWeave Sandboxes는 이 환경들을 하드웨어 수준에서 격리하고 지원 대상 학습 작업과 함께 실행하며, Spectrum-X Ethernet 스위치와 BlueField-4 DPU는 안전하고 지연이 낮은 에이전트 통신을 뒷받침한다. CoreWeave 테스트에서는 Vera CPU의 에이전트 샌드박스 시작 속도가 3배 이상 빨라졌고, Terminal-Bench의 모든 통과 과제에서는 1.7배의 성능 향상이 관찰됐다. 원문은 동시 실행 환경 수뿐 아니라 규모가 커질 때 각 환경의 성능과 일관성이 유지되는지도 핵심 평가 기준으로 제시한다.

4. Forge로 연결하는 운영 관찰과 실험

모델과 에이전트는 운영에서 드러난 행동을 다음 학습에 반영하고 평가를 통해 후속 버전을 개선하는 순환 과정으로 발전한다. 원문은 이 과정이 서로 다른 공급자의 도구로 나뉘어 있어 인계 단계마다 신호가 유실돼 왔다고 설명하며, CoreWeave Forge를 그 연결 문제에 대한 해법으로 제시한다. Forge는 Weights & Biases, OpenPipe의 후속 학습 전문성, 오픈소스 marimo 노트북 프로젝트를 통합하면서 모델·프레임워크·클라우드 전반에 대한 개방성을 유지한다. 정식 제공되는 CoreWeave ARIA는 실행 결과 분석, 실험 제안, 코드 변경 권고와 GitHub 저장을 지원하고, 실험 데이터에서 변화의 원인을 분석해 다음 실험을 제안한다. 새 서비스인 CoreWeave Agent Lens는 수천만 건의 운영 에이전트 트레이스를 개선에 활용할 수 있는 통찰로 전환하며, 원문은 실패 탐지를 20% 개선하고 문제 해결 비용을 절반으로 낮춘다고 주장한다. 정식 제공되는 CoreWeave Sandboxes는 서버리스 또는 기존 학습 인프라의 CPU·GPU 환경에서 에이전트 도구 호출, 강화학습, 평가마다 새 격리 환경을 제공한다.

5. 서버리스 후속 학습과 추론의 연결

Forge의 후속 학습 기능은 사용자의 운영 신호를 활용해 모델 품질을 높이고 지연과 비용을 줄이는 것을 목표로 하며, 사용자가 별도의 학습 클러스터를 갖추지 않아도 되도록 한다. 서버리스 지도 미세조정과 서버리스 RL은 자체 학습 레시피 실험을 지원하고, 원문은 서버리스 RL이 자체 관리 환경보다 1.4배 빠르며 비용은 40% 낮다고 제시한다. AI 팩토리용 오픈소스 추론 프레임워크 NVIDIA Dynamo는 CoreWeave의 관리형 추론 서비스와 비공개 프리뷰 상태의 RL Rollouts를 구동한다. RL Rollouts는 실행 중인 배포에 새 체크포인트를 적재해 재배포 없이 강화학습을 이어가고, 후속 학습에서도 운영 추론과 같은 추론 효율을 활용하도록 한다. Canva, Capital One, MasterClass는 Forge 위에서 구축하는 초기 기업으로 소개되며, NVIDIA Nemotron 공개 모델은 에이전트 워크플로용 추론·멀티모달 모델을 맞춤화하고 배포하는 경로를 제공한다.

6. 의료 적용 사례와 플랫폼 성과 주장

원문은 공동 설계 플랫폼의 효과를 AI 연구소와 AI 중심 기업뿐 아니라 글로벌 기업과 의료 서비스의 운영 적용으로 확장해 설명한다. 방문 돌봄 제공업체 Ennoble Care는 15개 주에서 약 50,000명의 고도 돌봄 필요 Medicare 환자를 지원하며, 임상 AI 추론을 실행하기 위해 CoreWeave를 선택했다. 이 업체는 CoreWeave Kubernetes Service에서 예약된 NVIDIA RTX PRO 6000 GPU 용량을 사용해 임상 문서 작성, 의사결정 지원, 사무 자동화용 AI 에이전트를 확대할 예정이다. 플랫폼의 근거로 원문은 CoreWeave가 MLPerf 학습·추론의 매 라운드에서 기록적인 결과를 냈으며, SemiAnalysis ClusterMAX 1.0·2.0·3.0 모두에서 Platinum 등급을 보유한 유일한 클라우드 제공업체라고 주장한다. 또한 상위 AI 연구소 10곳 중 9곳에 서비스를 제공한다고 밝히며, 실험 단계의 에이전트를 소프트웨어 작성과 임상 지원 같은 실제 운영 시스템으로 전환하는 것이 NVIDIA와 CoreWeave 협력의 지향점이라고 정리한다.

🧾 핵심 주장 / 시사점

  • 원문이 제시하는 경쟁력은 개별 칩의 성능뿐 아니라 NVIDIA와 CoreWeave의 공동 설계가 클러스터 구축, 에이전트 실행, 학습과 운영의 연결까지 이어진다는 데 있다.
  • 에이전트 인프라의 성능은 토큰 처리량과 함께 격리 환경의 시작 속도, 동시 실행 규모, 성능 일관성, 토큰당 비용을 종합해 판단해야 한다는 관점이 드러난다.
  • CoreWeave Forge는 운영 관찰을 실제 모델 개선으로 연결하는 데 초점을 두지만, 제시된 성능·비용 수치의 적용 조건과 정식 제공·비공개 프리뷰의 차이는 구분해서 해석해야 한다.

✅ 액션 아이템

  • SWE-2 초기 테스트의 최대 4.8배 처리량을 기준으로, Devin의 긴 컨텍스트·높은 동시성·토큰당 비용 조건에서 Vera Rubin NVL72의 적용 가치를 검토.
  • NVIDIA Vera CPU의 동시 환경 11,000개 이상 지원과 샌드박스 시작 속도 3배 이상 개선을 바탕으로, 대규모 에이전트 실행 환경의 적합성을 평가.
  • CoreWeave Forge의 운영 신호 활용과 서버리스 RL의 1.4배 속도·40% 비용 절감 주장을 검토하고, RL Rollouts의 비공개 프리뷰 상태를 도입 판단에 반영.

❓ 열린 질문

  • SWE-2 초기 테스트에서 관찰된 최대 4.8배 토큰 처리량 증가는 Devin의 긴 컨텍스트·높은 동시성 조건에서 어느 정도 유지되는가?
  • NVIDIA Vera CPU에서 동시 환경 11,000개 이상을 실행할 때 각 환경의 성능과 일관성은 어떻게 유지되는가?
  • CoreWeave Forge의 서버리스 RL이 자체 관리 환경보다 1.4배 빠르고 비용이 40% 낮다는 결과는 어떤 적용 조건에서 얻어졌는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.