As AI Increases Demands on Memory, Storage Steps Up
Quick Summary
AI의 데이터와 문맥 처리량이 시스템 메모리 한계를 넘어서면서, 저장장치는 GPU에 데이터를 빠르고 안전하게 공급하는 능동적 AI 인프라로 전환되고 있다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 요약
AI의 데이터와 문맥 처리량이 시스템 메모리 한계를 넘어서면서, 저장장치는 GPU에 데이터를 빠르고 안전하게 공급하는 능동적 AI 인프라로 전환되고 있다.
📌 핵심 요약
- 대규모 데이터와 긴 문맥을 사용하는 AI 에이전트가 늘면서, 단순한 저장 용량 확대보다 높은 처리량과 보안성을 갖춘 저장 구조가 중요해지고 있다.
- GPU가 저장 요청을 직접 시작해 수천 건의 작업을 동시에 발생시키면서 암호화, 압축, 검증, 데이터 재구성 같은 저장 서비스가 새로운 병목으로 부상했다.
- 제시된 벤치마크에서 NVIDIA Vera CPU는 2단계 압축·암호화 파이프라인 기준으로 x86 CPU보다 최대 3.21배 높은 처리량을 기록했다.
- NVIDIA는 GPU가 저장장치에 직접 읽고 쓸 수 있게 하는 cuFile API와 그 하부 저장 소프트웨어 스택을 오픈소스로 공개해 상호운용성과 보안 기술의 확산을 추진한다.
- Storage-Next와 SCADA는 GPU가 필요한 데이터만 저장장치에서 고속 메모리로 직접 가져오도록 하면서, 권한 분리와 리눅스 보안 절차를 통해 직접 접근의 위험을 통제한다.
🧩 주요 포인트
- GPU의 저장 직접 요청 증가 → 저장매체의 용량보다 병렬 데이터 서비스의 처리 능력이 AI 인프라 효율을 좌우한다.
- cuFile의 개방과 업계 공동 표준화 → 특정 하드웨어에 한정되지 않는 GPU·데이터 간 상호운용 기반을 넓힌다.
- SCADA의 권한 분리 구조 → 빠른 직접 접근과 지속적인 보안 정책 적용을 함께 달성하는 것이 핵심 설계 조건이 된다.
🧠 상세 정리
1. AI 확장이 저장 인프라에 가하는 압력
AI 에이전트가 방대한 데이터를 소비하고 문맥 창이 시스템 메모리의 한계를 넘어서면서, 저장장치는 단순한 보관 수단이 아니라 가속 컴퓨팅을 계속 작동시키는 핵심 기반이 되고 있다. NVIDIA는 저장 용량만 추가해서는 이 문제를 해결할 수 없으며, AI 공장이 유용하고 근거 있는 결과를 만들 수 있도록 데이터를 효율적이고 안전하게 공급하는 저장 구조가 필요하다고 설명한다. 특히 GPU가 저장 요청을 직접 시작할 수 있게 되면서 동시에 수천 건의 작업이 발생하고, 저장 계층이 감당해야 할 병렬 처리 압력도 커졌다. 이에 따라 다음 단계의 AI 성능은 연산 장치 자체뿐 아니라 연산 장치에 데이터를 제때 전달하는 메모리·저장 인프라의 설계에도 크게 좌우된다.
2. 데이터 서비스 병목과 Vera CPU 성능
수많은 GPU와 AI 에이전트의 요청을 처리하려면 저장 시스템은 데이터를 읽고 쓰는 데 그치지 않고 암호화, 압축, 검증, 재구성 작업을 지속적으로 수행해야 한다. 이러한 데이터 서비스는 수천 개의 에이전트가 저장장치에 동시에 접근할 때 전체 처리량을 제한하는 병목이 될 수 있다. 글에서 인용한 벤치마크에 따르면 NVIDIA Vera BlueField-4 STX에 포함된 Vera CPU는 2단계 압축·암호화 파이프라인에서 x86 CPU보다 최대 3.21배 높은 처리량을 제공했다. 해당 결과는 저장 플랫폼이 AI 데이터의 급증을 더 적은 연산 인프라로 처리하면서도 높은 처리량을 확보할 가능성을 보여준다. 즉 저장 계층의 효율은 드라이브 수뿐 아니라 데이터 변환과 보호 작업을 얼마나 빠르게 수행하는지에 의해 결정된다.
3. 수동적 저장소에서 능동적 데이터 경로로
가속 컴퓨팅이 저장 계층에 적용되면 저장장치는 데이터를 가만히 보관하는 공간을 넘어, 애플리케이션과 GPU로 데이터가 이동하는 능동적 경로의 일부가 된다. 이는 빠르지만 제한적인 메모리와 저렴하고 넉넉한 저장 드라이브 사이에서 데이터를 어디에 둘지 판단해 온 기존의 비용·성능 관계를 바꾼다. 약 40년 전에는 이 절충을 데이터 접근에 걸리는 분 단위 시간으로 따졌지만, 오늘날 GPU와 NVIDIA 및 협력사의 AI 저장 솔루션에서는 같은 문제가 마이크로초 단위로 다뤄진다. 시스템 메모리 부족과 AI의 데이터 수요 사이의 격차를 줄이려면 저장장치 하나의 개선만으로는 충분하지 않다. 메모리·저장 제조사부터 상위 소프트웨어까지 생태계 전반을 함께 설계하는 긴밀한 공동 최적화가 필요하다는 것이 글의 주장이다.
4. cuFile 오픈소스화와 상호운용성 확대
NVIDIA는 GPU가 CPU를 거치지 않고 저장장치에서 직접 데이터를 읽고 쓸 수 있게 하는 cuFile API와 그 아래의 수직형 저장 소프트웨어 스택을 오픈소스로 공개한다고 발표했다. cuFile은 NVIDIA GPUDirect Storage의 구성요소이며, 수십만 개의 GPU 스레드와 고대역폭 메모리 등을 활용해 마이크로초 단위로 저장 데이터에 안전하게 접근하도록 설계됐다. 공개된 기술은 리눅스의 검증된 보안 관행을 기반으로 GPU와 데이터 사이의 상호운용 가능한 저장 스택을 형성하는 데 목적이 있다. 빠르고 안전한 데이터 접근은 예방적·탐지형 사이버보안 기능에도 필수적이므로, cuFile 공개는 AI 기반 방어 체계가 요구하는 속도로 보안 문맥과 데이터에 접근하는 기반을 넓힌다. 관련 공개 기여 체계에는 구글, 인텔, NVIDIA, 메타가 최초 유지관리자로 참여하며, 여러 소프트웨어와 하드웨어 환경에 맞춘 최적화를 지원한다.
5. Storage-Next와 SCADA 중심의 업계 협력
Storage-Next는 저장장치 제조사, 컨트롤러 공급사, 열 설계·냉각·오케스트레이션 운영자, 표준화 단체가 GPU 중심 저장장치의 동작 방식을 함께 정립하기 위한 NVIDIA 주도 사업이다. DDN, 키옥시아, 마이크론을 포함한 40곳 이상의 주요 저장·플래시 업체가 참여해 기술 개선을 상호운용 가능한 개방형 산업 표준으로 전환하려 한다. 이 사업의 중심에는 대규모 AI 데이터셋에 대한 가속 접근이 있으며, NVIDIA는 이를 위해 확장형 가속 데이터 접근 체계인 SCADA를 제공한다. SCADA는 대규모 병렬 GPU가 애플리케이션에 실제로 필요한 데이터만 저장장치에서 자신의 고속 메모리로 직접 가져오게 한다. DDN은 이를 소프트웨어 정의형 AI 데이터 지능 플랫폼인 Infinia와 통합해 대규모 저장 병목을 줄이고, GPU의 가동 효율과 인사이트 도출 속도를 높이는 방향으로 활용하고 있다.
6. 직접 접근의 속도와 보안을 함께 확보하는 구조
애플리케이션이 저장 드라이브와 직접 통신하면 속도는 높아지지만, 통제가 부실할 경우 다른 프로세스의 메모리를 침범할 수 있어 심각한 보안 문제가 발생한다. SCADA는 이를 방지하기 위해 직접 접근 과정을 두 부분으로 분리한다. 높은 속도가 필요한 일반 사용자 영역의 애플리케이션 구성요소는 신뢰 컴퓨팅 기반 밖에 두고, 별도의 권한 있는 구성요소가 초기 설정 단계에서 애플리케이션과 승인된 저장장치 사이의 보호된 접근 경로를 구성한다. 이 권한 구성요소는 표준 리눅스 보안 절차에 따라 접근을 집행하면서 데이터를 효율적으로 보호한다. 또한 Vera BlueField-4 STX는 통합 DOCA 보안 스택으로 AI 데이터 경로에 정책을 지속 적용하며, CMX Context Memory Storage는 긴 문맥과 다중 대화형 에이전트 추론을 위한 문맥 저장 계층을 제공한다. 최종 목표는 빠른 병렬 처리와 보안을 동시에 갖춘 저장 인프라를 통해 AI 애플리케이션과 AI 공장에 더 나은 데이터를 공급하고, 정확하고 근거 있는 결과를 대규모로 생산하도록 하는 것이다.
🧾 핵심 주장 / 시사점
- AI 저장 성능은 저장 용량이나 매체 속도만으로 평가하기 어렵고, 압축·암호화·검증·재구성을 포함한 전체 데이터 경로의 처리량으로 판단해야 한다.
- GPU와 저장장치의 직접 연결이 확대될수록 속도 향상과 함께 권한 분리, 승인된 접근 경로, 지속적인 정책 집행을 처음부터 함께 설계해야 한다.
- 오픈소스 API와 다수 업체가 참여하는 표준화는 GPU 중심 저장 기술을 개별 제품 기능에서 상호운용 가능한 산업 기반으로 확장하는 핵심 수단이다.
✅ 액션 아이템
- AI 에이전트 워크로드에서 저장 용량보다 병렬 데이터 서비스 처리량이 병목인지 점검한다.
- GPU 직접 저장 요청 환경에서 암호화·압축·검증·재구성 파이프라인 한계를 비교한다.
- cuFile 개방 스택과 SCADA 권한 분리가 상호운용·보안 요구를 함께 충족하는지 범위를 정의한다.
❓ 열린 질문
- GPU 수천 건 동시 저장 요청에서 암호화·압축·검증·재구성 중 어느 단계가 최대 병목인가?
- Vera CPU의 최대 3.21배 처리량 이점이 긴 문맥 AI 에이전트 워크로드에서도 유지되는가?
- Storage-Next와 SCADA의 권한 분리는 직접 접근 속도와 보안 정책을 어떤 기준으로 균형 잡을 것인가?