Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#gpu-memory-offloading
Tag1건Article 1

#gpu-memory-offloading

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#curvine공동문서 1 · 연관도 100%#distributed-kv-caching공동문서 1 · 연관도 100%#lmcache공동문서 1 · 연관도 100%#amazon-sagemaker-hyperpod공동문서 1 · 연관도 71%#deployment-guide공동문서 1 · 연관도 58%#architecture-deep-dive공동문서 1 · 연관도 35%#ai-architecture공동문서 1 · 연관도 4%
Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine
Article2026년 8월 12일

Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine

Amazon SageMaker HyperPod에 Curvine 기반 공유 NVMe L2 캐시와 지능형 라우팅을 결합해 vLLM의 KV 캐시를 GPU·CPU·노드 간 스토리지로 확장하고, 테스트에서 교차 Pod 캐시 적중률 최대 100%와 TTFT 최대 2.7배 개선을 달성한 아키텍처와 구축 절차를 설명한다.

aws.amazon.com
#curvine#lmcache#amazon-sagemaker-hyperpod#distributed-kv-caching