Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#gpu-inference-serving
Tag1건Article 1

#gpu-inference-serving

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#concurrent-kernel-execution공동문서 1 · 연관도 100%#gpu-footprint-reduction공동문서 1 · 연관도 100%#heidi-health공동문서 1 · 연관도 100%#nvidia-cuda-mps공동문서 1 · 연관도 100%#workload-specific-batching공동문서 1 · 연관도 100%#amazon-ec2공동문서 1 · 연관도 71%#automatic-speech-recognition공동문서 1 · 연관도 71%#speaker-diarization공동문서 1 · 연관도 71%#implementation-case-study공동문서 1 · 연관도 26%
Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2
Article2026년 8월 27일

Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2

Heidi Health의 음성 인식 사례는 Amazon EC2에서 NVIDIA CUDA MPS와 Triton을 결합해 초당 GPU당 92.1개 요청과 1초 미만 지연시간을 유지하면서 GPU 인프라를 16개에서 4개로 75% 줄이는 구성을 제시한다.

aws.amazon.com
#amazon-ec2#heidi-health#nvidia-cuda-mps#concurrent-kernel-execution