Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#llm-gpu-gpu
Tag1건Article 1

#llm-gpu-gpu

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#workflow-automation공동문서 1 · 연관도 8%#retrieval-index공동문서 1 · 연관도 6%#agent-deployment공동문서 1 · 연관도 5%#agent-routing공동문서 1 · 연관도 4%#agent-memory공동문서 1 · 연관도 4%#applications공동문서 1 · 연관도 3%#semiconductors공동문서 1 · 연관도 3%#llm공동문서 1 · 연관도 3%
Prefill and Decode for Concurrent Requests - Optimizing LLM Performance
Article2025년 7월 28일

Prefill and Decode for Concurrent Requests - Optimizing LLM Performance

동시 요청을 처리하는 LLM 추론에서는 프리필과 디코드의 계산 특성이 달라, 첫 토큰 지연·토큰 생성 지연·총처리량·GPU 활용률 사이의 균형에 맞춰 배칭과 프리필 청크 크기를 조정해야 한다.

huggingface.co
#agent-memory#agent-routing#retrieval-index#workflow-automation