Benchmarking small LLM inference on SageMaker AI: G7 vs G5 and G6
Quick Summary
Amazon SageMaker AI에서 두 30B MoE 모델로 G7과 이전 세대 GPU의 추론 성능·비용을 평가하는 방법을 소개하지만, 제공된 원문은 벤치마크 실행 설명에서 끊겨 실제 성능 수치는 확인할 수 없다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Amazon SageMaker AI에서 두 30B MoE 모델로 G7과 이전 세대 GPU의 추론 성능·비용을 평가하는 방법을 소개하지만, 제공된 원문은 벤치마크 실행 설명에서 끊겨 실제 성능 수치는 확인할 수 없다.
📌 핵심 요약
- 원문은 NVIDIA Blackwell 기반 G7이 처리량·지연 시간·토큰당 비용을 개선한다고 주장하며, 개선 폭은 모델 구조·양자화 형식·워크로드에 따라 달라진다고 설명한다. 제공된 본문에는 이를 확인할 실제 비교 결과가 없다.
- Qwen3-Coder-30B-A3B-Instruct-FP8은 DJL Large Model Inference(LMI) 28.0으로 ml.g5.12xlarge·ml.g6.12xlarge·ml.g7.12xlarge에 배포해 비교한다. us-east-2에서 동시성 4, 요청 100개, 평균 입력·출력 각각 128토큰의 동일한 워크로드를 사용한다.
- NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4는 추론·질의응답·요약·에이전트 워크로드를 대상으로, vLLM과 Amazon SageMaker AI Generative AI Inference Recommendations를 사용해 G6·G6e·G7의 가격 대비 성능을 평가하도록 소개된다.
- 12xlarge 구성에서 G5·G6는 GPU 4개와 총 GPU 메모리 96GB, G6e는 GPU 4개와 192GB, G7은 GPU 2개와 64GB를 제공한다. 원문은 MoE 디코딩에서 메모리 대역폭이 중요하며, 비교 대상 중 G7만 네이티브 FP4 Tensor Core를 지원한다고 설명한다.
- 기존 엔드포인트의 성능을 측정하는 벤치마킹과 후보 구성을 평가·순위화하는 추천 워크플로를 구분한다. 실행에는 SageMaker AI·Amazon S3 권한이 있는 IAM 역할, 대상 인스턴스 할당량, Python 3.10 이상과 sagemaker>=3.16.0이 필요하며, 원문은 G7의 정식 제공 리전을 미국 동부 오하이오와 미국 서부 오리건으로 한정한다.
🧩 주요 포인트
- 동일한 Qwen3-Coder-30B-A3B-Instruct-FP8·LMI 28.0·워크로드 적용 → 인스턴스별 비교 조건을 맞추지만, GPU 수와 총 메모리 차이도 함께 고려해야 한다.
- MoE의 메모리 대역폭 의존성과 G7의 네이티브 FP4 지원 → FP8·NVFP4 모델별로 하드웨어 이점이 달라질 수 있어 성능 우위를 일괄적으로 일반화하기 어렵다.
- 기존 엔드포인트 벤치마킹과 후보 구성 추천의 역할 차이 → 배포 상태와 최적화 목표에 맞춰 평가 방식을 선택하며, 실제 성능 수치가 없는 현재 자료만으로 최종 구성을 확정할 수는 없다.
🧠 상세 정리
1. GPU 선택의 중요성과 글의 검증 범위
원문은 대규모 생성형 AI 배포에서 LLM 추론용 GPU 인스턴스 선택이 지연 시간, 처리량, 토큰당 비용에 큰 영향을 주는 결정이라고 설명한다. GPU 세대가 바뀌면 이 지표들이 개선될 수 있지만, 실제 개선 폭은 모델 아키텍처와 양자화 형식, 워크로드의 특성에 따라 달라진다는 조건을 함께 제시한다. 이를 살펴보기 위해 Amazon SageMaker AI에서 대표적인 30B Mixture-of-Experts(MoE) 모델 두 개를 평가하고, NVIDIA Blackwell GPU를 사용하는 G7의 가격 대비 성능을 이전 세대와 비교하는 접근을 소개한다. 글은 G7의 측정 가능한 이점을 보여준다고 주장하지만, 제공된 본문은 벤치마크 실행 과정에서 중단되어 결과 표나 성능 수치는 포함하지 않는다. 따라서 이 자료에서 확인할 수 있는 범위는 비교 목적과 구성, 평가 절차이며, 개선의 크기나 최종 우승 구성을 확정할 근거는 부족하다.
2. 두 모델을 통한 서로 다른 평가 접근
첫 번째 사례는 코드 생성, 디버깅, 리팩터링, 개발자 코파일럿 등 기업의 코딩 작업을 위한 Qwen3-Coder-30B 평가다. 구체적으로 Qwen3-Coder-30B-A3B-Instruct-FP8을 DJL Large Model Inference(LMI) 컨테이너로 배포하고, A10G 기반 ml.g5.12xlarge, L4 기반 ml.g6.12xlarge, RTX PRO 4500 Blackwell 기반 ml.g7.12xlarge를 비교한다. 두 번째 사례는 추론, 질의응답, 요약, 에이전트 워크로드를 위한 NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4로, vLLM과 Generative AI Inference Recommendations를 이용해 G6·G6e·G7 후보를 평가하는 방식이다. 두 사례는 직접 배포한 엔드포인트의 벤치마킹과 자동화된 구성 추천이라는 상호 보완적인 접근을 보여준다. 다만 모델과 서빙 스택, 양자화 형식, 워크로드가 서로 다르므로, 두 사례를 하나의 동일 조건 실험으로 해석해서는 안 된다.
3. 벤치마킹과 추천 워크플로의 역할
Amazon SageMaker AI의 생성형 AI 추론 추천 기능은 모델과 예상 워크로드, 최적화 목표를 입력받아 실제 GPU 인프라에서 후보 구성을 평가하는 방식으로 소개된다. 원문에 따르면 이 기능은 처리량·비용·지연 시간에 관한 추천과 함께 첫 토큰까지 걸리는 시간 등 일반적인 성능 지표의 벤치마킹도 제공한다. 이미 모델이 SageMaker AI 엔드포인트에 배포되어 있다면, 예상 워크로드를 해당 엔드포인트에 보내 성능을 확인하는 벤치마킹 워크플로를 사용할 수 있다. 반면 적합한 배포 구성을 찾는 단계에서는 모델, 후보 인스턴스, 워크로드, 최적화 목표를 정의하고, 실행 가능한 구성을 평가한 뒤 비용·지연 시간·처리량에 따른 순위형 추천을 받는다. Qwen3-Coder-30B 사례는 전자의 흐름을, Nemotron-3-Nano-30B 사례는 후자의 흐름을 설명하며, 추천 결과는 운영 요구에 맞는 구성을 검토하고 배포하는 데 사용된다.
4. 인스턴스별 GPU 수와 메모리 차이
원문은 G5·G6·G6e·G7이 서로 다른 NVIDIA GPU 세대와 메모리, 대역폭, 네트워킹 구성을 제공한다고 설명한다. Qwen 비교에 사용하는 12xlarge 구성에서는 G5와 G6가 각각 GPU 4개와 총 GPU 메모리 96GB를 제공하는 반면, G7은 GPU 2개와 총 64GB를 제공한다. Nemotron 평가에 포함되는 G6e의 12xlarge 구성은 GPU 4개와 총 GPU 메모리 192GB이며, G6와 G7의 구성은 앞서 제시한 것과 같다. 이에 따라 G7 비교는 가속기 수가 절반이고 총 GPU 메모리도 적은 조건에서 어느 정도의 성능과 비용 효율을 제공하는지 살펴보는 의미를 갖는다. 원문은 단일 GPU에 모델을 적재할 수 있는지를 결정하는 GPU 메모리 용량을 핵심 요소로 제시하므로, 총 메모리 수치와 GPU 수의 차이를 함께 읽어야 비교 조건을 정확히 이해할 수 있다.
5. MoE 디코딩과 저정밀 연산의 의미
원문은 MoE 모델의 토큰 생성 단계인 디코딩에서 메모리 대역폭이 성능을 제한하는 주요 요인이 된다고 설명한다. 각 토큰이 전체 전문가 중 일부만 활성화하기 때문에, 더 높은 메모리 대역폭이 토큰 사이 지연 시간을 줄이고 처리량을 높이는 데 직접적으로 기여한다는 논리다. 또 다른 비교 요소는 FP8과 NVFP4 같은 저정밀 형식의 네이티브 지원이며, NVFP4는 NVIDIA가 Blackwell 아키텍처와 함께 도입한 4비트 부동소수점 형식으로 소개된다. 원문은 Blackwell Tensor Core의 네이티브 FP4 양자화가 품질 손실을 최소화하면서 가중치당 약 4비트 수준으로 모델 크기를 줄인다고 주장한다. 비교 대상 중 G7만 네이티브 FP4 Tensor Core를 지원하고 G5·G6는 NVFP4 가중치를 하드웨어 가속 없이 실행한다고 설명하지만, 이 구조적 이점이 실제 성능 차이로 얼마나 이어지는지는 제공된 본문에서 확인되지 않는다.
6. 실행 전 권한·환경·리전 조건
원문은 평가를 실행하기 위한 준비 조건으로 Amazon SageMaker AI와 Amazon Simple Storage Service(Amazon S3)에 대한 권한을 가진 AWS Identity and Access Management(IAM) 실행 역할을 제시한다. 또한 사용하는 AWS 리전에서 대상 인스턴스 유형의 할당량이 확보되어 있어야 하며, Python 3.10 이상과 Amazon SageMaker Python SDK의 sagemaker>=3.16.0 환경이 필요하다고 명시한다. G7의 정식 제공 지역은 원문 기준 미국 동부 오하이오와 미국 서부 오리건으로 한정되어 있어, 후보 인스턴스 선택에는 리전 제약도 반영된다. 이어지는 Qwen3-Coder-30B 벤치마크는 us-east-2를 사용한다고 밝혀, 해당 사례의 실행 지역을 구체적으로 고정한다. 따라서 본문에 제시된 비교 절차를 적용하려면 모델과 서빙 설정뿐 아니라 실행 역할의 권한, 인스턴스 할당량, SDK 버전, 리전 조건까지 충족해야 한다.
7. Qwen 벤치마크의 통제된 비교 설정
Qwen 사례는 Qwen3-Coder-30B-A3B-Instruct-FP8이라는 동일한 MoE 코딩 모델을 세 인스턴스 유형에 배포하는 것으로 시작한다. 서빙 환경도 DJL Serving과 LMI 28.0으로 통일하고, ml.g5.12xlarge·ml.g6.12xlarge·ml.g7.12xlarge에서 같은 워크로드를 사용해 인스턴스 유형을 비교의 주요 변수로 삼는다. 명시된 워크로드는 요청 100개, 동시성 4, 요청당 평균 입력 128토큰과 평균 출력 128토큰이며, 실행 리전은 us-east-2다. 원문은 각 엔드포인트의 모델 구성과 배포, 벤치마킹에 필요한 전체 코드를 동반 노트북에서 제공한다고 설명하고, 엔드포인트가 준비된 뒤 합성 워크로드를 정의한다고 이어간다. 이러한 설정은 제시된 코딩 추론 시나리오에서 비교 조건을 맞추기 위한 것이며, 실제 개선 폭이 워크로드에 따라 달라진다는 글의 전제에 비추어 결과를 다른 요청 길이나 동시성에 그대로 적용할 근거는 제시되지 않는다.
8. 벤치마크 실행 과정과 결과의 공백
본문의 코드 예시는 Workload.synthetic로 토크나이저와 동시성 4, 요청 수 100, 평균 입력·출력 토큰 수 각각 128을 지정해 합성 워크로드를 생성한다. 이때 streaming=False로 설정하며, 생성한 워크로드와 대상 엔드포인트, 실행 역할을 start_benchmark에 전달하고 wait=False로 벤치마크를 시작한다. 원문은 Amazon SageMaker AI가 해당 워크로드를 엔드포인트에 보내고 NVIDIA AIPerf를 사용해 성능 지표를 수집한다고 설명한다. 그러나 제공된 자료는 이 설명 직후 문장이 끊겨, 수집된 지연 시간이나 처리량, 토큰당 비용, 인스턴스별 가격 대비 성능 결과를 보여주지 않는다. 따라서 현재 자료는 재현을 위한 설정과 실행 흐름을 이해하는 데 활용할 수 있지만, G7의 우위 정도나 Nemotron 추천 결과를 수치로 판단하려면 본문에 포함되지 않은 실제 측정 결과가 필요하다.
🧾 핵심 주장 / 시사점
- G7은 더 적은 GPU와 총 메모리로 비교에 참여하므로, GPU 수나 총 메모리만으로 추론 성능과 비용 효율을 판단하기 어렵다는 평가 관점을 제시한다.
- Qwen의 FP8 직접 벤치마킹과 Nemotron의 NVFP4 구성 추천은 서로 다른 조건을 다룬다. G7의 이점을 해석할 때 모델·양자화·서빙 환경·워크로드의 조합을 함께 고려해야 한다.
- 실행 조건은 구체적이지만 결과가 누락되어 있어, 이 자료의 활용 가치는 성능 우위의 확정보다 평가 방법과 비교 조건의 이해에 있다.
✅ 액션 아이템
- Qwen3-Coder-30B-A3B-Instruct-FP8을 LMI 28.0, 동시성 4, 요청 100개, 평균 입력·출력 각각 128토큰 조건으로 비교하고 실제 성능 수치 확인.
- NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4의 G6·G6e·G7 후보를 vLLM과 Generative AI Inference Recommendations로 평가해 가격 대비 성능 검토.
- G7 평가 실행에 필요한 IAM 역할, 인스턴스 할당량, Python 3.10 이상, sagemaker>=3.16.0 및 오하이오·오리건 리전 조건 확인.
❓ 열린 질문
- Qwen3-Coder-30B-A3B-Instruct-FP8의 동시성 4·요청 100개 조건에서 ml.g5.12xlarge·ml.g6.12xlarge·ml.g7.12xlarge의 실제 처리량·지연 시간·토큰당 비용은 각각 얼마인가?
- NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4에 대한 Generative AI Inference Recommendations는 G6·G6e·G7 중 어떤 구성을 최상위로 추천하는가?
- G7의 네이티브 FP4 지원과 GPU 2개·총 메모리 64GB 구성은 FP8·NVFP4 모델별 가격 대비 성능에 어떤 차이를 만드는가?