Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput
Quick Summary
AWS는 Amazon EKS·EFA·DeepEP를 결합해 MoE 강화학습의 자원 조율과 전문가 병렬 통신 병목을 줄이는 구성을 제시하며, 제목의 처리량 40% 향상 주장을 검증할 실험 조건과 결과는 제공된 본문에 포함되지 않는다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
AWS는 Amazon EKS·EFA·DeepEP를 결합해 MoE 강화학습의 자원 조율과 전문가 병렬 통신 병목을 줄이는 구성을 제시하며, 제목의 처리량 40% 향상 주장을 검증할 실험 조건과 결과는 제공된 본문에 포함되지 않는다.
📌 핵심 요약
- MoE는 희소성을 통해 수천억~수조 개 매개변수 모델의 추론 효율을 유지하지만, 대규모 강화학습에서는 롤아웃 생성과 정책 학습의 균형, 가속기 연산·메모리·네트워크 자원 조율, 노드 간 통신이 주요 과제가 된다.
- 롤아웃 생성은 첫 토큰 도착 시간이나 토큰 간 지연보다 총처리량을 중시하고, 정책 학습은 작업자들의 동기화된 진행을 요구한다. PPO는 일반적으로 critic 모델을 사용하고 GRPO는 그룹 기반 상대 보상으로 별도 critic을 생략하지만, 두 방식 모두 대규모 생성과 고대역폭 통신이 필요하다.
- Amazon EKS는 GPU·CPU·메모리 최적화 노드 그룹으로 작업을 나누고, 경험 버퍼로 생성과 학습을 연결한다. EFA는 노드 간 GPU 통신을, Amazon S3는 데이터셋·체크포인트·완료된 학습 산출물의 영구 저장을 담당한다.
- DeepEP는 일반적인 all-to-all 집합 통신을 토큰 dispatch·combine 전용 커널로 대체하고, 노드 내부에서는 NVLink·NVSwitch를, 노드 간에는 libfabric을 통한 EFA를 사용한다. DeepEP v2는 EFA를 기본 지원하며, NCCL 2.31에는 밀집 집합 통신용 최신 EFA 최적화가 포함된다.
- 지원되는 P5·P6 구성에서는 EFA와 NVIDIA GPUDirect RDMA로 인스턴스 간 GPU 메모리를 직접 연결할 수 있다. 본문은 Amazon EC2 Spot Instances를 롤아웃 비용 절감 수단으로 소개하지만 세부 운영 방법은 제시하지 않으며, 제목의 처리량 40% 향상에 대한 측정 근거가 나오기 전에 끝난다.
🧩 주요 포인트
- MoE의 희소화와 전문가 병렬화 확대 → 연산량 절감만으로 학습 확장성을 확보하기 어려우며, 동적인 토큰 통신과 노드 간 전송 효율이 중요해진다.
- 롤아웃 생성과 정책 학습의 상호 의존 → Amazon EKS의 이기종 자원 배치와 경험 버퍼를 함께 설계해야 하드웨어 유휴 상태와 학습 불안정성을 줄일 수 있다.
- DeepEP의 통신 최적화와 Amazon EC2 Spot Instances의 비용 절감 접근 → 성능과 비용을 서로 다른 수단으로 개선하려는 구성이지만, 처리량 40% 향상의 적용 범위는 제공된 본문만으로 판단할 수 없다.
🧠 상세 정리
1. MoE 확장과 강화학습의 인프라 부담
MoE는 희소성을 활용해 추론 효율을 유지하면서 대규모 언어 모델을 수천억 또는 수조 개 매개변수까지 확장하는 표준적인 아키텍처로 자리 잡았다고 본문은 설명한다. 그러나 희소성이 학습 인프라의 복잡성까지 제거하는 것은 아니며, 본문은 사전 학습, 중간 학습, 지도 미세조정인 SFT, 강화학습으로 이어지는 학습 과정을 제시한다. 특히 대규모 강화학습은 탄력적으로 수행되는 추론과 높은 통신 대역폭을 요구하는 긴밀한 모델 학습을 결합하므로 자원 운영 요구가 크다. 보상 모델, 검증기, 체크포인트 갱신도 메모리와 네트워크, 오케스트레이션 부담을 더한다. 따라서 핵심 문제는 공유 자원에서 학습·추론·평가를 함께 실행하면서 병목과 유휴 용량을 줄이는 데 있다.
2. 전문가 병렬화가 만드는 통신 중심 병목
본문은 새로운 MoE 아키텍처가 추론 비용을 낮추기 위해 더 희소해질수록, 학습은 연산보다 통신의 제약을 더 크게 받을 수 있다고 설명한다. 주요 원인은 전문가 병렬화인 EP로, 텐서 병렬화인 TP, 데이터 병렬화인 DP, 파이프라인 병렬화인 PP의 구조화된 통신에 더해 장치 사이의 동적인 all-to-all 토큰 라우팅을 발생시킨다. 긴밀하게 연결된 비동기 강화학습에서는 이러한 학습 통신 요구를 추론 기반 생성 작업과 함께 조율해야 한다. 학습 단계가 느리면 추론 작업자가 정체되고, 추론 처리량이 부족하면 학습 가속기가 유휴 상태가 된다. PPO는 일반적으로 가치 추정을 위한 critic 모델을 사용하고 GRPO는 그룹 기반 상대 보상으로 별도 critic을 생략하지만, 두 방식 모두 대규모 롤아웃과 긴밀한 정책 학습, 고대역폭 노드 간 통신을 요구한다.
3. 롤아웃 생성과 정책 학습의 균형
대규모 비동기 강화학습은 롤아웃 생성과 정책 학습이라는 두 작업을 동시에 최적화해야 한다. 롤아웃 생성은 분산 추론으로 경험을 생산하며, 첫 토큰 도착 시간인 TTFT나 토큰 간 지연을 최소화하는 것보다 전체 생성 처리량을 높이는 데 초점을 둔다. 반면 정책 학습에서는 사전 학습이나 SFT처럼 긴밀히 연결된 작업자들이 같은 보조로 진행해야 한다. 이 때문에 지연 급증이나 뒤처지는 작업자는 전체 작업을 멈추게 하거나 NVIDIA Collective Communications Library인 NCCL의 시간 초과를 유발할 수 있다. 두 작업의 속도가 맞지 않으면 하드웨어가 놀거나 학습 불안정성이 발생할 수 있으므로, 생성과 학습 각각의 성능뿐 아니라 서로의 처리 속도도 함께 고려해야 한다.
4. 연산·메모리·네트워크와 통신 영역의 제약
강화학습 시스템은 가속기 연산, 메모리, 네트워크 대역폭이라는 세 가지 자원 제약을 동시에 다뤄야 한다. 정책 학습은 연산 집약적이며 롤아웃 생성 속도를 따라가야 하고, 분산 추론은 KV 캐시 용량과 토큰 생성을 관리해야 하며, 보상 모델과 데이터 이동도 추가 부담을 준다. 작업이 단일 인스턴스를 넘어가면 모델 분할과 병렬 그룹이 여러 노드에 걸쳐 배치되면서 통신이 고대역폭 NVLink에서 상대적으로 대역폭이 낮은 노드 간 연결로 이동한다. MoE의 전문가 병렬화 정도가 커질수록 희소하고 세밀한 토큰 라우팅의 노드 간 비중도 늘어난다. P5와 P6 같은 AWS 가속 컴퓨팅 인스턴스는 주로 NVSwitch로 연결된 인스턴스 내부 NVLink와 인스턴스 간 EFA라는 두 통신 영역을 사용한다. 지원되는 구성에서는 EFA가 NVIDIA GPUDirect RDMA 및 운영체제 우회와 함께 GPU 메모리 간 직접 전송을 제공하므로, 어떤 연산을 EFA에서 처리하고 어떤 연산을 NVLink 내부에 둘지 구분하는 것이 중요하다.
5. Amazon EKS의 이기종 노드 구성
제안된 아키텍처는 Amazon EKS, EFA, Amazon S3를 결합해 오케스트레이션, 고성능 통신, 영구 저장을 각각 독립적으로 확장하도록 구성한다. Amazon EKS는 서로 다른 작업자의 수명 주기와 배치를 관리하며, 클러스터 안에는 강화학습 단계별로 최적화된 별도 노드 그룹을 둔다. GPU 가속 인스턴스는 롤아웃 생성, 보상 모델 추론, 정책 학습을 실행하고, CPU 인스턴스는 환경 실행과 전처리를 담당한다. 메모리 최적화 인스턴스에는 경험 버퍼와 체크포인트 캐시를 배치해 데이터를 생산하는 작업과 소비하는 작업을 연결한다. 이 구성은 빈번한 데이터 교환의 핵심 경로에 영구 저장소를 직접 넣지 않도록 하며, 각 작업의 자원 특성에 맞춰 전체 시스템을 조율하는 기반이 된다.
6. 경험 생성부터 체크포인트 저장까지의 흐름
롤아웃 단계에서는 모델이 CPU 기반 환경 파드와 상호작용해 샘플을 생성하고, 그 결과인 경험을 메모리 최적화 버퍼로 전달한다. 정책 학습은 이 버퍼에서 배치를 가져와 모델 가중치를 갱신한 뒤 새 체크포인트를 발행하고, 갱신된 체크포인트는 다음 롤아웃 생성에 반영된다. 체크포인트와 완료된 학습 산출물은 복구와 후속 활용을 위해 Amazon S3에도 영구 저장되며, 정책 학습과 가중치 갱신, 새 체크포인트 생성은 모두 EKS 클러스터에서 실행할 수 있다. EKS는 작업자 그룹의 스케줄링과 확장, 장애 복구, 조정을 담당하고, NVLink·NVSwitch와 EFA는 각각 노드 내부 및 노드 간 통신을 맡는다. 경험 버퍼와 Amazon S3는 빈번한 샘플·체크포인트 교환과 장기 산출물 저장을 분리하는 데이터 계층을 이룬다.
7. DeepEP의 전용 커널과 EFA 지원
일반적인 all-to-all 집합 통신은 밀집되고 규칙적인 통신에 가장 효율적이지만, MoE는 토큰이 전문가에게 동적으로 배분되면서 희소하고 세밀하며 불균형한 트래픽을 만든다. 전문가 병렬화가 여러 노드로 확장되면 동기화와 메시지별 오버헤드가 커져 노드 간 통신이 주요 병목이 된다. DeepEP는 이를 줄이기 위해 일반적인 집합 통신을 로컬 GPU의 토큰을 원격 전문가에게 보내는 dispatch 커널과 처리된 토큰을 다시 모으는 combine 커널로 대체한다. 이 커널들은 노드 내부에서 NVSwitch를 통한 NVLink를 사용하고, 노드 간에는 libfabric을 통해 EFA로 데이터를 보낸다. Amazon은 DeepEP의 통신 기본 연산을 libfabric으로 옮기는 기능을 기여했으며, 이를 통해 libfabric이 지원하는 네트워크 패브릭 사이의 이식성과 EFA 기반 MoE 학습 최적화를 지원한다. 본문은 DeepEP v2의 EFA 기본 지원과 함께, NCCL 2.31에도 밀집 집합 통신을 위한 최신 EFA 최적화가 포함된다고 명시한다.
8. 성능·비용 최적화 주장과 제공 자료의 한계
본문은 성능과 비용 최적화의 두 축으로 EFA 위에서 DeepEP를 사용하는 방법과 롤아웃 생성에 Amazon EC2 Spot Instances를 사용하는 방법을 소개한다. DeepEP는 전문가 dispatch와 combine의 통신 오버헤드를 줄여 롤아웃 생성 처리량을 개선하는 수단으로 설명되고, Spot Instances는 롤아웃 비용을 낮추는 수단으로 제시된다. 다만 제공된 본문은 DeepEP의 GPU 메모리 간 직접 전송을 설명하는 도중에 끝나므로, Spot Instances의 구체적인 운영 방법이나 비용 비교는 확인할 수 없다. 제목에는 처리량 40% 향상이 명시되어 있지만, 이를 뒷받침하는 비교 기준, 실험 구성, 측정 결과는 제공된 본문에 없다. 따라서 통신 최적화의 설계 원리는 정리할 수 있어도, 40%라는 수치를 특정 작업 조건이나 전체 강화학습 성능에 그대로 적용할 근거는 이 자료만으로 확보되지 않는다.
🧾 핵심 주장 / 시사점
- MoE의 추론 효율을 높이는 희소성은 학습 과정에서 동적 통신 부담을 키울 수 있으므로, 모델의 연산 효율과 분산 학습 인프라의 효율은 함께 평가해야 한다.
- 경험 버퍼와 영구 저장의 분리는 롤아웃·학습 사이의 빈번한 교환을 지원하는 동시에 복구와 후속 활용을 위한 저장 역할을 유지하는 설계다.
- DeepEP의 전용 통신 커널과 EKS의 자원 조율은 서로 다른 병목을 다루므로, 통신 개선만으로 전체 강화학습 처리량 향상이 보장된다고 해석할 수는 없다.
✅ 액션 아이템
- 롤아웃 생성과 정책 학습의 처리 속도 및 가속기 연산·메모리·네트워크 제약을 함께 검토.
- Amazon EKS의 GPU·CPU·메모리 최적화 노드 배치와 경험 버퍼 구성을 작업별 자원 요구에 맞춰 검토.
- DeepEP의 처리량 40% 향상 주장은 측정 조건과 결과 확인을 전제로 평가하고, Amazon EC2 Spot Instances의 비용 절감 효과는 세부 운영 정보 확보 후 판단.
❓ 열린 질문
- 처리량 40% 향상은 어떤 비교 기준과 측정 조건에서 얻어진 결과인가?
- 롤아웃 생성과 정책 학습의 속도가 달라질 때 Amazon EKS의 자원 배치와 경험 버퍼는 어떻게 조정되는가?
- Amazon EC2 Spot Instances를 롤아웃 생성에 적용하는 구체적인 운영 방법과 비용 절감 효과는 무엇인가?