Articleaws.amazon.com·2026년 9월 4일·0

Build a Physical AI model factory with NVIDIA Cosmos 3 on SageMaker HyperPod

Quick Summary

NVIDIA Cosmos 3와 Amazon SageMaker HyperPod를 결합해 합성 데이터 생성, 후속 학습, 평가를 하나의 공유 GPU 풀에서 반복하는 피지컬 AI 모델 팩토리를 구성한다.

Build a Physical AI model factory with NVIDIA Cosmos 3 on SageMaker HyperPod 관련 대표 이미지

🖼️ 인포그래픽

Build a Physical AI model factory with NVIDIA Cosmos 3 on SageMaker HyperPod 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Build a Physical AI model factory with NVIDIA Cosmos 3 on SageMaker HyperPod의 핵심 내용을 4단계로 요약한 인포그래픽
Build a Physical AI model factory with NVIDIA Cosmos 3 on SageMaker HyperPod 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

NVIDIA Cosmos 3와 Amazon SageMaker HyperPod를 결합해 합성 데이터 생성, 후속 학습, 평가를 하나의 공유 GPU 풀에서 반복하는 피지컬 AI 모델 팩토리를 구성한다.

📌 핵심 요약

  • 피지컬 AI 모델 팩토리는 실제 데이터 수집·정제, 합성 데이터 확장, 정책 후속 학습, 폐루프 시뮬레이션 평가를 반복하며 평가 실패를 다음 데이터 생성 대상으로 반영한다.
  • Cosmos 3는 영상·이미지·행동·소리를 하나의 토큰 시퀀스로 처리하고, 추론기와 생성기를 매 계층에서 결합하는 MoT 구조로 순방향 동역학, 역방향 동역학, 정책 모드를 지원한다.
  • 학습에서는 전체 잡음 제거 과정과 영상 복원을 수행하지만, 로봇 추론에서는 소수의 잡음 제거 단계만 실행하고 영상 복원을 생략한 채 행동 토큰을 관절 위치로 변환한다.
  • Cosmos3-Nano는 16B, Cosmos3-Super는 64B 규모이며, 별도 가중치 계보의 4B Cosmos3-Edge는 목표 하드웨어에 맞춰 직접 후속 학습한다.
  • Amazon SageMaker HyperPod와 Amazon EKS는 생성·후속 학습·평가에 공유 GPU 풀을 제공하며, Amazon S3와 Amazon FSx for Lustre를 공통 저장소로 사용한다. 핵심 비용 지표는 예약 GPU 시간당 유용한 파이프라인 진척을 뜻하는 GPU goodput이다.

🧩 주요 포인트

  1. 모델 구조의 통합 → Cosmos 3의 세 가지 모드를 공통 기반에서 운용하되, 후속 학습으로 특정 모드와 제어 주기에 특화한다.
  2. 학습·추론 연산량의 비대칭 → 영상 예측을 행동 판단의 내부 근거로 유지하면서 로봇 실행 시 영상 복원 연산을 생략한다.
  3. 공유 GPU 풀과 공통 저장소 → 단계별 재프로비저닝과 대규모 데이터 이동을 줄이고, 개별 작업 처리량보다 전체 루프의 GPU goodput을 중심으로 자원을 운영한다.

🧠 상세 정리

1. 단일 학습 작업에서 지속적인 모델 개선 루프로

로봇이나 자율주행차처럼 실제 세계의 데이터를 물리적 행동으로 전환하는 피지컬 AI 시스템은 한 번의 학습 작업만으로 완성되지 않는다. 원문은 합성 데이터를 생성하고, 주변 환경을 이해하는 인지 모델과 행동을 결정하는 정책 모델을 후속 학습하며, 두 모델을 폐루프 시뮬레이션으로 평가하는 반복 파이프라인을 제시한다. 피지컬 AI 모델 팩토리는 새롭게 들어오는 실제 데이터를 이 과정에 계속 투입해 모델을 반복적으로 개선하는 운영 체계다. 글은 Cosmos 3의 구조와 HyperPod의 연결, 클러스터와 대용량 공유 저장소 구성, 대표적인 분산 후속 학습 작업을 다룬다고 소개하며, 실행 코드와 인프라 템플릿 및 작업 명세는 awsome-distributed-ai GitHub 저장소에 있다고 안내한다.

2. 예약 용량과 GPU goodput 중심의 비용 관점

파이프라인을 계속 실행하려면 개별 작업뿐 아니라 전체 반복 과정에 필요한 GPU 용량을 확보해야 한다. 단계마다 GPU를 따로 구하면 가용성과 확보 시점이 달라지고, 확보한 자원이 데이터와 다른 가용 영역이나 리전에 배치될 수 있다고 원문은 설명한다. 기간이 정해진 작업에는 유연한 학습 계획을, 종료 시점이 정해지지 않은 운영에는 용량 예약을 활용해 전체 루프의 자원을 확보하는 방식을 제시한다. 확보한 용량은 파이프라인이 진척되지 않는 시간에도 비용이 발생하므로, 비용을 좌우하는 지표는 단일 작업의 최대 처리량보다 예약 GPU 시간당 실제로 얻는 유용한 진척인 GPU goodput이다. 단계별 별도 클러스터를 반복해서 구성하는 대신 하나의 지속적인 GPU 풀을 시간 분할해 쓰는 설계가 이 관점과 연결된다.

3. 공유 토큰 시퀀스와 계층별 전문가 결합

Cosmos 3는 영상 생성용 확산 트랜스포머와 텍스트 조건을 제공하는 별도 시각 언어 모델을 연결하는 일반적인 방식 대신, 하나의 공통 트랜스포머 기반에서 이해와 생성을 통합한다. 이미지 이해에는 비전 트랜스포머를, 픽셀 생성에는 가중치가 고정된 Wan2.2 영상 변분 오토인코더를 사용하며, 자세 변화와 파지 상태를 담은 행동 벡터에도 별도 인코더를 적용한다. 이렇게 인코딩한 모달리티는 하나의 시퀀스로 모이고, 모델이 읽는 텍스트·시각 토큰의 자기회귀 구역 뒤에 생성할 영상·음성·행동의 확산 구역이 놓인다. 각 계층에서는 다음 토큰을 예측하는 추론기와 잡음을 제거하는 생성기를 이중 스트림 어텐션으로 결합해 생성이 지속적으로 추론기의 출력을 참조하도록 한다. 확산 구역은 두 구역의 키를 모두 참조하지만, 자기회귀 구역은 인과적 제약을 유지하며 확산 토큰을 보지 않는다.

4. 학습과 로봇 추론의 연산 비대칭

Cosmos 3는 학습과 배포 단계에서 동일한 양의 연산을 수행하지 않도록 설계되어 있다. 학습 중에는 예측 영상이 손실 계산에 포함되므로 전체 잡음 제거 일정을 실행하고 영상 잠재 표현을 실제 픽셀로 복원한다. 반면 로봇에서 실행할 때는 소수의 잡음 제거 단계만 수행하며, 영상 잠재 표현은 내부적으로 생성하되 이를 픽셀로 복원하는 과정은 완전히 생략한다. 이때 영상 잠재 표현은 여전히 행동 예측을 뒷받침하는 역할을 하고, 최종적으로는 행동 토큰만 로봇이 실행할 관절 위치로 변환된다. 따라서 원문이 설명하는 비대칭은 영상 예측 자체를 없애는 방식이 아니라, 학습에 필요한 영상 복원과 실행에 필요한 행동 출력을 구분해 추론 시 수행할 연산을 줄이는 구조다.

5. 잡음 토큰의 배치로 구분하는 세 가지 행동 모드

중간 학습을 마친 기본 체크포인트는 어떤 토큰을 잡음 상태로 시작하는지 바꿔 세 가지 작업을 수행하고, 후속 학습은 이를 특정 모드와 제어 주기에 특화한다. 순방향 동역학은 현재 프레임과 행동을 알려진 조건으로 유지하면서 미래 영상의 잡음을 제거해, 드문 주행 장면이나 수집하기 어려운 조작 상호작용을 생성한다. 역방향 동역학은 영상을 알려진 조건으로 두고 행동을 복원하므로, 행동 라벨이 없는 원격 조작 기록이나 제삼자 시점 로봇 영상 등을 행동 라벨이 있는 학습 데이터로 바꾼다. 정책 모드는 세 시점의 이미지와 고유수용감각 정보를 조건으로 행동과 영상 토큰을 함께 예측하며, 미래 32단계의 관절 위치를 출력한다. 원문에 제시된 Cosmos3-Nano-Policy-DROID는 이 가운데 정책 모드에 특화된 변형으로, 15 Hz 제어 주기와 32단계 예측 구간을 사용한다.

6. Nano·Super와 별도 계보의 Edge

Cosmos 3 모델군의 주요 두 계층은 16B 파라미터의 Cosmos3-Nano와 64B 파라미터의 Cosmos3-Super다. Nano는 밀집형 8B Qwen3-VL 기반을, Super는 밀집형 32B Qwen3-VL 기반을 사용하며, Cosmos3-Nano-Policy-DROID 같은 작업별 변형이 이 계층 위에 구성된다. NVIDIA가 함께 공개한 Cosmos3-Edge는 장치 내 배포를 위한 4B 계층으로, 원문은 Jetson Thor와 Orin에서 벤치마크되었다고 설명한다. Edge는 Nano·Super와 물리 세계 사전 학습 데이터를 공유하지만 Qwen3-VL로 초기화하지 않고 약 2B 규모의 밀집형 기반을 처음부터 학습하므로 가중치 계보가 다르다. 이에 따라 Edge 배포는 Nano 체크포인트를 축소하는 과정이 아니라 목표 하드웨어에 맞춰 Edge를 직접 후속 학습하는 과정으로 구분된다.

7. 데이터 수집부터 평가 실패의 재투입까지

모델 팩토리의 첫 단계는 DROID, BridgeData2, 자율주행 센서 로그 같은 실제 데이터를 수집·정제해 Amazon S3와 Amazon FSx for Lustre의 공유 데이터 집합에 저장하는 것이다. 두 번째 단계에서는 Cosmos3-Super 교사 모델이 합성 데이터를 생성해 실제 데이터 집합을 확장한다. 세 번째 단계에서는 실제 데이터와 합성 데이터를 결합해 배포 가능한 Cosmos3-Nano 정책을 후속 학습하며, 시각 미세 조정은 Nano와 Super 모두에 적용한다. 네 번째 단계는 정책을 폐루프 시뮬레이션에서 평가하고, 실패 사례를 새로운 생성 대상으로 전환해 다음 반복의 데이터 집합으로 되돌리는 과정이다. 이러한 순환은 새 데이터가 들어올 때마다 다시 실행되는 것을 지향하며, 전체 모델군의 생성·정책·인지 기능을 공통 클러스터에서 운용해야 하는 근거가 된다.

8. HyperPod의 공유 클러스터와 저장소

Cosmos 3의 긴 토큰 시퀀스와 64B MoT 구조는 지연 시간이 낮은 노드 간 연결을 갖춘 다중 노드 학습 환경을 요구하며, 원문은 Amazon EKS 기반 Amazon SageMaker HyperPod를 이에 대응하는 클러스터로 제시한다. 합성 데이터 생성은 vLLM-Omni 서버에서, 후속 학습은 torchrun 아래의 cosmos-framework에서 FSDP2와 Ulysses 문맥 병렬화를 사용해 실행하고, 평가는 단일 GPU 정책 서버에서 수행한다. 세 단계는 EFA로 접근하는 Amazon FSx for Lustre 파일 시스템을 공유하며, 이 저장소는 데이터 저장소 연결을 통해 Amazon S3 버킷과 연계된다. 생성 단계가 기록한 합성 영상을 학습 단계가 같은 경로에서 읽고 정책 서버도 같은 볼륨의 체크포인트를 불러오므로, 단계 전환마다 재프로비저닝하거나 테라바이트 규모 데이터를 옮길 필요가 없다는 설명이다. 제공된 본문은 이어서 HyperPod가 장애 노드를 지속적으로 탐지하고 자동 재부팅하거나 교체한다고 설명하는 대목에서 끝나므로, 이후 구성 절차나 복구 세부 사항은 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • Cosmos 3의 공통 구조는 모델 선택뿐 아니라 생성·학습·평가를 같은 자원에서 순환시키는 인프라 설계의 근거가 된다.
  • 정책 추론은 내부 영상 예측을 행동 판단에 활용하면서도 픽셀 복원을 생략하므로, 영상 생성 능력과 실제 로봇 출력 경로를 구분해 이해해야 한다.
  • 공유 GPU 풀의 경제성은 개별 작업의 속도만으로 평가하기 어렵고, 단계 전환과 데이터 이동에서 잃는 시간을 포함한 전체 루프의 진척으로 판단해야 한다.

✅ 액션 아이템

  • 실제 데이터 수집·정제부터 폐루프 시뮬레이션 평가까지의 반복 과정과 평가 실패의 재투입 경로 검토.
  • 공유 GPU 풀과 공통 저장소를 기준으로 단계 전환의 재프로비저닝·데이터 이동 부담 및 GPU goodput 평가.
  • Cosmos3-Nano·Cosmos3-Super·Cosmos3-Edge의 역할과 특정 모드·제어 주기 및 목표 하드웨어에 맞는 후속 학습 방식 검토.

❓ 열린 질문

  • 공유 GPU 풀에서 생성·후속 학습·평가에 자원을 어떻게 배분해야 GPU goodput을 높일 수 있는가?
  • 폐루프 시뮬레이션 평가에서 확인한 실패 중 무엇을 다음 합성 데이터 생성 대상으로 우선 반영할 것인가?
  • 목표 하드웨어와 제어 주기에 비추어 Cosmos3-Nano와 Cosmos3-Edge 중 어떤 정책 모델이 적합한가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.