Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video
Quick Summary
Skild AI는 NVIDIA AI 인프라로 개발한 로봇 기반 모델 S1을 통해 단일 시연 영상만으로 가중치 업데이트나 작업별 추가 학습 없이 처음 보는 장시간 작업을 수행하는 접근을 제시했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Skild AI는 NVIDIA AI 인프라로 개발한 로봇 기반 모델 S1을 통해 단일 시연 영상만으로 가중치 업데이트나 작업별 추가 학습 없이 처음 보는 장시간 작업을 수행하는 접근을 제시했다.
📌 핵심 요약
- 지난주 출시된 S1은 시연 영상을 입력으로 받아 의도·물체·작업 순서를 해석하는 인컨텍스트 학습을 사용하며, 최대 10분에 이르는 낯선 다단계 작업을 수행할 수 있다.
- Skild AI의 신규 다단계 작업 시험에서 S1의 단계별 성공률은 약 66%로 유사 AI 시스템의 9%보다 7배 이상 높았다. 화분 심기 시험에서는 시연 촬영부터 실제 하드웨어의 자율 실행까지 11분이 걸렸다.
- Skild AI는 짧은 영상 하나가 약 380회의 직접 훈련 사례에 맞먹는 효용을 낼 수 있다고 추정하며, 해당 사례를 사람이 수집하려면 50~100시간이 걸릴 수 있다고 설명한다.
- Skild AI는 첫 상용 배포 후 10개월 만에 연환산 매출 1억 달러 수준과 60개 이상의 배포 파트너십에 도달했다. Skild AI·NVIDIA·Foxconn은 NVIDIA Blackwell 시스템의 고정밀 조립을 위해 양팔 로봇에 Skild Brain을 배포하고 있다.
- NVIDIA Cosmos, Omniverse, Isaac Sim, Isaac Lab, Newton, Nsight, TensorRT는 데이터 처리부터 시뮬레이션·학습·추론 최적화까지 개발 전 과정을 지원한다. 상용 배포 경험의 모델 반영은 고객 계약이 허용하는 범위에서 이루어진다.
🧩 주요 포인트
- 단일 영상과 재학습 없는 작업 적응 → 제품·공정·배치 변경 때마다 필요한 데이터 수집과 학습 부담을 줄일 가능성.
- 단계별 성공률 약 66%와 영상의 훈련 효용 추정 → 적응 성능과 데이터 효율 개선을 시사하지만, 전체 작업 성공률과 회사 추정치는 구분해 해석할 필요.
- NVIDIA Blackwell 조립 배포와 NVIDIA 개발 도구의 연결 → 연구 성과를 실제 생산 환경으로 확장하며, 배포 경험 활용에는 고객 계약이라는 제약이 존재.
🧠 상세 정리
1. 변화하는 현장을 위한 영상 기반 로봇 학습
제조 현장과 창고, 생산라인에서는 작업과 배치가 바뀌고 새 제품이 투입되지만, 대부분의 로봇은 상당한 재프로그래밍 없이 이를 따라가기 어렵다. 지난주 출시된 Skild AI의 로봇 기반 모델 S1은 처음 보는 장시간 작업을 단일 시연 영상에서 배워 수행하도록 설계됐다. 영상은 작업을 이해하고 실행하기 위한 입력으로 사용되며, 모델 가중치 업데이트나 작업별 추가 학습은 필요하지 않다. 원문은 이 방식을 인컨텍스트 학습이라고 설명한다. Skild AI는 NVIDIA AI 인프라에서 S1을 개발하고 연구했으며, 양사의 협력은 합성 데이터 생성과 모델 학습, 시뮬레이션, 실제 현장 배포까지 포괄한다. 공동 창업자이자 CEO인 Deepak Pathak은 사전 프로그래밍보다 경험을 통한 학습이 로봇공학의 중요한 변화라고 강조했다.
2. 한 번의 시연을 낯선 다단계 작업으로 전환
기존 산업용 로봇은 고정된 작업을 중심으로 만들어져 제품이나 공정, 배치가 달라지면 추가 데이터와 재학습, 검증이 필요하다. S1에서는 작업자가 원하는 작업을 영상으로 촬영해 모델에 프롬프트로 제공한다. 모델은 시연의 의도와 물체, 순서를 해석한 뒤 이를 해당 로봇의 행동으로 변환하며, 사전 학습 데이터에 포함되지 않은 작업도 재학습 없이 수행하는 경우가 많다고 원문은 설명한다. 제시된 사례는 화분 심기, 팬케이크 만들기, 핸드드립 커피 추출, 키트 조립으로, 낯선 작업의 길이는 최대 10분에 이른다. 이런 작업에는 수십 개의 조작 단계와 기존에 수행하지 않았던 순서의 기술 조합이 포함될 수 있다. S1은 물체의 위치 변화에 적응하고 오류에서 회복하며, 명시적으로 프로그래밍되지 않은 순서로 기술을 결합할 수도 있다.
3. 성공률과 시연 효율에 관한 시험 결과
화분 심기 시험 한 건에서 Skild AI 팀은 시연 영상 촬영부터 실제 하드웨어의 자율 실행까지 11분 만에 진행했다. 새로운 다단계 작업에 대한 회사 시험에서 S1의 각 단계 성공률은 약 66%였으며, 비교 대상인 유사 AI 시스템의 9%보다 7배 이상 높았다. 이 수치는 단계별 성공률로 제시되므로 전체 작업을 끝까지 완수한 비율과 동일하게 해석해서는 안 된다. Skild AI는 짧은 영상 하나를 보여주는 것이 약 380회의 직접 훈련 사례를 제공하는 것만큼 유용할 수 있다고 추정한다. 사람이 해당 사례를 직접 수집하는 데에는 50~100시간이 걸릴 수 있다는 설명도 덧붙였다. 따라서 영상의 효용에 관한 수치는 회사의 추정이며, 단계별 성공률은 회사가 수행한 시험 결과라는 맥락을 함께 보존해야 한다.
4. 상용 확장과 NVIDIA Blackwell 조립 적용
Skild AI는 첫 상용 배포 이후 10개월 만에 연환산 매출 1억 달러 수준에 도달했으며, 이는 같은 기간 실제 누적 매출을 뜻하는 수치는 아니다. 이 기간에 제조, 물류, 검사, 보안, 음식 준비 등을 아우르는 60개 이상의 배포 파트너십을 구축했다. S1의 접근은 작업자가 새 작업을 직접 시연하도록 해 변화마다 새로운 데이터셋이나 학습 실행이 필요한 반복을 줄이는 데 초점을 둔다. 고객 계약이 허용하는 경우 상용 배포 경험을 더 넓은 모델 개선에 반영하고 향후 배포를 가속할 수 있다. 실제 공장에서는 Skild AI, NVIDIA, Foxconn이 NVIDIA Blackwell 시스템의 고정밀 조립을 위해 양팔 로봇에 Skild Brain을 배포하고 있다. 공개된 작업 흐름에서 로봇은 버스바와 리미트 블록을 설치하고 나사 16개를 체결했으며, 여러 단계에 걸친 외란에 적응하기 위해 정밀 동작, 접촉을 고려한 제어, 순서 추적과 복구 능력을 사용했다.
5. 데이터 다양화와 가상 환경의 학습·검증
NVIDIA 가속 컴퓨팅은 시뮬레이션, 사람의 영상, 원격 조작과 사용이 허용된 배포 데이터를 활용해 Skild의 공통 로봇 지능을 대규모로 학습하도록 지원한다. NVIDIA Cosmos의 개방형 월드 기반 모델은 훈련 데이터를 다양화하고 영상을 구조화된 설명으로 변환하는 역할을 맡는다. Cosmos Curator는 대규모 데이터에 주석을 달고 필터링하며 정리하는 과정을 돕는다. Skild AI는 실제 배포 전에 로봇 지능을 학습하고 검증하기 위해 NVIDIA의 개방형 시뮬레이션 프레임워크를 폭넓게 사용한다. NVIDIA Omniverse 라이브러리와 NVIDIA Isaac Sim은 물리 기반 가상 환경을 제공해 데이터를 생성하고 예외적인 상황을 시험하며 행동을 검증한다. 이런 구성은 현장 투입 전에 다양한 경험을 확보하고 로봇의 행동을 확인하는 개발 과정을 뒷받침한다.
6. 물리 시뮬레이션부터 현장 추론까지 연결
Skild AI는 개방형 모듈식 로봇 학습 프레임워크인 Isaac Lab에서 강화학습을 수행해 로봇 지능의 기술을 강화한다. Newton 물리 엔진으로 구동되는 Isaac Lab은 힘, 접촉, 충돌, 압력 등 물리적 변수를 정밀하게 모델링하고 시뮬레이션과 현실의 차이를 줄이는 데 도움을 준다. Skild AI와 NVIDIA는 로봇이 고체 물체에 접촉하고 이를 잡고 조작하는 과정을 빠르고 정확하게 모델링하는 GPU 가속 시뮬레이션 솔버도 공동 개발하고 있다. 원문에 따르면 이 솔버는 곧 Newton의 일부로 모든 개발자에게 제공될 예정이다. 모델이 실제 운영 단계로 이동할 때 NVIDIA Nsight는 학습 중 성능 병목을 찾고, NVIDIA TensorRT 소프트웨어 개발 키트는 추론을 최적화해 물리 세계에서 로봇의 빠른 반응을 지원한다. 이 도구들은 데이터, 시뮬레이션, 학습과 배포를 연결된 개발 과정으로 묶는다.
🧾 핵심 주장 / 시사점
- S1은 새 작업에 대한 적응을 영상 입력 단계에서 처리하므로, 현장 변화에 대응하는 방식이 반복적인 재학습에서 작업 시연 중심으로 이동할 가능성을 보여준다.
- 단계별 성공률 개선과 단일 영상의 높은 훈련 효용은 서로 다른 근거다. 전자는 회사 시험 결과이고 후자는 회사 추정이므로 적용 범위와 확실성을 구분해야 한다.
- 시뮬레이션과 실제 배포 경험을 연결하는 개발 구조가 제시됐지만, 상용 경험을 모델 개선에 활용할 수 있는 범위는 고객 계약에 달려 있다.
✅ 액션 아이템
- 제품·공정·배치 변경에 따른 데이터 수집과 학습 부담을 기준으로 S1의 단일 영상 적응 방식의 적용 가능성 검토.
- S1의 단계별 성공률 약 66%와 약 380회의 직접 훈련 사례에 해당한다는 효용 추정을 구분해 성능과 데이터 효율 평가.
- NVIDIA Blackwell 조립 배포의 확장 가능성과 고객 계약이 허용하는 배포 경험 활용 범위 확인.
❓ 열린 질문
- S1이 수행하는 최대 10분의 다단계 작업에서 전체 작업 성공률은 단계별 성공률 약 66%와 어떻게 다른가?
- 짧은 영상 하나가 약 380회의 직접 훈련 사례에 맞먹는다는 Skild AI의 추정은 어떤 작업 범위에서 성립하는가?
- 고객 계약은 상용 배포 경험을 모델에 반영하는 범위를 어떻게 제한하는가?