When Will AI Make Me Scrambled Eggs? I Went To NVIDIA To Find Out.
Quick Summary
When Will AI Make Me Scrambled Eggs? I Went To NVIDIA To Find Out.를 중심으로, 가사 로봇의 병목은 성공 여부를 판단하는 능력이다. 집마다 환경이 다르고 음식의 품질은 영상만으로 평가하기 어렵다. 시각를 핵심 판단 포인트로 압축 정리한다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
When Will AI Make Me Scrambled Eggs? I Went To NVIDIA To Find Out.를 중심으로, 가사 로봇의 병목은 성공 여부를 판단하는 능력이다. 집마다 환경이 다르고 음식의 품질은 영상만으로 평가하기 어렵다. 시각를 핵심 판단 포인트로 압축 정리한다.
📌 핵심 요점
- 가사 로봇의 병목은 성공 여부를 판단하는 능력이다. 집마다 환경이 다르고 음식의 품질은 영상만으로 평가하기 어렵다. 시각 검사 등으로 결과를 검증하기 쉬운 세탁·빨래 개기가 완벽한 달걀 요리보다 먼저 해결될 수 있다는 전망이다.
- Cosmos는 세계 이해·시뮬레이션·행동을 연결하려 한다. 로봇과 자율주행차가 상황을 파악하고, 가상 환경에서 정책 후보를 평가하며, 관측 변화에 맞춰 제어 명령을 생성하도록 지원하는 방향이다.
- 시뮬레이션은 현실 시험의 빈틈을 보완한다. 재현하기 어려운 상황을 생성하고 유망한 정책을 추려 실제 시험 대상을 좁힐 수 있다. Omniverse와 Isaac 같은 물리 시뮬레이션 도구의 합성 데이터도 학습을 보완하지만, 그럴듯한 영상이 물리 법칙의 이해를 증명하지는 않는다.
- 발전의 축은 데이터와 모델 크기에 그치지 않는다. 추론으로 동작 설명을 구체화하고 여러 모델이 오류를 찾아 수정하는 방식도 시뮬레이션 품질을 높일 수 있다. 복잡한 물리 작업을 하위 문제로 나누고 도구 호출로 처리하는 구상도 제시된다.
- 현장 로봇에는 실시간성과 비용에 맞는 모델이 필요하다. 즉각적인 제어는 작은 엣지 모델이, 기다릴 수 있는 고차원 추론은 더 큰 모델이 맡는 조합이 가능하다. 엔비디아는 이런 다양한 요구에 대응하도록 하드웨어·소프트웨어·모델을 함께 개발한다.
🧩 배경과 문제 정의
- 가정용 로봇이 빨래나 요리 같은 일을 수행하려면 물리적 환경을 파악하고, 행동 결과를 예측하며, 상황 변화에 맞춰 제어 명령을 만들어야 한다.
- 자율주행차와 로봇을 현실에서만 시험하면 시간이 많이 들고 드문 상황을 충분히 검증하기 어렵다. 세계 모델은 환경 이해와 시뮬레이션을 통해 이 문제를 줄이는 수단이다.
- 엔비디아의 Cosmos는 물리 AI 개발자를 위한 세계 모델 플랫폼을 지향한다. 핵심 쟁점은 실시간 실행, 학습과 추론의 확장, 물리적 정확성, 실제 행동으로의 연결이다.
- 그럴듯한 물리 현상을 생성하는 능력과 물리 법칙을 이해하는 능력은 구분해야 한다. 모델이 실제로 물리를 이해하는지는 아직 확정할 수 없다.
🕒 시간순 섹션별 상세정리
1. 시각 콘텐츠 생성을 수작업 규칙에서 데이터 학습으로 바꾸기
- Cosmos 연구를 이끄는 민유 리우는 약 10년 전부터 딥러닝이 시각 콘텐츠 생성의 중심이 될 것이라고 예상했다. 당시 생성 이미지는 해상도가 낮고 사람의 모습도 부자연스러워 이 전망은 논쟁적이었다 [02:02]
- 핵심 발상은 3차원 세계를 만드는 규칙을 일일이 작성하는 대신 문제를 학습 문제로 전환하는 것이다. 데이터와 모델의 확장이 가능하다면 시각 콘텐츠 생성도 발전할 수 있다는 관점이다 [02:37]
2. 엔비디아가 하드웨어 위에 소프트웨어와 모델을 쌓는 이유
- 개발자가 GPU의 성능을 활용하려면 CUDA, 라이브러리, AI 모델도 필요하다. 엔비디아는 GPU·CPU·네트워크로 구성된 컴퓨터 위에 이런 소프트웨어 계층을 구축한다 [04:12]
- 도구를 직접 개발하면 개발자의 작업을 줄이는 동시에 미래의 과제에 필요한 컴퓨터 구조를 파악할 수 있다. 하드웨어와 소프트웨어를 함께 만드는 경험이 시스템 설계에 반영된다 [04:54]
3. 세계 모델은 목적에 따라 달라지는 모델들의 집합이다
- 인간은 언어를 익히기 전부터 세계에 대한 모델을 형성한다. 언어가 인간의 사고를 기호와 의미로 압축한다면, 세계 모델은 사건의 이유를 이해하고 다음 상황을 예측하거나 공간을 탐색하는 데 쓰인다 [05:59]
- 세계 모델은 하나의 단일 모델로 한정되지 않는다. Cosmos는 자율주행차, 로봇, 공장 내 여러 기계의 협업을 개선하려는 물리 AI 개발자의 필요에 초점을 맞춘다 [07:13]
4. 현실 시험의 빈틈을 세계 이해와 시뮬레이션으로 보완하기
- 세계 이해 기능은 작업자가 기계의 안전 지침을 따르는지 판단하거나 생산라인의 결함을 시각적으로 검사하는 데 필요하다 [08:08]
- 실제 차량과 운전자로 자율주행 정책을 시험하면 시간이 오래 걸리고 일부 상황은 재현하기 어렵다. 차량이 지각할 환경을 세계 모델로 생성하면 실제 배치 전에 정책의 성능·정확성·안전성을 평가할 수 있다 [08:34]
5. 세계 이해·시뮬레이션·행동을 하나의 모델로 통합하기
- Cosmos는 출시 이후 약 1년 반 동안 세계 이해와 시뮬레이션에 필요한 모델을 각각 구축해 왔다. 이어 6월 타이베이 기조연설에서 이해·시뮬레이션·행동 능력을 하나로 합친 모델을 공개했다 [09:53]
- 세 기능은 목표가 달라도 같은 세계를 모델링하므로 기초 표현을 공유할 수 있다. 이를 통합해 개발자가 필요한 기능을 더 간단하게 활용하도록 하는 것이 방향이다 [10:20]
6. 실시간 제어와 고차원 추론에 서로 다른 크기의 모델 배치하기
- 작은 모델은 로봇이 있는 현장의 엣지 장치에서 실시간으로 작동하도록 설계된다. 다만 작은 모델의 능력은 큰 모델보다 제한적이며, 큰 모델은 데이터센터나 더 강력한 컴퓨터에서 높은 성능을 제공한다 [12:03]
- 이동과 같은 작업은 즉각적인 처리가 필요하지만 일부 고차원 추론은 기다릴 수 있다. 내장 장치와 데이터센터에 서로 다른 크기의 모델을 배치하는 조합이 물리 AI의 요구를 충족할 수 있다 [12:53]
7. 데이터와 모델 크기뿐 아니라 설명의 정밀도도 확장하기
- 세계 모델에서도 데이터와 모델 규모를 늘리는 방향의 확장이 가능하다. 시각 콘텐츠 생성과 시뮬레이션에서는 생성할 장면을 텍스트로 더 상세하게 설명할수록 결과가 좋아지는 경향도 있다 [13:38]
- 예를 들어 로봇 손이 첫 구간에서 30도 움직이고 다음 구간에서 10도 더 움직인다고 시간에 따른 동작을 명시하면 생성에 도움이 된다. 추론 시간을 더 써서 설명을 구체화하는 방식으로도 품질을 높일 수 있다 [15:03]
8. 추론 시스템과 여러 모델의 수정 작업으로 시뮬레이션 개선하기
- 시뮬레이션용 추론 시스템은 지시를 바탕으로 결과에 포함할 내용을 점진적으로 구체화한다. 상세한 동작 설명을 만드는 주체는 사람이 아니라 모델 자체다 [16:08]
- 첫 시도에서 충분한 결과를 얻지 못하면 여러 모델이 프레임워크 안에서 문제를 찾아 수정할 수 있다. 로봇 손가락의 움직임을 조정하는 식의 반복 개선까지 포함하면 데이터·모델 크기·추론 시간 외에 에이전트 구성도 확장의 축이 된다 [16:47]
9. 풍부한 시각 데이터가 곧 쉬운 학습을 뜻하지는 않는다
- 현실에는 시각 데이터가 풍부하지만, 영상에는 가림 현상과 관측되지 않는 세부 행동이 존재한다. 언어보다 가공되지 않은 신호를 다루므로 데이터가 많아도 필요한 정보를 온전히 얻기는 어렵다 [17:51]
- 시각 생성은 출력 차원이 크고 포착해야 할 현상도 복잡하다. 공기로 물체를 밀었을 때 움직임이 어떻게 퍼지는지 같은 물리적 변화까지 학습해야 한다 [18:21]
10. 물리 엔진의 합성 데이터로 시뮬레이션 정확도 높이기
- 데이터 규모가 커지면 모델이 재현하는 물리 현상도 개선된다. Omniverse나 Isaac 같은 물리 시뮬레이션 도구로 합성 데이터를 생성해 모델의 물리적 성능을 보완할 수 있다 [19:08]
- 딥러닝 모델은 여전히 내부 작동을 충분히 설명하기 어려운 블랙박스다. 관측 데이터에 담긴 물리 법칙을 간접적으로 근사한다고 볼 수 있지만, 물리를 이해한다고 단정할 수는 없다 [19:46]
11. Cosmos 3에서 관측·언어 추론·영상과 행동 생성 연결하기
- Cosmos 3는 혼합 트랜스포머 구조를 바탕으로 관측을 받아들이는 구성 요소, 언어로 추론하는 구성 요소, 생성기를 연결한다. 생성기는 학습된 표현과 추론 결과를 이용해 시뮬레이션 영상을 만든다 [21:31]
- 로봇 작업에서는 영상뿐 아니라 행동도 중요한 출력이다. 원하는 결과가 모터를 움직일 행동일 수 있으며, 신경망 내부에서는 이런 정보 역시 토큰으로 표현된다 [22:07]
12. 물리 법칙을 스스로 도출하는지를 이해의 기준으로 삼기
- 물리 법칙을 모르는 추론 모델이 공의 낙하를 반복 관찰한 뒤 정확한 모델링에 필요한 9.8이라는 계수를 스스로 도출한다면, 물리를 학습했다는 더 강한 근거가 될 수 있다 [22:37]
- 현재 모델이 그 단계에 도달했다고 보지는 않는다. 다만 추론 과정을 활용하면 모델이 실제로 무엇을 배웠는지 확인하는 경로를 찾을 가능성이 있다 [23:18]
13. 정책 후보 평가와 물체 집기·놓기에 세계 모델 활용하기
- Cosmos로 주행 정책별 성공률을 평가하면 유망한 정책 체크포인트를 추려 실제 차량 시험 대상을 좁힐 수 있다 [24:50]
- Cosmos 자체를 정책 모델이나 행동 모델로 사용하는 방식도 가능하며, 공개 당시 물체 집기·놓기 작업에서 좋은 결과를 보였다. 텍스트·영상·행동을 함께 다루는 모델에서 행동을 출력하면 지시와 세계의 동적 변화를 바탕으로 작업에 필요한 동작을 선택할 수 있다 [25:22]
14. 정책 모델은 관측 변화에 맞춰 경로와 제어 명령을 계속 갱신한다
- 정책 모델은 주어진 작업과 시각적 관측을 바탕으로 물리 장치를 제어할 명령을 만드는 AI다. 자율주행의 좌회전에서는 단순한 허용 판단을 넘어 차량이 따라갈 경로의 지점들을 출력한다 [26:16]
- 경로 생성은 연속적으로 이루어져야 한다. 회전 중 다른 차량이 끼어들면 새로운 시각 입력을 받아 경로를 다시 예측한다 [26:51]
15. 물리 AI의 하네스는 로봇 도구와 결과 검사를 조직한다
- 하네스는 모델 호출과 도구 사용을 조직하는 실행 구조이며, 자원 접근이나 안전 권한에 관한 규칙도 포함할 수 있다. 물리 AI에서도 기본 구조는 비슷하지만 연결되는 도구가 달라진다 [27:48]
- 실제 로봇, 카메라 보정 도구, 로봇 제어 행동을 생성하는 정책 모델이 구성 요소가 될 수 있다. 시각 검사 역할의 모델은 로봇이 작업을 완료했는지 평가한다 [28:29]
16. 다음 토큰 예측과 확산 모델은 복잡한 문제를 단계적으로 푼다
- GPT 같은 다음 토큰 예측 모델과 확산 모델은 복잡한 문제를 작은 단계로 나누어 해결한다는 공통점이 있다. 전자는 토큰을 하나씩 예측하고, 후자는 잡음을 단계적으로 제거한다 [29:15]
- 확산 모델도 전체 결과를 단번에 완성하는 방식은 아니다. 초기 잡음에서 출발해 반복적으로 잡음을 줄이며 결과를 생성한다 [29:49]
17. 문제 분해와 도구 호출이 물리적 AI로 확장된다
- 에이전트 AI는 어려운 문제를 작은 작업으로 나누고 모델을 여러 번 호출해 순서대로 해결한다. 다음 토큰 예측이나 잡음 제거를 반복하는 방식과 달리, 호출마다 지시를 바꿔 서로 다른 작업을 수행하게 할 수 있으며 이러한 분해 방식은 확장성이 있다는 평가다. [30:02]
- 물리적 AI의 복잡한 작업도 하위 문제로 나누고, 작업에 맞춘 실행 그래프로 처리할 수 있다는 구상이다. [30:53]
18. 실시간 반응과 비용이 로봇 모델의 전문화를 요구한다
- 모델이 충분히 강력해질수록 효율성이 주요 선택 기준이 될 것으로 본다. 수학 올림피아드 문제를 풀 필요가 없는 로봇이라면, 초기 학습에서 그런 능력이 유용하더라도 이후까지 모델 용량을 할당할 이유는 줄어든다. [33:13]
- 데이터센터에서는 여러 사용자의 API 요청을 묶어 처리할 수 있지만, 현장의 로봇은 동작을 위해 기다릴 수 없다. 이러한 연산 요구의 차이가 용도별 모델 구조의 다양화와 전문화를 이끌 것이라는 전망이다. [34:09]
19. 로봇의 작업 전환에는 물리적 스킬과 검증 수단이 필요하다
- 소프트웨어 에이전트에 레시피 카드 같은 전문 스킬을 제공하듯, 로봇도 물리적 스킬을 통해 달걀 요리에서 빨래 개기로 작업을 전환할 수 있다는 구상이다. 실제 수행 중 발견한 문제에 따라 동작을 바꾸는 과정도 필요하다. [36:11]
- 소프트웨어의
skill.markdown에 해당하는 물리적 AI의 체계는 아직 도래하지 않았다는 판단이며, 초기 시도는 존재한다. 컴퓨터만으로 빠르게 검증할 수 있는 디지털 작업과 달리 물리적 작업의 검증은 어렵다. [37:33]
20. 가정 내 일반화의 난점은 성공 여부를 판단하는 데 있다
- 집마다 주방 배치와 빨래를 정리하는 침실 환경이 달라, 제조 현장 밖의 가사 작업에서는 결과를 일관되게 검증하기 어렵다. 이런 차이가 다양한 물리적 공간에서 작동하는 지능의 과제가 된다. [38:39]
- 물리적 AI에서는 데이터 확보뿐 아니라 검증 가능한 보상을 얻는 일도 큰 난제이며, 더 어려울 수도 있다. 요리 과정을 시뮬레이션하더라도 음식이 좋은지는 결국 사람이 먹어 봐야 판단할 수 있다는 사례가 이를 보여 준다. [39:21]
21. 시뮬레이션에서 검증 가능한 작업이 먼저 발전할 수 있다
- 현실에서 얻기 어려운 보상 중 상당수는 시뮬레이션에서 구현할 수 있다고 본다. 시뮬레이션으로 성공 여부를 검증할 수 있는 작업이 더 빠르게 해결될 것이라는 전망이다. [40:27]
- 더 많은 작업을 시뮬레이션으로 옮겨 검증 가능한 보상을 확보하면 물리적 AI의 발전도 빨라질 수 있다. 이에 따라 완벽한 스크램블드에그를 만드는 로봇보다 세탁과 빨래 개기를 제대로 수행하는 가정용 로봇이 먼저 나올 가능성에 동의한다. [41:02]
22. 용도별 모델과 개방성이 개발자의 혁신을 뒷받침한다
- NVIDIA의 모델군은 응용 분야마다 다른 전문성이 필요하다는 관점에 기반한다. 언어·코딩용 Nemotron과 세계 모델용 Cosmos를 비롯해 인간 이해, 자율주행, 의료를 위한 모델로 다양화하는 방향이다. [41:51]
- API는 문제 해결에 유용하지만 내부 작동을 알 수 없는 블랙박스로 남는다. 소스와 모델의 개방은 개발자가 내부 원리를 이해하고 새로운 아이디어로 더 나은 모델을 만드는 데 도움이 된다는 입장이다. [42:25]
23. 3차원 세계 생성의 검증 루프가 새로운 가능성을 보여 준다
- 자막에서 ‘아스트라’로 언급되는 사례는 소수의 숙련자에게 어려웠던 3차원 세계 제작의 가능성을 보여 준다. Blender로 공간을 만들고 투영 결과가 설명과 일치하는지 확인하는 반복 과정이 검증 가능한 보상을 제공해 시뮬레이션 환경 생성을 빠르게 할 수 있다는 평가다. [44:13]
- 다음 돌파구로 기대하는 것은 이런 방식을 물리적 AI와 물리적 도구 사용에 연결하는 일이다. 현재 가능한 작업에서도 아직 널리 인식되지 않은 검증 가능한 보상을 찾아낼 수 있다는 가능성이며, 구체적인 실현 시점이나 성과가 확정된 것은 아니다. [45:10]
24. 연구 성과와 지식의 공유가 후속 발전을 확산시킨다
- 연구자 한두 명 또는 세 명이 특정 분야의 AI를 발전시킬 아이디어를 논문으로 공개하면, 다른 사람들도 이를 배우고 후속 발전에 활용할 수 있다. 물리적 공간에서의 검증 가능성도 이러한 혁신이 나올 수 있는 분야로 거론된다. [45:32]
- 지식을 모든 사람에게 확산할 수 있도록 하는 일이 더 나은 세상을 만드는 데 중요하다는 믿음이 마지막 논지로 남는다. 연구 배경을 가진 많은 사람이 이런 생각을 공유한다는 점이 낙관의 근거가 된다. [46:00]
🧾 결론
- 제목의 질문에 대한 답은 출시 날짜가 아니라 해결해야 할 조건이다. 다양한 주방에서 작업하고 결과까지 검증하는 능력이 필요하다.
- 세계 모델의 실용적 가치는 환경 생성, 정책 평가, 행동 선택을 연결해 개발과 시험을 돕는 데 있다. 실제 환경에서의 성능 확인은 여전히 중요하다.
- 시뮬레이션에서 검증 가능한 보상을 확보하는 작업이 먼저 발전할 수 있다. 가사 로봇의 보급 순서도 작업별 검증 난도에 영향을 받을 수 있다.
- 물리 현상의 재현과 물리 법칙의 이해는 구분해야 한다. 모델이 관측으로부터 법칙을 스스로 도출하는 수준에 도달했다는 주장은 제시되지 않는다.
📈 투자·시사 포인트
- 엔비디아의 플랫폼 전략: GPU뿐 아니라 CUDA, 모델, 시뮬레이션 도구까지 함께 제공해 개발자의 작업을 줄이고 하드웨어 설계에 필요한 요구를 파악한다는 점이 관찰 포인트다.
- 용도별 연산 수요: 현장 제어와 데이터센터 추론은 지연시간·비용 조건이 다르다. 물리 AI의 확장이 어떤 모델 크기와 배치 방식으로 이어지는지 살펴볼 필요가 있다.
- 검증 수단의 중요성: 로봇의 동작 시연뿐 아니라 성공률을 반복 측정할 수 있는 환경과 보상 설계가 개발 속도를 좌우할 수 있다.
- 사업성 판단의 한계: 제공 자료는 기술 방향을 설명하지만 매출 기여, 수익성, 보급 시점을 제시하지 않는다. 기술적 가능성만으로 투자 성과를 판단할 근거는 부족하다.
⚠️ 불확실하거나 확인이 필요한 부분
- 스크램블드에그를 안정적으로 만드는 가정용 로봇의 출시 시점은 제시되지 않는다. 빨래 로봇이 먼저 나올 수 있다는 발언도 확정된 일정이 아닌 전망이다.
- Cosmos의 물체 집기·놓기 성과는 정량 성공률, 비교 대상, 시험 조건이 함께 제시되지 않아 일반 가정으로의 확장성을 판단하기 어렵다.
- 시뮬레이션에서 얻은 성능이 실제 환경에서도 유지되는 정도는 확인이 필요하다. 영상의 가림과 관측되지 않는 행동은 학습 정보의 한계로 남는다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- Cosmos 관련 원 발표와 기술 문서에서 모델 구조, 행동 출력 범위, 공개된 평가 조건을 확인한다.
- 요리·빨래 개기·케이블 연결을 대상으로 성공 기준과 검증 방법을 각각 정리하고, 시뮬레이션에서 평가 가능한 부분을 구분한다.
- 로봇 시연을 평가할 때 반복 성공률, 환경 변화 대응, 작업 완료 판정 방식을 함께 확인한다.
- 엣지 제어와 데이터센터 추론을 나누어 지연시간, 연산 비용, 필요한 모델 능력을 비교한다.
❓ 열린 질문
- 음식의 맛처럼 시각 검사만으로 판단하기 어려운 품질을 어떤 보상과 검증 방식으로 학습시킬 수 있을까?
- 시뮬레이션에서 익힌 작업을 배치와 도구가 다른 실제 가정에서도 얼마나 안정적으로 수행할 수 있을까?
- 작은 현장 모델과 큰 원격 모델 사이에서 작업을 나누는 기준은 어떻게 정해야 할까?