Robot-Use Agents: Why General-Purpose Models May Win in Robotics
Quick Summary
Robot Use Agents: Why General Purpose Models May Win in Robotics를 중심으로, 범용 모델의 로봇 제어는 코딩 에이전트의 일반화 능력이 물리적 작업으로 확장되는 사례다. Waddle Labs는 제어 시스템과 학를 핵심 판단 포인트로 압축 정리한다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Robot-Use Agents: Why General-Purpose Models May Win in Robotics를 중심으로, 범용 모델의 로봇 제어는 코딩 에이전트의 일반화 능력이 물리적 작업으로 확장되는 사례다. Waddle Labs는 제어 시스템과 학를 핵심 판단 포인트로 압축 정리한다.
📌 핵심 요점
- 범용 모델의 로봇 제어는 코딩 에이전트의 일반화 능력이 물리적 작업으로 확장되는 사례다. Waddle Labs는 제어 시스템과 학습 데이터를, RoboCurve는 다양한 모델·로봇의 평가를 다룬다.
- RT2는 웹 텍스트·이미지 사전학습을 로봇 행동으로 연결한 선행 사례다. 출연자들은 최근 모델의 강점을 행동 출력 이전의 추론, 코드 작성, 도구 사용에서 찾는다.
- 핵심 경쟁 요소는 모델 구조뿐 아니라 학습 데이터와 활용 방식이다. 코딩·컴퓨터 사용·시각 데이터가 로봇 작업에 필요한 절차적·공간적 이해로 전이될 수 있다는 주장이다.
- 문맥 내 학습은 적은 경험으로 빠르게 적응하는 수단이지만 한계도 있다. 배운 내용을 코드·도구·기술 라이브러리 또는 모델 가중치에 정착시키는 과정이 함께 논의된다.
- 상용화의 관건은 성공 시연을 빠르고 반복 가능한 실행으로 바꾸는 것이다. 반복 동작은 코드로 처리하고 인식·실패 대응에는 모델을 호출하는 구성이 제안되며, 지연시간과 기술 라이브러리 관리가 남은 과제로 제시된다.
🧩 배경과 문제 정의
영상은 코딩 에이전트의 능력이 로봇 제어까지 일반화될 수 있다는 관찰에서 출발한다. 필립 이솔라의 ‘로봇 사용 에이전트’ 논의를 소개하고, Waddle Labs와 RoboCurve 관계자들과 함께 범용 언어모델이 로봇을 다루는 방식과 그 한계를 살핀다.
중심 질문은 로봇 전용 데이터를 기반으로 특화 모델을 만드는 것과, 이미 강력한 범용 모델에 로봇 도구를 연결하는 것 중 어떤 접근이 더 효과적인가이다. 대화는 RT2와 코드 정책 연구에서 시작해 문맥 내 학습, 경험의 기술화, 실제 제어 시연, 데이터 간 전이, 상용화 병목으로 이어진다. 아래 내용은 제공된 전사에 담긴 설명과 주장을 정리한 것이며, 실험 관찰과 미래 전망을 구분한다.
🕒 시간순 섹션별 상세정리
1. 코딩 에이전트에서 로봇 사용 에이전트로
- 진행자는 코딩 에이전트의 영역 간 일반화가 로봇 제어로 확장되고 있다며, 범용 모델이 다양한 로봇의 능력을 높일 수 있다는 문제를 제기한다. [00:18]
- Waddle Labs는 언어모델 기반 제어 시스템과 데이터 수집·학습을, RoboCurve는 모델 종류와 로봇 형태를 가로지르는 평가를 보여준다. [01:19]
2. 주목받은 시연과 RT2의 출발점
- 뚜껑 풀기, 로봇 간 소통, 펜 열기 등의 영상이 연구 배경을 살펴보는 계기로 나온다. [01:49]
- RT2는 웹 텍스트·이미지로 사전학습한 모델을 미세조정해 말단장치의 위치·자세를 출력하고, 이를 관절 명령으로 연결하는 사례로 드러난다. [02:47]
- 출연자는 최근 모델이 일부 제어를 별도 미세조정 없이 수행할 정도로 발전했다는 관점을 제시한다. [02:58]
3. 행동 전에 생각하고 코드를 만드는 능력
- 수학 문제에서 답만 출력하던 모델에 중간 추론을 허용한 사례를 들어, 로봇도 행동 전에 더 많은 추론을 사용할 수 있다는 비교를 제시한다. [03:33]
- 초기 VLA의 직접 행동 출력과 대비해, 코드나 추론을 활용하면 복잡한 작업에 더 많은 계산을 쓰고 동작 절차를 압축해서 표현할 수 있다고 주장한다. [04:07]
4. 모델 구조에서 데이터 활용 방식으로
- 에이전트에 자율성과 자원을 더 주면 기존에 미세조정으로 해결하던 일을 수행할 수 있다는 견해가 나온다. [04:25]
- 다른 출연자는 VLA도 언어모델 기반이므로 차이를 구조에만 돌리기 어렵다며, 모델이 잘 이해하는 풍부한 데이터로 로봇 작업을 표현하는 데 주목한다. [05:21]
- RT2의 강점 역시 웹 이미지와 관련 정보의 사전학습을 활용한 데 있다는 설명이 계속된다. [05:43]
5. 도구 사용과 코딩 데이터의 로봇 전이
- 최근 모델은 복잡한 정책을 코드로 작성하고, 도구를 사용해 이용 가능한 로봇 팔과 환경을 탐색하는 데 더 능숙해졌다고 보여준다. [06:27]
- 컴퓨터 사용과 코딩을 포함한 다양한 데이터를 로봇 모델에 통합하면 결국 범용 에이전트에 가까워진다며, 강력한 기반 모델을 로봇 제어에 활용하자는 주장을 펼친다. [07:04]
6. Code as Policies와 Voyager의 도구 생성
- 진행자는 초기 코딩 모델이 주석을 바탕으로 파이썬 코드를 완성하던 시기의 Code as Policies 연구를 현재 로봇 에이전트의 선행 흐름으로 보여준다. [07:40]
- Voyager는 기본 도구와 제어 구문을 조합해 새로운 도구를 만들고, 마인크래프트에서 이를 다시 호출한 사례로 드러난다. [08:22]
- 사고와 경험을 재사용 가능한 도구로 압축하는 능력이 강조되며, 코딩 능력에 대한 투자가 로봇 정책 작성에도 영향을 줬다는 해석이 나온다. [09:17]
7. 기본 동작 함수를 조합하는 초기 로봇 정책
- 초기 연구는 집기·들기·특정 자세로 이동하기 같은 동작을 파이썬 함수로 제공하고, 모델이 이를 조합해 복잡한 작업을 수행하도록 했다고 보여준다. [10:10]
- 출연자는 방대한 코딩 사전학습 덕분에 추가 로봇 데이터 없이 첫 시도부터 동작 순서를 구성한 점을 강조하며, 이것이 후속 연구의 동기가 됐다고 드러낸다. [10:39]
8. 문맥 내 학습의 효율과 포화
- 논문화 전 실험을 소개하며, 상태·행동·결과에 대한 피드백을 문맥에 넣는 방식과 가중치에 학습을 반영하는 방식을 비교한다. [11:28]
- 피드백으로 개선하려면 이를 활용하도록 학습된 모델이 필요하며, 예시를 추가할수록 성능이 항상 일정하게 좋아지는 것은 아니라고 보여준다. [12:29]
- 해당 실험에서는 약 20~40개 예시 이후 개선이 포화됐다고 보고하고, 모델의 문맥 활용 능력과 길이 제한을 한계로 지적한다. [13:07]
9. 검색·미세조정·기술 저장의 선택
- 필요한 정보를 검색해 문맥으로 가져오는 RAG를 참고서를 보며 시험을 치르는 상황에 비유하고, LoRA와 전체 모델 학습까지 적응 방식의 범위를 넓힌다. [13:50]
- 데이터가 많은 경우와 적은 경우의 적합한 학습 방식이 다를 수 있으며, 적은 경험으로 얻은 학습을 도구나 기술로 압축하는 구조가 중요하다고 제안한다. [14:22]
- 시험관을 집는 실험실 로봇을 예로 들어, 현장에서 익힌 기술을 프로그램과 기억으로 남겨 후속 에이전트가 활용하는 방식을 보여준다. [15:05]
10. 큰 모델의 특화와 학습 표현의 경계
- 큰 모델이 특정 작업에 맞는 작은 모델과 실행 체계를 구성하면 더 작고 빠른 수행이 가능하다는 메타학습 관점이 드러난다. [15:39]
- 문맥 내 학습의 도달 범위는 아직 열린 문제이며, 가중치에서의 학습과 기호적 표현 사이의 경계도 단순하지 않다고 드러낸다. [15:59]
- Y Combinator의 모집 안내가 삽입된 뒤 실제 로봇 시연으로 전환한다. [16:12]
11. 카메라 관찰과 직접 도구 호출 시연
- 로봇 팔로 탁자의 큐브를 집어 그릇에 넣는 장면을 보여준다. 출연자는 이 제어가 관절 코드를 직접 생성하는 방식보다는 카메라 입력을 바탕으로 도구를 호출하는 방식에 가깝다고 정정한다. [16:44]
- 반복 작업은 매번 대형 모델을 호출하기보다 빠른 코드나 기존 기술로 실행하는 편이 적합하고, 예외 처리에도 도움이 된다고 보여준다. [17:17]
- 시연의 느린 반응은 모델 지연시간과 연결된다. 이후 속도 개선 추세와 연말 실시간 제어 가능성을 전망하지만 측정 자료는 제시하지 않는다. [17:49]
12. 반복 실행과 예외 판단의 결합
- 시연에서는 여러 차례 카메라 이미지를 받고 다음 말단장치 자세를 출력하는 도구 호출을 반복했다고 보여준다. [18:25]
- 반복적이고 결정적인 부분은 코드로 자동화하고, 물체 인식이나 실패 판정처럼 상황에 따라 달라지는 지점에서는 시각언어모델을 호출하는 구성을 제안한다. [19:11]
13. 입력에 답하는 모델에서 프로그램을 만드는 모델로
- 입력과 출력의 대응을 직접 학습하는 방식과, 몇 가지 예시를 보고 그 대응을 구현하는 함수를 생성하는 방식을 비교한다. [20:16]
- 전통적 프로그램 생성의 어려움은 적절한 사전 가정을 찾는 데 있었으며, 강력한 모델의 코드 생성이 이를 도울 수 있다는 해석이 나온다. [20:50]
- 신경망이 실행 가능한 기호인 코드를 출력한다는 점에서 이 접근을 신경기호적 방식으로 보여준다. [20:56]
14. 공통 세계 표현이라는 가설
- 플라톤적 표현 가설을 소개하며, 서로 다른 데이터로 학습한 모델들이 세계에 대한 유사한 표현으로 수렴할 수 있다는 관점을 논의한다. [21:43]
- 이 가설이 성립한다면 강력한 언어모델의 세계 표현이 강력한 로봇 모델의 표현과 비슷해져 로봇 제어에도 유용할 수 있다고 추론한다. [22:55]
15. 공간 이해와 컴퓨터 사용 데이터
- 진행자는 Astra의 시각·공간 능력 향상 원인을 묻고, 출연자는 컴퓨터 사용과 CAD 데이터의 기여 가능성을 추정한다. [23:56]
- Blender에서 물체를 회전시키는 작업처럼 화면 조작에도 공간 관계가 포함되며, 이를 큰 모델의 기존 능력과 결합하면 로봇 제어에 도움이 될 수 있다고 보여준다. [24:43]
- 로봇 데이터에 코딩·컴퓨터 사용·일인칭 영상 등 다양한 데이터를 함께 학습시키는 방향을 제안한다. [25:11]
16. 익숙한 인터페이스로 물리적 제어 연결하기
- 물리적 세계를 본떠 만든 그래픽 인터페이스가 역으로 모델의 물리적 작업 이해를 도울 수 있다는 비유가 드러난다. [25:45]
- 로봇 도구를 컴퓨터 사용 도구처럼 설계하고, 커서를 끌어 이동 목적지를 지정하게 하는 연결 방식이 작업 수행에 도움이 된다는 연구 사례를 언급한다. [26:04]
17. 범용 로봇 전망과 경제성의 병목
- 출연자는 약 2년 안에 자연어 지시에 따라 새로운 작업과 환경에 일반화하는 범용 로봇이 등장할 수 있다는 전망을 제시한다. [27:04]
- Waddle Labs 측은 매 단계 대형 모델이 추론하면 너무 느려 경제성이 떨어진다며, 최초의 문맥 기반 수행을 빠르게 반복할 수 있는 기술·정책으로 전환해야 한다고 강조한다. [27:39]
- 인간의 수면 중 기억 정착에 비유해, 모은 경험을 정리하고 별도 모델의 가중치에 반영하는 가능성을 논의한다. [28:35]
18. 축적된 기술을 정리하는 문제와 마무리
- DreamCoder의 기술 라이브러리와 압축 과정을 언급하며, 로봇의 경험과 기술도 재구성할 필요가 있다고 보여준다. [29:00]
- 커지는 기술 라이브러리를 어떻게 가지치기하고 조직하며 배치 데이터를 관리할지가 향후 과제로 드러난다. [29:18]
- 진행자는 앞으로 몇 년간의 로봇 발전에 대한 기대와 사회가 변화의 규모를 충분히 인식하지 못하고 있다는 견해로 대화를 마친다. [29:38]
🧾 결론
- 범용 모델 우위는 영상의 중심 가설이다. 제시된 시연과 연구 설명만으로 모든 로봇·작업에서 우위가 입증된 것은 아니다.
- 로봇 지능의 발전 경로는 로봇 데이터만 늘리는 방식에서 다양한 데이터와 기존 모델의 능력을 활용하는 방향으로 넓어진다.
- 범용 모델의 적응 능력과 재사용 가능한 실행 코드를 결합하는 방식이 영상에서 제안하는 실용적 방향이다.
- 경험을 축적하는 것에 더해, 필요한 기술을 찾아 재사용하고 정리하는 능력이 장기 운용의 핵심 과제로 남는다.
📈 투자·시사 포인트
- 기업을 검토할 때 기반 모델의 성능뿐 아니라 로봇 연결 시스템, 평가 역량, 현장 데이터 수집 구조를 함께 살펴볼 근거를 제공한다.
- 경제성 판단에서는 단일 작업의 성공 여부와 함께 반복 처리 속도, 모델 호출 지연, 실패 후 복구 능력을 확인해야 한다. 영상에서도 매 단계 대형 모델이 추론하는 방식의 낮은 생산성을 지적한다.
- 범용 모델이 개선될수록 이를 현장 작업에 연결하고 경험을 재사용 가능한 기술로 전환하는 소프트웨어의 역할이 커질 수 있다.
- ‘약 2년 내 범용 로봇’은 출연자의 전망이다. 투자 판단에서는 이 시간표와 실제 배치 환경에서 검증된 성능을 구분해야 한다.
⚠️ 불확실하거나 확인이 필요한 부분
- 모델 간 성공률, 작업 난도, 시험 횟수, 비용을 통제한 비교표가 제공되지 않는다. 범용 모델의 전반적 우위를 정량적으로 판단하기에는 자료가 부족하다.
- Astra의 공간 능력 향상을 컴퓨터 사용·CAD 데이터와 연결하는 설명은 출연자의 추정이다. 실제 학습 데이터 구성이나 인과관계가 공개된 것으로 읽어서는 안 된다.
- 문맥 내 학습이 약 20~40개 예시에서 포화된다는 관찰은 아직 논문화하지 않았다는 실험 설명에 기반한다. 유효 문맥 길이를 학습 길이의 절반 정도로 보는 발언 역시 일반 법칙으로 확장하기 어렵다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- RT2와 Code as Policies의 원문에서 사전학습, 행동 출력 방식, 제공 도구, 추가 로봇 데이터 사용 조건을 확인한다.
- 동일 로봇·동일 작업에서 직접 도구 호출, 코드 정책, VLA를 비교하고 성공률·완료 시간·실패 복구·호출 비용을 기록한다.
- 시연 과정을 반복 동작과 인식·예외 판단으로 나누고, 어떤 부분을 재사용 가능한 코드로 전환할 수 있는지 표시한다.
- 문맥 내 학습으로 얻은 경험을 기술 라이브러리에 저장했을 때 새로운 환경에서도 재사용되는지 검증한다.
❓ 열린 질문
- 범용 모델이 로봇 특화 모델보다 유리한 작업과, 별도의 로봇 데이터·미세조정이 필요한 작업은 어떻게 나뉘는가?
- 새 경험을 문맥, 검색 가능한 기억, 실행 코드, 가중치 중 어디에 저장해야 적응 속도와 반복 실행 효율이 가장 좋아지는가?
- 기술 라이브러리가 커질 때 중복 기술을 통합하고 불필요한 기술을 제거하면서 일반화 능력을 유지할 수 있는가?