This AI entrepreneur is developing agents that can plan ahead for the unexpected
Quick Summary
Danijar Hafner는 월드 모델 안에서 미래 결과를 예측하며 학습하는 AI 에이전트를 개발하고, 이를 훈련에서 접하지 못한 상황에 대응하는 로봇으로 확장하고 있다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Danijar Hafner는 월드 모델 안에서 미래 결과를 예측하며 학습하는 AI 에이전트를 개발하고, 이를 훈련에서 접하지 못한 상황에 대응하는 로봇으로 확장하고 있다.
📌 핵심 요약
- 31세인 Danijar Hafner의 신생 스타트업은 샌프란시스코 SoMa에서 비공개로 운영되고 있으며, 중국에서 수입한 휴머노이드를 활용해 낯선 환경에 대응하는 AI 연구를 물리적 로봇으로 확장하고 있다.
- Hafner는 물리적 현실을 모사하는 월드 모델 안에서 에이전트를 훈련하는 모델 기반 강화학습을 사용한다. 에이전트는 모델 속 경험으로 미래 결과를 예측하며, 기사는 이 방식이 로봇공학에서 전통적으로 사용해 온 현실의 시행착오 훈련 없이도 복잡한 작업을 수행하게 한다고 설명한다.
- Hafner는 2015년 Hasso Plattner Institute 학부 2학년 때 Google Brain의 학생 연구원이 됐고, 이후 Google Brain과 Google DeepMind 등에서 약 12차례 인턴십과 기타 직무를 경험했다. Geoffrey Hinton, Ashish Vaswani와 함께 일했으며, Timothy Lillicrap는 그의 연구·구현 능력을 높이 평가했다.
- PlaNet은 미리 계획해 행동하는 에이전트를 구현했고, Dreamer 2는 월드 모델을 사용해 Atari 2600 게임에서 인간 수준의 성능에 처음 도달했다. Dreamer 3는 Minecraft Diamond challenge를 처음 해결했으며, Dreamer 4는 게임과 직접 상호작용하지 않고 녹화된 게임 플레이 영상의 오프라인 데이터로 다이아몬드 채굴을 학습했다.
- DayDreamer는 Dreamer 알고리즘을 이용해 로봇이 새로운 환경에서 스스로 작동하고, 밀려 넘어지는 것 같은 새로운 경험에 별도의 특정 훈련 없이 대응하게 했다. Hafner는 2025년 가을 Google DeepMind를 떠나 스타트업을 설립했지만, 구체적인 다음 단계는 공개하지 않았다.
🧩 주요 포인트
- 월드 모델에서 미래 결과를 예측하는 접근 → 처음 보는 집의 구조와 가구 배치처럼 훈련에 없던 상황에 대응하는 로봇을 만드는 핵심 수단으로 제시된다.
- PlaNet에서 Dreamer 4까지 이어진 게임 성과 → 사전 계획, 인간 수준의 수행, 복잡한 목표 달성, 직접 상호작용 없는 학습으로 접근법의 가능성을 단계적으로 입증했다.
- DayDreamer의 현실 적용과 비공개 스타트업 설립 → 가상 환경에서 검증한 연구를 물리적 로봇으로 확장하고 있지만, 다음 단계의 구체적인 내용은 아직 확인할 수 없다.
🧠 상세 정리
1. 비공개 스타트업이 겨냥하는 낯선 환경
기사의 출발점은 샌프란시스코 SoMa에 있는 Danijar Hafner의 사무실로, 방문 당시 다른 사람은 한 명뿐이고 가구도 거의 없지만 다양한 형태와 크기의 휴머노이드가 공간 중앙의 거치대에 매달려 있었다. 31세인 Hafner의 신생 스타트업은 아직 비공개 운영 단계이며, 문에도 회사 이름이 붙어 있지 않았다. 그는 사업의 세부 내용은 아끼면서도, 훈련에서 경험하지 못한 환경을 AI가 탐색하도록 해 온 오랜 연구의 연장선이라고 설명했다. 중국에서 수입한 휴머노이드는 그 연구의 다음 단계이자 물리적 구현이며, 로봇을 사람의 집에 보내려면 처음 보는 평면 구조와 가구 배치에도 대응할 수 있어야 한다는 문제가 연구의 필요성을 보여 준다.
2. 월드 모델 안에서 학습하고 미래를 예측하는 방식
Hafner가 사용하는 핵심 방법은 모델 기반 강화학습으로, 물리적 현실을 모사하도록 설계한 월드 모델을 만들고 그 안에서 에이전트를 훈련한다. 에이전트는 이 모델을 현실 세계의 시뮬레이션처럼 받아들이며 그 안에서 어떻게 행동할지를 학습한다. 이후 모델 속 경험을 바탕으로 앞으로 일어날 결과를 예측하는데, Hafner는 이를 꿈꾸거나 상상하는 것으로 표현할 수 있다고 본다. 이러한 예측은 에이전트와 그것을 탑재한 로봇이 현실의 낯선 상황에 대응하도록 하는 기반이다. 기사는 그의 방식이 로봇공학에서 전통적으로 사용해 온 현실의 시행착오 훈련 없이도 매우 복잡한 작업을 수행하게 한다고 설명하지만, 이 대목에서 구체적인 작업별 성능 수치나 비교 결과를 제시하지는 않는다.
3. 사고 과정에 대한 관심에서 시작된 연구
Hafner는 독일 북동부의 시골 마을에서 자랐으며, 부모는 모두 클래식 음악가였다. 그는 이웃에게 프로그래밍을 배웠고 고등학교 때 AI 온라인 강의를 듣기 시작하면서 빠르게 이 분야에 몰두했다. 스스로 사고가 어떻게 작동하는지에 늘 매료돼 있었다고 설명하며, AI를 컴퓨터에서 사고를 모사할 수 있는 수단으로 받아들였다. 2015년에는 포츠담의 Hasso Plattner Institute에서 공학을 공부하던 학부 2학년으로서 Google Brain의 학생 연구원 자리를 얻었다. 기사는 이 개인적 관심과 초기 연구 기회를 소개한 뒤, 그가 여러 연구 조직에서 경험을 쌓으며 자신의 접근법을 발전시켜 온 경력으로 이야기를 이어 간다.
4. Google에서 쌓은 경험과 동료의 평가
Google Brain의 학생 연구원으로 시작한 Hafner는 이후 회사에서 약 12차례 인턴십과 기타 직무를 경험했으며, 영국·캐나다·미국의 Google Brain과 Google DeepMind에서도 일했다. 기사는 두 조직이 이후 DeepMind로 통합됐다고 설명하고, 그가 함께 일한 연구자로 Geoffrey Hinton과 Ashish Vaswani를 소개한다. Hinton은 AI의 대부 중 한 명으로 불리며, Vaswani는 오늘날 대규모 언어 모델에 쓰이는 트랜스포머 기술을 설명한 논문 「Attention Is All You Need」의 공동 저자다. 과거 그의 관리자이자 공동 저자였던 Timothy Lillicrap는 Google의 뛰어난 연구자들 사이에서도 Hafner가 상위 0.5%에 쉽게 든다고 평가했다. 또한 엔지니어 팀 전체가 필요할 만한 것을 그가 혼자 만드는 경우가 많았다고 말했으며, 이는 기사에서 동료의 평가로 제시된다.
5. PlaNet에서 Dreamer 4까지 이어진 게임 검증
Hafner는 여러 해에 걸쳐 월드 모델 안에서 훈련한 에이전트가 인기 비디오게임을 수행하게 하면서 자신의 접근법을 다듬고 입증했다. 첫 돌파구인 PlaNet은 에이전트가 앞을 내다보고 계획해 행동하도록 했으며, Dreamer 2는 월드 모델을 사용해 Atari 2600 게임에서 인간 수준의 성능을 달성한 최초의 에이전트였다. Dreamer 3는 게임 속 보석을 스스로 채굴하는 Minecraft Diamond challenge를 처음 해결했다. Dreamer 4는 여기서 더 나아가 게임과 직접 상호작용하지 않고, 녹화된 게임 플레이 영상으로 구성된 오프라인 데이터에서 다이아몬드 채굴을 학습했다. 이 흐름은 계획을 통한 행동에서 복잡한 목표 달성으로, 다시 직접적인 게임 경험 없이 학습하는 방식으로 연구가 발전해 왔음을 보여 준다.
6. DayDreamer의 현실 적용과 공개되지 않은 다음 단계
최근 Hafner는 가상 세계에서 개발한 에이전트를 물리적 현실로 옮기기 시작했으며, DayDreamer 프로젝트가 그 사례로 소개된다. 이 프로젝트는 Dreamer 알고리즘을 사용해 로봇이 새로운 환경에서 스스로 작동하고, 밀려 넘어지는 것 같은 새로운 경험에도 해당 상황을 위한 별도의 특정 훈련 없이 반응하게 했다. 이는 앞서 제시된 게임 성과에서 실제 로봇의 환경 적응으로 넘어가는 주요 전환점이다. Hafner는 2025년 가을 Google DeepMind를 떠나 새 스타트업을 설립했지만, 앞으로의 구체적인 계획에는 말을 아꼈다. 그는 세상을 바꿀 문제를 해결하는 데 관심이 있었다고 밝혔으며, 기사는 이 포부를 전하면서도 스타트업의 제품이나 다음 단계에 대한 세부 정보는 공개하지 않는다.
🧾 핵심 주장 / 시사점
- 기사에서 월드 모델의 가치는 미래 결과를 예측해 훈련에서 접하지 못한 환경에 대응하도록 하는 데 있다. 처음 보는 집의 구조와 가구 배치는 이 능력이 필요한 구체적인 사례다.
- Dreamer 계열의 성과는 서로 다른 진전을 보여 준다. Dreamer 2는 수행 수준, Dreamer 3는 복잡한 목표 달성, Dreamer 4는 직접 상호작용 없이 학습하는 가능성을 각각 드러낸다.
- DayDreamer는 물리적 로봇으로 연구가 확장됐다는 근거지만, 비공개 스타트업의 구체적인 다음 단계까지 설명해 주지는 않는다. 확인된 연구 성과와 향후 사업의 포부 사이에는 공개 정보의 차이가 남아 있다.
✅ 액션 아이템
- 월드 모델의 미래 결과 예측이 처음 보는 집의 구조와 가구 배치에 대한 대응으로 이어지는 근거 검토.
- PlaNet, Dreamer 2, Dreamer 3, Dreamer 4의 성과를 사전 계획·수행 수준·목표 달성·직접 상호작용 없는 학습의 관점에서 비교.
- DayDreamer의 새로운 환경 대응 성과와 비공개 스타트업의 아직 공개되지 않은 다음 단계를 구분해 파악.
❓ 열린 질문
- 월드 모델에서 미래 결과를 예측하는 능력은 처음 보는 집의 구조와 가구 배치에 대응하는 데 어느 정도까지 효과가 있는가?
- Dreamer 4의 직접 상호작용 없는 학습은 물리적 로봇으로 확장할 때도 같은 방식으로 가능한가?
- 2025년 가을 설립한 비공개 스타트업은 DayDreamer의 성과를 어떤 구체적인 다음 단계로 이어 갈 것인가?