YouTubeNo Priors: AI, Machine Learning, Tech, & Startups·2026년 9월 18일·0

Why Diffusion Will Win AI Inference with Inception Co-Founder and CEO Stefano Ermon

Quick Summary

Inception의 스테파노 에르몬은 확산 모델의 병렬 생성이 AI 추론의 속도와 비용 경쟁에서 유리하다고 보지만, 최고 수준의 지능과 대규모 확장에서도 우세할지는 아직 검증이 필요하다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Why Diffusion Will Win AI Inference with Inception Co-Founder and CEO Stefano Ermon 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Why Diffusion Will Win AI Inference with Inception Co-Founder and CEO Stefano Ermon의 핵심 내용을 4단계로 요약한 인포그래픽
Why Diffusion Will Win AI Inference with Inception Co-Founder and CEO Stefano Ermon 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Inception의 스테파노 에르몬은 확산 모델의 병렬 생성이 AI 추론의 속도와 비용 경쟁에서 유리하다고 보지만, 최고 수준의 지능과 대규모 확장에서도 우세할지는 아직 검증이 필요하다.

📌 핵심 요점

  1. 자기회귀 추론은 앞선 토큰이 완성돼야 다음 토큰을 생성하므로 병렬화가 제한된다. 확산 모델은 여러 토큰을 동시에 처리해 GPU의 행렬 연산 능력을 더 잘 활용한다는 것이 핵심 주장이다.
  2. 창업의 근거가 된 연구는 GPT-2 규모에서 같은 데이터·파라미터 수의 자기회귀 모델에 필적하는 퍼플렉시티를 보였고, 텍스트 생성 속도를 약 10배 높였다고 소개된다. 이 결과를 현재 모든 모델과 작업에 적용되는 성능 차이로 해석해서는 안 된다.
  3. 추론 효율은 서비스 비용뿐 아니라 추론 시 연산 확대와 강화학습 롤아웃 생성에도 영향을 준다. 같은 자원으로 더 많은 경로를 탐색할 수 있다는 점이 확산 방식의 장기적 경쟁 논리다.
  4. Mercury의 초기 적용처는 지연 시간에 민감한 작업이다. 에르몬은 속도 최적화 모델들과 비슷한 품질에서 더 빠르다고 주장하며, OpenCall의 음성 에이전트 전환 사례와 OpenAI 호환 API·구조화 출력 지원을 소개한다.
  5. 상용화 경쟁력에는 자체 서빙 엔진, 후학습 인프라, 고객 피드백과 평가 데이터가 포함된다. 생성 중 제어와 데이터 효율도 잠재적 장점이지만, 대규모 실현 여부와 제품화 방식은 열려 있다.

🧩 배경과 문제 정의

  • 자기회귀 언어 모델은 토큰을 순서대로 생성하므로 추론에서 병렬화가 제한되고, GPU 연산보다 메모리 이동이 병목이 되기 쉽다. 추론 속도와 비용은 서비스 운영뿐 아니라 추론 시 연산 확장과 강화학습 후처리에도 영향을 준다.
  • 이미지·영상에서 성과를 낸 확산 모델을 텍스트·코드에 적용하려면 연속적인 픽셀과 달리 단어 사이에 자연스러운 중간값이 없는 이산 데이터의 특성을 해결해야 한다.
  • Inception은 여러 토큰을 동시에 처리하는 확산 기반 언어 모델로 속도와 효율을 높이려 한다. 대형 연구소와 경쟁하려면 모델 품질뿐 아니라 실제 서비스용 추론 엔진과 고객 사용 경험도 확보해야 한다.
  • 현재의 차별점은 속도이며, 더 높은 지능·데이터 효율·제어 가능성이 대규모 모델에서도 실현될지는 아직 불확실하다.

🕒 시간순 섹션별 상세정리

1. 생성 모델의 출발점은 비지도 학습과 세계의 구조 이해다

  • 에르몬이 스탠퍼드에 합류한 2014년에는 흐릿한 숫자 이미지를 생성하는 것도 성과였고, 생성 모델 연구는 비라벨 데이터에서 특징을 학습해 지도학습을 개선한다는 논리로 필요성을 설명해야 했다. [00:50]
  • 생성 모델은 데이터 구조를 이해하고, 행동 이후의 상황을 상상하는 세계 모델을 만드는 수단이었다. 당시에는 오늘날 LLM의 능력까지 예상하지 못했고, 평생 연구할 어려운 문제라고 생각했던 분야가 예상보다 빠르게 발전했다. [01:48]

2. 불안정한 GAN의 대안으로 반복적인 노이즈 제거가 등장했다

  • 초기 이미지 생성용 자기회귀 모델은 느리고 흐릿했으며, 이후 부상한 GAN은 학습이 불안정하고 결과 재현이 어려웠다. 이 문제를 해결하기 위해 2019년 박사과정 학생과 점수 기반 생성 모델을 연구했다. [03:01]
  • 이미지의 노이즈를 제거할 수 있다면 이미지 구조를 충분히 학습한 것이라는 생각이 확산 모델의 기반이 됐다. 순수한 노이즈에서 시작해 전체 대상을 점진적으로 정제하는 방식은 픽셀을 하나씩 생성하는 방식과 다르다. [03:39]

3. 소규모 언어 모델에서의 품질 동등성과 속도 개선이 창업으로 이어졌다

  • 2024년 연구에서는 10억 개 미만의 파라미터를 사용하는 GPT-2 규모에서, 같은 데이터와 같은 파라미터 수의 자기회귀 모델에 필적하는 퍼플렉시티를 달성했다. 트랜스포머를 확산 방식으로 학습해도 데이터를 비슷한 수준으로 모델링할 수 있다는 결과였다. [05:05]
  • 여러 토큰을 동시에 출력해 텍스트 생성 속도를 약 10배 높였다. 이 결과를 더 큰 모델로 확장하고 상용 규모의 확산 언어 모델을 개발하기 위해 Inception을 설립했다. [05:32]

4. 추론 병렬화가 자기회귀 모델의 GPU 병목을 겨냥한다

  • 연속적인 이미지·영상에서는 확산 모델이, 이산적인 텍스트·코드에서는 자기회귀 모델이 주로 쓰인다. 모든 모달리티를 다루는 모델이 어느 방식을 채택할지는 아직 결론이 나지 않았으며, Inception은 추론 확장성을 근거로 확산에 투자한다. [07:04]
  • 2017년 RNN에서 트랜스포머로의 전환은 학습 중 여러 토큰을 병렬 처리할 수 있게 했다. 그러나 자기회귀 추론은 여전히 앞선 토큰이 완성돼야 다음 토큰을 생성할 수 있어, 연산보다 가중치를 메모리 계층 사이에서 이동하는 데 많은 시간을 쓴다. [08:17]

5. 추론 효율은 서비스 경제성과 강화학습의 확장성을 함께 좌우한다

  • 모델의 경제성은 전력과 비용당 얻는 지능에 좌우된다. 추론 모델의 발전 상당 부분이 추론 시 연산량 확대에 의존하므로, 같은 자원으로 더 많은 추론을 수행하는 능력이 중요해진다. [10:05]
  • 강화학습 후처리에서도 모델이 여러 경로를 탐색하도록 롤아웃을 생성하는 과정이 병목이다. 추론 효율 개선은 탐색·평가·학습의 확장에도 도움이 되며, 에르몬은 더 병렬적인 방식이 장기적으로 유리하다고 본다. [10:34]

6. 이산 데이터의 난제를 넘어 Mercury를 실제 서비스로 연결했다

  • 픽셀 색상 사이에는 자연스럽게 보간할 수 있지만 두 단어 사이에는 그런 중간값이 없을 수 있다. 연속 데이터의 노이즈 제거 원리를 이산 공간으로 확장하려면 별도의 연구개발이 필요했다. [11:41]
  • 에르몬은 Mercury가 벤치마크에서 Haiku·Flash·OpenAI의 mini·nano 계열처럼 속도를 중시하는 모델들과 비슷한 품질을 내면서 더 빠르다고 주장한다. 비교 대상은 대형 연구소의 최고 지능 모델 전체가 아니라 속도 최적화 모델이다. [12:23]

7. 기존 트랜스포머 자산을 활용하면서 확산 특유의 학습·추론법을 개발한다

  • Inception은 설립 약 2년, 약 50명 규모이며 학습 방식과 추론 가속을 계속 연구하고 있다. 확산 모델에는 추론 시 연산량과 품질을 교환하는 다양한 선택지가 있으며, 이미지·영상 분야의 증류와 미분방정식 풀이 기법이 가속 가능성의 사례다. [13:30]
  • 데이터 구성, 평가, 강화학습 후처리 인프라까지 새로운 모델에 맞는 방법이 필요하다. 다만 모델은 여전히 트랜스포머와 어텐션을 사용하므로 기존 아키텍처 연구, 공개 데이터셋, 평가와 벤치마크를 활용한다. [14:17]

8. 지연 시간에 민감한 음성 에이전트에서 속도의 가치가 드러난다

  • 같은 품질이라면 더 빠른 모델을 선호하고, 빠른 모델을 위해 추가 비용을 지불하는 수요도 있다. 에르몬은 빠른 응답에 익숙해지면 느린 모델로 돌아가기 어렵다고 본다. [16:55]
  • 음성 에이전트 기업 OpenCall의 파이프라인은 음성 인식, 도구 호출과 다음 응답을 결정하는 LLM, 음성 합성으로 구성된다. 높은 품질을 위해 추론형 LLM을 쓰는 경우가 많아 중간 단계의 속도가 중요하다. [17:37]

9. 소프트웨어 가속과 하드웨어 가속은 함께 성능을 높일 수 있다

  • 전용 하드웨어는 추론을 가속하는 한 방법이고, 모델 구조를 바꿔 기존 하드웨어를 더 잘 활용하는 것도 가능하다. 두 방식은 상호 보완적이며 성능 개선 효과가 어느 정도 곱해질 수 있다는 견해다. [19:09]
  • 확산 모델에 더 잘 맞는 하드웨어가 향후 개발될 가능성도 있다. 다만 구체적인 하드웨어나 실현 시점이 제시된 것은 아니다. [19:27]

10. 대형 연구소와의 경쟁력은 연구 비밀에서 운영 자산으로 넓어진다

  • 새로운 아키텍처의 성과를 더 많은 연산 자원을 가진 대형 기업이 흡수할 수 있다는 우려는 Inception에도 중요한 문제다. 초기 경쟁력은 모델을 개발하고 개선하는 아이디어, 지식재산과 영업비밀에 있다. [19:35]
  • 실제 제품을 배포하면서 확보하는 서빙 엔진과 운영 소프트웨어도 경쟁 자산이다. 확산 LLM을 학습하는 데 성공하더라도 이를 서비스할 엔진이 없으면 실제 사용으로 연결하기 어렵다. [20:22]

11. 데이터가 지저분해도 압축 성능으로 구조 학습을 평가할 수 있다

  • 코드처럼 사람이 만든 데이터에는 물리 세계와 다른 불규칙성과 잡음이 있다는 문제가 제기된다. 에르몬은 자기회귀와 확산 모두 데이터를 효율적으로 압축하는 방법을 학습하면서 공통 구조와 패턴을 찾는다고 보여준다. [21:42]
  • 2024년 연구의 퍼플렉시티 동등성은 GPT-2 규모에서 확산 모델이 자기회귀 모델과 비슷한 정도의 데이터 구조를 포착했다는 근거다. [23:22]

12. 기존 API와 구조화 출력 호환성으로 도입 부담을 줄인다

  • 음성 에이전트에서는 모델이 의도대로 행동하게 만드는 제어 체계가 중요한 가치다. Mercury는 텍스트를 입력하고 출력하는 OpenAI 호환 API를 유지하며, 지시 준수와 JSON 같은 구조화 출력을 지원한다. [25:12]
  • 에르몬에 따르면 해당 고객은 기존 모델보다 나은 결과를 얻으면서 필요한 서비스 수준을 유지했다. 인터페이스가 같아 기존 애플리케이션 구성을 활용할 수 있다는 점이 도입을 단순하게 한다. [25:46]

13. 전체 결과를 점진적으로 다듬는 방식은 생성 중 제어의 가능성을 연다

  • 자기회귀 방식에서는 완성된 대상의 제약 충족 여부나 보상을 평가하려면 전체 생성이 끝날 때까지 기다려야 하는 경우가 있다. 분자의 용해도처럼 전체 결과에 달린 속성이 예시다. [26:02]
  • 확산 모델은 대략적인 전체 대상을 먼저 만들고 정교하게 다듬으므로, 생성 도중 외부 보상 함수나 제약 조건으로 방향을 조정할 수 있다. 학술 문헌에는 이런 제어가 상대적으로 쉽고 자기회귀 방식에서 어려운 유도 방식이 가능하다는 근거가 있다는 설명이다. [26:37]

14. 노이즈 제거 학습의 데이터 효율이 새로운 장점이 될 수 있다

  • 규모를 키웠을 때 속도 외에 어떤 능력이 나타날지는 아직 모른다. 속도는 검증과 측정이 쉽고 가치가 분명해 초기 차별점으로 선택됐다. [27:36]
  • 확산 모델이 자기회귀 모델보다 데이터 효율이 높다는 학술적 근거가 일부 있다. 같은 이미지에 여러 형태의 노이즈를 추가하고 제거하는 학습은 하나의 데이터를 다양한 관측 형태로 확장하는 데이터 증강처럼 작동한다. [28:05]

15. 단기 적용 기회는 최고 지능보다 지연 시간이 중요한 작업에 있다

  • 향후 약 2년의 작업 분담을 생각할 때, 현재 Inception 모델은 최상위 지능 수준에 도달하지 않았고 상당수 작업은 그 수준의 능력을 요구한다는 한계가 있다. [29:04]
  • 에르몬은 OpenRouter의 연구·대화·코딩·소프트웨어 엔지니어링·로그 처리 등 작업 분류를 참고해, 지연 시간이 특히 중요한 작업이 약 20~30%라고 추정한다. 이를 적용 가능 범위의 하한으로 보는 견해를 제시하기 시작하지만, 제공된 자막은 해당 설명이 완결되기 전에 끝난다. [29:29]

16. 확산 모델의 미성숙한 생태계와 기술 공개의 상충관계

  • 확산 모델은 기술 스택이 달라 서빙 엔진과 커널 등 많은 요소를 내부에서 개발해야 했다. 활용할 만한 오픈소스가 부족하고 공개 모델의 품질도 충분하지 않아, 배포와 고객의 시험 도입이 어려워졌다 [30:12]
  • 후학습과 RLHF·RL을 위한 스택도 자체 구축했다. 이 기술을 지식재산으로 보호하려고 전부 공개하지 않았지만, 그만큼 커뮤니티의 기여 기회가 줄고 도입과 온프레미스 배포가 어려워지는 단점이 있다 [31:14]

17. 개척 여지가 큰 연구 분야와 인간 판단의 역할

  • 학습 규모, 모델 크기, FLOPs는 영업비밀로 공개하지 않았다. 확산 모델 분야에는 아직 발명할 것이 많으며, Inception은 연구 방향에 주도권을 갖고 새로운 시도를 하려는 사람들에게 기회가 있다는 입장이다 [32:03]
  • 최전선 연구소의 모델을 활용하면서 아이디어를 시험하고 반복하는 속도와 개발 생산성이 크게 높아졌다. 다만 연구의 재귀적 자기개선이 충분히 실현된 단계는 아니라고 보며, 다른 곳의 모델에 접근하지 못해 생기는 판단의 한계도 인정한다 [33:16]

18. 약 50명 조직의 생산성과 현재 서비스·차기 연구의 분담

  • 약 50명이 연구·서빙·제품을 담당하는 조직에서 에이전트가 생산성을 높이고 있으며, 인력보다 연산 자원이 병목인 경우가 많다는 판단이다 [34:04]
  • 제품팀은 플랫폼과 고객의 모델 활용을 지원한다. 현재 최선의 모델을 서비스하는 팀과 다음 버전을 만드는 팀이 나뉘며, 차기 모델 연구에는 학습·강화학습·추론이 포함된다 [34:46]

19. 학계의 영향력을 만드는 새로운 방법과 비주류 연구

  • 초기 확산 모델 연구는 학계에서 감당할 수 있는 학습 규모에서도 GAN보다 좋은 성능과 높은 안정성을 보였다. Ermon은 이 아이디어들이 이후 Stable Diffusion과 Midjourney 같은 확산 모델의 확산으로 이어졌다는 점을 연구 방향에 대한 확신의 근거로 든다 [35:46]
  • 공동 지도에 참여한 FlashAttention과 연구실의 로테이션 프로젝트로 시작한 DPO도 학계에서 출발해 산업에 영향을 준 사례다. 특히 DPO는 문제의 수학적 구조에 대한 통찰을 바탕으로 모델의 후학습과 정렬을 더 효율적으로 수행하는 방법을 만들었다 [36:20]

🧾 결론

  • 제목의 ‘확산이 이긴다’는 전망은 병렬 추론의 효율에 근거한 에르몬의 견해다. 모든 작업에서 자기회귀 모델을 대체한다는 결론은 아니다.
  • 현재의 분명한 차별점은 속도이며, 단기 도입 판단은 필요한 품질을 유지하면서 실제 응답 시간을 얼마나 줄이는지에 달려 있다.
  • 확산 언어 모델의 성공에는 모델 연구와 함께 안정적인 서빙·후학습·고객 지원 체계가 필요하다. 부족한 오픈소스 생태계는 이러한 실행 부담을 키운다.

📈 투자·시사 포인트

  • 추론 경쟁을 평가할 때 모델 지능과 함께 비용·전력당 성능을 봐야 한다. 효율 개선은 서비스 운영과 강화학습 확장 양쪽에 가치를 줄 수 있다.
  • 음성 에이전트처럼 응답 지연이 사용자 경험에 직접 영향을 주는 분야는 초기 도입 후보가 된다. 다만 에르몬의 지연 민감 작업 비중 추정치를 확정적인 시장 규모로 사용하기는 어렵다.
  • 소프트웨어와 전용 하드웨어의 가속은 상호 보완적일 수 있다. 모델 구조 개선이 기존 GPU 활용도를 높인다는 사례만으로 전용 칩의 가치가 사라진다고 판단할 수는 없다.
  • Inception의 경쟁력은 연구 아이디어뿐 아니라 운영 엔진과 고객 기반 평가 자산에도 달려 있다. 기술 비공개가 보호하는 자산과 커뮤니티·온프레미스 도입을 제한하는 비용을 함께 살펴볼 필요가 있다.

⚠️ 불확실하거나 확인이 필요한 부분

  • Mercury의 품질·속도 우위와 OpenCall 전환 효과는 에르몬의 설명이다. 제공된 자료에는 비교 모델의 정확한 버전, 하드웨어, 부하, 출력 길이와 상세 측정 결과가 없다.
  • 약 10배 속도 개선과 퍼플렉시티 동등성은 소개된 연구 맥락의 결과다. 현재 상용 모델이나 최고 지능 모델 전체와의 비교로 일반화할 근거는 부족하다.
  • 데이터 효율과 생성 중 제어에는 학술적 근거가 언급되지만, 대규모 언어 모델에서도 장점이 유지되는지는 확인이 필요하다. 학습 규모·모델 크기·FLOPs도 공개되지 않았다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 도입 후보 작업을 지연 민감도와 필요한 지능 수준으로 나누고, 음성 응답·도구 호출처럼 속도의 가치가 큰 작업부터 평가한다.
  • 같은 작업·품질 기준과 명시된 실행 조건에서 Mercury와 기존 모델의 응답 지연, 처리량, 비용을 비교한다.
  • 실제 애플리케이션에서 지시 준수, JSON 출력, 도구 호출, 서비스 수준 유지 여부를 확인한다.
  • 서빙 엔진 의존성, 후학습 지원, 온프레미스 배포 가능성과 운영 부담을 도입 검토에 포함한다.

❓ 열린 질문

  • 모델과 학습 규모를 키워도 확산 방식의 속도 이점이 유지되면서 최고 수준의 지능에 접근할 수 있을까?
  • 생성 중 외부 보상과 제약으로 결과를 조정하는 기능은 어떤 인터페이스와 고객 작업에서 실질적인 가치를 만들까?
  • Inception은 기술 보호와 생태계 확대 사이에서 어떤 공개 전략을 선택할까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.