Articleresearch.google·2026년 7월 15일·0

Towards demystifying the creativity of diffusion models

Quick Summary

확산 모델의 창의성은 신경망이 점수 함수를 매끄럽게 학습하면서 데이터 매니폴드로의 수렴은 유지하되 훈련 표본 사이를 보간하도록 만드는 수학적 결과로 설명될 수 있다.

Towards demystifying the creativity of diffusion models 관련 대표 이미지

🖼️ 인포그래픽

Towards demystifying the creativity of diffusion models 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Towards demystifying the creativity of diffusion models 내용을 설명하는 본문 이미지

💡 한 줄 요약

확산 모델의 창의성은 신경망이 점수 함수를 매끄럽게 학습하면서 데이터 매니폴드로의 수렴은 유지하되 훈련 표본 사이를 보간하도록 만드는 수학적 결과로 설명될 수 있다.

📌 핵심 요약

  • 연구진은 ICLR 2026 논문에서 확산 모델이 훈련 데이터를 단순 복제하지 않고 새로운 표본을 생성하는 원인을 점수 평활화라는 메커니즘으로 설명했다.
  • 훈련 데이터로부터 완벽한 점수 함수를 학습한 모델은 잡음 상태의 데이터점을 기존 훈련 표본으로 정확히 끌어당기므로 생성 과정이 암기로 귀결된다.
  • 실제 신경망은 정규화의 영향으로 급격히 변하는 점수 함수를 그대로 학습하기 어려우며, 더 완만한 함수를 학습해 훈련 표본 사이에 보간 영역을 만든다.
  • 1차원 실험에서는 가중치 감쇠가 강할수록 두 훈련점 사이의 점수 함수가 더 매끄러워졌고, 명시적 가중치 감쇠가 없어도 경사 기반 학습의 암묵적 정규화가 같은 현상을 유발할 수 있었다.
  • 고차원 공간에서는 점수 평활화가 데이터 매니폴드에 접하는 방향의 표본 붕괴를 완화하면서도 매니폴드로 향하는 수렴을 방해하지 않아 현실성과 새로움의 균형을 형성한다.

🧩 주요 포인트

  1. 완벽한 점수 함수는 생성점을 훈련 표본에 수렴시킨다 → 정확한 역확산만으로는 창의성보다 암기가 나타난다.
  2. 신경망 정규화는 점수 함수의 급격한 경계를 완화한다 → 생성점이 표본 사이에 머물 수 있어 새롭고 타당한 결과가 형성된다.
  3. 고차원 평활화는 방향에 따라 다르게 작용한다 → 매니폴드 도달에 필요한 품질은 유지하면서 접선 방향의 복제를 줄인다.

🧠 상세 정리

1. 확산 모델의 창의성에 대한 핵심 질문

확산 모델은 이미지 생성이나 분자 발견처럼 복잡하고 국소적인 구조를 다루는 생성 작업에서 강력한 성능을 보이며, 실제 훈련 데이터에 없던 새로운 결과도 만들어 낸다. 실제 이미지로 학습한 모델이 무작위 잡음을 새로운 고품질 이미지로 변환한다는 점에서 이러한 일반화 능력은 흔히 모델의 “창의성”으로 불린다. 그러나 모델이 유한한 훈련 표본을 학습하면서도 그 표본의 복사본이 아닌 결과를 만드는 이유는 확산형 생성 AI의 블랙박스를 이해하기 위해 설명해야 할 문제다. 연구진은 ICLR 2026에 발표한 논문에서 이 현상을 우연한 결과로 보지 않고, 신경망이 잡음에서 데이터로 이어지는 변환을 자연스럽게 매끄럽게 학습하기 때문에 발생하는 수학적 효과로 분석했다. 핵심 주장은 신경망이 정확하지만 날카로운 점수 함수 대신 평활화된 근사 함수를 학습하고, 그 차이가 생성점을 훈련 표본 사이로 이동시킨다는 것이다.

2. 역확산 과정과 완벽한 학습의 암기 문제

확산 모델의 학습은 고양이 사진과 같은 실제 데이터에 점차 잡음을 더해 원래 모습을 알아볼 수 없게 만든 뒤, 이 손상 과정을 단계별로 되돌리도록 모델을 훈련하는 방식으로 진행된다. 이 역과정인 잡음 제거가 성공하면 모델은 순수한 잡음에서 현실적으로 보이는 데이터를 복원할 수 있다. 하지만 모델이 유한한 훈련 표본만을 바탕으로 이 과정을 완벽하게 학습한다면, 배포 시에도 결국 그 표본들의 복사본을 출력하게 된다. 이 경우 모델은 새로운 데이터를 만드는 생성기가 아니라 저장된 사례를 되찾는 검색 도구에 가까우며, 이러한 행동이 암기다. 실제 확산 모델은 대체로 암기를 넘어 새로운 표본을 생성하므로, 연구는 완벽한 복원이라는 이상적 상황과 실제 신경망이 학습하는 근사적 복원 사이의 차이에 주목한다.

3. 점수 함수가 생성 경로를 결정하는 방식

연구는 잡음 제거 과정을 방 안에 흩어진 기체 입자들이 힘장에 이끌려 의미 있는 형태를 이루는 과정에 비유한다. 여기서 움직이는 입자는 잡음 제거를 거치는 개별 데이터점이고, 각 위치에서 이동할 방향을 지시하는 힘장은 훈련 데이터로부터 학습된 점수 함수다. 점수 함수는 순수한 잡음에서 의미 있는 이미지와 같은 데이터로 이동하는 전체 생성 흐름을 결정한다. 훈련 데이터에 대응하는 완벽한 점수 함수가 사용되면 각 데이터점은 기존 훈련 표본의 위치로 정확히 끌려가고, 최종 분포는 그 표본들 위로 붕괴한다. 따라서 새로운 결과가 생기는 원인을 찾으려면 점수 함수 자체의 역할뿐 아니라, 신경망이 이 함수를 실제로 얼마나 정확하고 매끄럽게 근사하는지를 함께 살펴봐야 한다.

4. 두 훈련점으로 살펴본 1차원 암기와 보간

연구진은 훈련 데이터가 -1과 +1 두 점뿐인 1차원 사례를 통해 점수 평활화의 효과를 설명한다. 잡음 제거 후반의 완벽한 점수 함수는 두 점의 중간인 0 부근에서 부호가 급격하게 바뀌며, 공간을 거의 날카롭게 양분한다. 그 결과 왼쪽에 있는 입자는 -1로, 오른쪽에 있는 입자는 +1로 당겨지고 모든 입자가 결국 두 훈련점 중 하나에 도달한다. 생성 결과가 두 표본 위로 완전히 수렴하므로 이 상황에서는 보간이나 새로운 표본이 발생하지 않고 암기만 남는다. 반면 중간 지점의 급격한 변화를 더 완만한 기울기로 바꾸면 그 영역의 입자 이동이 느려지고, 일부 입자는 두 훈련점 사이에 머물 수 있어 기존 데이터와 다른 결과를 형성한다.

5. 정규화가 만드는 점수 평활화

실제 확산 모델은 완벽한 점수 함수에 직접 접근하는 대신 신경망이 학습한 근사 함수를 사용하며, 신경망은 정규화 때문에 급격한 절벽 형태의 변화를 그대로 표현하기 어려울 수 있다. 연구진은 두 층으로 구성된 ReLU 신경망이 1차원 점수 함수를 맞추도록 하고, AdamW 최적화에서 가중치 감쇠의 강도를 달리하는 실험을 수행했다. 가중치 감쇠가 강해질수록 두 훈련점 사이에서 학습된 점수 함수가 더 매끄러워졌으며, 중간 영역의 입자들은 이전보다 느리게 이동했다. 이 입자들은 어느 한 훈련점으로 완전히 붕괴하지 않고 두 점 사이의 “보간 영역”에 정착할 수 있었다. 연구가 말하는 창의성은 이처럼 불완전한 학습이 무작위로 실패한 결과가 아니라, 점수 함수의 날카로운 경계를 완화해 새롭지만 훈련 데이터와 연결된 위치를 생성하는 효과다.

6. 수학적 연결과 암묵적 정규화의 증거

논문은 신경망 정규화를 함수 공간에서 해석하는 기존 이론과 잡음 제거의 수학을 결합해, 정규화와 점수 평활화 및 보간 사이의 연결을 정량화한다. 가중치 감쇠는 이 메커니즘을 관찰하기 위한 명시적 정규화 수단이지만, 연구 결과가 특정 설정에만 한정된다고 보지는 않는다. 실험에서는 가중치 감쇠 같은 명시적 전략을 사용하지 않더라도 경사 기반 알고리즘으로 학습한 신경망의 암묵적 정규화로 점수 평활화가 나타날 수 있었다. 본문은 이러한 암묵적 효과를 서로 다른 기법으로 연구한 선행 연구들도 함께 언급하며, 현재 분석이 기존 정규화 연구 위에 구축되었음을 밝힌다. 따라서 연구진의 설명에서 보간은 별도로 설계된 생성 규칙이 아니라 신경망 학습 과정의 근사성과 정규화 성질에서 자연스럽게 나타날 수 있는 결과다.

7. 고차원 데이터에서의 매니폴드 복원

고해상도 이미지는 매우 큰 차원의 픽셀 공간에 놓이지만, 그 공간의 대부분은 사람이 의미를 알아볼 수 없는 무작위 잡음에 해당한다. 인식 가능한 이미지들은 전체 공간의 작은 일부인 데이터 매니폴드에 존재하며, 이는 더 큰 공간 안에 들어 있는 얇은 면과 같은 구조로 설명된다. 모델은 이 매니폴드의 모양이나 위치를 미리 알지 못하므로, 유한한 훈련 표본을 근거로 숨은 구조를 추론해야 한다. 이런 관점에서 이미지 생성은 데이터 매니폴드를 복원한 뒤 그 위에서 기존 표본과 다른 새로운 점을 찾는 작업이다. 연구진은 점수 평활화가 단순히 두 표본 사이의 수치적 중간값을 만드는 데 그치지 않고, 훈련 표본이 놓인 숨은 구조를 근사해 새롭고 의미 있는 데이터를 생성하는 데 중요한 역할을 한다고 설명한다.

8. 방향별 평활화와 품질·새로움의 균형

다차원 공간에서 점수 평활화는 모든 방향에 동일하게 작용하지 않고 데이터 매니폴드와의 관계에 따라 다른 효과를 낸다. 매니폴드에 평행한 접선 방향에서는 1차원 사례처럼 이동을 늦춰 생성점이 개별 훈련 표본으로 붕괴하는 경향을 줄인다. 반면 매니폴드를 향하는 방향에서는 완벽한 점수 함수도 이미 비교적 매끄럽고, 평평한 매니폴드라면 직선 형태이므로 추가 평활화의 영향이 크지 않다. 그 결과 생성점은 의미 없는 잡음 공간에 멈추지 않고 매니폴드로 계속 수렴하면서도, 그 위에서는 훈련 표본 사이의 빈 공간에 정착할 수 있다. 이는 결과가 현실적으로 보이는 이유와 기존 표본의 복사본이 아닌 이유를 동시에 설명하며, 연구가 제시하는 품질과 새로움의 균형을 이룬다.

9. 결론, 적용 가능성 및 연구 범위

연구진은 확산 모델의 창의성이 신비로운 우연이라기보다, 완벽하게 날카롭지 않은 신경망이 알려진 데이터 사이에 보간의 다리를 만드는 데서 비롯되는 예측 가능한 수학적 결과일 수 있다고 결론짓는다. 이미지 생성에서는 서로 다른 훈련 이미지 사이의 새로운 이미지를, 분자 발견에서는 기존 분자의 특징을 일부 결합한 새로운 분자 구성을 제안하는 현상으로 이 설명을 연결한다. 다만 이번 연구는 메커니즘을 밝히기 위한 초기 시도이며, 데이터 분포와 신경망 구조가 더 복잡해지는 경우나 조건부 생성에서는 추가 연구가 필요하다고 명시한다. 이 이해를 바탕으로 맹목적 암기를 피하면서도 더 나은 보간 능력을 갖춘 모델을 의도적으로 설계할 가능성이 제시된다. 연구진은 논문의 그림을 생성하는 데 사용한 수치 실험 코드도 함께 공개했다.

🧾 핵심 주장 / 시사점

  • 이 연구가 다룬 메커니즘에서 새로움은 훈련 데이터와 단절된 창작이 아니라, 평활화된 점수 함수가 숨은 데이터 구조를 따라 표본 사이를 보간한 결과로 해석된다.
  • 정규화로 인한 근사 오차는 단순한 성능 손실이 아니라 개별 훈련 표본으로의 붕괴를 줄이는 기능을 하며, 방향별 효과 덕분에 매니폴드로의 수렴과 생성 품질은 유지될 수 있다.
  • 연구진은 점수 평활화의 이해가 암기를 피하는 더 나은 보간형 모델 설계로 이어질 수 있다고 제안하지만, 복잡한 분포·구조·조건부 생성까지 포괄하는 설명은 후속 연구 과제로 남긴다.

✅ 액션 아이템

  • 완벽한 점수 함수 학습이 생성 과정을 훈련 표본 암기로 이끄는지 점수 평활화 관점에서 비교한다.
  • 가중치 감쇠 강도와 암묵적 정규화가 훈련점 사이 점수 함수 매끄러움에 미치는 영향을 점검한다.
  • 고차원에서 매니폴드 수렴은 유지하고 접선 방향 표본 붕괴를 완화하는 평활화 범위를 정의한다.

❓ 열린 질문

  • 점수 평활화가 현실성과 새로움의 균형을 유지하는 경계는 어디에 있는가?
  • 명시적 가중치 감쇠 없이도 암묵적 정규화만으로 충분한 보간 영역이 형성되는가?
  • 접선 방향 복제를 줄이면서 매니폴드 품질을 지키는 판단 기준은 무엇인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.