Articleresearch.google·2026년 9월 24일·0

Automating coherent long-form video generation

Quick Summary

Google은 Gemini와 Veo 위에서 창작 방향 최적화, 시각 기억, 구간별 생성, 프롬프트 개선을 결합해 장편 영상의 서사 진행과 시각적 일관성을 유지하는 다중 에이전트 연구 프레임워크를 소개했다.

Automating coherent long-form video generation 관련 대표 이미지

🖼️ 인포그래픽

Automating coherent long-form video generation 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Automating coherent long-form video generation의 핵심 내용을 4단계로 요약한 인포그래픽
Automating coherent long-form video generation 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Google은 Gemini와 Veo 위에서 창작 방향 최적화, 시각 기억, 구간별 생성, 프롬프트 개선을 결합해 장편 영상의 서사 진행과 시각적 일관성을 유지하는 다중 에이전트 연구 프레임워크를 소개했다.

📌 핵심 요약

  • Google 연구진 Yale Song과 Yiwen Song은 2026년 9월 24일 Co-Director, CANVAS, A²RD, VQQA를 소개하며, 기존 선형 생성 파이프라인의 의미적 표류와 연쇄 오류를 전역 최적화 및 세계 상태 추적으로 완화한다고 설명했다.
  • AI video co-director는 다중 슬롯머신(MAB) 알고리즘으로 창작 전략·서사 방식·미학적 원형을 선택하고, 제작 에이전트와 멀티모달 대규모 언어 모델(MLLM) 평가자의 피드백을 통해 창작 구성을 반복 최적화한다. Gemini와 Veo 위의 조정 계층으로서 SynthID 워터마킹 등 기반 모델의 안전장치를 계승한다.
  • CANVAS는 지속적 시각 기억으로 인물·장소·사물 상태를 관리한다. 원문의 박물관 절도 장면 비교에서는 Gemini-3.1-Pro와 AutoStudio에서 나타난 소품·배경·인물 불일치를 방지했다고 제시한다.
  • A²RD는 멀티모달 영상 기억을 사용하는 구간별 자기회귀 생성 구조로, 외삽과 보간을 전환하며 서사 진행과 시각적 일관성을 조율한다. 원문은 이를 보여주는 10분 길이의 시연 영상을 제시한다.
  • VQQA는 영상에 맞춘 시각 질문과 비전 언어 모델(VLM)의 비평으로 텍스트 프롬프트를 반복 개선하는 블랙박스 최적화 방식이다. Global Selection은 모든 반복 후보를 수정 전 원래 프롬프트에 비추어 평가해 최고 점수 영상을 선택한다.

🧩 주요 포인트

  1. 선형 프롬프트 연결을 전역 최적화와 평가 피드백으로 대체 → 개별 제작 단계가 공통 창작 방향을 따르도록 하고 연쇄 오류를 줄이는 구조를 제안한다.
  2. CANVAS의 세계 상태 추적과 A²RD의 멀티모달 영상 기억 → 장면 재방문 시 정체성 유지와 새로운 서사 전개를 함께 다룬다.
  3. VQQA의 프롬프트 수정과 Global Selection 결합 → 모델 내부 접근이나 직접적인 픽셀 편집 없이 개선을 유도하면서 원래 요청에서 벗어나는 위험을 억제한다.

🧠 상세 정리

1. 고품질 단편에서 일관된 장편으로 넘어갈 때의 문제

영상 확산 모델은 사실적인 장면을 수초 안에 생성할 만큼 발전했지만, 고품질 클립을 일관된 긴 이야기로 연결하는 일은 여전히 어렵다는 것이 원문의 출발점이다. 기존 에이전트 파이프라인은 독립적으로 작성한 프롬프트와 모듈을 순차 연결하므로, 인물 복장이나 배경이 미묘하게 달라지는 의미적 표류와 앞단의 자산 결함이 뒤쪽 영상 합성을 망치는 연쇄 오류가 발생한다. 초기 오류가 장기적 일관성을 무너뜨리면 광범위한 수동 개입이 필요하며, 마지막에 드러난 실패를 특정 프롬프트의 책임으로 추적하기도 어렵다. 연구진은 이를 고전적인 신용 할당 문제와 연결하고, 개체와 환경이 의도치 않게 변하는 특징 표류와 이야기가 의미 있게 진전하지 못하는 콘텐츠 붕괴도 함께 지적한다. 따라서 해결 대상은 개별 장면의 화질뿐 아니라 전체 서사의 진행과 장면 사이 상태 유지까지 포함한다.

2. 네 연구 축을 연결하는 조정 계층

Google의 Yale Song과 Yiwen Song은 2026년 9월 24일 글에서 장편 생성을 전역 최적화와 세계 상태 추적 문제로 다루는 다중 에이전트 연구를 소개했다. 연구 묶음은 COLM 2026 발표 예정인 Co-Director, EMNLP 2026 발표 예정인 CANVAS, 그리고 A²RD와 VQQA로 구성되며, 서로 다른 생성 병목을 네 축으로 나누어 다룬다. Gemini와 Veo 위에 놓인 조정 계층은 사용자의 고수준 창작 의도를 여러 모델의 프롬프트 작성, 샷 연결, 반복적인 시각 개선으로 옮기는 작업을 자동화한다. 연구진은 품질을 추론 시점의 최적화 목표로 삼아 창작적 합성과 일관성 관리를 분리하고, 사용자가 이야기 자체에 집중하도록 설계했다고 설명한다. 포괄적 평가에서 다중 샷 서사 일관성과 인물 유지가 크게 개선되었다고 주장하지만, 제공된 본문에는 그 개선 폭을 나타내는 정량 수치가 제시되지 않는다.

3. AI video co-director의 창작 방향 탐색

AI video co-director는 영상 전체의 의미적 일관성을 확보하기 위해 이야기 제작을 계층적인 전역 최적화 문제로 정식화한다. 최상위 Orchestrator Agent는 다중 슬롯머신(MAB) 알고리즘을 사용해 새로운 서사 전략을 탐색하는 일과 효과가 확인된 창작 구성을 활용하는 일의 균형을 조절한다. 선택 공간은 의도를 나타내는 창작 전략, 이야기 구조를 정하는 서사 방식, 시각적 분위기와 촬영 특성을 정하는 미학적 원형이라는 세 차원으로 구성된다. 예를 들어 정보 전달 전략과 짧은 일화 중심의 서사 방식, 특정 미학적 원형을 조합한 추상적 창작 경로를 하위 에이전트의 시스템 프롬프트에 주입한다. 이 하향식 지시는 제작 단계 전체가 하나의 창작 방향을 공유하도록 하며, 구조화된 프롬프트는 Gemini와 Veo에 전달되지만 아키텍처 자체는 특정 기반 생성 모델에 종속되지 않도록 설계되었다.

4. 제작 계층과 평가 피드백, 안전장치

선택된 창작 구성에 따라 Pre-Production Agent는 장면별 줄거리와 시각 자산을 통합해 일관된 스토리보드를 만든다. 이어 Production Agent 아래에서 Keyframe Agent가 인물과 장면의 시각적 기준을 잡고, Video Agent가 움직임을 추가하며, Audio Agent가 어울리는 내레이션과 음악을 결합한다. 완성된 편집본은 멀티모달 대규모 언어 모델(MLLM) 평가자가 앞서 정한 세 창작 차원에 따라 비평하고, 차원별 보상 신호를 MAB에 돌려주어 다음 생성 반복의 선택을 개선한다. 이처럼 전략 조정과 다단계 제작은 서로 연결된 두 반복 과정으로 작동하며, 최종 평가를 앞단의 창작 구성 조정에 활용한다. 원문은 기반 모델을 통해 생성된 이미지·영상·음성이 SynthID 워터마킹을 포함한 기본 안전장치를 계승한다고 설명하고, 실제 제작에서는 개별적으로 안전한 클립의 조합에서 생길 수 있는 맥락상 문제를 다루기 위해 최종 영상에 추가 안전 분류기를 적용할 수 있다고 덧붙인다.

5. CANVAS의 시각 기억과 장면 재방문

CANVAS는 통일된 대본만으로 해결되지 않는 인물 변화와 불안정한 환경을 다루기 위해 다중 샷의 시각적 연속성을 명시적으로 계획한다. 정식 명칭은 Continuity-Aware Narratives via Visual Agentic Storyboarding이며, Gemini 위에서 인물·장소·사물 상태의 구조화된 표현과 지속적 시각 기억을 유지한다. 필요한 시각 기준점을 기억에서 검색하거나 새로 만들기 때문에 같은 공간 안의 전환뿐 아니라 다른 장면을 거쳐 이전 장소로 돌아올 때도 정체성과 공간 구조를 보존하도록 설계되었다. HardContinuityBench의 박물관 절도 장면 비교에서 Gemini-3.1-Pro 단독 생성은 전시물과 방 배치가 달라졌고, AutoStudio는 도둑의 모자가 사라지거나 배경이 일치하지 않는 모습을 보였다고 원문은 설명한다. 반면 해당 예시의 CANVAS는 인물, 공간 기하 구조, 사물 상태를 전체 서사에 걸쳐 완전히 일관되게 유지했다고 제시하며, 연속된 컷과 비연속적인 장소 재방문을 모두 비교 대상으로 삼는다.

6. A²RD의 구간별 생성과 시간적 확장

A²RD는 스토리보드를 수분 길이의 실제 영상으로 확장하기 위한 에이전트 기반 자기회귀 생성 아키텍처로, 구간의 맥락과 동적 변화를 추적하는 멀티모달 영상 기억을 사용한다. 각 구간은 검색·합성·개선·갱신의 반복 과정을 거치며, 에이전트는 상황에 따라 생성 방식을 외삽과 보간 사이에서 조정한다. 외삽은 이야기를 새로운 사건으로 전개하는 데 쓰이고, 보간은 기존 인물과 환경에 구간을 연결해 장면의 물리적 일관성을 유지하는 데 쓰인다. 원문은 수분의 시간 간격을 넘어 서사가 이어져야 하는 10분 영화를 시연으로 제시하고, 두 방식의 전환이 이야기 진전과 기존 디자인 보존을 함께 지원한다고 설명한다. 일반적인 생성기에서 인물이 변형되고 장소가 달라지는 시각적 저하와 대비해, A²RD는 기억을 지속적으로 조회하여 첫 장면부터 마지막 프레임까지 인물 정체성, 복장 세부 사항, 공간 구조를 유지한다고 주장한다.

7. VQQA의 질문 기반 프롬프트 개선

VQQA는 시각적 결함을 시스템이 스스로 찾고 수정하도록 하는 Video Quality Question Answering 프레임워크로, 다양한 입력 양식과 영상 생성 작업에 적용할 수 있도록 제안되었다. 원문은 기존 추론 시점 최적화 방법이 계산 비용이 높거나 모델 내부에 접근해야 하는 경우가 많다는 제약을 먼저 제시한다. 이에 VQQA는 주어진 프롬프트에 맞는 시각 질문을 동적으로 만들고, 비전 언어 모델(VLM)의 비평을 다음 개선 방향을 알려주는 자연어 피드백인 의미적 기울기로 사용한다. 이는 역전파의 수치 기울기와 유사한 역할을 한다는 설명이며, 수동적인 평가 점수를 사람이 해석하고 실행에 옮길 수 있는 피드백으로 바꾸는 데 초점이 있다. 시스템은 영상 생성, 시각 질문을 통한 평가, 비평에 따른 텍스트 프롬프트 수정 과정을 자연어 인터페이스로 반복해 고수준의 구성 결함을 개선한다.

8. 원래 요청을 보존하는 후보 선택과 수정 범위

VQQA는 반복 수정 중 의미가 원래 요청에서 벗어나는 문제를 막기 위해 Global Selection을 사용하며, 마지막 반복의 결과를 무조건 채택하지 않는다. 전역 VLM 평가자는 최적화 과정에서 생성된 모든 영상을 수정 전 원래 프롬프트와 비교하고, 가장 높은 점수를 받은 후보를 선택해 부분적인 수정이 전체 맥락을 해치지 않도록 한다. 실제 수정 대상은 픽셀이 아니라 텍스트 프롬프트이므로, 이 방식은 프레임을 가리거나 덧칠하는 편집기가 아니라 속성 연결 오류와 인물 속성 불일치 등을 다루는 블랙박스 프롬프트 최적화기다. 수정된 프롬프트는 생성기가 잠재 공간에서 새로운 경로를 샘플링하도록 유도하며, 원문은 엄격한 직육면체 형태에 사실적인 마일러 풍선 질감을 구현하는 사례를 제시한다. 공연 중 악기가 바뀌는 문제와 바이올린 연주자·피아니스트의 일관성에 관한 사례도 시작되지만, 제공된 본문은 그 설명 도중 끊겨 있어 후속 내용이나 최종 결과를 더 구체적으로 확정할 수 없다.

🧾 핵심 주장 / 시사점

  • 장편 영상의 일관성은 단일 생성 모델의 화질뿐 아니라, 전체 창작 방향을 조정하고 장면 사이 상태를 기억하는 구조의 문제로 다뤄진다.
  • CANVAS와 A²RD는 각각 시각적 스토리보드와 시간에 따른 영상 생성에서 기억을 활용하며, 이전 상태의 보존과 서사 진행을 함께 지원한다.
  • VQQA는 비평을 프롬프트 수정에 활용하면서도 원래 요청을 최종 선택 기준으로 유지해, 국소적인 품질 개선과 전체 의도 보존을 연결한다.

✅ 액션 아이템

  • 장편 영상의 연쇄 오류를 줄이는 접근으로 전역 최적화와 평가 피드백의 적용 가능성 검토.
  • 장면 재방문 시 정체성 유지와 서사 전개를 기준으로 CANVAS와 A²RD의 기억 활용 방식 비교.
  • VQQA의 프롬프트 수정과 Global Selection이 개선 효과 및 원래 요청 보존에 기여하는지 확인.

❓ 열린 질문

  • AI video co-director의 MAB 선택과 MLLM 평가 피드백은 선형 프롬프트 연결 대비 연쇄 오류를 얼마나 줄이는가?
  • CANVAS와 A²RD의 기억 활용은 장면 재방문 시 정체성 유지와 새로운 서사 전개의 균형을 어떻게 조절하는가?
  • VQQA의 Global Selection은 반복 수정의 최종 후보를 그대로 선택하는 방식보다 원래 요청을 얼마나 더 잘 보존하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.