모션 디자이너는 끝났습니다.(feat.오퍼스 5.5)
Quick Summary
오퍼스 5.5로 모션 영상 제작을 자동화한 사례는 모션 디자이너의 역할이 반복 제작에서 기획과 품질 판단으로 이동할 가능성을 보여주지만, 직업 전체의 소멸까지 입증하지는 않는다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
오퍼스 5.5로 모션 영상 제작을 자동화한 사례는 모션 디자이너의 역할이 반복 제작에서 기획과 품질 판단으로 이동할 가능성을 보여주지만, 직업 전체의 소멸까지 입증하지는 않는다.
📌 핵심 요점
- 발표자는 45초짜리 서비스 소개 영상의 3D 로고, 글자 애니메이션, 실제 서비스 화면, 나레이션과 효과음을 오퍼스 5.5로 제작했으며, 수정까지 포함한 대화가 10턴 미만이었다고 설명한다.
- 제작은 대상·메시지·길이를 정한 브리프에서 시작했다. 참고 영상에서는 움직임의 문법을 가져오고, 색상과 글꼴은 소개하는 서비스의 실제 브랜드에서 가져왔다.
- 서비스 화면은 Playwright로 실제 사이트를 캡처하고, 게임 장면은 실제 결과물을 플레이하며 녹화했다. 버튼과 입력창의 좌표도 측정해 커서와 카메라 움직임을 맞췄다.
- 나레이션의 글자별 타임스탬프로 단어 애니메이션을 동기화했다. Three.js로 만든 3D 로고와 에이전트들이 분담한 장면을 Hyperframes에서 조립하고, 자연어 피드백으로 수정했다.
- 가장 큰 확장 요소는 제작 순서와 수정 규칙을 스킬로 저장한 점이다. 발표자는 이를 복사해 다른 주제와 언어의 영상 제작에 재사용할 수 있다고 주장한다.
🧩 배경과 문제 정의
영상은 새로운 AI 모델·스킬·에이전트가 계속 등장해도 자신의 실제 작업에 무엇이 가장 적합한지는 별도로 평가해야 한다는 문제에서 출발한다. 도입부의 서비스 소개 영상은 최대 네 개의 AI 셋업에 같은 프롬프트를 실행하고, 이름을 가린 결과를 선택하며, 모델·환경·시간·토큰 기록과 리더보드를 남기는 과정을 보여준다.
이후 발표자는 방금 본 45초 영상을 오퍼스 5.5로 제작했다고 밝히고, 브리프부터 화면 캡처·나레이션·3D·조립·수정까지의 과정을 설명한다. 핵심 질문은 이 제작 과정을 재사용 가능한 스킬로 만들었을 때 반복 작업과 사람의 역할이 어떻게 달라지는가이다.
🕒 시간순 섹션별 상세정리
1. AI 셋업 비교 서비스와 완성 영상 공개
- 도입 영상은 같은 프롬프트로 최대 네 개의 모델·스킬·환경 조합을 비교하고, 이름을 가린 결과 중 실제로 쓸 것을 선택하는 서비스를 보여준다. 결과별 기록은 셋업 리더보드에 쌓인다. [00:40]
- 발표자는 45초 영상의 3D 로고, 글자 애니메이션, 실제 서비스 화면, 효과음과 나레이션을 오퍼스 5.5가 만들었으며 수정 대화도 10턴 미만이었다고 드러낸다. 제작 스킬을 구독자에게 배포하겠다고 예고한다. [01:20]
- 영상은 로고 충돌, 결과물 벽, 셋업 카드, 입력 화면, 블라인드 선택, 결과 기록, 리더보드, 마지막 로고의 여덟 장면으로 구성된다. 확대·화면 관통·겹침·밀기 전환을 섞었으며, 발표자는 사람이 직접 제작하면 며칠이 필요한 분량이라고 평가한다. [02:29]
2. 브리프와 실제 서비스 자료 확보
- 브리프에는 대상과 메시지, 45초 길이, 가로 화면, 나레이션 사용을 정했다. 두 참고 영상에서는 글자 움직임·화면 카드·숫자 카드의 표현을 참고하고, 색과 실제 폰트 파일은 서비스 사이트에서 가져왔다. [03:14]
- 서비스 화면은 Playwright로 실제 사이트를 열어 두 배 해상도로 캡처했다. 버튼과 입력창의 좌표를 코드로 측정해 커서가 정확히 멈추고 카메라가 원하는 위치로 이동하도록 했다. [03:40]
- 실제 게임 결과물을 브라우저에서 플레이하며 16개 클립을 녹화했다. 발표자의 추가 요청으로 네 셋업의 비교 작업을 다시 실행해 결과 네 개를 더 확보했고, 영상에 실제 실행 결과를 넣었다. [04:05]
3. 나레이션과 글자 애니메이션 동기화
- 나레이션은 영상에서 ‘V4’로 소개한 일레븐랩스 모델로 제작했다. 여덟 문장을 한 번에 녹음해 억양과 음량의 연결을 유지하고, 글자별 타임스탬프로 문장 경계와 단어 시작 시간을 추출했다. 서비스 이름의 발음은 한글 표기로 보정했다. [04:40]
- 목소리가 심심하다는 피드백에 감정 태그를 붙이고 안정성과 스타일 값을 조정했다. 재녹음할 때 앞뒤 문장을 함께 전달하고 새 음성을 기존 구간 길이에 맞춰, 화면 타이밍을 유지했다. [05:09]
- 단어가 발음되는 순간 화면 글자가 등장하도록 연결했다. 강조 단어에는 크기 변화와 흐림 효과를 적용하고, 순간적인 화면 흔들림을 더해 음성과 시각 효과를 맞췄다. [05:31]
4. 3D 로고 렌더링과 영상 조립·수정
- 평면 로고가 부족하다는 피드백 이후 오픈소스 벡터 로고를 Three.js로 입체화했다. 로고별 재질과 조명·그림자를 설정하고, 프레임마다 12장을 평균 내는 모션 블러를 적용했으며, 충돌을 나레이션에 맞춰 투명 배경 영상으로 렌더링했다. [06:43]
- Hyperframes에서 장면을 웹페이지와 코드 애니메이션으로 구성하고, 에이전트들이 여덟 장면을 분담했다. 전환과 배경 음악을 합치고 효과음은 24개에서 줄여 17곳에 배치했다. 렌더는 약 1분이 걸렸고, 재인코딩으로 47초를 45초로 줄였다. [07:22]
- 발표자는 템포·색·효과음·문구·3D 로고에 관한 불만을 말로 전달했고, 오퍼스 5.5가 수정할 파일과 값을 찾았다고 보여준다. 영어판을 먼저 만든 뒤 한국어 문구·리듬·글꼴을 조정했으며, 영어 음성 후보와 구간별 길이도 보정해 한국어 45초, 영어 40초 버전을 완성했다. [08:37]
5. 스킬 재사용, 직무 변화 주장과 배포 안내
- 브리프, 화면 캡처, 음성 설정, 효과 배치, 렌더 최적화와 수정 내용을 스킬의 규칙으로 저장했다. 발표자는 이를 다른 컴퓨터로 복사하고 주제·색·글꼴·리듬을 바꿔 재사용할 수 있으며, 한 사람이 여러 제작 영역을 지시하고 결과를 선택할 수 있다고 보여준다. [09:40]
- 발표자는 이번 작업에서 모션 디자이너를 대체했다고 느꼈고 상위 1% 외에는 어려워질 것이라고 주장한다. 반복적인 키프레임·효과 작업보다 무엇을 만들지 정하는 기획과 좋은 결과를 알아보는 눈이 남는다고 강조한다. [10:17]
- 마지막에는 브리프부터 화면 캡처·나레이션·효과음·렌더까지 포함한 모션 그래픽 스킬을 구독자에게 제공하겠다고 안내한다. 다운로드 링크는 설명란과 고정 댓글에 두겠다고 말하고, 사용자가 만든 영상을 댓글로 공유해 달라며 마무리한다. [10:40]
🧾 결론
- 이 사례의 결과물은 브라우저 자동화, 음성 합성, 3D 렌더링, 코드 기반 애니메이션을 연결한 제작 과정에서 나왔다.
- 사람은 브리프와 참고 자료를 제공하고, 결과를 보며 템포·목소리·효과·화면 구성을 판단했다. 실행 자동화가 늘어나도 기획과 검수는 여전히 과정에 포함된다.
- 수정 내용을 스킬의 규칙으로 축적하면 다음 제작에서 같은 문제를 반복할 가능성을 줄일 수 있다. 다만 같은 품질이 언제나 재현되는지는 별도 확인이 필요하다.
- ‘상위 1%를 제외한 모션 디자이너는 끝났다’는 표현은 발표자의 평가다. 영상이 직접 보여주는 범위는 특정 서비스 소개 영상의 제작 사례다.
📈 투자·시사 포인트
- 제작 경쟁력을 판단할 때 개별 모델의 성능뿐 아니라 실제 화면 수집, 음성 동기화, 렌더링까지 이어지는 작업 흐름을 함께 볼 필요가 있다.
- 스킬로 제작 규칙을 재사용하는 방식은 반복적인 홍보 영상과 언어별 버전을 만드는 업무에 영향을 줄 수 있다. 발표자는 한국어 45초, 영어 40초 버전을 같은 방식으로 제작했다.
- 발표자가 강조하는 인력 변화는 기획과 좋은 결과를 알아보는 판단력의 중요성이다. 반복 제작을 수행하는 역량과 AI 제작 과정을 지휘하는 역량의 관계가 핵심 쟁점이다.
- 영상에는 특정 종목이나 수익 전망이 없다. 경제성을 평가하려면 대화 횟수와 최종 렌더 시간 외에 전체 제작 시간, 사용 비용, 검수 부담을 확인해야 한다.
⚠️ 불확실하거나 확인이 필요한 부분
- 오퍼스 5.5와 일레븐랩스의 ‘V4’라는 모델 표기는 제공된 전사의 표현이다. 정확한 제품명·버전과 실제 사용 설정은 원본 화면이나 배포 자료에서 확인필요가 있다.
- ‘10턴 미만’은 발표자가 제시한 대화 횟수이며 전체 작업 시간을 뜻하지 않는다. 약 1분이라는 렌더 시간도 준비·캡처·녹음·수정 전체의 소요 시간이 아니다.
- 사람이 만들면 며칠 걸린다는 비교와 모션 디자이너를 완전히 대체했다는 평가는 동일 조건에서 검증한 비교 결과가 제시되지 않은 주장이다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 영상 설명란과 고정 댓글에서 스킬 배포 링크를 확인하고, 작업 순서·필요 도구·실행 조건이 포함되어 있는지 살펴본다.
- 제작할 영상의 대상, 핵심 메시지, 길이, 화면 비율, 나레이션 여부를 한 장의 브리프로 정리한다.
- 실제 서비스 화면과 결과물을 확보하고, 커서가 가리킬 버튼이나 입력창의 좌표를 확인한다.
- 나레이션 발음과 단어별 타이밍을 먼저 검수한 뒤, 글자 애니메이션과 장면 전환의 동기화를 확인한다.
❓ 열린 질문
- 이 방식은 소개 영상 외에 복잡한 캐릭터 연기나 독창적인 연출이 필요한 모션 작업에서도 같은 수준으로 작동할까?
- 주제와 브랜드가 바뀌었을 때 스킬이 유지하는 품질의 범위는 어디까지이며, 사람이 다시 판단해야 하는 부분은 무엇일까?
- 전체 제작 비용과 검수 시간을 포함하면 기존 제작 방식 대비 어떤 조건에서 경제성이 생길까?