Turn Claude Into a Video Editing GENIUS (in 3 simple steps)
Quick Summary
Claude를 영상 편집에 활용하는 핵심은 전사·컷 편집, 디자인 시스템 적용, 피드백을 통한 연출의 3단계를 거쳐 작업 규칙을 재사용 가능한 스킬로 만드는 것이다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Claude를 영상 편집에 활용하는 핵심은 전사·컷 편집, 디자인 시스템 적용, 피드백을 통한 연출의 3단계를 거쳐 작업 규칙을 재사용 가능한 스킬로 만드는 것이다.
📌 핵심 요점
- 발표자는 Sonnet 5.5로 컷 편집과 다양한 모션 그래픽을 제작했다고 설명하며, Opus 5.5 대비 토큰 비용이 절반이라고 주장한다. 이는 영상에서 제시한 사례와 설명에 기반한 비교다.
- 애니메이션은 JavaScript와 HTML 코드로 구성되어 요소별 수정이 가능하다. SVG 역시 크기를 바꾸거나 색상을 수정하고 애니메이션을 적용할 수 있는 소재로 소개된다.
- 첫 단계는 음성을 전사하고 불필요한 침묵과 실패한 테이크를 제거하는 것이다. Assembly AI 등을 통해 얻은 전사문을 Claude가 분석하며, 어떤 테이크를 남길지도 지시할 수 있다.
- 두 번째 단계는 원하는 시각적 스타일을 디자인 시스템으로 명시하는 것이다. 디자인 문서나 참고 영상의 프레임을 활용해 스타일을 정리하고, 이를 스킬에 담아 반복 적용한다.
- 세 번째 단계는 결과물을 검토하며 구체적인 수정 의견을 전달하는 것이다. 발표자는 초기 결과가 원하는 수준의 약 80~90%에 도달할 수 있지만, 제작에 사용할 품질을 얻으려면 반복 연출과 피드백이 중요하다고 강조한다.
🧩 배경과 문제 정의
발표자는 Claude로 말하는 사람 중심의 원본 영상을 편집하고, 발화 내용에 맞는 모션 그래픽을 추가하는 과정을 소개한다. Sonnet 5.5가 Opus 5.5보다 저렴하면서도 다양한 스타일을 구현할 수 있다는 것이 출발점이며, 제시된 사례는 발표자의 작업과 테스트에 기반한다.
해결하려는 문제는 불필요한 발화를 제거하고, 일반적인 기본 스타일에서 벗어나며, 초기 결과를 실제 제작에 사용할 수준까지 다듬는 것이다. 이를 위해 전사·컷 편집, 디자인 시스템 적용, 구체적인 피드백이라는 3단계를 제안하고, 최종적으로 작업 경험을 스킬에 저장해 반복 사용한다.
🕒 시간순 섹션별 상세정리
1. Claude 영상 편집 사례와 3단계 접근 소개
- 발표자는 Sonnet 5.5의 영상 편집·모션 그래픽 능력과 Opus 5.5 대비 절반이라는 토큰 비용을 소개하고, /animate 스킬을 사용한 원본 영상의 편집 결과를 보여준다. [00:26]
- SVG는 크기를 바꿔도 흐려지지 않고 색상 수정과 애니메이션 적용이 가능한 형식이라고 보여준다. 영상의 컷과 모션 그래픽도 Sonnet으로 제작했다고 드러낸다. [00:55]
- 평면 벡터, 아이소메트릭, 3D, 유리 질감, 컷아웃 등 여러 스타일을 제시하며 별도의 AI 영상 생성 모델 없이 활용하는 3단계를 예고한다. [01:39]
2. 코드로 만든 애니메이션과 디자인 시스템 재사용
- 발표자는 자체 테스트와 커뮤니티 경험을 근거로 Sonnet이 Opus에 가까운 결과를 낼 수 있다고 평가하며 여러 애니메이션 사례를 비교한다. [02:32]
- 결과물이 JavaScript와 HTML 코드로 구성되므로 요소를 분리해서 수정할 수 있고, 마음에 드는 스타일을 디자인 시스템과 스킬로 정리해 재사용할 수 있다고 보여준다. [03:19]
- 같은 발화에 서로 다른 디자인 시스템을 적용한 사례를 보여준다. Vincent Wei의 디자인을 참고했으며, 참고 영상을 Claude에 전달해 스타일을 정리하는 방법도 뒤에서 소개한다고 예고한다. [04:44]
3. 첫 단계의 준비: 전사 도구와 처리 방식 선택
- 원본 영상의 경로를 전달하고 Assembly AI로 전사하도록 요청한 뒤, 침묵과 실패한 테이크를 제외하도록 지시하는 방법을 보여준다. API 키 발급도 Claude의 안내를 받을 수 있다고 보여준다. [05:40]
- 시작 프롬프트와 자료를 담은 8쪽 PDF를 보여준다. 무료 대안으로 Whisper를 언급하며, CPU 성능에 따라 오디오 1시간 처리에 약 15~50분이 걸린다고 드러낸다. [06:13]
- Assembly AI는 같은 길이의 오디오를 약 42초에 전사했다고 주장한다. 이미 ElevenLabs 구독이 있다면 해당 전사 기능도 선택지로 제시한다. [06:36]
4. 전사 기반 컷 편집과 수정 경험의 축적
- 약 1분 50초짜리 영상의 전사문을 Claude가 분석해 남길 부분을 선택한 사례를 보여준다. 중복 테이크 중 최신 테이크를 남기도록 지시할 수 있다고 보여준다. [07:11]
- 최종 MP4에 채팅으로 의견을 줄 수 있으며, 자체 개발 중인 편집 인터페이스에서는 컷을 조정하고 수정 의견을 모아 전달한다. 이런 피드백으로 스킬을 보정해 발화 습관에 맞추는 방식을 보여준다. [08:09]
- 이어 AI 시스템 구축·판매 교육과 커뮤니티를 홍보한 뒤 영상 편집 설명으로 돌아온다. [08:43]
5. 두 번째 단계: 기본 스타일을 넘어 디자인 시스템 지정
- 별도 스킬이나 디자인 시스템 없이 생성한 결과를 보여주며, 기본 스타일이 반복되면 영상의 차별성이 떨어질 수 있다고 지적한다. 원하는 미감을 명시하는 것이 핵심이라고 보여준다. [09:36]
- 전사문에 styles.referero.design으로 표기된 사이트의 디자인 Markdown을 활용해 디자인 시스템과 전용 스킬을 만드는 방법을 보여준다. [09:58]
- skill.dev에서는 모션 그래픽과 시작 프롬프트를 찾을 수 있다고 보여준다. watchships.com은 앱 출시 영상 참고 자료를 제공하지만 재현용 프롬프트가 없는 경우가 있다고 드러낸다. [10:50]
6. 참고 영상의 프레임에서 스타일 추출
- 프롬프트가 없는 참고 영상도 활용할 수 있다며, Vincent Wei의 X 게시물 링크를 Claude에 전달하고 FFmpeg로 프레임을 추출해 분석한 과정을 보여준다. [11:23]
- 추출한 화면을 모은 콘택트 시트에서 원하는 테마를 찾아 재현했다고 보여준다. FFmpeg는 화면 추출 같은 영상 명령을 자동화할 수 있어 에이전트와 함께 쓰기 좋은 도구로 묶인다. [11:55]
- 프레임을 바탕으로 디자인 시스템을 만들고 라이브러리에 추가한다. 일반적인 요청에 의존하기보다 용도에 맞는 디자인 시스템을 먼저 준비해야 한다고 강조한다. [12:17]
7. 세 번째 단계: 초기 결과를 검토하고 연출하기
- 컷 편집과 디자인 시스템이 준비되어도 한 번의 요청으로 원하는 최종 결과를 얻기는 어렵다고 보여준다. 초기 결과에서 장면의 흐름과 애니메이션을 검토하는 단계가 필요하다. [12:42]
- Claude Design을 설명하는 장면에서 처음 생성된 선화 애니메이션 대신 실제 UI를 보여주도록 수정한 사례를 비교한다. 두 번째 버전은 피드백을 반영한 결과다. [13:18]
- 채팅으로도 수정할 수 있지만, 영상의 특정 위치에 의견을 남기는 인터페이스를 이용하면 타임스탬프와 화면상의 지점을 함께 전달할 수 있다고 보여준다. [13:46]
8. 수정 의견을 모아 전달하고 제작 품질 확보
- 검토 과정에서 남긴 의견을 한꺼번에 Claude에 전달한다. 그 결과 두 번째 버전에는 요청한 UI가 반영되었으며, 발표자는 익숙한 인터페이스를 직접 보여주는 편이 시청자에게 더 낫다고 평가한다. [14:21]
- 첫 두 단계는 상당 부분 자동화할 수 있고 초기 결과가 원하는 수준의 80~90%에 도달할 수 있다고 드러낸다. 제작에 사용할 품질을 위해서는 반복 피드백이 가장 중요하다고 강조한다. [14:46]
9. 디자인 규칙과 피드백을 /animate 스킬로 저장
- 디자인 시스템과 수정 의견이 모인 같은 세션에서 /animate 스킬을 만들도록 요청한다. 세션의 작업 규칙과 피드백을 재사용 가능한 형태로 정리하는 단계다. [15:02]
- 이미 스킬이 있다면 새 피드백을 반영해 갱신하고 자신의 취향에 맞게 다듬는다. 발표자는 이를 통해 1인 제작자도 품질 있는 애니메이션을 만들 수 있다고 정리한다. [15:24]
- 시청에 감사를 전하고 구독을 요청하며 영상을 마무리한다. [15:35]
🧾 결론
- 영상의 중심은 모델에 한 번 요청하는 기법보다 전사, 스타일 지정, 검토를 연결하는 제작 과정에 있다.
- 디자인 시스템은 영상의 일관성을 만들고, 스킬은 그 규칙과 수정 경험을 다음 작업에 재사용하는 수단이다.
- 전사와 기본 애니메이션 제작을 자동화하더라도, 어떤 장면이 메시지를 잘 전달하는지 판단하는 연출 과정은 필요하다.
- 발표자는 이 과정을 통해 1인 제작자도 품질 있는 애니메이션을 만들 수 있다고 설명한다. 다만 사례의 성과를 모든 영상에 동일하게 적용할 수 있는지는 별도 확인이 필요하다.
📈 투자·시사 포인트
- 토큰 비용이 낮아진다는 주장만으로 전체 제작비 절감을 확정하기는 어렵다. 전사 서비스 이용료와 수정 작업까지 포함해 실제 비용을 비교필요가 있다.
- 반복 제작에서는 디자인 시스템과 누적된 피드백을 스킬로 정리하는 일이 생산성 개선의 중요한 요소가 될 수 있다.
- 발표자는 타임라인에서 수정 의견을 모아 에이전트에 전달하는 편집 도구를 개발 중이라고 소개한다. 이는 생성 기능과 검토 인터페이스를 연결하는 도구의 활용 가능성을 보여준다.
- 영상에는 AI 시스템 구축과 판매를 가르치는 커뮤니티 홍보도 포함되어 있다. 교육·서비스 사업에 대한 소개와 편집 성능 시연을 구분해서 읽어야 한다.
⚠️ 불확실하거나 확인이 필요한 부분
- 전사문에는 모델 이름이 Sonic, Sonet, Sonnet 등으로 혼재한다. 발표자가 반복해서 사용하는 Sonnet 5.5와 Opus 5.5의 정확한 제품명, 출시 시점, 가격은 제공된 자료만으로 독립 확인할 수 없다.
- 토큰 비용 절반, 오디오 1시간의 전사에 약 42초 소요, 초기 결과의 완성도 80~90% 등은 발표자의 주장이나 경험치다. 동일 조건의 벤치마크나 전체 비용 내역은 제시되지 않는다.
- Whisper의 처리 시간은 CPU 성능에 따라 달라진다고 설명되며, Assembly AI의 가입 크레딧도 발표자가 확정적으로 말하지 않는다. 실제 이용 조건을 확인해야 한다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 짧은 원본 영상으로 전사와 컷 편집을 시험하고, 남길 테이크와 제거할 침묵의 기준을 명시한다.
- Assembly AI, Whisper 또는 이미 이용 중인 전사 서비스의 실제 처리 시간과 비용을 같은 영상으로 비교한다.
- 원하는 스타일의 디자인 문서나 참고 프레임을 Claude에 전달해 디자인 시스템을 정리한다.
- 초기 애니메이션을 검토하며 수정할 장면의 타임스탬프와 변경 내용을 기록하고, 의견을 모아 전달한다.
❓ 열린 질문
- 한국어 음성이나 발화가 겹치는 영상에서도 전사와 테이크 선택이 충분히 정확하게 작동할까?
- 길고 복잡한 영상에서는 토큰 비용, 전사 비용, 반복 수정 시간이 각각 얼마나 늘어날까?
- 참고 영상의 정지 프레임만으로 움직임의 속도와 전환 리듬까지 어느 수준으로 재현할 수 있을까?