YouTubeCraig Hewitt·2026년 8월 6일·0

I Automated My Entire Video Edit with Claude Code (Full Workflow)

Quick Summary

Claude Code로 영상 편집 전 과정을 자동화할 수 있지만, 실전 품질과 효율은 전문 도구의 모듈식 조율과 사람의 반복 피드백을 결합할 때 가장 높아진다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

I Automated My Entire Video Edit with Claude Code (Full Workflow) 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

I Automated My Entire Video Edit with Claude Code (Full Workflow)의 핵심 내용을 4단계로 요약한 인포그래픽
I Automated My Entire Video Edit with Claude Code (Full Workflow) 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Claude Code로 영상 편집 전 과정을 자동화할 수 있지만, 실전 품질과 효율은 전문 도구의 모듈식 조율과 사람의 반복 피드백을 결합할 때 가장 높아진다.

📌 핵심 요점

  1. Claude Code는 미디어를 직접 편집하는 단일 도구가 아니라 Whisper의 전사, FFmpeg의 컷 처리, Hyperframes의 자막·그래픽, Higgsfield의 생성형 B-roll을 연결하는 오케스트레이터로 사용됐다.
  2. 단어 단위 Whisper 타임스탬프를 편집 타임라인으로 전환하면 무음 제거와 구간별 컷 결정을 자동화할 수 있지만, 자연스러운 문장 경계와 호흡을 보존하려면 실제 오디오 분석이 추가로 필요하다.
  3. 자동화 품질은 첫 구현보다 실제 촬영본을 이용한 반복 검증에서 개선됐다. 단어 시작점만 보던 무음 판정, 고정된 −35dB 임계값, 불완전한 세그먼트 경계가 실제 영상 테스트를 통해 수정됐다.
  4. 로컬 HTML 미리보기와 추상화된 피드백 규칙을 사용하면 특정 구간만 수동 보정하는 대신, 목 가다듬기·앞부분 여백·겹치는 말소리처럼 반복되는 문제를 이후 실행에서도 일관되게 처리할 수 있다.
  5. 약 6시간 만에 전사, 프리뷰, 자막 카드, 화면 녹화와 토킹 헤드 오버레이까지 구현했지만, 일부 컷과 화면 배치는 미완성이었으며 완전 자동화보다 생성형 그래픽과 B-roll을 기존 편집기에 결합하는 하이브리드 방식이 더 현실적인 대안으로 제시됐다.

🧩 배경과 문제 정의

  • 완성된 자동화 결과만 복제하는 방식은 설계 원리와 시행착오를 가려, 학습자가 새로운 작업에 응용할 판단 기준을 얻기 어렵다.
  • 원본 영상과 브랜드 자료를 입력하면 전사, 컷 편집, 그래픽, 생성형 B-roll, 검토용 미리보기, 최종 렌더링까지 이어지는 자동화 파이프라인이 필요하다.
  • Claude Code는 모든 미디어 작업을 직접 처리하기보다 Whisper, FFmpeg, Hyperframes, Higsfield를 조율하며, 사람은 창의적 방향과 피드백을 담당한다.
  • 첫 결과를 완벽하게 만드는 것보다 실제 영상으로 오류를 발견하고 수정하면서 품질을 높이는 반복 구조가 중요하다.

🕒 시간순 섹션별 상세정리

1. 완성품 복제보다 제작 과정에 집중하는 실험

  • 사전 제작 없이 빈 프로젝트에서 시작하며, 성공뿐 아니라 혼란·실수·수정 과정까지 포함해 자동 편집 시스템의 설계 원리를 드러내는 것이 목표다. [00:36]
  • AI 교육이 완성된 결과와 다운로드 가능한 기술만 제공하면 학습자는 설계 이유와 문제 해결 방식을 놓치므로, 시행착오 자체를 학습 과정으로 남긴다. [00:52]

2. 입력 자료와 역할을 분리한 전체 구조

  • 원본 영상, 폰트·색상·로고가 담긴 브랜드 키트, 선호하는 편집 스타일의 참고 자료가 파이프라인의 핵심 입력값이다. [02:26]
  • Claude Code는 편집을 직접 수행하는 두뇌라기보다 전문 도구를 호출하는 오케스트레이터이며, 사람은 첫 결과를 평가하고 방향을 수정하는 크리에이티브 디렉터 역할을 맡는다. [03:11]

3. 전사·컷 편집·그래픽·B-roll 도구의 분업

  • Whisper가 타임스탬프가 포함된 전사를 만들고, FFmpeg가 그 타임라인을 기준으로 구간 삭제·이동·오버레이 삽입을 실제 미디어 파일에 적용한다. [03:43]
  • Hyperframes는 HTML과 React 기반 애니메이션을 만들고, Higsfield MCP는 기존 촬영분으로 충당하기 어려운 생성형 B-roll을 담당한다. [04:46]

4. 모듈 교체 가능성과 예상 비용

  • 생성형 영상 도구의 우열은 바뀔 수 있으므로 Hyperframes 같은 구성 요소를 나중에 다른 도구로 교체할 수 있는 모듈식 구조가 필요하다. [05:08]
  • Whisper·FFmpeg·Hyperframes는 무료이고 Higsfield B-roll 10개에는 약 20~30달러가 들 수 있어, 생성형 영상 비용을 편당 50달러 미만으로 제한한다. [05:38]

5. 스크린샷과 자연어로 시작하는 초기 명세

  • 새 빈 폴더에 시스템 구성도 스크린샷을 넣고, 원본 영상·B-roll·그래픽·브랜드 키트를 받아 Claude Code가 전체 도구를 조율하는 파이프라인을 요구한다. [07:28]
  • 즉시 구현하지 않고 먼저 시스템을 이해한 뒤 계획 모드에서 질문하도록 지시해, 잘못된 가정이 코드로 굳어지기 전에 요구사항을 맞춘다. [08:41]

6. 전사문을 편집 타임라인으로 사용하는 핵심 원리

  • 초기 분석은 로컬 파일 기반 파이프라인과 Claude Code의 디렉터 역할을 확인하고, 채팅형 보조 도구가 아니라 작업 흐름을 실행하는 에이전트로 범위를 잡는다. [10:18]
  • 단어 단위 Whisper 타임스탬프가 편집 타임라인이 되면서, 사람이 영상 편집기를 직접 훑지 않아도 무음 제거와 구간별 컷 결정을 자동화할 수 있다. [10:25]

7. 자동 컷의 범위와 촬영 단계의 전제

  • 자동 편집은 단순 무음 제거를 넘어 불필요한 곁가지까지 정리하되, 과도하게 공격적인 삭제보다 대화의 자연스러움을 유지하는 방향을 택한다. [11:24]
  • 녹화 중 말을 고치려면 한 문장 안에서 즉시 이어 붙이지 말고 멈춘 뒤 다시 시작해야 하며, 이 간격이 있어야 자동 컷 이후에도 음성과 문장이 자연스럽다. [11:37]

8. 장편 영상과 브라우저 검토 흐름 확정

  • 첫 버전의 출력 범위는 장편 영상으로 제한하고 세로형 쇼츠는 제외해, 해상도와 편집 문법이 다른 두 형식을 한 번에 처리하는 복잡성을 피한다. [12:24]
  • 결과물은 로컬 HTML 미리보기에서 확인하고 수정 의견을 반영하며, 상세 인터뷰 방식은 비전과 제약을 충분히 전달하지 못해 엉뚱한 결과가 나오는 위험을 줄인다. [12:42]

9. 프로젝트 단위 Hyperframes 설치

  • 입력 영상은 단일 카메라 토킹헤드와 화면 녹화 조합으로 정하고, 비용이 드는 Higsfield B-roll은 자동 생성 전에 제안을 검토하는 방식으로 통제한다. [13:38]
  • Hyperframes의 핵심 스킬을 전역이 아닌 프로젝트 수준에 심볼릭 링크로 설치해, 저장소 업데이트를 반영하면서 프로젝트별 의존성과 설정을 유지한다. [14:23]

10. 실행 중 MCP 추가와 계획 품질 관리

  • 실행 중 Hyperframes MCP를 추가한 뒤 현재 세션을 중단하고 새 정보를 주입하자, 별도 세션으로 이탈하지 않고 기존 계획에 도구 정보를 반영해 작업을 재개한다. [15:39]
  • 계획이 빗나가는 주된 원인은 모델 성능보다 부족한 맥락과 불명확한 제외 조건이므로, 구현 전에 원하는 결과·제약·도구를 구체적으로 전달하는 시간이 후속 오류를 줄인다. [17:09]

11. Hyperframes 도입에 따른 책임 범위 재조정

  • Hyperframes가 자막과 그래픽을 이미 담당하므로 자체 구현 범위는 컷 엔진과 오케스트레이션으로 좁히되, 생성형 B-roll은 핵심 요구사항으로 유지한다. [17:58]
  • 컷 품질은 실제 촬영본 없이는 검증할 수 있어 RAW 폴더에 샘플 파일을 넣기로 하고, 계획 단계에서 구현 범위와 검증 자료를 함께 확정한다. [18:28]

12. 생성된 프로젝트 구조와 위임 원칙

  • Hyperframes가 Claude Code와 Codex용 스킬 디렉터리를 각각 만들고, 로컬 Whisper 전사·컷 결정·자막·그래픽 오버레이·음향 효과를 포함하는 작업 구조를 구성한다. [19:32]
  • 비전·맥락·제약·도구를 충분히 제공한 뒤에는 세부 구현을 계속 간섭하기보다 첫 결과를 실행하고 피드백으로 수정하는 편이 효율적이다. [20:21]

13. 브랜드 방향 설정과 첫 구현의 자기 수정

  • 브랜드 폴더는 웹사이트를 기준으로 어두운 배경, 주황색 포인트, 미니멀하고 굵은 인상을 반영하며, RAW와 파이프라인 폴더가 실제 편집 작업의 입력과 중간 단계를 나눈다. [21:25]
  • 약 20분 만에 나온 첫 버전은 단어 시작 시점만으로 무음을 판단한 오류를 발견하고, 마지막 단어 이후부터 다음 단어 전까지의 실제 오디오 구간을 분석하도록 기준을 바꿨다. [22:18]

14. 실제 영상과 테스트로 검증한 1단계 컷 엔진

  • 1단계는 85개 테스트를 통과했고 FFmpeg 기반 기계적 컷, 편집 결정 목록 검증, 프레임 정렬, 패딩, 타임라인 재매핑, 검토 페이지까지 구현했다. [23:59]
  • 단위 테스트만으로는 Whisper가 단어 타임스탬프를 뒤따르는 침묵 구간까지 늘리는 문제를 찾지 못했지만, 실제 촬영본 검증이 결함을 드러내 수정 근거를 만들었다. [24:43]

15. 실제 MOV 입력과 녹음별 무음 기준 적응

  • RAW 폴더에 QuickTime MOV 촬영본을 넣어 입력 확장자를 점검하고, MOV도 받아들인 뒤 최종 산출물은 표준 MP4 형식으로 통일하는 흐름을 확인한다. [26:18]
  • 고정된 무음 임계값 −35dB가 평균 음량 −24dB인 녹음에서 호흡과 작은 자음을 무음으로 오인하자, 녹음별 측정 음량과 노이즈 오버라이드를 사용하는 동적 기준으로 수정한다. [28:12]

16. 미세한 편집 오류를 프로젝트 피드백으로 축적

  • 자동 편집이 무음은 제거했지만 목을 가다듬는 소리와 앞부분의 여백은 남겼으며, 해당 유형까지 함께 제거하도록 프리뷰 문서에 수정 지침을 기록했다. [30:27]
  • 세그먼트 사이에 말소리가 겹치는 불완전한 컷은 깔끔하게 다듬고, 자동 처리가 어려우면 검토 대상으로 표시하도록 추가했다. [31:38]

17. 개별 수정이 아닌 재사용 가능한 편집 규칙으로 전환

  • 프리뷰에 남긴 의견은 특정 구간 하나를 직접 고치는 지시가 아니라, 같은 유형의 문제가 나타날 때마다 더 나은 처리를 적용하는 추상적 피드백이다. [33:16]
  • 피드백을 분석한 뒤 Hyperframes가 생성한 자바스크립트 스킬을 갱신하면, 이후 실행부터 동일한 편집 상황을 더 안정적으로 처리할 수 있다. [33:44]

18. 후속 편집 단계를 분리하고 컨텍스트를 관리

  • 1단계는 토킹 헤드 편집이며, 2단계 화면 녹화와 3단계 B-roll·애니메이션을 기존 계획 문서에 따라 순차적으로 구현해야 한다. [34:12]
  • 컨텍스트 사용량이 74%에 이르면 모델 성능 저하가 우려되므로, 장기 기억에 필요한 정보를 저장하고 컨텍스트를 초기화한 뒤 다음 단계로 넘어가는 전략이 필요하다. [34:59]

19. 핸드오프 프롬프트로 화면 녹화 합성 작업 재개

  • 1단계 전체를 단일 컨텍스트에서 마친 뒤 남은 용량이 약 60%가 되자, 새 컨텍스트에서도 2단계를 이어갈 수 있도록 필요한 정보를 담은 핸드오프 프롬프트를 생성했다. [35:57]
  • 화면 녹화 구간에서도 토킹 헤드의 오디오를 유지하고, 화면 삽입 위치와 크기·배치·노출 시간은 계획 단계에서 별도로 결정해야 한다. [36:34]

20. 주관적 화면 전환을 위한 명시적 촬영 신호

  • 화면 녹화가 얼마나 오래 보여야 하는지는 내레이션과의 관계에 따라 달라지는 주관적 판단이어서, 결과를 보며 창의적 피드백을 반복해야 한다. [37:14]
  • “이제 화면을 보자” 같은 자연어 단서나 편집 후 제거할 전용 액션 워드를 촬영 중 삽입하면, 자동 편집기가 화면 전환 시점을 더 명확하게 식별할 수 있다. [37:30]

21. 동기화 전제를 보완하고 실행 중 작업을 조향

  • 토킹 헤드와 화면 녹화는 처음부터 끝까지 길이가 동일한 두 소스로 녹화되므로, 자막에서 얻은 컷 타임스탬프를 양쪽 파일에 똑같이 적용할 수 있다. [38:50]
  • Claude Code에서는 진행 중인 계획을 중단한 뒤 추가 맥락을 입력해야 하지만, Codex 앱은 실행 중 즉시 지시를 삽입하거나 현재 작업 뒤에 다음 지시를 대기열로 보낼 수 있다. [39:16]

22. 반나절 빌드로 완성한 핵심 편집 기능

  • 약 6시간의 작업 끝에 전사, 프리뷰, 자막 카드, 화면 녹화와 토킹 헤드 오버레이까지 영상 편집의 주요 요소를 구현했다. [40:54]
  • 2분 분량의 결과물은 반나절 작업치고 완성도가 높았지만, Higgsfield를 이용한 B-roll 생성은 당일 게시 일정을 맞추기 위해 제외했다. [41:50]

23. 결과물의 한계와 현실적인 하이브리드 전략

  • 자막 카드와 두 가지 색상의 오버레이는 유용했지만, 토킹 헤드의 원형 크롭이나 화면 좌우 배치가 미완성이었고 일부 컷은 단어 사이 무음과 경계를 자연스럽게 처리하지 못했다. [43:12]
  • 종단 간 AI 편집은 시간·컴퓨터 사용량·메모리 부담에 비해 수동 편집보다 결과가 부족할 수 있어, Higgsfield의 B-roll과 Hyperframes의 그래픽 요소만 생성한 뒤 기존 편집기에 넣는 방식이 더 적합하다. [45:35]

🧾 결론

  • 성공의 핵심은 Claude Code 자체의 편집 능력보다 명확한 입력 자료, 도구별 책임 분리, 실제 촬영본 검증, 반복 가능한 피드백 구조에 있다.
  • 전사 기반 컷 자동화는 기계적인 탐색과 반복 작업을 크게 줄일 수 있지만, 자연스러운 대화 리듬과 주관적인 화면 전환까지 안정적으로 결정하지는 못했다.
  • 완전한 종단 간 자동화를 목표로 하기보다 컷 엔진, 그래픽, B-roll처럼 자동화 효과가 큰 모듈부터 선택적으로 도입하는 전략이 비용과 품질의 균형에 유리하다.

📈 투자·시사 포인트

  • 단일 AI 모델보다 Whisper·FFmpeg·Hyperframes·Higgsfield 같은 전문 도구를 교체 가능하게 연결하는 오케스트레이션 계층의 가치가 커질 수 있다.
  • 영상 생성 비용뿐 아니라 실행 시간, 컴퓨터 사용량, 메모리 부담, 사람의 검토 비용까지 포함한 총비용이 자동 편집 제품의 경쟁력을 좌우한다.
  • 브라우저 미리보기, 편집 결정 목록, 자연어 피드백 축적처럼 사람이 결과를 빠르게 검토하고 규칙을 개선하는 인터페이스가 완전 무인 자동화보다 현실적인 제품 차별점이 될 수 있다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 약 6시간 동안 제작한 결과는 2분 분량의 특정 토킹헤드·화면 녹화 조합을 대상으로 했으므로, 장편 영상이나 다른 촬영 형식에서도 같은 품질과 생산성이 유지되는지는 확인되지 않았다.
  • Higgsfield B-roll은 당일 게시 일정 때문에 최종 워크플로에서 제외됐으므로, 생성 비용과 결과 품질, 전체 파이프라인 통합 효과는 실제 완성본으로 검증되지 않았다.
  • 85개 테스트를 통과했어도 실제 촬영본에서 Whisper 타임스탬프와 고정 무음 임계값의 결함이 발견됐으므로, 단위 테스트만으로 편집 품질을 보장하기 어렵다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 원본 영상, 브랜드 키트, 편집 참고 자료, 원하는 결과와 제외 조건을 먼저 정리한 뒤 Claude Code의 계획 모드에서 구현 범위를 확정한다.
  • Whisper 전사와 FFmpeg 컷 엔진을 최소 기능으로 구축하고, 단위 테스트뿐 아니라 실제 MOV 촬영본으로 무음·호흡·문장 경계를 검증한다.
  • 녹음별 평균 음량과 노이즈를 측정해 고정 임계값 대신 동적 무음 기준을 적용한다.
  • 로컬 HTML 검토 페이지에 보존·삭제 구간과 타임스탬프 전사를 표시하고, 개별 수정이 아니라 재사용 가능한 편집 규칙으로 피드백을 기록한다.

❓ 열린 질문

  • 어떤 촬영 신호와 녹화 습관이 자동 컷과 화면 전환의 정확도를 가장 안정적으로 높일 수 있는가?
  • 생성형 B-roll과 그래픽만 자동화하는 하이브리드 방식은 종단 간 자동화보다 실제 편집 시간을 얼마나 줄일 수 있는가?
  • 장편 영상과 세로형 쇼츠를 각각 처리할 때 해상도·편집 문법·검토 방식의 차이를 어떤 모듈 경계로 분리해야 하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.