GPT-6 Astra Finally Solves AI Video Editing (full guide)
Quick Summary
GPT 6 Astra의 AI 영상 편집 가이드는 Codex와 Hyperframes를 연결하고 전사·장면 설계·반복 수정을 거쳐 실제 사용할 영상을 완성하는 방법을 보여 준다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
GPT-6 Astra의 AI 영상 편집 가이드는 Codex와 Hyperframes를 연결하고 전사·장면 설계·반복 수정을 거쳐 실제 사용할 영상을 완성하는 방법을 보여 준다.
📌 핵심 요점
- 자연어 편집의 핵심은 타이밍이다. 발화·자막·화면 전환·모션 그래픽·음악을 맞추기 위해 먼저 정밀한 시간 정보로 전사하고, 실수와 침묵을 제거한다.
- 제작은 Codex 로컬 프로젝트에 Hyperframes와 의존성을 설치하는 것에서 시작한다. 컷 편집 후 Astra가 대사의 의도에 맞는 장면을 설계하고, Hyperframes 등으로 HTML 애니메이션을 구현한다.
- 편집 지시는 위치·등장 순서·종료 시점까지 구체적이어야 한다. 손짓에 반응하는 그래픽, 발음하는 단어의 색상 강조, 실제 영상이 재생되는 입체 카드처럼 발화와 화면을 연결한다.
- 첫 결과에는 검토와 수정이 필요했다. 약 1분 5초의 원본은 28초로 줄었지만, 도입부의 흡인력·카드 겹침·작은 글씨가 수정 대상으로 남았다. 첫 작업은 약 18분, 두 번째 버전은 약 10분이 걸렸고 도입부는 추가로 수정했다.
- 반복 작업의 기준은 기록으로 축적한다. 도구 선택과 편집 규칙은
AGENTS.md에, 만족스러운 제작 방식과 후속 수정 의견은 스킬에 저장한다. 요소 위치나 글자 크기의 미세 조정에는 Hyperframes Studio의 직접 편집도 활용한다.
🧩 배경과 문제 정의
- 자연어 기반 영상 편집의 핵심 과제는 발화, 자막, 화면 전환, 모션 그래픽, 음악의 타이밍을 일치시키는 것이다. 단순한 효과 생성만으로는 완성도 높은 편집을 얻기 어렵다.
- Codex 데스크톱 앱과 Hyperframes를 결합해 긴 영상, 숏폼, 광고, 구독·가입 유도 영상을 제작한다. 기존 촬영본뿐 아니라 과거 영상과 브랜드 자료도 편집 자산으로 활용한다.
- 작업 흐름은 전사, 불필요한 구간 제거, 장면 설계, 애니메이션 구현, 반복 검증으로 이어진다. 구체적인 편집 지시와 수정 경험을 스킬로 축적하면 다음 작업에서 같은 요구를 반복할 필요가 줄어든다.
🕒 시간순 섹션별 상세정리
1. 자연어 편집의 범위와 긴 영상 자동 편집
- 도입부에는 AI 활용법·무료 모델 API·AI 에이전트를 소재로 한 짧은 편집 샘플이 계속된다. 자연어 지시로 모션 그래픽과 자막을 만들고, 얼굴 화면을 이동시키거나 여러 유튜브 영상을 입체적으로 배치한다. [04:05]
- 얼굴 촬영본과 화면 녹화본을 함께 사용한 사례에서는 실수·말더듬·침묵을 제거해 14분 영상을 9분으로 줄였다. 화면에 보여 줄 내용이 없는 구간에는 얼굴을 확대하고, 설명이 필요한 구간에는 화면 녹화 중심 배치로 돌아간다. [04:20]
2. 숏폼의 시청 흐름과 시각적 일관성
- Claude 활용 숏폼은 명세·검증·환경이라는 세 요소를 순서대로 풀어낸다. 처음에 세 개의 빈 퍼즐 조각을 보여 주는 구성은 남은 요소를 확인하려는 관심을 끝까지 유지하는 장치다. [04:35]
- 장면은 약 1~2초마다 보조 영상, 전체 화면 애니메이션, 얼굴 화면 사이를 전환한다. 종이 질감과 입체 움직임을 유지하면서 자막·음악·효과음을 맞추고, NVIDIA 소재에는 초록색 강조색을 적용한다. [05:03]
3. 광고에서 기존 영상과 브랜드 자산 활용
- 편집 스킬은 무료 커뮤니티의 Hyperframes 학생 키트에서 제공된다. AI 에이전트로 초기 사업 업무를 지원하는 광고 사례는 가로형 16:9와 세로형 9:16 두 비율로 제작했다. [05:55]
- 광고의 보조 영상에는 기존 유튜브 콘텐츠와 AIS Live 세션이 들어간다. 광고 문맥에 맞는 실제 활동 장면을 활용하고, Google Drive에서 찾은 행사 로고에도 애니메이션을 적용한다. [07:21]
4. 가입 유도 영상에 맞춘 차분한 편집
- 커뮤니티 가입 유도 영상은 무료 스킬·가이드·템플릿·저장소와 교육 과정을 화면에 연결한다. 가입 후 이용할 자료를 구체적으로 보여 주는 구성이다. [08:04]
- 차분한 음악과 느긋한 전환도 편집 방식의 선택지다. 커뮤니티 화면을 캡처하고 잘라 쓰며, 강좌·행사 사진과 영상을 결합해 실제 제공 내용이 드러나도록 만든다. [08:49]
5. 로컬 프로젝트 생성과 Hyperframes 설치
- 새 폴더를 만든 뒤 Codex에서 해당 폴더를 로컬 프로젝트로 연결한다. 처음에는 비어 있는 폴더에 영상 프로젝트, 렌더링 결과, 관련 파일이 쌓이는 구조다. [09:33]
- Hyperframes GitHub 저장소 주소와 함께 저장소 가져오기, 의존성 설치, 필요한 스킬 추가를 요청한다. 영상 편집에 필요한 실행 환경을 프로젝트 안에 갖추는 것이 첫 설치 단계다. [10:21]
6. 전사와 컷 편집을 먼저 확정하는 제작 순서
- 촬영본은 먼저 발화 내용과 정밀한 시간 정보를 전사해야 자막·애니메이션을 맞출 수 있다. 무료 로컬 Whisper 또는 ElevenLabs를 활용하고, 다음 단계에서 실수와 긴 침묵을 제거한다. [11:26]
- 컷 편집 후에는 Astra가 대사의 의도를 바탕으로 장면 단위인 비트를 설계한다. Hyperframes 등으로 HTML 애니메이션을 구현하며, 음악과 효과음의 타이밍도 이 설계에 포함한다. [12:05]
7. 반복 검증과 전사용 API 설정
- 구현 후에는 전체 결과와 스크린샷, 전사문을 다시 확인하고 수정하는 과정을 반복한다. 화면 요소가 영역을 벗어나지 않는지, 발화와 효과가 동기화되는지가 주요 검증 기준이다. [13:10]
- ElevenLabs 설정 예시에서는 월 약 5달러부터 시작하는 요금제를 언급하며, 개발자 메뉴에서 API 키를 만든다. 전사만 필요한 경우 키 권한을 음성 인식으로 제한하고, 키는 비밀번호처럼 비공개로 취급한다. [13:48]
8. 비밀 정보와 프로젝트 편집 규칙 저장
- API 키는 프로젝트의
.env파일에 저장하고, 전사에 ElevenLabs를 사용한다는 규칙은AGENTS.md에 기록한다. 반복 작업에서도 같은 도구 선택을 유지하기 위한 설정이다. [14:45] AGENTS.md에는 프로젝트 구조뿐 아니라 선호하는 편집 방식과 저장 규칙도 추가할 수 있다. 이번 구성에서는 속도를 중시해 로컬 Whisper 대신 유료 ElevenLabs를 선택하고, 생성된.env자리표시자에 키를 입력한다. [15:35]
9. 인트로 원본을 구체적인 편집 목표로 전환
- 인트로 실습은 앞서 활용한 별도 편집 스킬 없이 기본 환경에서 진행한다. 원본 영상의 발화와 손짓에 맞춰 효과를 직접 지정하며, 파일 경로와 목표를 담은
/goal프롬프트를 사용한다. [16:30] - 첫 지시는 전사로 타이밍을 확보한 뒤 실수와 침묵을 제거하는 것이다. 빠른 인트로를 목표로 0.5~1초 정도의 침묵도 남기지 않도록 요구한 다음 애니메이션 작업으로 넘어간다. [17:54]
10. 손짓과 발화에 맞춘 모션 그래픽 연출
- 시각적 방향은 애플 스타일의 매끄러운 움직임과 액체 유리 질감이다. 왼손이 가리키는 위치에는 카드·문서·화면·차트가 위에서 내려오게 해, 손짓으로 그래픽을 만들어 내는 느낌을 목표로 한다. [18:28]
- 오른쪽에는 그림자·회전·깊이를 갖춘 입체 요소와 은은한 어두운 배경을 배치한다. 왼쪽 효과가 먼저, 오른쪽 효과가 나중에 등장하고, 두 묶음은 해당 발화가 끝날 때 함께 사라지도록 지정한다. [19:24]
11. 자막·얼굴 화면·영상 카드의 세부 배치
- 자막은 얼굴을 가리지 않는 하단에 배치하고, 발음하는 단어를 흰색에서 파란색으로 강조한다. 얼굴 화면은 둥근 모서리와 그림자가 있는 세로형 크롭으로 줄여 발화에 맞춰 위치를 이동시킨다. [20:17]
- 지정한 배경은 불투명도 50%로 조정하고, 로컬 폴더의 최근 영상 4~6개를 부채꼴 입체 카드로 펼친다. 카드에는 정지 이미지 대신 실제 영상을 동시에 재생하고 회전과 그림자를 적용한다. [21:11]
12. 완성 기준을 검증하고 편집 경험을 스킬로 축적
- 완료 조건은 시제품이 아닌 사용 가능한 최종 결과물이다. 스크린샷을 통해 장면과 발화의 동기화, 화면 경계 준수, 전문적인 시각 품질을 점검하도록 요구한다. [22:35]
- 만족스러운 결과의 제작 방식을 스킬로 저장하면 다음에는 영상과 스킬 사용 지시만으로 시작할 수 있다. 이후 수정 의견도 스킬에 반영해 편집 기준을 지속적으로 개선한다. [23:04]
13. 첫 결과 확인과 두 번째 수정 목표
- 원본 약 1분 5초는 첫 편집에서 28초로 줄었다. 결과에는 양쪽 모션 그래픽, 발화에 맞춘 자막, 얼굴 화면 이동, 여러 영상의 입체 배치가 포함된다. [23:43]
- 첫 검토에서는 도입 2초의 시각적 흡인력, 재생 영상 카드가 서로 겹쳐 보이는 배치, 작은 텍스트가 수정 대상으로 남았다. 카드 배치를 더 자연스럽게 만들고 글자 크기를 키울 필요가 있다. [24:38]
14. 도입부와 입체 카드 수정 요청, 직접 편집의 활용
- 도입부 첫 2초에는 얼굴을 가리지 않으면서 시선을 끄는 모션 그래픽이 필요하다. 영상 카드 4개에는 두께를 더하고 서로 관통하지 않도록 뒤쪽으로 펼쳐 배치하며, 작은 화면 문구는 확대하는 것이 수정 목표다. [25:33]
- 하이퍼프레임 스튜디오에서는 요소 위치와 글자 크기를 직접 바꿀 수 있고, 3차원 장면과 영상 요소도 분리되어 있다. 10분짜리 영상에서 한 요소만 미세 조정할 때는 편집 화면에서 수정한 뒤 내보내는 편이 자연어 요청을 다시 처리하는 것보다 간편할 수 있다. [26:40]
15. 두 차례 수정 결과와 전체 화면 도입부의 완성
- 두 번째 버전은 약 10분 만에 완성됐고, 화면 문구가 커지면서 카드의 입체감도 개선됐다. 다만 원하는 형태를 구체적으로 지정하지 않은 도입부는 만족도가 낮아 추가 수정이 필요했다. [27:29]
- 첫 2초를 전체 화면 애니메이션으로 바꾸고, 기존 도입부와 어울리는 배경에 “놀랍지 않나요?”라는 문구가 움직이며 등장하도록 수정했다. 결과물에는 단순한 텍스트 애니메이션과 액체 유리 느낌의 카드가 겹쳐졌고, 뒤 장면과 배경의 일관성도 유지됐다. [29:00]
🧾 결론
- 완성 기준은 발화와 장면의 동기화, 화면 경계 준수, 읽기 쉬운 텍스트와 시각 품질을 갖춘 사용 가능한 결과물이다.
- 긴 영상·숏폼·광고·가입 유도 영상은 서로 다른 전환 속도와 음악을 요구한다. 빠른 효과뿐 아니라 차분한 편집도 목적에 맞게 선택한다.
- 구체적인 지시와 반복 검토를 거쳐 얻은 편집 기준을 스킬에 반영하면 다음 작업에서 같은 요구를 반복하는 부담을 줄일 수 있다.
📈 투자·시사 포인트
- 제작 도구를 평가할 때는 첫 생성 시간과 함께 수정 횟수, 직접 편집의 편의성, 최종 품질을 살펴볼 필요가 있다. 시연에서도 첫 결과 이후 여러 차례 수정이 이어졌다.
- 기존 유튜브 영상·행사 장면·브랜드 로고는 광고와 가입 유도 영상의 재사용 자산이 된다. 새 촬영 외에도 보유 자료를 조합하는 제작 방식이 제시된다.
- 무료 로컬 Whisper와 유료 ElevenLabs의 선택은 비용과 속도를 비교하는 운영 판단이다. 영상에서는 속도를 중시해 ElevenLabs를 선택했지만, 정량적인 비교 결과는 제시하지 않는다.
- 이 자료는 제작 방식과 사례를 보여 주며, 기업 실적이나 투자 수익을 판단할 근거는 제공하지 않는다.
⚠️ 불확실하거나 확인이 필요한 부분
- 제목의 ‘AI 영상 편집 해결’을 모든 영상에서의 자동 완성으로 일반화하기는 어렵다. 시연에서는 카드 배치·글자 크기·도입부를 반복해서 수정했다.
- 약 18분과 10분이라는 작업 시간은 해당 사례의 수치다. 하드웨어, 원본 분량, 작업 복잡도별 소요 시간이나 전체 제작 비용은 확인되지 않는다.
- ElevenLabs의 월 약 5달러 시작 요금은 영상 속 설명이다. 실제 적용 요금과 전사 사용 한도는 도입 전에 확인해야 한다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 짧은 촬영본으로 Codex 로컬 프로젝트와 Hyperframes 실행 환경을 구성하고, 전사와 컷 편집부터 진행한다.
- Whisper와 ElevenLabs 중 전사 도구를 선택한다. API 키를 사용한다면 음성 인식 권한으로 제한하고 비공개로 관리하며, 도구 선택은
AGENTS.md에 기록한다. - 장면별 발화·손짓·자막 위치·효과의 등장 및 종료 시점을 편집 지시에 명시한다.
- 전체 재생 결과와 스크린샷, 전사문을 함께 확인해 동기화·화면 경계·글자 크기·카드 겹침을 점검한다.
❓ 열린 질문
- 긴 영상에서도 시연과 같은 동기화와 시각 품질을 유지하려면 검토와 수정에 얼마나 많은 시간이 필요한가?
- 어떤 수정은 자연어 재요청으로 처리하고, 어떤 수정은 Studio에서 직접 처리하는 것이 효율적인가?
- 축적한 편집 스킬을 다른 영상 형식에 적용할 때 어느 정도까지 재사용할 수 있는가?