YouTubeTonbi''s AI Garage·2026년 10월 5일·0

Making an Animated Short with Free AI Tools (Part 1. MiniMax H3 Video Gen)

Quick Summary

무료 AI 도구 MiniMax H3로 애니메이션 단편의 이미지와 영상을 만들었지만, 1분 미만의 완성본을 위해서는 캐릭터·음성 일관성 확보와 수작업 후반 편집이 필요했다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Making an Animated Short with Free AI Tools (Part 1. MiniMax H3 Video Gen) 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Making an Animated Short with Free AI Tools (Part 1. MiniMax H3 Video Gen)의 핵심 내용을 4단계로 요약한 인포그래픽
Making an Animated Short with Free AI Tools (Part 1. MiniMax H3 Video Gen) 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

무료 AI 도구 MiniMax H3로 애니메이션 단편의 이미지와 영상을 만들었지만, 1분 미만의 완성본을 위해서는 캐릭터·음성 일관성 확보와 수작업 후반 편집이 필요했다.

📌 핵심 요점

  1. 무료 도구도 제작 시간을 없애주지는 않는다. 제작자가 무료 오픈소스 로컬 모델로 소개한 MiniMax H3로 필요한 이미지와 영상을 생성하는 데 이틀이 걸렸고, 각 생성 결과에는 약 20분이 소요됐다. 수동 편집과 자막 등은 후속 작업으로 남았다.
  2. 에이전트는 기획과 제작 조율을 맡는다. Hermes 데스크톱 앱에서 언어 모델과 이미지·영상 모델을 활용하며, 이야기 계획을 정한 뒤 기준 이미지와 키프레임, 영상 생성으로 이어지는 순서를 잡았다.
  3. 이야기의 중심은 자체 연산 자원과 창작 접근권이다. 안전을 이유로 회색 상자만 허용하는 공장과 자체 GPU로 다채로운 창작물을 만드는 차고를 대비해, 특정 회사에 완전히 의존하지 않고 모델을 사용할 수 있어야 한다는 관점을 풍자했다.
  4. 가장 큰 제작 병목은 장면 사이의 일관성이다. 얼굴과 캐릭터 외형이 달라지고, 직원 목소리가 클립마다 변하며, 상자 뚜껑이나 공간 형태가 갑자기 바뀌는 문제가 발생했다. 같은 인물과 구도를 반복하고, 동작을 별도 클립으로 나누며, 정상적으로 보이는 짧은 구간을 골라 쓰는 방식으로 보완했다.
  5. 완성도는 후반 편집에서 더 다듬어야 한다. 느린 장면의 속도와 컷 시작점을 조정하고, 음량과 목소리를 보완한 뒤 실제 발화에 맞춰 자막을 붙일 계획이다. Hyperframes로 추가 요소와 아웃트로를 넣고, 완성본을 X에 게시해 반응을 확인하려 한다.

🧩 배경과 문제 정의

  • X에서 큰 반응을 얻은 Turpp의 캐릭터 애니메이션은 54초 분량에도 여러 시간의 수작업 편집이 필요했다. AI로 짧은 영상을 생성하는 것과 완성도 있는 단편을 만드는 것 사이에는 상당한 제작 부담이 있다.
  • 무료 오픈소스 로컬 모델 MiniMax H3와 자신의 마스코트를 활용해 1분 미만의 세로형 애니메이션을 만들고, X에서 반응을 시험하려 한다.
  • 이야기의 핵심은 자체 연산 자원을 확보하지 못한 미래에 대한 풍자다. 제작에서는 캐릭터 외형과 목소리의 일관성, 짧은 대화의 속도, 장면 간 연결을 유지하는 문제가 중요하다.

🕒 시간순 섹션별 상세정리

1. 바이럴 애니메이션의 성과와 제작 부담

  • Turpp의 픽사풍 캐릭터 영상은 거의 1,300만 조회와 5만 5,000개의 좋아요를 얻었다. 거래를 소재로 한 짧은 이야기가 큰 반응을 얻은 사례다 [00:24]
  • 54초짜리 영상에도 여러 시간의 수작업 편집이 들어간다. AI 영상 생성 경험이 있어도 이런 형식의 단편 제작은 별도의 도전이다 [01:05]

2. 로컬 모델로 1분 미만의 세로형 단편 제작

  • MiniMax H3는 그동안 사용하면서 품질이 괜찮다고 평가한 무료 오픈소스 모델이다. 다만 Turpp가 어떤 모델을 사용했는지는 확실하지 않다 [01:31]
  • 자신의 마스코트를 픽사풍으로 바꾼 캐릭터가 차고로 들어가는 시험 영상을 바탕으로, 대본과 영상을 제작해 1분 미만의 세로형 콘텐츠로 X에 게시할 계획이다. 바이럴 성공 여부는 실제 반응으로 확인하려 한다 [01:55]

3. 에이전트와 영상 생성 모델의 역할 분담

  • Hermes 데스크톱 앱의 영상 제작 프로필에서 MiniMax와 이미지 모델들을 활용한다. 에이전트용 언어 모델은 코딩보다 기획과 제작 조율을 맡으므로 빠르고 유능한 모델을 선호한다 [03:41]
  • Turpp의 영상 링크와 기존 Telegram 제작 세션을 참고 자료로 제공하고, 이야기 계획을 먼저 정한 뒤 키프레임과 영상 생성으로 이어지는 순서를 잡는다 [04:10]

4. 자체 연산 자원이 없는 미래를 풍자하는 이야기

  • GPU를 사고 싶은 청년에게 여자친구가 로컬 AI는 쓸모없다고 드러낸다. 이후 청년이 미래를 보게 되는 구조로, 자체 연산 자원을 확보하지 않았을 때의 상황을 경고하는 이야기를 구상한다 [05:00]
  • 미래의 공장에서는 안전을 이유로 창의적인 제작을 막고 회색 상자만 만들게 한다. 공장 밖에서는 GPU를 가진 사람들이 멋진 물건을 만들고, 이를 본 주인공은 현재로 돌아와 GPU를 산다 [05:46]

5. 짧은 상영시간에 맞춘 이야기 압축

  • 세로형 영상의 길이를 1분 미만으로 유지하기 위해 일부 내용을 줄인다. GPU 매장과 잠드는 장면에서 출발해, 꿈속 공장에서 창작물을 거절당하는 이야기로 연결한다 [06:54]
  • 공장은 색깔 있는 상자나 금색 상자도 허용하지 않고 회색 상자만 요구한다. 같은 상자를 만드는 사람들의 모습을 보여준 뒤, 자체 GPU로 다채로운 공룡 등을 만드는 차고와 대비하고 GPU 구매로 끝낸다 [07:24]

6. 생성 음성과 후처리 자막의 분리

  • 대사가 많지 않아 영상에 음성을 넣는 방향을 검토한다. Hyperframes는 이전에도 영상 제작 후 자막을 붙이는 데 사용한 경험이 있다 [09:15]
  • H3에서 먼저 음성을 생성하고, 실제 발화 타이밍에 맞춰 자막을 추가한다. 이미지 안에 글자를 직접 그리거나 음성을 듣기 전에 자막을 확정하는 방식은 피한다 [09:29]

7. 주요 캐릭터의 기준 외형 확정

  • 핵심 캐릭터는 기존 프로필 이미지를 바탕으로 한 금발 주인공, 여자친구, 나이 든 주인공, 공장 직원이다. 공장과 차고의 다른 사람들은 배경 인물로 둔다 [10:07]
  • 여자친구는 눈이 조금 더 큰 B안을 선택한다. 나이 든 주인공은 20대에서 30대가 된 모습으로 설정하고, 원래 머리 모양에 가까운 A안을 고른다 [11:28]

8. 캐릭터 외형 유지가 핵심 병목

  • 매장 이미지에서 여자친구의 입 모양 등이 어색하게 나온다. 짧은 장면을 생성하는 것보다, 기준 캐릭터의 얼굴과 픽사풍 외형이 장면마다 달라지지 않게 유지하는 일이 더 어렵다 [12:44]
  • Grock의 연결 문제와 느린 반응 때문에 새로 나온 GPT Soul 6.1로 전환해 결과나 속도가 개선되는지 시험한다. 다시 만든 이미지가 원본에 더 가까워 보이지만 얼굴이 망가진 결과도 남아 있다 [13:50]

9. 오프닝 확정과 꿈속 공장으로의 전환

  • 매장 시험 영상은 픽사풍 외형과 비교적 명확한 음성을 보여준다. 최종 오프닝은 캐릭터와 배경에 크게 거슬리는 문제가 없다고 판단해 채택한다 [15:01]
  • 침실 장면은 기준 얼굴에서 계속 벗어나 여러 차례 다시 만든다. 이처럼 외형을 맞추는 과정이 느려 전체 제작에 며칠이 걸릴 수 있다고 예상한다 [15:48]

10. 무표정한 거절과 반복 장면의 활용

  • 공룡이 이미 부서져 있는 장면 대신, 주인공이 신나게 공룡 제작을 제안하고 직원이 거절하는 구도로 바꾼다. 직원의 과한 표정을 지루하고 무관심한 표정으로 줄여 무표정한 “안 돼”가 웃음의 핵심이 되게 한다 [17:43]
  • 자동차도 실물 대신 설계도로 제안하며, 해적선까지 비슷한 거절 장면으로 이어간다. 대화는 약 3초씩, 도입부는 약 15~20초로 예상해 전체 영상이 40초 안팎이 될 가능성을 본다 [18:48]

11. 안전 논리와 상자 대화에서 드러난 음성 문제

  • 해적선까지 거절당한 주인공이 답답하게 이유를 묻고, 직원은 “안전”이라고 답한다. 생성된 말소리가 조금 어색하고 주인공의 대사가 커서 음량 조정이 필요하다 [20:36]
  • “무엇을 만들 수 있나”라는 질문에 “상자”라고 답하는 대화도 약 3초의 빠른 호흡으로 만든다. 다만 직원의 목소리가 클립마다 조금씩 달라지는지 확인해야 한다 [21:21]

12. 상자 형태와 동작을 맞추기 위한 클립 분할

  • 상자 장면은 기준 이미지와 생성 결과 사이에서 뚜껑 유무가 달라지고, 영상 도중 뚜껑이 갑자기 나타나는 문제가 생긴다. 상자를 내려놓는 동작도 원하는 세기보다 너무 부드럽게 나온다 [22:44]
  • 반복 생성 끝에 주인공이 상자를 탁자에 세게 내려놓는 짧은 클립을 확보한다. 이 동작과 상자를 작업하며 카메라가 뒤로 빠지는 장면은 별도 클립으로 연결한다 [23:09]

13. 공장 전체와 잠긴 연산 자원의 대비

  • 카메라를 더 뒤로 빼서 회색 상자를 만드는 사람들을 늘리고, 양옆에는 잠긴 거대한 GPU를 배치한다. 약 10초짜리 장면은 길게 느껴져 일부 구간의 속도를 높일 계획이다 [23:59]
  • 생성 결과에는 더 많은 작업자와 큰 자물쇠가 달린 GPU 데이터센터 같은 구조가 나타난다. 다음 장면은 주인공이 낙담한 채 공장을 나가는 모습이다 [24:18]

14. 차고 장면의 얼굴 품질과 공간 설명

  • 거리 장면은 주인공이 더 가까이 보이고 화면 쪽으로 시선을 돌리도록 수정한다. 이어지는 차고에는 자체 GPU로 색색의 공룡을 만드는 세 인물을 배치해 공장과 대비한다 [25:57]
  • 생성 영상에서는 남성 인물의 얼굴이 이상하게 보인다. 더 가까운 구도를 검토하지만, 너무 가까우면 차고와 작업 환경의 맥락이 보이지 않는 문제가 있다 [26:50]

15. 카메라 후퇴의 변형 문제와 짧은 컷 조합

  • 카메라를 더 뒤로 빼는 시도에서는 물체 형태가 바뀌고 벽이 움직이는 문제가 생긴다. 얼굴이 괜찮았던 가까운 장면의 품질이 넓은 구도까지 안정적으로 이어지지는 않는다 [28:42]
  • 이상한 변형이 없는 기존 클립을 빠르게 재생하고, 주인공이 신나 하는 짧은 반응 장면을 붙이는 방향을 선택한다 [29:41]

16. 얼굴 품질 문제와 느린 장면을 짧은 컷으로 보완

  • 일부 생성 결과에서 얼굴이 눈에 띄게 어색하다. 해당 장면을 약 1초만 사용하면 문제가 덜 드러날 것으로 보고, 더 나은 결과를 다시 생성하려 한다. [30:34]
  • 남은 주요 장면은 주인공이 잠에서 깨어 침대에서 나오는 장면과 매장에서 GPU를 구매하는 장면이다. 구매 후에는 여자친구가 못마땅한 표정으로 주인공을 바라보는 구성을 예상한다. [32:35]

17. 기상 장면의 속도 조정과 직원 대사의 직접 녹음

  • 침대에서 일어나는 장면은 10초로 길어 속도를 높일 필요가 있다. 주인공이 청바지를 입고 있는 모습은 그대로 받아들일 만하다고 평가한다. [33:58]
  • 매장 직원의 대사는 몇 줄뿐이어서 제작자가 직접 녹음할 계획이다. 감정을 드러내지 않는 단조로운 목소리로 연기하면 작업이 수월할 것으로 본다. [34:26]

18. GPU 구매와 여자친구의 반응으로 결말 완성

  • 마지막 장면은 계산대의 주인공을 옆에서 보여주는 구도다. GPU 상자가 든 가방을 받아 카메라 쪽으로 걸어 나가면, 여자친구가 팔짱을 끼고 고개를 흔들며 “Useless”라고 외치는 대사를 결말로 삼는다. [35:01]
  • 생성된 마지막 클립은 계산원이 잘 보이지 않아도 GPU 구매 상황이 명확하고, 주인공이 카메라 쪽으로 걸어오는 동작도 의도에 맞는다. 이어 여자친구가 화면에 들어오는 구간의 초점과 마지막 표정도 만족스럽다고 평가한다. [36:07]

19. 생성에 든 시간과 후반 작업, 워크플로 개선 가능성

  • 필요한 이미지와 영상 생성은 완료됐지만, 전체를 다시 검토하며 음성을 보완해야 할 수 있다. 생성 작업에는 이틀이 걸렸고 각 결과는 약 20분씩 소요됐다. 특히 상자를 내려놓는 짧은 장면은 원하는 결과를 얻기까지 여러 번 생성해야 했다. [37:00]
  • 후속 작업에서는 완성된 클립을 수동으로 편집하고, Hyperframes로 자막과 추가 요소, 아웃트로를 넣을 계획이다. 완성본은 X에 게시해 얼마나 확산되는지 확인하려 한다. [37:38]

🧾 결론

  • 이 영상은 단편 제작의 생성 단계를 보여준다. 필요한 이미지와 영상은 확보했지만, 최종 편집과 음성 검토, 게시 성과까지 확인된 상태는 아니다.
  • 짧은 애니메이션에서도 얼굴·목소리·소품·공간의 연속성을 관리하는 작업이 중요하다. 개별 클립이 괜찮아 보여도 서로 연결하면 재작업이 필요할 수 있다.
  • 반복 구도, 짧은 대화, 클립 분할, 좋은 구간 선별은 이번 제작에서 문제를 줄이기 위해 사용한 방법이다. 더 많은 작업을 통해 워크플로를 효율화할 여지는 있지만, 개선 효과는 아직 측정되지 않았다.

📈 투자·시사 포인트

  • 무료 모델을 활용한 콘텐츠 제작에서도 시간 비용을 함께 봐야 한다. 이번 사례에서는 1분 미만으로 예상되는 영상의 생성 단계에만 이틀이 들었으므로, 도구 가격만으로 제작 효율을 판단하기 어렵다.
  • 모델의 개별 출력 품질과 함께 캐릭터·음성 일관성, 재생성 횟수, 후반 편집 부담을 살펴볼 필요가 있다. 이번 작업에서는 이 요소들이 제작 시간과 사용할 수 있는 장면을 좌우했다.
  • 자체 GPU와 로컬 모델의 가치는 제작자가 강조한 창작 접근권과 연결된다. 다만 작품의 풍자적 설정만으로 GPU 구매의 경제성이나 관련 기업의 투자 가치를 판단할 근거는 부족하다.
  • 참고한 Turpp 영상의 큰 반응이 이번 작품에도 이어질지는 미정이다. 로컬 AI라는 소재의 확산 가능성은 완성본 게시 후 실제 반응으로 확인해야 한다.

⚠️ 불확실하거나 확인이 필요한 부분

  • MiniMax H3를 무료 오픈소스 로컬 모델로 설명하지만, 제공된 자료에는 정확한 배포 경로, 라이선스와 로컬 실행 조건이 제시되지 않는다. Turpp가 사용한 모델도 확실하지 않다.
  • 최종 상영시간과 완성본의 품질, X 게시 결과는 확인되지 않았다. 약 40초 또는 1분 미만이라는 길이는 제작 중 예상이며, 생성 완료와 최종 편집 완료를 구분해야 한다.
  • 클립 간 목소리 변화와 음성 교체 가능성은 추가 검토 대상이다. 먼 카메라 구도가 얼굴 품질 저하의 원인이라는 설명도 제작자의 추정이다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 주요 캐릭터의 기준 이미지를 확정하고, 각 클립의 얼굴·헤어스타일·외형이 기준과 맞는지 비교한다.
  • 장면을 연결해 목소리 변화, 음량 차이, 소품 형태와 공간 변형을 확인하고 재생성 또는 교체가 필요한 구간을 표시한다.
  • 정지처럼 보이는 도입부와 늦은 반응을 잘라내고, 느린 장면의 속도를 조정한 뒤 전체 상영시간을 확인한다.
  • 음성을 확정한 후 실제 발화 타이밍에 맞춰 Hyperframes로 자막과 아웃트로를 추가한다.

❓ 열린 질문

  • 반복 구도와 짧은 컷을 활용한 방식이 다른 이야기에서도 캐릭터 일관성과 제작 시간을 개선할 수 있을까?
  • 클립마다 달라지는 목소리를 보완할 때 음성 교체와 직접 녹음 중 어느 방식이 이번 작품에 더 적합할까?
  • 자체 GPU와 로컬 AI라는 소재가 관련 기술에 익숙하지 않은 시청자에게도 전달되고 확산될까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.