GPT6 아스트라 + Fish Audio 조합 미쳤습니다.. 성우 없이 혼자 게임 만드는 시대.. ㄷㄷ
Quick Summary
GPT6 아스트라로 게임을 구현하고 Fish Audio로 캐릭터 목소리를 더하는 시연은 성우를 별도로 섭외하지 않는 1인 게임 제작의 가능성을 보여준다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
GPT6 아스트라로 게임을 구현하고 Fish Audio로 캐릭터 목소리를 더하는 시연은 성우를 별도로 섭외하지 않는 1인 게임 제작의 가능성을 보여준다.
📌 핵심 요점
- 제작자는 AI 코딩, 캐릭터 이미지·애니메이션, 음성을 결합해 퀘스트와 이벤트가 있는 판타지 시뮬레이션 게임을 구성했다.
- 코딩에는 코덱스와 아스트라를 사용했다고 설명한다. 이미지·영상 제작의 상세 과정은 후속 영상으로 남기고, 이번 편은 음성 구현에 집중한다.
- Fish Audio에서 한국어·성별·연령·음색으로 목소리를 탐색하고, 자동 태그로 대사에 감정·쉼·강조를 더하는 과정을 보여준다.
- 게임 연결 방법으로 MCP 서버와 사용 문서를 활용한 연동을 소개한다. 시연에서는 개발자 키를 설정하고 선택한 보이스 ID를 캐릭터에 적용한다.
- 기존 목소리 선택 외에도 약 30초의 자기 음성을 활용한 복제와 텍스트 기반 음성 디자인을 시연한다. 결과에 대한 평가는 제작자의 청취 경험에 근거한다.
🧩 배경과 문제 정의
제작자는 머릿속 아이디어를 판타지 시뮬레이션 게임으로 구현한 뒤, 캐릭터와 자막만으로는 장면의 생동감이 부족하다는 문제를 제시한다. 대사가 많은 게임에서 모든 목소리를 직접 녹음하거나 성우를 섭외하는 부담을 줄일 방법으로 AI 음성을 소개한다.
전체 제작 요소는 코딩, 이미지·애니메이션, 음성의 세 가지다. 이번 영상은 그중 캐릭터 목소리를 선택하거나 만들고 게임에 연결하는 과정을 다루며, 이미지와 영상의 상세 제작법은 다음 편으로 예고한다.
🕒 시간순 섹션별 상세정리
1. AI 게임 제작의 세 요소와 시연
- 코딩을 맡을 AI, 캐릭터 이미지·애니메이션, 캐릭터를 실감 나게 할 음성을 제작 준비물로 제시한다. [00:31]
- 판타지 세계에서 퀘스트를 수행하는 게임을 소개하고, 상업 훈련에서 대사와 애니메이션이 함께 나오는 이벤트를 보여준다. [01:18]
- 준비한 프롬프트를 코덱스의 아스트라 모델에 입력하는 흐름을 소개하며 이미지·영상 프롬프트는 후속 편에서 설명하겠다고 드러낸다. [01:47]
2. 이미지에서 음성으로 생동감 확장
- 이미지 2.5의 두 버전으로 소개한 결과물을 비교하고, 디테일을 이유로 선버스트를 캐릭터 제작에 선택했다고 보여준다. [02:37]
- 마법 훈련 장면에서 자막만 나오는 경우를 보여주며, 많은 대사를 직접 더빙하기 어려운 문제에 AI 목소리를 대안으로 제시한다. [03:28]
- 기존 목소리 샘플과 상인 캐릭터 적용 사례를 들려준다. 여섯 등장인물 중 두 명에만 음성이 있어 나머지 캐릭터에도 추가하겠다고 한다. [04:33]
3. 캐릭터 음색 선택과 자동 감정 태그
- 검술 스승에게 어울리는 음성을 찾기 위해 한국어·남성·중년 필터를 적용하고, 깊고 묵직한 음색으로 후보를 좁힌다. [05:15]
- 선택한 음성에 대사를 넣고 자동 태그를 적용한다. 대사 분석을 통해 감정과 쉼·강조를 넣는 기능이라고 보여준다. [05:50]
- 생성한 대사를 게임 영상과 함께 들어본 뒤, 어울리는 목소리의 보이스 ID를 가져오는 단계로 넘어간다. [06:07]
4. 개발 환경 연결과 게임 적용
- 연결 방법으로 MCP 서버와 사용 문서를 활용한 방식을 보여준다. 코덱스 앱에서는 문서와 키 입력 파일을 활용해 AI에 연결 작업을 요청하는 흐름을 보여준다. [06:52]
- 대시보드에서 개발자 키를 생성해 지정한 파일에 넣고, 선택한 보이스로 검술 스승의 목소리를 바꾸도록 요청한다. [07:20]
- 음성이 추가된 검술 훈련을 재생하고, 캐릭터마다 어울리는 목소리를 선택해 적용하는 방식을 정리한다. [07:50]
5. 자기 음성 복제와 이용 조건 소개
- 원하는 목소리가 없을 때 사용할 기능으로 음성 업로드·복제와 텍스트 설명을 보여준다. 긴 녹음이 필요한 전문 복제는 시연하지 않는다. [08:19]
- 자기 음성을 녹음하고 분석한 뒤 개인용 음성으로 생성한다. 두 결과물을 들려주며 약 30초 녹음으로 나온 품질에 만족감을 표현한다. [09:26]
- 생성 한도와 유료·연간 플랜 혜택을 안내하고, 자기 음성 복제를 콘텐츠 녹음에도 활용할 수 있다고 제안한다. [10:07]
6. 텍스트 음성 디자인과 후속 제작 예고
- 심야 라디오 진행자 예시를 바탕으로 나이를 60대 후반으로 조정하고, 길드장 대사를 미리 듣기 텍스트로 넣어 음성을 생성한다. [10:46]
- 디자인한 음성도 쓸 만하다고 평가하면서 자기 음성 복제 결과를 더 높게 평가한다. 퀘스트 확장과 이미지 기반 애니메이션 제작은 다음 편으로 남긴다. [11:26]
- 이번 편의 초점이 음성을 통한 생동감 향상임을 정리하고, 무료 크레딧·API 혜택을 안내한다. 이미지·영상 제작을 다룰 후속 편을 예고하며 마무리한다. [12:21]
🧾 결론
- 이 영상의 핵심 결과물은 캐릭터 대사에 음성을 붙여 생동감을 높인 게임 시연이다.
- 목소리 선택, 감정 표현 조정, 게임 연동을 하나의 흐름으로 연결하는 것이 실습의 중심이다.
- 기존 음성 탐색·자기 음성 복제·텍스트 음성 디자인은 원하는 캐릭터 목소리를 확보하는 서로 다른 경로로 제시된다.
- 전체 게임 제작을 재현하려면 이번 편에서 생략한 이미지·애니메이션 제작 과정도 추가로 확인해야 한다.
📈 투자·시사 포인트
- 제작 관점에서는 AI 코딩과 음성 도구의 결합이 1인 개발자가 시도할 수 있는 작업 범위를 넓히는 사례다. 실제 개발 시간이나 비용 절감 폭은 제시되지 않는다.
- 음성 도구의 활용 가치는 자연스러움뿐 아니라 캐릭터에 맞는 음색 탐색, 감정 조절, 개발 환경 연결의 편의성에서도 드러난다.
- 자기 음성 복제는 게임 밖에서도 콘텐츠 녹음에 활용할 수 있다고 제안된다. 다만 제작 속도 개선을 수치로 검증한 내용은 없다.
- 유료 플랜 판단에는 생성 한도와 API 이용 조건 확인이 필요하다. 영상의 할인·무료 혜택 안내만으로 장기 비용이나 투자 수익성을 판단하기는 어렵다.
⚠️ 불확실하거나 확인이 필요한 부분
- 제목의 GPT6 아스트라와 본문의 이미지·음성 모델명은 공식 명칭이나 버전이 별도로 검증되지 않았다. 특히 자막에는 Fish Audio가 ‘PC 오디오’ 등으로 표기되는 혼선이 있다.
- 요금 설명에는 ‘월간 15분’, ‘최대 200분’, ‘50%’, ‘30~40%’가 함께 등장한다. 정확한 가격 단위, 생성 한도, 할인 적용 조건을 이 자막만으로 확정할 수 없다.
- 약 30초 녹음으로 얻은 복제 품질과 음성의 자연스러움은 단일 시연에 대한 주관적 평가다. 다양한 대사에서의 발음·감정 일관성은 확인되지 않는다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 캐릭터 한 명과 대표 대사 몇 개를 골라 음성 적용 전후의 게임 장면을 비교한다.
- 한국어·연령·성별·음색 필터로 후보를 찾고, 자동 태그 적용 전후의 쉼·강조·감정을 들어본다.
- 사용 환경에 맞는 연동 문서를 확인하고, 개발자 키 설정과 보이스 ID 적용을 작은 범위에서 검증한다.
- 원하는 목소리가 없으면 자기 음성 복제와 텍스트 음성 디자인을 각각 시험해 캐릭터 적합성을 비교한다.
❓ 열린 질문
- 등장인물 전체와 다양한 퀘스트에 음성을 적용해도 캐릭터별 음색과 감정 표현이 일관되게 유지되는가?
- 대사량이 늘어날 때 음성 생성 비용과 응답 지연은 어느 정도이며, 게임에서는 어떤 방식으로 음성을 재생하는가?
- 후속 편의 이미지·영상 제작 과정까지 포함하면 전체 제작 시간과 수정 작업량은 얼마나 되는가?