YouTubeLimitless Podcast·2026년 8월 20일·0

The Only FOUR AI Models Worth Using

Quick Summary

The Only FOUR AI Models Worth Using를 중심으로, 최근 90일 동안 주요 연구소가 15개 이상의 모델을 출시하고 OpenRouter의 선택지가 400개를 넘으면서, 최고 지능 하나를 핵심 판단 포인트로 압축 정리한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

The Only FOUR AI Models Worth Using 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

The Only FOUR AI Models Worth Using의 핵심 내용을 4단계로 요약한 인포그래픽
The Only FOUR AI Models Worth Using 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

The Only FOUR AI Models Worth Using를 중심으로, 최근 90일 동안 주요 연구소가 15개 이상의 모델을 출시하고 OpenRouter의 선택지가 400개를 넘으면서, 최고 지능 하나를 핵심 판단 포인트로 압축 정리한다.

📌 핵심 요점

  1. 최근 90일 동안 주요 연구소가 15개 이상의 모델을 출시하고 OpenRouter의 선택지가 400개를 넘으면서, 최고 지능 하나보다 비용·제품 완성도·작업 적합성을 함께 판단해야 하는 시장이 됐다.
  2. 현재의 실용적인 역할 분담은 X 실시간 정보의 Grok, 대화형 음성과 이미지 생성의 ChatGPT, 코딩·글쓰기·구현을 포함한 깊은 작업의 Claude, 음악과 가벼운 창작의 Gemini로 정리된다.
  3. 대부분의 일반 구독자에게는 ChatGPT와 Claude가 무난한 주력 선택이고, Grok과 Gemini는 실시간 검색이나 특화 창작 기능이 필요한 순간에 보완재 역할을 한다.
  4. Kimi·DeepSeek 같은 오픈 모델은 비용·사설 실행·데이터 통제에서 유리하며, 특히 OpenClaw 자동화와 다중 에이전트처럼 토큰 소비가 큰 환경에서 경제성이 커진다.
  5. 장기적인 경쟁력은 벤치마크 점수만이 아니라 개인 맥락의 축적, 이메일·드라이브·업무 도구 연동, 에이전트 실행 능력, 모델별 강점을 자동 선택하는 라우팅에서 결정될 가능성이 크다.

🧩 배경과 문제 정의

  • 최근 90일 동안 주요 AI 연구소가 15개 이상의 모델을 내놓고 OpenRouter에서만 400개 이상을 선택할 수 있게 되면서, 단순히 가장 똑똑한 모델을 고르는 방식은 현실성이 떨어졌다.
  • 중국계 오픈 모델은 낮은 비용·사설 실행·데이터 통제에서 강점을 보이고, 미국계 폐쇄 모델은 높은 지능·완성도 높은 제품·서비스 연동에서 우위를 유지한다.
  • 일반 사용자는 하나의 구독 서비스와 축적된 개인 맥락이 중요하지만, 개발자·에이전트 운영자·대규모 토큰 사용자는 비용과 전문 기능에 따라 여러 모델을 조합필요가 있다.

🕒 시간순 섹션별 상세정리

1. 모델 폭증과 선택 기준의 변화

  • 최근 90일 동안 OpenAI 3개, Anthropic 4개, Google 3개를 포함해 프런티어 연구소들이 15개 이상의 모델을 출시했고, 중국계 연구소까지 가세하면서 선택지가 급격히 늘었다. [01:07]
  • OpenRouter에서만 400개 이상의 모델을 쓸 수 있어 최고 지능만 좇기보다 비용이 낮거나 특정 작업에 맞는 모델을 선택하는 기준이 중요해졌다. [01:12]

2. 오픈 모델의 성장과 비용 압력

  • 시장은 중국계 오픈 모델과 미국계 폐쇄 모델로 크게 갈리며, Kimi·DeepSeek 같은 오픈 모델은 직접 운영할 수 있다는 차별점을 가진다. [01:17]
  • OpenRouter 기준 미국 연구소의 토큰 점유율은 2025년 6월 70%에서 30%로 낮아졌지만, 단일 라우터의 편향이 있어 전체 시장을 그대로 대표하지는 않는다. [01:39]

3. 최고 지능보다 ‘충분히 좋은’ 성능

  • 중국계 모델은 최상위 모델보다 지능이 낮더라도 대다수 업무를 처리할 만큼 성능이 충분하고, 자연스러운 문체와 적은 안전장치 덕분에 지시 이행 범위가 넓다. [03:04]
  • Artificial Analysis 지능 지수에서는 Claude 계열이 선두를 차지하고 Grok 4.6도 상위권에 진입해, 폐쇄형 최상위 모델의 지능 우위와 후발 모델의 추격이 동시에 나타난다. [03:30]

4. 일반 구독자와 대규모 토큰 사용자의 갈림길

  • 일반 소비자는 월 20·100·200달러 정액제로 많은 사용량을 확보할 수 있어, 가격 차이보다 지능과 제품 완성도가 높은 주요 연구소의 구독이 유리하다. [05:41]
  • 오픈 모델의 비용 우위는 OpenClaw 같은 자동화 워크플로와 다수 에이전트가 막대한 토큰을 소비할 때 커지며, 일상적인 고품질 작업에는 폐쇄 모델 구독이 더 적합하다. [06:24]

5. 이미지 생성과 대화 품질의 차별화

  • ChatGPT ImageGen 2.0은 문장을 그대로 이미지로 옮기는 데 그치지 않고 요청 의도와 입력 이미지를 해석해, 이전 세대보다 맥락에 맞는 결과물을 만든다. [07:30]
  • Claude Opus 5는 Fable 5보다 자연스럽고 간결하게 응답해 일상 사용 비중이 커졌으며, 장황하고 고풍스러운 문체는 높은 지능과 별개로 사용성을 떨어뜨린다. [08:00]

6. 저가형 모델 경쟁과 컴퓨트의 역할

  • 저렴하고 접근하기 쉬우며 사설 실행도 가능한 오픈 모델이 확산되자 OpenAI와 Anthropic은 주력 모델을 증류한 저가형 제품으로 비용 격차를 줄이기 시작했다. [09:44]
  • GPT-5.6 Luna는 가격이 약 80% 낮아져 GLM-5.3과 경쟁하고, Opus 5도 Fable 5의 절반 수준 비용으로 비슷한 역량을 제공하면서 폐쇄 모델 내부의 선택지가 늘었다. [10:16]

7. 구독 시장에서 갈리는 Gemini와 Grok의 강점

  • API나 토큰 단위 결제를 쓰지 않는 대다수 구독자에게는 모델 단가보다 서비스에 포함된 도구가 중요하며, Gemini는 최전선 지능보다 특화 기능에서 경쟁한다. [11:02]
  • Google은 Lyria의 음악·가사 생성, 이미지 제작, 브랜드 로고를 활용한 마케팅 소재와 상품 시안처럼 좁지만 독특한 창작 작업에서 강점을 가진다. [11:44]

8. 음성 경험과 빅테크의 유통 해자

  • ChatGPT 음성 모드는 사람 같은 멈춤과 감정 표현을 강화했지만, 단순한 질문에도 과도하게 능청스러운 반응을 섞어 빠른 정보 확인에는 불편할 수 있다. [13:22]
  • Microsoft와 Google은 모델 성능이 선두가 아니더라도 Fortune 500과 기존 업무 도구에 깊이 들어가 있어, 사용자가 Teams·Docs 안의 AI 버튼을 누르는 것만으로 채택을 늘릴 수 있다. [14:04]

9. 주류 선택인 ChatGPT와 Claude의 역할 분담

  • 가격과 지능을 함께 고려한 상위 구간에서는 ChatGPT와 Claude 구독이 대부분의 사용자에게 가장 무난하며, 월 20달러부터 최상위 연구 역량에 접근할 수 있다. [15:39]
  • Claude는 코딩·글쓰기·구현과 적은 지시에서 강하고, GPT-5.6 Sol은 복잡한 작업의 명세 작성·상위 수준 운영·결과 검증에 더 잘 맞는다. [16:20]

10. 코딩 모델의 성장과 자동 라우팅 전망

  • 코딩에서는 Claude와 GPT 계열이 상위권을 유지하며, Codex 사용자는 약 한 달 반 만에 500만 명에서 1,500만 명으로 늘어 코드베이스 이해와 기능 개발 수요를 흡수했다. [18:06]
  • Grok 4.6·Qwen 3.8·Kimi가 수개월 안에 비용과 지능의 파레토 최전선에 진입할 가능성이 있어, 현재의 양강 선택 구조는 오래 유지되지 않을 수 있다. [19:01]

11. 지식 노동을 맡는 클라우드 에이전트

  • 이메일·Slack·플러그인을 다루는 지식 노동에서는 일반 지능뿐 아니라 도구를 스스로 선택하고 실행하는 에이전트 역량이 핵심 차별점이 된다. [19:43]
  • Grok Bot은 클라우드 가상머신에서 하나 이상의 에이전트를 실행해 개인 노트북의 위험을 줄이고, 여러 도구를 연결해 사용자의 반복 업무를 학습한다. [20:01]

12. 일상 업무에서는 개인 맥락이 경쟁력

  • 장보기·요리·운동·등하교 일정처럼 일상적인 작업에는 하나의 서비스를 꾸준히 쓰는 편이 유리하며, 대부분의 모델은 이 수준의 문제를 이미 충분히 처리한다. [20:44]
  • 식단 취향·알레르기·과거 요리 결과 같은 누적 정보가 다음 판단의 정확도를 높이므로, 최고 벤치마크 점수보다 사용자를 얼마나 잘 아는지가 중요하다. [21:23]

13. 안전성 제동과 로컬 모델의 추격

  • OpenAI의 미공개 고지능 모델에서 이전보다 큰 정렬 문제가 나타나 훈련 속도가 조정됐고, 안전 위험과 정부 규제가 향후 고성능 모델 공개를 늦출 수 있다. [22:43]
  • 선두 연구소의 공개 속도가 느려지면 후발 연구소가 따라잡을 시간이 생기며, 연말에는 현재 최상위 폐쇄 모델과 비슷한 오픈 모델 3~5개가 등장할 가능성이 있다. [23:27]

14. 애플의 UX 우위와 현재의 네 가지 선택

  • 사용자가 직접 가중치를 내려받고 고사양 하드웨어를 마련할 유인은 약하므로, 선탑재되고 암호화된 Siri가 개선되면 Apple이 대중적인 로컬 AI 사용을 흡수할 가능성이 크다. [24:50]
  • 현재는 X 실시간 정보에 Grok, 대화형 음성에 ChatGPT, 최고 수준의 지능과 깊은 작업에 Claude, 음악과 가벼운 창작에 Gemini가 각각 적합하다. [26:04]

15. Meta 모델의 실사용 가치와 오픈소스 수요

  • Facebook 이용자들이 Meta AI를 실제로 어디에 활용하는지는 불분명하며, 구체적인 사용 경험과 사례가 필요하다. [27:02]
  • 마케터와 광고주에게 Meta 모델은 수익을 크게 늘릴 가능성이 있으며, 실제 성과 사례가 비즈니스 가치를 판단할 근거가 된다. [27:07]

16. 참여 요청과 방송 마무리

  • YouTube·Spotify·Apple 이용자의 구독, 알림 설정, 댓글은 채널 운영과 콘텐츠 확산에 큰 도움이 된다. [27:28]
  • 친구에게 콘텐츠를 공유해 도달 범위를 넓힐 수 있으며, 감사 인사와 다음 라운드업 예고를 끝으로 엔딩 음악이 시작된다. [27:46]

🧾 결론

  • ‘네 가지 모델’은 절대적인 성능 순위라기보다 현재 시점에서 주요 사용 사례를 가장 실용적으로 나눈 선택지다.
  • 일반 사용자는 주력 구독 하나에 취향과 과거 작업 맥락을 축적하는 편이 유리하고, 개발자·에이전트 운영자·대규모 토큰 사용자는 여러 모델을 비용과 기능에 따라 조합하는 편이 합리적이다.
  • 가장 똑똑한 모델을 매번 찾는 것보다 자신의 핵심 작업을 정의하고, 그 작업에서 품질·속도·비용·연동성을 함께 비교하는 것이 더 중요하다.
  • 후발 모델의 추격과 오픈 모델의 성장, 안전성 검토에 따른 출시 지연 때문에 현재의 네 가지 선택 구도는 빠르게 달라질 수 있다.

📈 투자·시사 포인트

  • 충분한 컴퓨트를 확보해 서빙 비용을 낮출 수 있는 연구소가 가격 경쟁과 기업 채택에서 유리해질 수 있다.
  • Microsoft와 Google처럼 기존 업무 도구와 기업 고객 기반을 보유한 사업자는 모델 성능이 선두가 아니어도 강력한 유통 해자를 유지할 수 있다.
  • 여러 모델을 자동으로 선택하면서 공통 기억을 보존하는 집계 플랫폼은 모델 공급자가 늘어날수록 전략적 가치가 커질 가능성이 있다.
  • 암호화된 로컬 AI가 대규모 기기에 기본 탑재되면 건강·생활 데이터의 외부 전송을 줄이려는 수요와 오픈 모델의 사설 실행 수요가 함께 확대될 수 있다.

⚠️ 불확실하거나 확인이 필요한 부분

  • OpenRouter에서 미국 연구소의 토큰 점유율이 70%에서 30%로 낮아졌다는 수치는 단일 라우터의 이용자 구성과 편향을 포함하므로 전체 AI 시장 점유율로 일반화할 수 없다.
  • 연말까지 최상위 폐쇄 모델과 비슷한 오픈 모델 3~5개가 등장할 것이라는 전망과 후발 모델의 파레토 최전선 진입 가능성은 예측이며 확정된 결과가 아니다.
  • Stripe의 OpenRouter 인수는 출처에서 ‘인수설’로 제시됐으므로 실제 거래나 기업가치를 확정 사실처럼 해석해서는 안 된다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 자신의 반복 업무를 실시간 정보, 대화·이미지, 코딩·글쓰기·깊은 작업, 음악·가벼운 창작으로 나누고 Grok·ChatGPT·Claude·Gemini에 각각 시험 배정한다.
  • 일반 사용자는 주력 구독 하나를 정한 뒤 식단·운동·업무 방식 등 재사용할 개인 맥락을 꾸준히 축적한다.
  • 자동화나 다중 에이전트로 토큰을 많이 쓰는 경우 오픈 모델과 폐쇄 모델을 동일 작업으로 비교해 품질·비용·사설 실행 필요성을 함께 기록한다.
  • 모델 가격과 기능, 안전성 검토, 새로운 출시로 선택 구도가 바뀔 수 있으므로 주력·보조 모델 구성을 정기적으로 재평가한다.

❓ 열린 질문

  • 자동 라우팅 플랫폼은 서로 다른 모델 사이에서 공통 기억을 유지하면서 개인정보와 데이터 소유권을 어떻게 보장할 것인가?
  • Apple의 로컬 AI가 대규모 기기에 보급되면 사용자는 클라우드 모델보다 낮을 수 있는 성능과 강화된 프라이버시 사이에서 어떤 선택을 할 것인가?
  • 안전성 문제와 정부 검토가 선두 모델의 출시를 늦출 경우 오픈 모델과 후발 연구소가 실제로 성능 격차를 얼마나 줄일 수 있을 것인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.