YouTubeSuperbash (BoxminingAI)·2026년 8월 20일·0

Ranking Top LATEST AI Models (Tier List)

Quick Summary

Ranking Top LATEST AI Models (Tier List)를 중심으로, 이번 티어는 단순 벤치마크 점수가 아니라 실제 업무의 지능, 속도, 오류 빈도, API 가격, 사용량 제한과 무료 리셋을 종합한다를 핵심 판단 포인트로 압축 정리한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Ranking Top LATEST AI Models (Tier List) 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Ranking Top LATEST AI Models (Tier List)의 핵심 내용을 4단계로 요약한 인포그래픽
Ranking Top LATEST AI Models (Tier List) 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Ranking Top LATEST AI Models (Tier List)를 중심으로, 이번 티어는 단순 벤치마크 점수가 아니라 실제 업무의 지능, 속도, 오류 빈도, API 가격, 사용량 제한과 무료 리셋을 종합한다를 핵심 판단 포인트로 압축 정리한다.

📌 핵심 요점

  1. 이번 티어는 단순 벤치마크 점수가 아니라 실제 업무의 지능, 속도, 오류 빈도, API 가격, 사용량 제한과 무료 리셋을 종합한다. 모델 성능이 수개월 만에도 크게 바뀌기 때문에 과거의 강자가 빠르게 하위권으로 내려갈 수 있다.
  2. 최상위 역할은 분화돼 있다. Fable 5는 복잡한 문제를 구조화하는 기획과 대화에서 S+ 수준이지만 실행에는 소극적이고, GPT 5.6 Soul은 앱 설계와 마이그레이션을 포함한 고난도 코딩의 주력 모델이다. Grok 4.6은 빠른 속도와 포스트트레이닝 개선을 바탕으로 에이전트 작업에서 S 티어에 가깝지만 긴 작업에서는 방향이 흐트러질 수 있다.
  3. 비용 효율에서는 DeepSeek V4가 두드러진다. V4 Flash는 시각적 오류와 완성도 문제가 있었지만 전체 벤치마크 비용이 약 1달러였고, V4 Pro는 잠정 A 티어로 평가된다. 반면 Kimi K3는 높은 지능과 쉬운 API 통합에도 5일·월간 한도가 겹치며 실질 비용이 높아졌다.
  4. 특화형과 신형 모델도 선택지를 넓힌다. GLM 5.3은 제한된 사용 경험에도 Kimi급 지능으로 잠정 A 티어를 받았고, Qwen 3.8 Max는 웹 디자인과 랜딩 페이지 제작에서 강점을 보였다. GPT 계열은 Soul이 고난도 작업, Terra가 일상 실행을 맡는 구조로 분화됐으며 잦은 리셋이 구매 가치를 높였다.
  5. 업데이트 정체와 지시 이행 실패는 순위를 빠르게 떨어뜨린다. MiniMax M3는 버그와 잘못된 결과에 대한 과신으로 C 티어가 됐고, Opus 5는 명령 이행 저하로 B 티어에 머문다. Gemini 3.1 Pro와 Meta 계열도 지능이나 가격 경쟁력을 잃었으며, 오래된 저가 모델을 고위험 판단에 사용하는 것은 특히 위험하다.

🧩 배경과 문제 정의

  • 수개월 사이 AI 모델의 성능이 크게 향상되면서 기존 티어 순위가 빠르게 낡았고, 단순 벤치마크보다 실제 업무에서의 유용성을 다시 비교할 필요가 생겼다.
  • 코딩·기획·에이전트 작업에서는 지능뿐 아니라 속도, 오류 빈도, API 가격, 사용량 제한과 무료 리셋까지 실질적인 선택 기준이 된다.
  • 최상위 모델만 계속 사용하면 비용이 급증하며, 신형 모델은 검증 기간이 짧아 성능과 가격을 함께 고려한 용도별 선택이 중요하다.

🕒 시간순 섹션별 상세정리

1. 실사용 중심의 티어 기준

  • S 티어는 일상 업무에서 압도적으로 유용한 모델, D 티어는 적절한 도구 환경이 있어도 우선 선택할 이유가 적은 모델을 뜻하며, 2026년 8월의 높아진 성능 수준을 기준으로 삼는다. [00:36]
  • 최첨단 모델만 사용하면 비용이 지나치게 커지므로 가격이 낮은 모델까지 함께 비교해야 하며, 팀원별로 서로 다른 AI 스택과 전문 분야를 맡아 경험을 합친다. [01:09]

2. Fable 5의 압도적 기획 능력과 실행 한계

  • Fable 5는 원시 지능과 플랜 모드에서 S+ 수준이며, 복잡한 문제를 대화로 구조화하는 능력이 여전히 최상위권이다. [01:51]
  • 코딩뿐 아니라 하루 일정과 작업 계획에도 강하지만, 좋은 결과를 얻으려면 사용자도 문제와 맥락을 제대로 구성할 수 있어야 한다. [02:12]

3. GPT 5.6 Soul의 고난도 코딩 역할

  • GPT 5.6 Soul은 고난도 코딩의 주력 모델로 쓰이며, 앱 설계부터 기존 앱 마이그레이션까지 비교적 완성도 높게 처리한다. [03:15]
  • 비용 제약이 작다면 기획용 Fable 5와 구현용 Soul만으로도 최첨단 작업의 상당 부분을 처리할 수 있지만, 두 모델 모두 저렴한 선택지는 아니다. [03:25]

4. Kimi K3의 높은 지능과 비싸진 사용 비용

  • Kimi K3는 중국 모델 가운데 A와 S 사이에 놓일 만큼 지능이 높고, 전체 파라미터 대비 토큰당 활성 파라미터 비율이 큰 구조가 강점이다. [04:04]
  • API를 통해 여러 프로젝트와 대시보드에 통합하기 쉽지만, 5일 단위 제한과 월간 총사용량 제한이 겹쳐 8월 14일경 이미 월간 할당량을 모두 소진했다. [05:28]

5. Grok 4.6의 속도와 에이전트 경쟁력

  • Grok 4.6은 출시 직후 기존 Grok보다 순위가 크게 올랐으며, 종합 지능 기준으로는 A 티어와 S 티어 사이에서 의견이 갈린다. [09:55]
  • 개발 작업에서는 Soul 수준의 지능과 매우 빠른 응답을 보이지만, 긴 작업 도중 방향이 흐트러지는 문제가 남아 있어 속도는 S급, 고난도 지능은 A급에 가깝다. [10:27]

6. DeepSeek V4의 압도적인 비용 효율

  • DeepSeek V4 Flash는 빠르고 매우 저렴하며, 새로 나온 V4 Pro는 아직 충분히 시험하지 못했지만 같은 계열의 구조적 개선을 공유한다. [12:18]
  • Flash는 시각적 오류와 완성도 문제가 있었지만 전체 벤치마크 실행 비용이 약 1달러에 불과했고, 다른 모델에서 같은 테스트가 25~40달러까지 든 사례와 큰 차이를 보였다. [13:59]

7. MiniMax M3와 구형 모델의 급격한 하락

  • MiniMax M3는 수익성이 불확실한 실험 프로젝트에 부담 없이 쓰던 저가형 주력 모델이었지만, 잦은 버그와 잘못된 결과를 확신하는 문제가 커져 C 티어로 내려갔다. [15:05]
  • 약 두 달 동안 주요 업그레이드가 없었던 사이 최신 모델과의 격차가 크게 벌어졌고, 현재는 DeepSeek만큼 저렴하지도 Kimi만큼 지능적이지도 않다. [16:18]

8. Opus 5의 명령 이행 저하와 불확실성

  • Opus 5는 프롬프트와 작업 지시를 끝까지 이행하는 능력이 저하됐고, 파워 유저들이 원하는 결과물을 얻는 데 어려움을 겪어 B 티어에 머문다. [18:15]
  • 모델 경쟁에서는 매주 성능 우위가 바뀔 수 있으므로 특정 서비스의 연간 요금제는 위험하며, Anthropic의 최근 성능 약화가 그 위험을 키운다. [19:04]

9. GPT 계열의 리셋 혜택과 역할 분화

  • GPT 5.6 Soul은 한 주에 여러 차례 사용량이 리셋돼 실제 구매 가치가 높아졌고, Terra도 같은 혜택 덕분에 A 티어에 놓이지만 향후 수익화가 강화되면 이 조건은 달라질 수 있다. [20:45]
  • GPT 5.5는 좋은 실행 모델이었지만 Terra가 절반 수준의 가격으로 비슷한 역할을 맡으면서 과거 모델이 됐고, 현재는 Soul이 고난도 작업, Terra가 일상 작업을 담당한다. [21:14]

10. Meta와 Gemini의 잃어버린 선두 경쟁력

  • Meta의 Muse Spark는 최상위권 지능에 미치지 못하고, Muse Glimmer를 로컬용으로 개방해 다른 경쟁 축을 만들려 해도 지능에서는 선두 모델에, 가격에서는 DeepSeek에 뒤처진다. [22:39]
  • Gemini 3.1 Pro는 과거의 선두 지위를 잃어 C 티어로 내려갔으며, 상대적으로 빠르고 실용적인 Gemini Flash만 높은 B 티어 수준을 유지한다. [23:14]

11. GLM 5.3의 잠재력과 비싼 크레딧

  • 당일 출시된 GLM 5.3은 경험이 충분하지 않지만 크레딧이 소진되기 전까지 벤치마크 성능이 좋았고, Kimi급 지능을 근거로 잠정 A 티어에 놓인다. [23:54]
  • 이전 GLM 5처럼 심각하게 느려지거나 멈추지 않았고 Kimi보다 더 지능적일 가능성도 보였지만, 높은 가격 때문에 S 티어로 올리기에는 근거가 부족하다. [24:36]

12. Qwen 3.8 Max의 웹 디자인 특화

  • Qwen 3.8 Max는 낮은 A 티어에 해당하며, 많은 웹사이트 학습 데이터에 기반한 네이티브 이해 덕분에 웹 디자인에서 뚜렷한 강점을 보인다. [25:06]
  • 첫 벤치마크에서 Higgsfield MCP의 도움을 일부 받았지만 관련 스킬을 스스로 활용해 애니메이션이 포함된 완성도 높은 랜딩 페이지를 만들었다. [25:29]

13. 무료 리셋이 바꾼 실질 가격 계산

  • Grok과 GLM도 OpenAI처럼 추가 사용량과 저장된 리셋을 제공하기 시작하면서, 모델 회사들이 크레딧 보조를 통해 사용자를 확보하는 경쟁이 확대됐다. [26:44]
  • 무작위 무료 리셋이 반복되면 토큰당 공식 가격만으로 일상 사용 비용을 계산하기 어렵고, 구독 기간 동안 실제로 사용할 수 있는 총량이 더 중요한 가격 지표가 된다. [26:46]

14. 초보자의 모델 선택과 고위험 판단 원칙

  • AI를 처음 사용한다면 Fable 5·Grok 4.6·GPT 5.6 Soul이 우선 선택지이며, 대화와 일반 업무에서 최신 모델의 성능 차이를 가장 쉽게 체감할 수 있다. [27:09]
  • 오래된 저가 모델은 잘못된 답을 확신할 가능성이 높아 농작물 살포나 중요한 인생 결정에 사용하면 위험하며, 최신 모델도 전문적인 인생 조언을 전적으로 맡길 수준은 아니다. [27:44]

15. DeepSeek 중심의 일상 운영과 후속 자료

  • 일상적인 AI 작업과 웹사이트 제작에서는 비용 효율이 높은 DeepSeek가 할당량을 소진한 Kimi를 대신해 기본 선택지로 자리 잡았다. [28:32]
  • 코딩 요금제는 한도 소진 후 사용자가 즉시 복구하기 어렵지만, DeepSeek는 약 5달러만 충전해도 바로 작업을 이어갈 수 있어 반복 실행과 예산 통제가 유연하다. [28:50]

🧾 결론

  • 최고의 모델 하나를 모든 업무에 적용하기보다 기획, 고난도 코딩, 에이전트 실행, 웹 디자인, 저비용 반복 작업을 분리해 모델을 배치하는 편이 합리적이다.
  • 공식 토큰 가격만으로는 실제 비용을 판단하기 어렵다. 무료 리셋, 저장된 리셋, 기간별 한도와 충전 후 즉시 복구 가능성까지 포함한 총사용량을 비교해야 한다.
  • 모델 경쟁력이 매주 바뀔 수 있으므로 연간 계약보다 필요한 기간의 월간 요금제를 활용하고 정기적으로 모델 구성을 재평가하는 편이 안전하다.
  • 최신 모델도 전문적인 인생 조언을 전적으로 맡길 수준은 아니며, 농작물 살포나 중요한 인생 결정처럼 위험도가 높은 문제에는 별도의 전문 검증이 필요하다.

📈 투자·시사 포인트

  • AI 모델의 경쟁력은 원시 지능만이 아니라 속도, 포스트트레이닝, 지시 이행률, API 통합성, 크레딧 보조와 사용량 리셋을 포함한 제품 설계에서 결정되고 있다.
  • 무료 리셋 경쟁은 사용자를 확보하는 보조금 전략으로 볼 수 있지만, 향후 수익화가 강화되면 현재의 실질 가격과 모델 티어가 함께 달라질 수 있다.
  • 프리미엄 중국 모델들이 높은 지능을 우선하면서 과거의 큰 가격 차이가 줄었고, 현재는 DeepSeek가 뚜렷한 비용 차별화를 유지하는 사례로 제시된다.
  • 선두 모델이 짧은 주기로 교체되는 시장에서는 장기 구독보다 전환 가능한 월간 계약과 용도별 멀티모델 운영의 전략적 가치가 커진다.

⚠️ 불확실하거나 확인이 필요한 부분

  • DeepSeek V4 Pro는 아직 충분히 시험되지 않았고, GLM 5.3도 출시 당일 크레딧이 소진되기 전까지의 제한된 경험을 근거로 평가됐다.
  • Grok 4.6의 종합 지능은 A와 S 티어 사이에서 의견이 갈리며, 긴 작업 중 방향이 흐트러지는 문제가 어느 범위까지 재현되는지 추가 확인이 필요하다.
  • Opus 5의 낮은 코딩 평가를 Project Glasswing 관련 제한과 연결한 설명은 확인된 사실이 아니라 추정이다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 업무를 기획, 고난도 구현, 빠른 에이전트 실행, 웹 디자인, 저비용 반복 작업으로 나누고 각 역할의 후보 모델을 따로 지정한다.
  • 실제 프로젝트와 유사한 대표 작업으로 속도, 오류, 지시 이행률, 완성도와 비용을 함께 기록해 후보 모델을 비교한다.
  • 공식 토큰 가격뿐 아니라 기간별 한도, 무료 리셋 횟수, 총사용량과 한도 소진 후 복구 비용을 측정한다.
  • 성능 변화가 빠른 서비스는 연간 계약을 피하고 필요한 기간의 월간 요금제로 먼저 검증한다.

❓ 열린 질문

  • OpenAI, Grok, GLM의 무료 리셋과 크레딧 보조가 수익화 이후에도 유지될까?
  • 충분한 반복 시험을 거친 뒤 DeepSeek V4 Pro와 GLM 5.3의 티어는 현재의 잠정 평가를 유지할까?
  • Grok 4.6의 장기 작업 이탈과 Opus 5의 지시 이행 저하는 후속 포스트트레이닝이나 정책 변화로 개선될 수 있을까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.