AI Royal Rumble: Part 1 (Kimi K3 v. Fable v. Sol v. Grok v. GLM)
Quick Summary
AI Royal Rumble 1부에서는 빠른 완료보다 실제 작동 여부, 검증의 깊이, 위험 통제가 승패를 갈랐고 GLM 5.2와 Grok 4.5가 차례로 탈락했다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 결론
AI Royal Rumble 1부에서는 빠른 완료보다 실제 작동 여부, 검증의 깊이, 위험 통제가 승패를 갈랐고 GLM 5.2와 Grok 4.5가 차례로 탈락했다.
📌 핵심 요점
- 다섯 모델은 동일한 브리프와 공통 도구만 받은 채 웹사이트·모의투자·게임·LoRA 학습 과제를 자율 수행하며, 모호한 요구사항도 질문 없이 직접 해석해야 했다. 실패를 숨기지 않는 정직성, 지시 준수, 실제 산출물, 창의성이 주요 평가 기준이었다.
- 첫 번째 웹사이트 과제에서 Sol은 풍부한 시각 요소와 역동적인 전환, Fable은 토너먼트 구조를 활용한 몰입감, Kimi K3는 밝은 색조와 독자적인 장면 구성을 보여줬다. 세 모델 모두 일부 레이아웃·깜빡임 문제가 있었지만 전반적인 흐름은 작동했다.
- Grok은 약 19분 만에 가장 빨리 웹사이트를 완성했지만 시각적 개성과 필수 콘텐츠가 부족했다. GLM 5.2는 스크롤과 진행 기능이 사실상 작동하지 않아 첫 라운드 최하위로 탈락했다.
- 두 번째 모의투자 과제에서는 Fable·Sol·Kimi K3가 돈치안 돌파와 이동평균 필터, 평균진폭범위 손절을 결합한 유사한 추세 추종 전략에 수렴했다. 그러나 거래 조건과 위험 관리 차이로 Fable은 소폭 수익, Kimi K3와 Sol은 손실, Grok은 약 12% 손실을 기록했다.
- Fable과 Kimi K3가 각각 3회와 4회만 거래한 것과 달리 Sol은 52회, Grok은 144회 거래했다. 충분한 반복 검증 없이 조건을 느슨하게 구성한 Grok은 세 평가 구간 모두에서 손실을 내며 탈락했고, Fable·Sol·Kimi K3가 2부에 진출했다.
🧩 배경과 문제 정의
- 2026년 7월 말 기준, 프런티어 AI 모델 5개가 동일한 브리프와 도구를 받아 사람의 도움 없이 고난도 과제를 수행한다.
- 벤치마크 점수나 개발사의 주장에 의존하지 않고, 실제 제작·연구·구현·검증 역량을 비교해 가장 강한 모델을 가리는 것이 목적이다.
- 과제의 모호성을 스스로 해소하고 실패를 숨기지 않는 자율 에이전트 역량을 중점적으로 평가하며, 각 라운드에서 최하위 모델은 탈락한다.
🕒 시간순 섹션별 상세정리
1. 동일 조건의 자율 경쟁과 정직성 중심 규칙
- 다섯 모델은 동일한 브리프와 도구만 사용해 추가 도움 없이 과제를 완수해야 한다. [00:12]
- 질문이나 선택지 요청은 허용되지 않으며, 실패나 결함도 숨기지 않고 그대로 평가받는다. [00:27]
- 네 라운드마다 최하위 모델이 탈락하고, 마지막 두 모델이 결승에서 맞붙는다. [00:35]
2. 네 가지 고난도 과제와 참가 모델
- 첫 과제는 독자적인 시각 체계를 갖춘 스크롤형 웹사이트 제작이다. [03:27]
- 이어 실시간 모의투자, 타임루프 퍼즐 게임, 무성영화 스타일의 LoRA 학습을 진행한다. [03:42]
3. 공정한 실행 환경과 웹사이트 브리프
- Fable은 Claude Code, Sol은 Codex, Grok은 Grok Build에서 각각 실행된다. [06:32]
- GLM과 Kimi는 기존 스킬을 제거한 Hermes Agent 빈 프로필에서 동일한 공통 도구만 사용한다. [06:47]
4. 큰 완료 시간 격차와 평가 원칙
- Grok 4.5는 약 19분 만에 웹사이트를 가장 먼저 완성한다. [08:47]
- Sol은 약 49분 만에 두 번째로 완성해 Grok보다 약 30분 늦는다. [09:05]
5. Sol의 고밀도 시각 연출
- Sol은 첫 화면부터 Grok보다 더 많은 시각 요소와 전환을 제시한다. [10:28]
- 스크롤을 시작하자 높은 정보 밀도와 뚜렷한 시각적 개성이 드러난다. [10:43]
6. GLM 5.2의 작동 불능
- GLM 결과물은 스크롤 입력에 제대로 반응하지 않으며 별도의 스크롤바도 없다. [12:25]
- 진행률도 2%에 머물러 콘텐츠를 정상적으로 확인하기 어렵다. [12:40]
7. Fable의 토너먼트형 인터페이스
- Fable은 1시간 14분 만에 작업을 완료한다. [13:50]
- 모델 이름이 빠르게 교체되는 도입부로 토너먼트 분위기를 조성한다. [14:05]
8. Kimi K3의 밝고 과감한 화면
- Kimi K3는 가장 긴 1시간 52분을 들여 결과물을 완성한다. [15:28]
- 다른 모델들과 달리 밝은 색조의 인터페이스로 차별화한다. [15:43]
9. 첫 라운드 판정과 GLM 탈락
- Grok은 요구된 화면을 구현했지만 움직임과 시각적 개성이 부족하다. [16:52]
- Sol은 세련된 디자인과 풍부한 움직임, 역동적인 전환을 앞세워 Grok보다 높은 완성도를 보여준다. [17:05]
10. 모의투자 과제와 과적합 방지 조건
- 두 번째 과제는 시장 조사·전략 추론·시스템 구현을 함께 요구한다. [19:00]
- 각 모델은 외부 도움 없이 거래 전략을 직접 연구하고 개발해야 한다. [19:27]
11. 새 세션에서 시작된 두 번째 라운드
- 남은 네 모델은 이전 과제의 영향을 배제하기 위해 새 세션에서 동시에 출발한다. [21:57]
- 각 모델에는 시장 조사부터 실행 시스템 구현까지 아우르는 긴 요구사항이 주어진다. [22:12]
12. 돌파 전략으로의 수렴과 위험 설계 차이
- Fable은 비트코인·이더리움·솔라나·금에 돈치안 채널 돌파 전략을 적용한다. [24:37]
- Sol과 Kimi K3도 설정은 다르지만, 독립적으로 유사한 돌파 전략에 도달한다. [24:52]
13. 모의투자 손익과 과도한 거래의 대가
- 초반 손익 경쟁은 팽팽하지만, Grok의 성과는 이후 급격히 악화된다. [26:40]
- 반면 Fable과 Kimi K3는 비교적 안정적인 흐름을 유지한다. [26:55]
14. Grok 탈락과 파트 1의 결론
- Grok 4.5는 기능 오류 없이 과제를 완수했지만, 전략을 반복적으로 검토하고 개선하는 과정이 부족했다. [28:28]
- 결국 빠른 완료에 치중한 접근은 첫 라운드의 단순한 화면과 두 번째 라운드의 큰 손실로 이어지며 탈락의 원인이 됐다. [28:47]
🧾 결론
- 이번 1부의 핵심은 모델의 응답 속도나 벤치마크 평판보다 실제 결과물이 요구사항대로 작동하는지, 실패를 스스로 발견하고 검증했는지가 더 중요하다는 점이다.
- GLM 5.2는 핵심 상호작용의 작동 실패, Grok 4.5는 지나치게 빠른 완료와 부족한 반복 검증이 각각 탈락의 직접적인 배경이 됐다.
- Fable은 두 과제에서 비교적 안정적인 완성도와 보수적인 위험 관리를 보여줬고, Sol은 강한 시각적 표현력, Kimi K3는 긴 작업시간을 활용한 독자적 구현으로 생존했다.
- 최종 우승자는 아직 결정되지 않았으며, 게임 개발과 LoRA 학습 결과까지 다루는 2부를 확인해야 세 모델의 종합 우열을 판단할 수 있다.
📈 투자·시사 포인트
- AI 모델의 경쟁력은 단일 벤치마크보다 자율적인 요구사항 해석, 도구 활용, 오류 처리, 결과 검증처럼 실제 업무에서 드러나는 복합 역량으로 평가할 필요가 있다.
- 가장 빠른 Grok이 두 과제 모두에서 품질과 검증 부족을 드러낸 사례는 낮은 지연시간이나 빠른 산출이 곧 높은 생산성과 신뢰성을 의미하지는 않음을 보여준다.
- 모의투자 결과에서는 비슷한 돌파 전략을 채택했더라도 거래 빈도와 위험 제한에 따라 손익이 크게 달라졌다. 전략 아이디어 자체보다 과잉 거래 억제와 손실 통제가 시스템 성과를 좌우할 수 있다는 시사점이 있다.
- 오픈웨이트 모델인 Kimi K3는 웹사이트와 거래 시스템을 모두 완성하며 2부에 진출했지만, 이것만으로 폐쇄형 모델과의 전반적인 성능 격차가 해소됐다고 단정할 수는 없다.
- 검증 필요: 영상의 모의투자 성과는 제한된 평가 구간과 모의 계좌에서 나온 결과이므로 실거래 수익성이나 장기적인 전략 우위를 입증하지 않는다. 평가 구간, 수수료·슬리피지 반영 방식, 반복 실험 결과를 추가로 확인해야 한다.
⚠️ 불확실하거나 확인이 필요한 부분
- 영상은 다섯 참가 모델을 2026년 7월 말의 프런티어 모델로 소개하지만, 정확한 모델 ID·체크포인트·출시 상태와
Kimi K3의 오픈웨이트 공개 여부 등은 각 개발사의 공식 자료로 별도 확인해야 한다. [04:20–05:48] - 모델마다 Claude Code·Codex·Grok Build·Hermes Agent처럼 서로 다른 실행 환경을 사용했다. 공통 도구가 제공됐다는 설명만으로는 컨텍스트 한도, 추론 설정, 토큰 예산과 도구 구현까지 완전히 동일했는지 판단하기 어렵다. [06:32]
- 거래 시스템의 운용 기간이 과제 소개에서는 이틀로 설명되지만 [03:27], 세부 조건에서는 24시간으로 제시된다. 실제 평가 기간과 실시간 운용 범위를 확인해야 한다. [20:13]
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 각 개발사의 공식 발표와 모델 카드를 찾아 참가 모델의 정확한 버전, 공개일, 오픈웨이트 여부를 대조한다.
- 원본 브리프·초기 프롬프트·도구 목록·실행 설정·토큰 사용량·작업 로그가 공개됐는지 확인해 실험의 재현 가능성을 평가한다.
- 다섯 웹사이트 산출물을 동일한 브라우저·해상도·입력 장치에서 다시 실행해 스크롤 진행, 누락된 장면, 텍스트 잘림과 요소 겹침을 비교한다.
- 거래 평가의 정확한 기간과 가격 데이터, 수수료·슬리피지·펀딩비, 포지션 크기 및 손절 조건을 확보한 뒤 모델별 손익을 재계산한다.
❓ 열린 질문
- 각 참가자의 정확한 모델 버전과 추론 설정, 컨텍스트 한도, 토큰·비용 예산은 무엇이었나?
- 서로 다른 에이전트 실행 환경에서 도구 호출 방식과 오류 복구 능력까지 공정하게 통제됐나?
- Fable에만 가드레일 발생 시 하위 모델로 전환하는 규칙이 적용된 이유는 무엇이며, 실제 전환이 발생했나?