YouTubeSuperbash (BoxminingAI)·2026년 8월 14일·0

Grok 4.6 is FINALLY GOOD! (Real Tests and Review)

Quick Summary

실제 16개 프로젝트 테스트에서 Grok 4.6은 마침내 최상위권 코딩 모델의 후보가 됐지만, 결과물 간 품질 편차와 시뮬레이션 로직 오류는 여전히 뚜렷했다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Grok 4.6 is FINALLY GOOD! (Real Tests and Review) 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Grok 4.6 is FINALLY GOOD! (Real Tests and Review)의 핵심 내용을 4단계로 요약한 인포그래픽
Grok 4.6 is FINALLY GOOD! (Real Tests and Review) 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

실제 16개 프로젝트 테스트에서 Grok 4.6은 마침내 최상위권 코딩 모델의 후보가 됐지만, 결과물 간 품질 편차와 시뮬레이션 로직 오류는 여전히 뚜렷했다.

📌 핵심 요점

  1. 리뷰어는 Grok 4.6이 Grok 4.5와 같은 기반 모델을 사용하면서도 후속 학습과 행동 조정을 통해 장기 코딩의 일관성을 크게 높였다고 평가했다.
  2. 한 번의 프롬프트로 하위 에이전트를 배치해 16개 프로젝트를 동시에 제작한 조건에서도 Helm's Deep과 Vice City 같은 시각적 결과물은 매우 높은 완성도를 보였다.
  3. 반면 비행 조작, 길 찾기, 객체 배치, 포식자·피식자 규칙 등 상호작용과 시뮬레이션 로직에서는 직관성 부족과 명백한 오류가 반복됐다.
  4. 일부 프로젝트는 WebGL 같은 추가 도구가 없어 실행되지 않았고, UI·그래픽·물리·게임 규칙의 완성도가 프로젝트마다 크게 달랐다.
  5. 리뷰어의 사용량 기준으로 전체 작업은 주간 한도의 40%를 소비했으며, GPT 5.6 Soul이나 Fable 5보다 상대적으로 저렴한 대규모 코딩 선택지로 평가됐다.

🧩 배경과 문제 정의

영상은 Grok 4.6이 실제 코딩 작업에서 마침내 최상위권 모델과 경쟁할 수 있는지를 16개 프로젝트로 검토한다. 리뷰어는 Grok 4.5가 빠른 조사와 에이전트 하네스에는 유용했지만 장기 코딩에는 부적합했다고 평가하며, 같은 기반 모델을 사용하는 4.6에서 후속 학습과 행동 조정이 어떤 변화를 만들었는지 살핀다. 다만 16개 프로젝트는 각각 독립된 세션이 아니라 하나의 프롬프트로 배치된 하위 에이전트들이 제작했으므로, 이번 결과는 직접 코딩 능력과 다중 에이전트 조정 능력이 결합된 평가다.

🕒 시간순 섹션별 상세정리

1. 최상위권 진입과 테스트 조건

  • 리뷰어는 Grok 4.6을 Fable 및 GPT 5.6 Soul과 견줄 수준으로 평가하고, 특히 Helm's Deep의 조명과 횃불 표현을 지금까지 본 결과 중 가장 인상적인 사례로 꼽는다. 같은 기반 모델을 사용한 4.5보다 후속 학습과 행동 조정이 개선됐다는 설명도 덧붙인다. [00:39]
  • 장기 코딩에서 일관성이 높아져 첫 번째 선택지로 고려할 수 있다고 주장하며, 16개 벤치마크 제작에 주간 사용량의 40%가 들었다는 비용 정보를 제시한다. [01:12]

2. 사양 비교와 도시 랜딩 페이지

  • 코딩·터미널·소프트웨어 엔지니어링 지표에서 최상위 모델과 경쟁하고 있으며, 빠른 조사에는 적합했지만 장기 코딩에는 부족했던 Grok 4.5와 달리 4.6은 장기 작업에도 유력한 선택지가 됐다고 평가한다. [02:20]
  • Cityscroll Journey는 Lisbon을 소재로 한 애니메이션 랜딩 페이지를 무난하게 구현했지만, 목적지 링크를 누르면 전환 애니메이션 없이 바로 이동해 Qwen 3.8 Max 결과보다 경험이 단순했다. [03:32]

3. 비행 조작의 실패와 Helm's Deep의 성공

  • Ember Glider는 재시작 기능과 현실적인 감각은 갖췄지만 좌우 조작이 반대로 느껴지고 움직임이 직관적이지 않아 게이머 관점에서는 실패에 가깝다고 평가한다. [04:44]
  • Helm's Deep은 비와 천둥, 횃불, 조명과 환경 세부 묘사가 뛰어나 큰 성공으로 판정됐다. 다만 성문 이후 상층부로 진행하지 못하고 내부가 채움 공간으로 남았다는 한계도 있었다. [05:36]

4. 마법학교·시 게임·타워 디펜스

  • Hogwarts 비행 시뮬레이터는 새로운 비행 경로를 제공했지만 성의 거대한 규모를 충분히 표현하지 못했고, Jabberwock은 WebGL이 필요해 실행되지 않아 명확한 실패로 판정됐다. [06:52]
  • Low Poly Tower Defense는 지도와 그래픽을 구현하고 플레이도 가능했지만 카메라 각도가 제한됐으며, 적의 경로 탐색과 종료 지점 표현에서 일관성 문제가 발견됐다. [08:00]

5. 제작 로직과 레이싱 완성도

  • Low Poly World는 나무 채집과 제작 애니메이션을 제공했지만 제작한 벤치가 엉뚱한 위치에 배치됐다. 리뷰어는 모델 오류 가능성과 함께 프롬프트를 개선할 필요성도 인정했다. [08:55]
  • 기계식 시계는 내부 구조가 보기 좋았으나 완성된 외형이 불분명했고, Neon Drift는 이전 랩의 자신과 경쟁하는 기능은 재미있었지만 Qwen 3.8 결과보다 덜 매끄럽고 시각적으로 단순했다. [10:00]

6. 사무실 경로 탐색과 생태 규칙

  • Office Life는 시간이 지나치게 빠르게 흐르고 직원들이 테이블을 우회하지 않은 채 통과했다. 사무실 세부 표현은 좋았지만 핵심 경로 탐색 조건을 충족하지 못해 실패로 판정됐다. [11:10]
  • Petri Dish에서는 포식자를 계속 추가해도 피식자가 승리하고 포식자 수에도 상한이 걸렸다. 리뷰어는 자연스러운 포식 관계를 구현하지 못한 로직상의 큰 실패라고 평가했다. [12:22]

7. 우주 슈팅·투석기·우주 규모

  • Starfall Arena는 레벨업과 궤도 칼날을 구현했지만 지나치게 단순했다. Stormwind Trebuchet은 발사 물리는 통과했으나 인터페이스가 화면을 가리고 이동도 되지 않아 UI는 실패로 판정됐다. [13:32]
  • Universe Simulator는 행성 간 거리를 크게 표현해 우주의 규모감을 잘 전달했고 다른 모델의 결과보다 인상적이라는 평가를 받았지만, Neptune의 회전 속도 정확성은 확인되지 않았다. [14:14]

8. 시각적 고점과 구조적 한계

  • Vice City는 자동 생성 도시의 애니메이션과 주야 전환이 보기 좋았다. 리뷰어는 Helm's Deep과 함께 높은 점수를 주면서도 나머지 결과가 평범한 이유로 단일 대형 프롬프트의 품질 편차를 지적했다. [14:51]
  • 중국 건축 조립 프로젝트는 지붕 밖으로 막대가 돌출되는 기존 문제를 반복했고 노화 효과도 주로 색상과 변형으로 표현됐다. 세밀한 균열은 부족했지만 전체적으로는 통과 판정을 받았다. [16:05]

9. 비용·귀속 범위와 최종 평가

  • 리뷰어는 이번 작업에서 Grok 4.6이 직접 모든 프로젝트를 코딩한 것이 아니라 하위 에이전트의 조정자 역할을 했다고 명시했다. 그럼에도 주간 한도의 40%로 대규모 작업을 수행해 경쟁 모델보다 상대적으로 저렴했다고 평가했다. [17:01]
  • Helm's Deep처럼 하나의 탁월한 결과만으로도 큰 승리라고 보며 Grok 4.6을 확실한 상위 선택지로 결론 내린다. 향후에는 하위 에이전트 없이 프로젝트별로 직접 코딩시켜 품질 개선 여부를 시험하겠다고 예고한다. [17:53]

🧾 결론

  • Grok 4.6은 Grok 4.5의 빠른 에이전트 실행 특성을 유지하면서 장기 코딩 작업까지 맡길 수 있는 수준으로 발전했다는 것이 리뷰어의 핵심 판단이다.
  • 최고의 결과물은 경쟁 모델과 견줄 만큼 인상적이지만, 16개 결과 전체가 같은 수준을 유지하지는 못해 안정적인 최상위 모델이라고 단정하기에는 이르다.
  • 이번 테스트에서 Grok 4.6은 직접 모든 코드를 작성하기보다 하위 에이전트를 지휘한 조정자였으므로, 단일 세션 직접 코딩 성능은 별도로 검증해야 한다.
  • 현재 강점은 모든 작업을 평균 이상으로 처리하는 균일성보다, 제한된 비용으로 일부 프로젝트에서 매우 높은 최고점을 만들어 내는 능력에 가깝다.

📈 투자·시사 포인트

  • 기반 모델 교체 없이 후속 학습과 행동 조정만으로 코딩 성능이 크게 달라질 수 있다는 평가는 모델 경쟁의 핵심이 사전 학습 규모뿐 아니라 후속 최적화와 에이전트 행동 설계로 이동하고 있음을 시사한다.
  • 한 프롬프트로 다수의 하위 에이전트를 조정하는 방식은 대규모 소프트웨어 제작의 비용과 시간을 줄일 가능성이 있지만, 결과물별 품질 관리와 자동 검증 체계가 함께 필요하다.
  • 높은 시각적 완성도와 정확한 로직 구현은 별개의 역량이었다. 코딩 모델을 평가할 때 데모 화면뿐 아니라 조작 체계, 경로 탐색, 상태 전이, 규칙 준수까지 점검해야 한다.
  • 리뷰어가 주장한 상대적 비용 우위가 반복 측정에서도 확인된다면 Grok 4.6은 비용 민감도가 높은 에이전트 코딩 워크플로에서 경쟁력 있는 선택지가 될 수 있다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 영상에는 16개 프로젝트의 공통 채점 기준, 원본 프롬프트, 실행 로그, 성공률 표가 제시되지 않아 리뷰어의 통과·실패 판정과 모델 간 비교를 독립적으로 재현하기 어렵다.
  • 테스트는 한 번의 프롬프트와 하위 에이전트 조정 방식으로 진행됐다. 각 프로젝트를 Grok 4.6이 단일 세션에서 직접 구현했을 때의 품질을 보여 주지는 않는다.
  • 40%의 주간 사용량이라는 비용 수치는 리뷰어의 계정 한도를 기준으로 한 상대값이며, 실제 토큰 수와 동일 조건의 경쟁 모델 비용은 공개되지 않았다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 동일한 16개 프롬프트와 실행 환경을 보존하고 Grok 4.6, Grok 4.5 및 비교 모델을 반복 실행해 성공률과 품질 분산을 측정한다.
  • Grok 4.6이 하위 에이전트 없이 프로젝트 하나를 직접 완성하는 단일 세션 테스트를 수행해 조정 능력과 직접 코딩 능력을 분리한다.
  • 경로 탐색, 객체 배치, 충돌 처리, 게임 규칙, 조작 방향을 자동 검사하는 테스트를 추가해 시각적으로 그럴듯한 실패를 걸러낸다.
  • 실제 토큰 사용량, 실행 시간, 재시도 횟수와 프로젝트당 비용을 기록해 리뷰어가 제시한 비용 우위를 검증한다.

❓ 열린 질문

  • Grok 4.6의 뛰어난 Helm's Deep 결과는 안정적으로 재현되는 성능인가, 아니면 16개 작업 중 발생한 높은 편차의 한 사례인가?
  • 하나의 대형 프롬프트 대신 프로젝트별 단일 세션을 사용하면 평균 품질과 로직 정확성이 얼마나 개선되는가?
  • 후속 학습과 행동 조정 가운데 장기 코딩 일관성 향상에 가장 크게 기여한 요소는 무엇인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.