YouTubeCraig Hewitt·2026년 8월 13일·0

Which AI Writes Best? I Tested Claude, Grok, and ChatGPT

Quick Summary

Claude·Grok·ChatGPT 계열을 같은 콘텐츠 과제로 시험한 결과, 자연스러운 문체와 SEO 구조를 가장 잘 결합한 ChatGPT 계열의 Codex가 가장 잘 썼다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Which AI Writes Best? I Tested Claude, Grok, and ChatGPT 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Which AI Writes Best? I Tested Claude, Grok, and ChatGPT 내용을 설명하는 본문 이미지

💡 한 줄 결론

Claude·Grok·ChatGPT 계열을 같은 콘텐츠 과제로 시험한 결과, 자연스러운 문체와 SEO 구조를 가장 잘 결합한 ChatGPT 계열의 Codex가 가장 잘 썼다.

📌 핵심 요점

  1. 비교 대상은 장문 SEO 글, LinkedIn 게시물, 이메일 뉴스레터였으며, 결과물의 품질뿐 아니라 웹 조사, 앱 사용 경험, 실행 시간, 비용 대비 처리량까지 함께 평가했다.
  2. Cursor·Grok은 내부 링크, FAQ, 표 등 SEO 구조와 처리량에서 강점을 보였지만, 목록 중심의 딱딱한 흐름을 사람에게 친숙한 문체로 다듬을 필요가 있었다.
  3. Claude는 동일한 장문 작업에 32분이 걸렸고 외부 접근 실패 후에도 초안을 완성했으며, 개인 문체 재현에서도 뚜렷한 우위를 보이지 못해 종합 최하위로 평가됐다.
  4. Codex는 약 8분 만에 자연스러운 문장 리듬, 구조화된 정보, 구어체 검색 질문, 구체적인 사례를 결합해 장문 SEO 글과 LinkedIn 게시물에서 가장 좋은 결과를 냈지만, 확인 질문 생략과 긴 이메일은 약점이었다.
  5. 최종 품질은 모델 자체뿐 아니라 실행 하네스, 저장소 문맥, 글쓰기 예시, 네트워크 권한에 좌우됐으며, 사람의 읽기 경험과 AI의 인용 가능성을 동시에 고려해야 했다.

🧩 배경과 문제 정의

  • Claude는 오랫동안 장문, 단문, 소셜 콘텐츠에서 자연스러운 문체를 만드는 기본 선택지였지만 최근 모델 품질과 사용 경험에 대한 불만이 커졌다.
  • Claude 텍스트의 보이지 않는 워터마크가 검색엔진과 AI 답변 서비스의 노출·추천에 영향을 줄 가능성은 콘텐츠 마케팅과 SEO에 새로운 위험을 제기한다.
  • Claude, Cursor·Grok, Codex를 유사한 조건에서 비교해 글의 품질, 조사 능력, 작업 흐름, 비용 대비 처리량을 함께 판단필요가 있다.

🕒 시간순 섹션별 상세정리

1. 비교 기준과 Claude 재검토 계기

  • 장문 SEO 글, 이메일 뉴스레터, 소셜 게시물을 동일하게 작성해 결과물의 품질과 데스크톱 앱의 작업 경험을 함께 비교한다. [00:30]
  • Claude 텍스트의 보이지 않는 워터마크가 Google이나 ChatGPT·Perplexity의 검색 노출과 브랜드 추천에 영향을 줄 가능성이 제기되지만 실제 효과는 불확실하다. [01:23]
  • 최근 Claude Opus의 응답 품질과 상호작용에서 반복적인 불편이 생기면서 Cursor·Grok과 Codex·GPT 계열이 대안으로 부상했다. [02:20]

2. Cursor·Grok의 작업 설정과 사전 질문

  • 첫 과제는 팟캐스트 광고의 CPM 요율과 벤치마크를 다루는 Castos 블로그 글이며, 상세 SEO 요구사항과 팀 의견을 공통 브리프로 사용한다. [02:57]
  • Cursor의 Grok 4.5 고품질 모드에 이슈 링크와 저장소 문맥을 제공하고 필요하면 웹 조사와 확인 질문을 수행하도록 지시한다. [03:23]
  • Grok은 데이터 출처, 파일 위치, 첫 화면의 직접 답변, Castos 고유 주장, 기존 글과의 canonical 충돌을 확인한 뒤 공개 자료를 조사해 초안을 완성한다. [04:31]

3. Cursor 결과물과 사람·기계 가독성의 균형

  • Cursor 초안은 내부 링크, 핵심 요점, FAQ를 갖춰 SEO 구조는 강하지만 목록과 표의 비중이 높아 서술 흐름이 다소 딱딱하다. [06:11]
  • 친숙하고 편안한 어조와 덜 정형화된 구성을 더하면 사람이 읽기 좋은 문체로 보완할 수 있다. [06:56]
  • 정돈된 정보는 ChatGPT·Perplexity의 인용과 브랜드 추천에 유리할 수 있지만 기계 가독성에 치우치면 실제 독자의 경험이 나빠지므로 균형이 필요하다. [07:12]

4. Claude의 이례적인 실행 시간과 앱 경험

  • Claude Code 데스크톱 앱은 동일한 프롬프트로 도구와 명령을 실행하며 32분 동안 작업해, 터미널에서 비슷한 글을 작성할 때의 약 5분보다 훨씬 오래 걸렸다. [07:59]
  • 같은 모델도 실행 하네스와 애플리케이션에 따라 처리 방식과 성능이 달라질 수 있어 비교 조건을 유지하기 위해 Cowork 대신 Claude Code를 사용한다. [08:37]
  • 완성 파일이 별도 브랜치에 생성돼 GitHub에서 열어야 하므로 결과 확인 과정에 추가적인 앱 전환이 발생한다. [09:11]

5. Claude 초안의 평범한 품질과 조사 실패

  • Claude 초안은 링크, 핵심 요점, 표, FAQ와 요율 산정 근거를 포함했지만 Cursor보다 뚜렷하게 낫지 않았고 개인 문체를 재현하는 차별점도 부족했다. [09:27]
  • 외부 도메인 접근이 egress proxy에 모두 차단됐는데도 초안을 계속 생성해 수치와 근거가 실제 조사 결과인지 검증하기 어려워졌다. [10:13]
  • 웹 조사가 필수라면 접근 실패 후 작업을 중단하고 권한 설정을 요청해야 하며, 확인 없이 결과를 완성한 동작은 하네스와 권한 처리의 중대한 위험이다. [10:33]

6. Codex의 빠른 실행과 통합 작업 환경

  • Codex GPT-5.6 고품질 모드는 동일한 프롬프트를 약 8분 동안 처리했지만 명시적으로 요청한 확인 질문 없이 곧바로 초안을 만들었다. [11:07]
  • 결과물을 앱 안에서 바로 열 수 있고 내장 브라우저와 컴퓨터 조작 기능까지 결합돼 하나의 앱으로 지식 작업을 처리하기에 유리했다. [11:27]

7. Codex 초안의 SEO 신호와 자연스러운 문체

  • 첫 문장에서 다른 팟캐스트 호스팅 업체와 외부 자료를 인용해 출처 신뢰 신호를 줄 수 있지만 경쟁 브랜드를 앞부분에 노출한다는 상충도 생겼다. [12:06]
  • 짧고 긴 문장과 문단을 섞어 자연스러운 리듬을 만들면서 핵심 요점, 표, 구조화된 데이터를 유지했다. [12:38]
  • ChatGPT나 Perplexity에 입력할 법한 구어체 질문을 H2로 배치해 직접 답하고, 구체적인 사례와 전략적 문서 구조를 갖춰 개인 문체에 가장 가까운 결과를 냈다. [12:49]

8. 장문 결과 순위와 비용 대비 처리량

  • 장문 초안의 상대적 순위는 Claude가 최하위, Cursor·Grok이 2위였으며 Claude는 기존의 높은 기대에 비해 품질 우위를 보여주지 못했다. [14:04]
  • 구독료 대비 처리량은 Claude가 가장 비싸고 Codex가 그다음이며 Cursor·Grok은 월 약 20달러 플랜에서도 많은 작업을 처리할 수 있다는 개인적 추정이 제시됐다. [14:21]
  • 문체의 자연스러움, SEO 구조, 사례의 구체성을 종합한 장문 SEO 글의 최종 1위는 Codex였다. [14:56]

9. 제3자 평가로 자기 문체 편향 줄이기

  • 장문 SEO 결과는 목표한 수준에 가장 가까웠지만 Codex의 우위는 내용 전반보다 문체 측면에 집중됐다. [15:00]
  • 결과를 작성한 ChatGPT·Claude·Grok 대신 Gemini나 Kimi K3에 브리프와 결과물을 함께 제공하면 자기 문체를 알아보는 편향을 줄일 수 있다. [15:35]
  • AI 방어력을 다룬 유튜브 자막 전체와 개인 글쓰기 예시·스킬을 결합해 본인 문체의 LinkedIn 게시물과 이메일 뉴스레터를 생성한다. [16:30]

10. Cursor가 재현한 소셜 게시물과 뉴스레터 문체

  • LinkedIn 결과물은 짧은 문장과 다양한 목록 형식으로 전형적인 AI 문체의 흔적을 줄이고 고유한 경험이 필요한 곳에는 개인 사례를 추가하도록 표시했다. [17:12]
  • 개인 사업과 경험에 관한 예시를 저장소에 더 넣으면 독자적인 근거와 반대 관점의 훅도 자동으로 반영할 수 있다. [17:32]
  • 뉴스레터는 실용적인 질문, 대화체, P.S., 제목과 미리보기 문구까지 기존 스타일을 재현해 Cursor가 Claude의 비용과 품질이 불만일 때 고려할 대안임을 보여줬다. [18:50]

11. Claude가 개인 문체와 가독성을 놓친 지점

  • Claude는 짧은 문장마다 문단을 나누는 기존 스타일과 달리 긴 문단을 만들었고 AI 해자와 선발 우위를 연결한 도입부도 의미가 불분명했다. [19:59]
  • 뉴스레터도 실제 개인 문체와 거리가 멀어 읽고 싶은 이메일이 되지 못했으며, Fable은 전략적 사고에는 강하지만 콘텐츠 작성에는 부적합하고 Opus 5는 더 낮은 평가를 받았다. [20:49]

12. Codex의 높은 문체 적합성과 과도한 분량

  • Codex의 LinkedIn 게시물은 문장마다 문단을 나누는 소셜 글쓰기 형식을 따랐고 Claude보다 확실히 나았으며 Cursor보다도 근소하게 우세했다. [21:42]
  • 이메일은 간결 모드에서도 지나치게 길었지만 LinkedIn 결과는 우수했고, 글쓰기 스킬과 예시를 조정하면 이메일 품질도 개선할 수 있었다. [22:27]
  • 종합적으로 Cursor와 Codex는 비슷한 수준이었고 Claude는 크게 뒤처졌으며, Codex는 대체 훅과 이메일 제목·미리보기 후보도 함께 만들었다. [22:44]

13. 최종 순위와 비용·프로젝트 이전 기준

  • 세 콘텐츠 비교에서 Claude Code와 Opus 5 조합이 최하위를 기록해 오랜 주력 도구였더라도 콘텐츠와 코드 작업에서 Codex·Grok·Cursor로 전환할 이유가 커졌다. [23:27]
  • Codex는 월 100달러 요금제로 일주일 작업량을 감당했지만 Claude는 Fable 사용 시 한도에 부딪혔고, Grok과 Cursor는 월 20달러 수준에서도 많은 작업량과 토큰을 제공할 가능성이 있었다. [23:48]
  • 기존 저장소는 Codex에서 바로 활용하거나 CLAUDE.md의 스킬·예시·MCP 설정을 변환할 수 있고, Cursor는 Claude 프로젝트와 지식을 직접 가져와 첫날부터 호환할 수 있다. [24:51]

🧾 결론

  • 장문 SEO 글의 명확한 1위는 Codex였고, 세 콘텐츠를 종합해도 Codex와 Cursor가 상위권을 형성했다.
  • Cursor·Grok은 강한 SEO 구조와 상대적으로 높은 비용 대비 처리량을 제공해 Claude의 실용적인 대안이 됐다.
  • Claude Code와 Opus 5 조합은 속도, 조사 신뢰성, 문체 적합성에서 기대에 미치지 못해 기존 주력 도구라는 지위를 재검토할 필요가 생겼다.
  • 모델 선택보다 중요한 운영 원칙은 출처 접근 실패를 숨기지 않고, 개인 글쓰기 예시와 검증 절차를 작업 환경에 명시하는 것이다.

📈 투자·시사 포인트

  • AI 글쓰기 경쟁의 중심은 단일 모델 성능에서 브라우징, 컴퓨터 조작, 저장소 문맥, 결과 미리보기를 결합한 통합 작업 환경으로 이동하고 있다.
  • Cursor·Grok이 낮은 월 요금에서도 많은 작업량을 제공한다는 관찰은 콘텐츠 제작 도구 시장에서 가격 대비 처리량이 중요한 차별점이 될 가능성을 보여준다.
  • 검색엔진과 AI 답변 서비스에 함께 노출되려면 구조화된 정보와 출처 신호를 강화하되, 실제 독자의 가독성과 브랜드 문체를 훼손하지 않는 균형이 필요하다.
  • 기존 Claude 프로젝트와 스킬을 Codex나 Cursor로 이전할 수 있다는 점은 전환 비용을 낮춰 특정 모델에 대한 장기 고착을 약화할 수 있다.

⚠️ 불확실하거나 확인이 필요한 부분

  • Claude 텍스트의 보이지 않는 워터마크가 실제로 Google 검색 노출이나 ChatGPT·Perplexity의 브랜드 추천을 낮추는지는 확인되지 않았다.
  • 결과는 특정 사용자의 브리프, 저장소, 글쓰기 예시, 앱 환경을 이용한 비교이므로 모든 콘텐츠 유형과 사용자에게 동일하게 일반화하기 어렵다.
  • Claude의 외부 도메인 접근이 egress proxy에 차단된 상태였기 때문에 모델 자체의 조사 능력과 실행 환경의 권한 문제를 분리해 평가하기 어렵다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 실제 업무에서 사용하는 장문 글, 소셜 게시물, 뉴스레터 브리프를 고정하고 Claude·Grok·Codex를 같은 평가표로 다시 비교한다.
  • 웹 조사가 필요한 작업에는 외부 접근 실패 시 생성을 중단하고 권한 요청과 출처 검증을 수행하도록 명시한다.
  • 개인 문체 예시, 사업 경험, 선호하는 문단 길이, 금지 표현을 저장소에 보강해 모델별 재현 품질을 다시 측정한다.
  • Gemini나 Kimi K3에 원본 브리프와 익명화한 결과물을 제공해 작성 모델을 가린 제3자 평가를 진행한다.

❓ 열린 질문

  • Claude의 워터마크가 실제 검색엔진과 AI 답변 서비스에서 탐지되며 노출이나 추천에 영향을 주는가?
  • 동일한 네트워크 권한과 실행 하네스를 적용해도 Claude의 조사 신뢰성과 처리 시간이 뒤처지는가?
  • Codex의 과도한 이메일 분량은 프롬프트와 글쓰기 예시만으로 안정적으로 줄일 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.