I Made Codex and Claude Code Build the Same App. One Clearly Won.
Quick Summary
같은 앱을 만든 대결에서 Claude Code는 Codex보다 적은 시간과 비용으로 실제 사용 흐름을 완성해 분명한 승자가 됐지만, 아키텍처와 테스트 깊이에서는 Codex가 강했다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 결론
같은 앱을 만든 대결에서 Claude Code는 Codex보다 적은 시간과 비용으로 실제 사용 흐름을 완성해 분명한 승자가 됐지만, 아키텍처와 테스트 깊이에서는 Codex가 강했다.
📌 핵심 요점
- 두 에이전트는 동일한 프롬프트로 출시 가능한 Typeform 대체 제품을 만들었지만, 제작 시간·비용·기능 완성도에서 큰 격차를 보였다.
- Codex가 만든 Real Form은 시각적 완성도와 기능 수가 돋보였으나, 복잡한 편집 화면과 실제로 작동하지 않는 기능 때문에 출시 가능성은 낮았다.
- Claude Code가 만든 Fora는 디자인이 거칠고 상태 오류가 남았지만, 폼 제작부터 게시·응답 제출·결과 분석까지 핵심 사용자 흐름이 실제로 작동했다.
- Claude Code는 약 5시간 30분과 200만 출력 토큰으로 작업을 마친 반면, Codex는 약 61시간과 1,150만 출력 토큰을 사용해 효율 차이가 크게 벌어졌다.
- Claude Code는 목표와 완료 기준을 바탕으로 제품 가치를 판단하는 데 강했고, Codex는 단계별 지시를 충실히 수행하며 아키텍처와 테스트 범위를 확장하는 데 강했다.
🧩 배경과 문제 정의
Claude Code와 Codex에 동일한 프롬프트를 주고 같은 폼 제작 애플리케이션을 만들게 한 비교 실험이다. 목표는 단순한 프로토타입이 아니라 조사·개발·검증을 반복해 곧바로 출시할 수 있는 Typeform 대체 제품을 구현하는 것이었다. 평가는 디자인과 사용성뿐 아니라 실제 기능, 버그, 비용, 토큰, 작업 시간, 서브에이전트와 도구 호출 규모까지 포함했다.
🕒 시간순 섹션별 상세정리
1. 동일 조건의 제작 실험과 프롬프트 설계
- 동일한 프롬프트를 받은 두 에이전트의 작업 시간은 약 3일과 5시간, 비용은 약 3,000달러와 800달러 수준으로 벌어졌고 제작 방식도 크게 달랐다. [00:44]
- 프롬프트는 전문 에이전트가 조사·개발·검증을 수행하도록 했지만, 조사 결과를 전체 제품 흐름으로 바꾸는 계획 단계는 빠져 있었다. [00:59]
- 첫 성공이나 프로토타입에서 멈추지 않고 조사·테스트·파괴·수정·재검증을 반복해 출시 가능한 제품을 완성하도록 요구했다. [01:12]
2. Real Form의 디자인과 초기 진입 경험
- Real Form의 랜딩 페이지에는 전형적인 AI 생성 요소가 보였지만 배경의 깊이와 구성은 준수해 즉시 바이브 코딩 결과물로 보일 정도는 아니었다. [01:49]
- 계정 인증 키가 없어 데모 작업공간으로 들어갔으며, 변수 삽입과 요소 크기 조절 기능은 확인했지만 실제 운영 환경은 검증하지 못했다. [02:42]
3. 복잡한 편집 화면과 초반 버그
- 편집 화면에 많은 설정이 한꺼번에 노출되고 삭제 방식과 요소의 역할도 불명확해, 간단한 폼을 만드는 사용자조차 혼란을 겪을 수 있었다. [03:28]
- 시작 화면의 이미지 미리보기가 나타나지 않고 확인 창이 화면 왼쪽에 어색하게 표시되는 등 에이전트 테스트가 놓친 사용 시나리오가 발견됐다. [04:41]
4. 풍부한 관리자 기능과 미완성된 실제 동작
- 응답 유형과 데이터 수집 옵션은 폭넓었지만, 제작자 관점에서는 Typeform보다 복잡해 초기 이탈 가능성이 컸다. [04:50]
- 조건 분기, 테마, 접근성 검사, 웹훅, 이메일 알림과 공유 화면을 갖췄지만 테마 조작처럼 화면만 있고 실제로 동작하지 않는 기능이 있었다. [05:30]
- 완성된 제품을 요구했음에도 데모를 전제로 한 구현이 많아, 시각적 잠재력과 별개로 출시 가능 제품이라는 핵심 조건을 충족하지 못했다. [06:01]
5. Fora의 단순한 진입 구조와 작업공간 관리
- Fora의 랜딩 페이지는 거칠고 바이브 코딩 흔적이 강했지만, 회원가입 후 사용자가 해야 할 일은 Real Form보다 명확했다. [06:13]
- 설정 메뉴 하단이 잘려 로그아웃할 수 없는 버그가 있었으나, 여러 작업공간을 생성하고 전환하는 기능은 정상 작동했다. [06:49]
- 새 폼 화면은 위압감이 적고 Typeform과 유사했으며, 표시 방식·진행률·문항 번호·자동 저장·부분 응답 수집을 쉽게 설정할 수 있었다. [07:31]
6. 직관적인 폼 편집과 누적되는 상태 오류
- 질문과 설명을 즉시 수정하고 필수 여부와 입력 유형을 지정할 수 있었으며, 다양한 콘텐츠도 명확한 흐름으로 추가할 수 있었다. [08:00]
- 새 문항 번호가 모두 1로 남고 선택한 문항의 설정이 즉시 표시되지 않는 등 상태 동기화와 번호 계산 오류가 반복됐다. [09:12]
- 조건 분기와 테마 변경은 실제로 작동했지만, 디자인·결과·웹훅 화면에서 편집 화면으로 쉽게 돌아갈 수 없는 탐색 문제가 있었다. [10:03]
7. 게시부터 응답 분석까지 이어지는 실제 기능
- 폼을 게시해 링크를 발급하고 Typeform과 유사한 화면에서 답변을 제출할 수 있어 실제 응답 흐름까지 연결됐다. [10:34]
- 제출 결과는 요약과 개별 응답 화면에 저장되고 유입 정보도 표시됐지만, 변경한 제목은 다시 게시해야 대시보드에 반영됐다. [11:03]
- Real Form은 시각적 완성도에서 앞섰으나, 실제 기능과 요구사항 충족도에서는 Fora가 훨씬 우수했다. [11:31]
8. 제작 에이전트 공개와 효율 격차
- Fora는 Claude Code, Real Form은 Codex의 결과물이었으며, Claude Code가 디자인을 제외한 기능 구조와 실제 동작에서 더 좋은 평가를 받았다. [11:59]
- Claude Code는 약 832달러와 200만 출력 토큰으로 5시간 30분 만에 끝냈지만, Codex는 약 3,000달러와 1,150만 출력 토큰으로 약 61시간을 사용했다. [13:54]
- Claude Code는 35개 서브에이전트와 약 2,800회 도구 호출, Codex는 126개와 약 3만 2,500회를 사용했으며 두 결과물 모두 수동 테스트에서 버그가 발견됐다. [14:59]
9. 테스트 규모와 프롬프팅 방식의 차이
- Claude Code는 단위 테스트 296개·테스트 케이스 199개·브라우저 테스트 102개를 수행했고, Codex는 각각 2,300개·341개·391개를 수행했다. [15:11]
- Claude Code는 창의적인 기획·브레인스토밍·경로 탐색에 적합했고, Codex는 명시된 지시를 따르며 테스트를 반복해 완료 여부를 확인하는 성향이 강했다. [15:32]
- Claude Code에는 목표와 완료 기준 중심의 프롬프트가, Codex에는 단계별 지시가 더 적합했으며 Codex는 목표한 사용자 경험을 충분히 추론하지 못했다. [16:05]
10. 제품 판단은 Claude Code, 아키텍처와 테스트는 Codex
- 종합 승자인 Claude Code는 필수 기능과 선택 기능을 구분했지만, Codex는 135개 기능까지 확장하며 사용자 경험보다 구축 자체에 치우쳤다. [17:24]
- Codex는 불변 리비전, 오프라인 복구, 마이그레이션 안전성, 동시성 처리와 클라우드 경계를 구현했고, Claude Code는 계약 우선 방식으로 병합 충돌을 피했다. [17:48]
- Codex는 교차 브라우저·모바일·속성 기반 테스트와 장애 주입까지 수행해, 더 큰 비용과 긴 시간을 쓰는 대신 버그와 경계 사례 탐지 범위를 넓혔다. [18:29]
11. 효율성의 역전과 개인별 실험의 필요성
- Claude Code의 비용 기록은 약 447달러와 800달러 수준으로 엇갈렸지만, 전체 비교에서는 약 11배 빠르고 6.6배 저렴한 것으로 정리됐다. [19:38]
- 과거에는 Codex가 토큰 효율과 속도에서 앞섰으나, 새 모델과 실행 하네스 조합은 순위를 뒤집을 수 있어 작은 실험으로 워크플로 적합성을 확인해야 한다. [20:16]
- 도구 개발자와 업계 전문가의 업무와 동기가 서로 다르므로, 일반적인 조언보다 자신과 유사한 작업을 수행하는 사람의 경험을 참고해야 한다. [20:52]
🧾 결론
- 이번 비교의 종합 승자는 필수 기능과 선택 기능을 구분하고 실제 사용 가능한 제품 흐름을 구현한 Claude Code였다.
- 기능 수와 테스트 수가 많더라도 사용자가 핵심 작업을 직관적으로 완료하지 못하면 제품 완성도로 이어지지 않는다.
- Codex는 불변 리비전, 오프라인 복구, 마이그레이션 안전성, 동시성 처리와 장애 주입처럼 운영 신뢰성이 중요한 작업에서 뚜렷한 강점을 보였다.
- 두 결과물 모두 수동 테스트에서 버그가 발견됐으므로, 에이전트가 보고한 완료 상태만으로 출시 여부를 판단해서는 안 된다.
📈 투자·시사 포인트
- AI 코딩 에이전트의 경쟁력은 토큰 소비량이나 테스트 개수보다 실제 제품 가치까지 포함한 품질 조정 비용과 개발 시간으로 평가할 필요가 있다.
- 모델뿐 아니라 실행 하네스·프롬프트 방식·버전 조합이 결과를 뒤집을 수 있어, 단일 비교 결과를 영구적인 서열로 해석하기 어렵다.
- 제품 판단에 강한 에이전트와 신뢰성 검증에 강한 에이전트가 분화될 가능성을 보여주며, 업무 유형에 따른 선택이 중요하다.
- 수동 QA가 여전히 필수라는 결과는 에이전트 도입 이후에도 검증 절차와 사람의 사용자 경험 판단이 핵심 비용으로 남는다는 점을 시사한다.
⚠️ 불확실하거나 확인이 필요한 부분
- Claude Code의 비용이 약 447달러, 800달러, 832달러로 서로 다르게 기록돼 정확한 비용 우위는 원자료 확인이 필요하다.
- Real Form은 계정 인증 키가 없어 데모 작업공간에서만 확인했으므로, 인증된 실제 운영 환경에서의 기능 수준은 충분히 검증되지 않았다.
- 조사와 개발 사이에 전체 흐름을 설계하는 계획 단계가 프롬프트에서 빠졌기 때문에, 이 누락이 두 에이전트의 결과에 미친 영향을 분리하기 어렵다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 실제 업무와 유사한 소규모 앱을 선정해 두 에이전트에 동일한 입력·완료 기준·수동 QA 시나리오를 적용한다.
- 프롬프트에 조사·계획·개발·검증 단계를 명시하고, 필수 기능과 선택 기능의 우선순위를 사전에 구분한다.
- 제작 시간·비용·출력 토큰·서브에이전트·도구 호출 수뿐 아니라 게시부터 최종 사용자 행동까지의 성공률을 함께 기록한다.
- 에이전트 테스트와 별도로 상태 동기화, 화면 탐색, 인증, 게시, 재게시와 같은 실제 사용자 경로를 수동으로 파괴 테스트한다.
❓ 열린 질문
- 명시적인 계획 단계를 추가했다면 Codex가 기능 과잉을 줄이고 사용자 경험을 더 잘 최적화했을까?
- 인증된 운영 환경에서 Real Form을 검증하면 데모에서 작동하지 않았던 기능과 제품 평가가 달라질까?
- Claude Code의 제품 판단과 Codex의 아키텍처·테스트 강점을 한 워크플로에서 결합하면 비용 대비 완성도가 더 높아질까?