YouTubeNate Herk·2026년 8월 23일·0

100 Hours Testing Deepseek Harness vs. Claude Code. What You Need to Know.

Quick Summary

100시간 테스트의 결론은 DeepSeek Harness가 속도와 커스터마이징에서는 Claude Code를 앞서지만, 깊이 있는 작업의 품질·신뢰성·비용 효율까지 고려하면 아직 Claude Code를 대체하지 못한다는 것이다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

100 Hours Testing Deepseek Harness vs. Claude Code. What You Need to Know. 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

100 Hours Testing Deepseek Harness vs. Claude Code. What You Need to Know.의 핵심 내용을 4단계로 요약한 인포그래픽
100 Hours Testing Deepseek Harness vs. Claude Code. What You Need to Know. 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

100시간 테스트의 결론은 DeepSeek Harness가 속도와 커스터마이징에서는 Claude Code를 앞서지만, 깊이 있는 작업의 품질·신뢰성·비용 효율까지 고려하면 아직 Claude Code를 대체하지 못한다는 것이다.

📌 핵심 요점

  1. DeepSeek Harness는 무료 오픈소스 하네스로, 모델뿐 아니라 도구·스킬·세션·샌드박스·저장소·에이전트 루프·UI까지 플러그인 형태로 교체하거나 수정할 수 있다.
  2. 동일한 모델과 프롬프트를 사용한 제작자의 비교에서는 DeepSeek Harness가 대규모 지식 저장소 검색과 스프레드시트 생성, 서브에이전트 작업을 Claude Code보다 일관되게 빠르게 완료했다.
  3. 작업 품질은 하네스만이 아니라 투입한 모델과 실행 모드에 크게 좌우된다. 특히 시각 능력이 없는 DeepSeek 모델은 스크린샷 기반 검증과 UI 반복 개선에서 한계를 보였다.
  4. Claude Code는 더 오래 걸렸지만 분석 범위와 과학적 깊이, 출처 수, 보수적인 사실 판단에서 우세했고, 제작자는 고객이나 팀에 전달할 결과물로 Claude Code 쪽을 더 신뢰했다.
  5. DeepSeek Harness는 빠르고 저렴한 연구·검색·지식 작업이나 자체 하네스를 만들 개발자에게 매력적이지만, 개발자 프리뷰 단계의 버그와 장기 세션의 컨텍스트 회귀 때문에 주력 도구로는 신중한 검증이 필요하다.

🧩 배경과 문제 정의

DeepSeek Harness는 다양한 AI 모델을 연결할 수 있는 무료 오픈소스 에이전트 하네스다. 제작자는 약 일주일 동안 이를 사용하며 모델 선택, 실행 모드, 비용, 신뢰성, 커스터마이징과 실제 결과물을 Claude Code 중심으로 비교했다. 핵심 문제는 무료 여부가 아니라 동일한 모델도 하네스에 따라 속도·품질·행동이 얼마나 달라지는지, 그리고 DeepSeek Harness가 Claude Code를 실제로 대체할 수 있는지다.

🕒 시간순 섹션별 상세정리

1. 비교 목적과 에이전트 하네스의 의미

  • 제작자는 DeepSeek Harness에서 좋았던 점과 불편했던 점, 실제 사용 방식과 Claude Code와의 차이를 솔직하게 정리하겠다고 드러낸다. [00:17]
  • 하네스는 모델을 실행시키는 도구·프롬프트·루프의 환경이며, DeepSeek Harness에는 DeepSeek뿐 아니라 Opus·GPT·Kimmy·Meta 등 여러 모델을 연결할 수 있다고 보여준다. [01:06]
  • OpenClaw와 Hermes Agent도 에이전트 하네스의 예이므로 개념 자체는 새롭지 않지만, DeepSeek Harness는 오픈소스라 내부 동작까지 수정할 수 있다는 점이 다르다. [01:51]

2. 플러그인 구조와 로컬 설치

  • 도구·스킬·세션·샌드박스·저장소·루프·UI를 포함한 모든 기능이 플러그인이며, 외부 플러그인은 악성 코드 가능성이 있으므로 설치 전 검토해야 한다고 경고한다. [02:29]
  • UI는 일반적인 챗봇과 비슷하고, GitHub 링크를 Codex에 전달해 설치 도움을 받은 뒤 localhost에서 실행했다고 보여준다. [02:59]
  • OpenRouter 키를 넣으면 여러 모델을 선택할 수 있지만 기본 사용 방식은 구독이 아니라 토큰당 API 과금이며, 구독 연동 플러그인은 직접 검증하지 않았다. [03:27]

3. 실행 모드와 컨텍스트 주입 차이

  • 출력 품질은 하네스뿐 아니라 선택한 모델과 추론 노력에 좌우되며, Standard Mode는 파일 편집·셸·웹 검색을 포함한 완전한 코딩 에이전트로 동작한다. [04:12]
  • PTC Mode는 큰 작업과 병렬·멀티체인 실행에 적합했고, Minimal Mode는 도구와 컨텍스트를 줄여 빠르고 저렴한 단순 작업에 유용했다고 평가한다. [04:52]
  • Standard Mode는 AGENTS.md와 Claude 관련 컨텍스트, 시스템 프롬프트와 스킬 카탈로그를 즉시 읽지만 Minimal Mode는 이를 생략해 일회성 대화에 가깝다. [05:51]

4. 모델 비용과 시각 작업의 한계

  • 하네스 자체는 무료이며 무료 모델을 쓰면 계속 무료로 실행할 수 있지만, 유료 모델의 추론 비용은 별도로 발생한다. [06:01]
  • DeepSeek V4 Flash로 브랜드 지침을 반영한 웹사이트를 만들 수는 있었지만, 화면을 보고 스크린샷으로 검증·추론·반복할 수 없어 UI 오류를 놓쳤다고 지적한다. [06:58]
  • 저렴한 토큰을 사용해도 하네스나 모델이 비효율적이면 전체 비용은 커질 수 있으므로 백만 토큰 가격보다 완료당 비용을 봐야 한다고 강조한다. [07:27]

5. 프리뷰 단계의 신뢰성과 강력한 커스터마이징

  • 개발자 프리뷰답게 작동 중단, 마우스 이동 제한, 압축 오류, 장기 세션의 컨텍스트 회귀와 일부 UI 버그를 경험했다고 드러낸다. [08:22]
  • 반면 커스터마이징에서는 Claude Code나 Codex와 비교하기 어려울 만큼 앞서며, Creator Mode에서 프리셋·플러그인·UI를 직접 만들 수 있다고 보여준다. [08:50]
  • Creator Mode가 즉시 해제되는 버그도 보였지만 셸, 에이전트 루프, 검색 제공자와 여러 플러그인을 직접 켜고 끄거나 수정할 수 있다는 장점은 분명하다고 평가한다. [09:26]

6. 사용자별 적합성과 Claude Code 대체 여부

  • 일반적인 영상 편집·연구·지식 작업에서는 Claude Code나 Codex의 하네스에 큰 결핍을 느끼지 않았지만, 특정 제약을 해결해야 하는 개발자에게는 맞춤화가 유용할 수 있다고 본다. [10:15]
  • 저렴한 모델로 대량 연구나 지식 작업을 분산하는 용도는 생각하고 있으나, 현재 직접 하네스를 구축해야 할 필요성은 없다고 드러낸다. [10:41]
  • 깊은 작업과 Opus 사용의 구독 경제성을 고려하면 DeepSeek Harness는 Claude Code를 대체하지 않으며, 무료 Claude Code가 아니라 무료 하네스일 뿐이라고 결론 내린다. [11:32]

7. 검색 속도와 실행 궤적의 가시성

  • 이름을 잊은 과거 프로젝트를 대규모 AI 운영체제에서 찾는 동일 프롬프트 테스트에서 DeepSeek Harness는 약 1분, Claude Code는 5분 이상 걸렸다고 보여준다. [11:58]
  • 같은 모델을 사용한 화면 시연에서도 DeepSeek 쪽은 약 50초 만에 트랜스크립트와 요약을 찾은 반면 Claude Code는 계속 검색 중이었고, 서브에이전트 연구에서도 DeepSeek가 일관되게 빨랐다고 평가한다. [12:50]
  • Trajectory 화면은 사용자 프롬프트, 주입된 컨텍스트와 중간 단계를 한곳에 표시하고 세션 로그도 내려받게 해, 실패를 분석해 새 스킬이나 플러그인으로 개선하기 좋다고 본다. [13:33]

8. 유튜브 분석 스프레드시트 비교

  • 같은 Opus 5 모델로 유튜브 분석 데이터를 스프레드시트화했을 때 DeepSeek Harness는 약 3분, Claude Code는 약 17분이 걸렸다고 드러낸다. [14:20]
  • DeepSeek 결과는 조회수·참여율 색상 구분과 상하위 영상, 월별 추세, 태그 분석을 단순하고 해석하기 쉽게 제공했지만 일부 차트에는 레이블이 없었다. [15:03]
  • Claude Code 결과는 더 많은 탭과 전체 467개 영상, 상위 50개와 세밀한 분석을 담아 품질은 더 높았지만 장황했으며, 두 시스템 모두 모호한 프롬프트를 받았다는 조건이 있었다. [15:51]

9. 연구 보고서의 깊이와 신뢰도

  • 설탕이 신체에 미치는 영향을 같은 연구 스킬로 작성하게 하자 형식은 같았지만 Claude Code는 약 5,000단어와 26개 출처, DeepSeek Harness는 약 4,400단어와 최소 14개의 핵심 출처를 사용했다. [16:37]
  • Claude Code는 더 과학적이고 깊으며 보수적으로 결론을 냈고, DeepSeek Harness는 더 친근하고 실용적이지만 때때로 지나치게 확신하는 표현을 보였다. [17:07]
  • 제작자는 고객이나 팀에 전달할 결과물로 Claude Code 쪽을 더 신뢰하지만, 기존 스킬이 Claude Code용으로 만들어졌다는 비교상의 한계를 인정한다. [17:32]

10. 최종 권고와 테스트 원칙

  • 하네스나 모델이 바뀌면 같은 스킬도 다르게 해석되므로 DeepSeek Harness 전용 스킬을 만들면 더 빠르고 좋은 결과가 나올 가능성이 있다고 본다. [17:37]
  • 타인의 리뷰만 따르지 말고 원하는 모델을 직접 넣어 자신의 업무에서 어떻게 작동하는지 시험해야 한다는 조언으로 비교를 마무리한다. [17:50]
  • 시청자에게 감사를 전하며 영상을 끝낸다. [17:59]

🧾 결론

  • DeepSeek Harness는 무료 Claude Code가 아니라, 서로 다른 목표와 실행 구조를 가진 별도의 오픈소스 에이전트 하네스다.
  • 검색 속도와 실행 효율, 세부 동작의 변경 가능성은 DeepSeek Harness의 가장 강한 차별점이다.
  • 깊은 연구와 외부 전달용 결과물에서는 Claude Code가 더 상세하고 보수적이며 신뢰할 만하다는 것이 제작자의 판단이다.
  • 최종 선택은 일반적인 순위보다 자신의 모델·스킬·데이터·업무를 넣은 반복 테스트를 통해 내려야 한다.

📈 투자·시사 포인트

  • AI 에이전트 시장의 경쟁축이 모델 성능만이 아니라 하네스의 실행 루프, 컨텍스트 처리, 검증 도구와 확장 생태계로 이동할 가능성을 보여준다.
  • 모든 기능을 플러그인으로 제공하는 구조는 개인별 맞춤 하네스와 개발자 생태계를 촉진할 수 있지만, 외부 플러그인의 보안 검토가 필수적인 공급망 위험도 함께 만든다.
  • 토큰 단가만으로 경제성을 비교하면 실제 비용을 오판할 수 있다. 반복 실패와 긴 실행 시간을 포함한 완료당 비용이 더 중요한 평가 기준이다.
  • 범용 지식 업무 사용자는 기존 구독형 도구의 완성도와 신뢰성을 선호할 수 있지만, 구체적인 하네스 제약을 가진 제품 개발자에게는 오픈소스 커스터마이징이 강한 유인이 될 수 있다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 제목은 100시간 테스트를 표방하지만, 본문은 지난 일주일 동안 사용했다고만 설명하며 총 실행 시간, 반복 횟수, 실패율과 전체 테스트 기록을 제시하지 않는다.
  • 속도 비교는 제작자의 AI 운영체제와 기존 스킬, 대규모 위키를 대상으로 한 관찰이며, 하드웨어·컨텍스트 크기·모델 설정·네트워크 조건이 통제된 표준 벤치마크인지는 확인되지 않는다.
  • Claude 또는 Codex 구독을 DeepSeek Harness에서 사용할 수 있다는 플러그인은 제작자가 직접 시험하지 않았으므로 실제 작동 여부와 정책 적합성을 별도로 확인해야 한다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 자신의 대표 업무를 선정해 동일한 모델·프롬프트·데이터로 DeepSeek Harness와 Claude Code를 여러 차례 실행하고 시간, 성공률, 수정 횟수와 완료당 비용을 기록한다.
  • Standard·PTC·Minimal Mode를 각각 시험해 컨텍스트 주입, 병렬 작업, 빠른 일회성 작업에 적합한 모드를 구분한다.
  • UI나 디자인 작업에는 스크린샷을 보고 검증할 수 있는 모델과 도구가 연결됐는지 먼저 확인한다.
  • 인터넷에서 받은 플러그인은 설치 전에 Claude Code나 Codex로 코드를 검토하고, 요청 권한과 외부 통신 여부를 점검한다.

❓ 열린 질문

  • DeepSeek Harness 전용으로 스킬과 에이전트 루프를 최적화하면 Claude Code와의 깊이·출처·신뢰성 격차를 얼마나 줄일 수 있는가?
  • 개발자 프리뷰가 성숙한 뒤에도 현재의 속도 우위가 유지되면서 장기 세션의 압축 오류와 컨텍스트 회귀가 해결될 것인가?
  • 플러그인 커스터마이징에 드는 구축·검토·유지보수 비용까지 포함하면 어떤 사용자군에서 실제 총비용 우위가 발생하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.