Paste This Into Claude, Never Hit a Token Limit Again
Quick Summary
Claude의 토큰 한도 소진을 늦추려면 하위 에이전트에 사용할 모델을 명시하고, 불필요한 문맥과 반복 추론을 줄이라는 것이 영상의 핵심이다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Claude의 토큰 한도 소진을 늦추려면 하위 에이전트에 사용할 모델을 명시하고, 불필요한 문맥과 반복 추론을 줄이라는 것이 영상의 핵심이다.
📌 핵심 요점
- 고성능 모델은 작업 지휘와 최종 분석을 맡기고, 자료 읽기·요약은 비용이 낮은 모델의 하위 에이전트에 위임한다. 발표자는 고객 분석 보고서 비용이 약 350달러에서 44달러로 줄었다고 설명한다.
- 새 대화에도 도구·커넥터·스킬 설명이 문맥을 차지할 수 있다. 사용하지 않는 연결과 플러그인을 비활성화하고, 초기 문맥 사용량을 점검한다.
- 첫 프롬프트에 전체 작업과 목표, 수행 의도, 제약, 완료 기준을 담는다. 발표자는 이를 통해 수정 횟수와 불필요한 작업을 줄일 수 있다고 주장한다.
- 초안 이후 작은 수정에는 같은 모델의 추론 강도를 낮추는 방법을 제안한다. 대화 중 추론 강도 변경과 모델 자체 변경은 캐시 측면에서 다르게 설명된다.
- 대화 하나에는 작업 하나를 담고, 긴 작업은 필요한 맥락을 요약해 이어간다. 끝으로 중복 검증 요구, 과도한 강조, 고정된 사고 절차 지시를 줄이라고 권한다.
🧩 배경과 문제 정의
영상은 강력한 Claude 모델을 사용해 복잡한 업무를 처리할 때 토큰과 비용이 빠르게 소진되는 문제에서 출발한다. 발표자 Ben은 고객 지원 통화 자료를 분석하는 보고서 작업에서 67개의 하위 에이전트가 실행됐고, 비용이 약 350달러에 달했다고 소개한다.
문제의 원인은 하위 작업에도 비싼 모델이 사용되는 구성, 시작부터 쌓이는 도구 설명, 반복 수정, 불필요하게 길어진 대화로 제시된다. 해결 방향은 작업별 모델 배분과 문맥 관리다. 다만 영상에서는 금액, 토큰 사용량, 문맥 한도, 사용 한도가 함께 언급되므로 각각의 효과를 구분해 읽어야 한다.
🕒 시간순 섹션별 상세정리
1. 토큰 한도 문제와 절감 약속
- 발표자는 강력한 모델이 토큰을 빠르게 소모한다며, 프롬프트에 추가할 한 가지 지시와 다섯 가지 추가 습관을 소개하겠다고 예고한다. 최대 90% 비용 절감과 품질 유지도 주장한다. [00:19]
- 자신을 세 차례 창업한 경험이 있고 AI 에이전시와 전문가·사업자 커뮤니티를 운영하는 Ben으로 보여준다. [00:32]
2. 67개 하위 에이전트가 만든 비용
- 최근 두 달간 고객 지원 통화를 바탕으로 고객 분석 보고서를 만들도록 요청하자 67개의 하위 에이전트가 실행됐다고 보여준다. 결과에는 제품 로드맵과 고객 프로필, 주요 문제가 포함됐다. [01:15]
- 하위 에이전트도 기본적으로 비싼 모델을 사용했다고 말하며, 전체 토큰의 약 80%가 하위 에이전트에서 발생했을 것으로 추정한다. 보고서 비용은 약 350달러였다고 드러낸다. [01:43]
- 하위 에이전트에 다른 모델을 쓰도록 지시한 뒤 거의 같은 보고서를 44달러에 얻었다고 주장한다. [02:23]
3. 지휘 모델과 자료 처리 모델의 역할 분담
- 주 모델이 모든 원문을 직접 읽으면 문맥 한도에 도달하거나, 최종 분석 전에 많은 문맥을 소모할 수 있다고 보여준다. 긴 문맥에서 성능이 떨어지는 구간에는 임의적인 명칭을 붙인다. [03:22]
- 하위 에이전트가 자료를 읽고 요약을 반환하면 주 모델은 그 요약을 바탕으로 분석과 보고서 작성에 집중할 수 있다는 논리다. [03:51]
- 자료 읽기와 조사에 하위 에이전트를 사용하고, 그 에이전트의 모델까지 명시하는 지시를 제안한다. 모델명은 전사에서 일관되지 않지만 역할을 나누라는 취지는 분명하다. [04:51]
4. 새 대화의 초기 문맥 점검
- 두 번째 팁으로 깨끗한 문맥에서 시작하기를 제시한 뒤, 강좌·기술 지원·스킬 자료를 제공하는 자신의 커뮤니티를 홍보한다. [05:43]
- 자신의 환경에서는 첫 요청 전부터 8만 4천 토큰을 사용한다고 드러낸다. 코드 탭의
/context로 확인할 수 있지만 Cowork에서는 작동하지 않는다고 보여준다. [06:08] - 시스템 관련 항목 외에도 MCP 도구, 커넥터 정보, 스킬 설명이 문맥을 차지하므로 사용하지 않는 항목을 비활성화하라고 권한다. [07:12]
5. 통합 커넥터와 작업 사전 설계
- Composio를 여러 소프트웨어 연결을 하나로 묶는 커넥터로 보여준다. 개별 커넥터를 모두 문맥에 올리는 부담을 줄일 수 있다는 설명이다. [07:41]
- 세 번째 팁은 작업과 프롬프트를 미리 설계하는 것이다. 짧은 요청 뒤 여러 번 수정하면 이전 대화를 반복해서 처리하게 된다고 주장한다. [08:34]
- 사전 설계로 첫 결과의 완성도를 높이면 수정 횟수와 추론 강도를 줄일 수 있다며, 대부분의 작업에 중간 추론 강도를 권한다. [09:01]
6. 첫 프롬프트에 담을 네 가지와 생각 정리 도구
- 전체 작업과 목표, 수행 의도, 제약, 완료 기준의 네 가지를 정리하라고 제안한다. 하위 에이전트 모델 지시는 제약에 넣고, 결과 예시로 종료 기준을 구체화할 수 있다고 보여준다. [10:16]
- 작업이 불명확할 때는 ‘interview me’ 스킬로 질문을 받고, 답변을 구조화된 프롬프트로 정리하는 방법을 보여준다. [10:49]
- 음성 전사 도구로 생각을 길게 말한 뒤 ‘prompt master’ 스킬로 정리하는 방법도 제안한다. 관련 스킬은 설명란의 무료 자료로 제공한다고 안내한다. [11:25]
7. 수정 단계에서는 추론 강도 조절
- 네 번째 팁은 대화 중 추론 강도를 바꾸는 것이다. 초안 이후 레이아웃 같은 작은 변경에는 낮은 추론 강도를 사용해 추론 토큰을 줄일 수 있다고 보여준다. [12:11]
- 특정 모델에서는 대화 도중 추론 강도를 바꿔도 캐시가 깨지지 않는 변화가 있었다고 주장한다. [12:35]
- 모델 자체를 바꾸면 이전 대화를 다시 읽는 비용이 생긴다고 설명하면서도, 이후 작업이 단순하면 비용이 낮은 모델로 전환하는 편이 유리할 수 있다고 덧붙인다. [12:52]
8. 작업별 대화 분리와 긴 세션 관리
- 다섯 번째 팁은 작업 하나에 대화 하나를 사용하는 것이다. 서로 다른 작업을 한 대화에서 처리하면 관련 없는 이전 기록까지 부담이 된다고 보여준다. [13:30]
- 같은 작업도 대화가 길어지면 새 세션으로 옮기는 방안을 고려하라고 권한다. 다만 전사에 제시된 토큰 기준은 수치가 불명확하다. [14:15]
/context,/compact, 자동 압축 기능을 소개하지만, 자신의 경험에서는 압축이 충분한 맥락을 보존하지 못하는 경우가 있다고 드러낸다. [14:48]
9. 다음 세션에 맥락을 넘기는 방법
- 발표자가 만든
/refresh스킬은 다음 세션의 목표를 질문한 뒤, 이전 대화에서 관련 맥락을 모아 긴 인계 프롬프트를 만든다고 보여준다. [15:09] - 이 프롬프트를 새 세션에 붙여 넣어 작업을 이어가는 방식이며, 해당 스킬도 무료 자료로 제공한다고 안내한다. [15:21]
10. 불필요한 지시 줄이기와 마무리
- 마지막 팁은 중복 검증 지시, 과도한 강조, 고정된 단계별 사고 절차 요구를 피하는 것이다. 발표자는 이런 지시가 추가 검증과 도구 호출을 유발할 수 있다고 보여준다. [16:08]
- 특정 절차 지시를 빼면 토큰 사용이 15% 줄고 정확도가 5% 높아졌다는 실험 결과를 인용하지만, 전사에는 실험 조건이 제시되지 않는다. [16:18]
- 강좌, 기술 지원, 스킬·플러그인 자료, 커뮤니티를 다시 홍보하고 효율적인 업무 활용을 다룬 다른 영상으로 안내하며 끝낸다. [16:44]
🧾 결론
- 영상은 하위 에이전트 모델 지정이라는 핵심 팁과 다섯 가지 추가 운영 습관을 제시한다. 공통 목표는 비싼 모델이 처리할 자료와 불필요한 반복을 줄이는 것이다.
- 하위 에이전트는 자료를 분산 처리하고 요약을 반환해 주 모델의 문맥 부담을 덜어주는 역할로 설명된다. 위임할 작업의 난도에 맞는 모델 선택이 중요하다.
- 비용 절감, 토큰 사용량 감소, 사용 한도 회피는 각각 확인해야 한다. 제시된 사례만으로 제목의 ‘다시는 한도에 걸리지 않는다’는 표현까지 보장할 수는 없다.
📈 투자·시사 포인트
- AI 업무 자동화의 비용을 평가할 때는 주 모델뿐 아니라 하위 에이전트의 수와 모델 구성도 살펴볼 필요가 있다. 영상의 비용 사례는 이 구성이 총비용에 영향을 줄 수 있음을 보여준다.
- 도구와 스킬을 많이 연결하는 운영 방식에는 초기 문맥 부담이라는 비용이 따를 수 있다. 발표자는 사용하지 않는 연결을 끄고, Composio 같은 통합 커넥터를 활용하는 방안을 소개한다.
- 업무 요구사항과 완료 기준을 미리 정리하는 습관은 AI 운영비 관리와 연결된다. 영상은 프롬프트 작성과 세션 관리도 비용 효율을 좌우하는 요소로 다룬다.
- 특정 기업의 실적이나 투자 수익을 판단할 자료는 제시되지 않는다. 이 영상에서 도출할 수 있는 시사점은 AI 활용 조직의 운영 효율에 한정된다.
⚠️ 불확실하거나 확인이 필요한 부분
- 전사에는 ‘Fable 5.1’, ‘set 5’, ‘Sonnet’, ‘Opus 5’ 등 모델명이 혼재한다. 실제 제품명·버전과 하위 에이전트 모델 지정 기능은 이 자료만으로 확정하기 어렵다.
- 약 350달러에서 44달러로 줄었다는 수치를 그대로 계산하면 절감률은 약 87%다. 발표자의 ‘80~85%’ 설명 및 도입부의 ‘최대 90%’ 주장과 구분해야 하며, 동일 품질 여부도 독립적인 평가가 제시되지 않는다.
- 100만 토큰 문맥 한도, 새 대화의 8만 4천 토큰 사용, 대화 중 추론 강도 변경 시 캐시 유지 등은 발표자가 설명한 사례와 동작이다. 적용 환경과 조건은 전사만으로 충분히 확인되지 않는다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 사용 중인 환경에서 하위 에이전트 생성 및 모델 지정이 가능한지 확인하고, 실제 선택된 모델과 사용량을 점검한다.
- 동일한 소규모 자료로 기존 구성과 하위 에이전트 모델을 바꾼 구성을 비교한다. 총비용과 함께 누락, 사실 오류, 최종 보고서의 유용성을 기록한다.
- 지원되는 환경에서
/context로 초기 문맥을 확인하고, 사용하지 않는 커넥터·MCP 도구·스킬·플러그인을 비활성화한다. - 첫 프롬프트에 작업과 목표, 의도, 제약, 완료 기준을 작성한다. 자료 읽기와 최종 판단 중 무엇을 위임할지도 명시한다.
❓ 열린 질문
- 비용이 낮은 하위 모델로 위임해도 품질을 유지할 수 있는 작업과, 주 모델의 직접 검토가 필요한 작업은 어떻게 구분할 것인가?
- 영상의 비용 절감 사례가 다른 데이터 규모와 작업 유형에서도 재현되는가?
- 대화를 압축하거나 새 세션으로 옮길 때 반드시 보존해야 할 맥락은 무엇이며, 누락 여부는 어떻게 확인할 것인가?