Hermes Agent - Full Tutorial & Setup Guide (For Beginners)
Quick Summary
Hermes Agent는 독립 서버에 모델·메시징·메모리·스킬·예약 작업을 연결해 초보자도 약 30분 만에 구축할 수 있는 상시 실행형 개인 AI 에이전트다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Hermes Agent는 독립 서버에 모델·메시징·메모리·스킬·예약 작업을 연결해 초보자도 약 30분 만에 구축할 수 있는 상시 실행형 개인 AI 에이전트다.
📌 핵심 요점
- Hermes Agent의 차별점은 질문에 답하는 챗봇을 넘어 24시간 실행되면서 먼저 알림을 보내고, 사용자 선호를 기억하며, 반복 절차를 재사용 가능한 스킬로 학습하는 데 있다.
- 노트북 대신 월 약 6달러의 독립 서버를 사용하면 절전으로 인한 작업 중단을 피할 수 있고, 프롬프트 인젝션이나 도구 오용의 피해 범위도 개인 파일이 아닌 임대한 장비로 제한할 수 있다.
- 초기 구성은 Hostinger 원클릭 배포, OpenRouter API 키와 추론 모델 등록, Telegram 게이트웨이 연결 순서로 진행된다. 저장·재시작 후 메시지 응답까지 확인해야 실제 연결이 완료된 것이다.
- 브라우저·Telegram·데스크톱 앱은 동일한 서버 에이전트에 접속하므로 세션과 기억을 공유한다. 데스크톱 설치 때 새 로컬 에이전트를 만들지 않고 Remote Gateway로 기존 서버에 연결하는 것이 핵심이다.
- 실질적인 자동화는 웹 검색·파일 처리·코드 실행·병렬 하위 에이전트·예약 작업을 조합해 구현한다. 위험 작업에는 사용자 승인을 두고, 저렴한 모델과 지출 한도·로그·재시작·Hermes doctor를 함께 활용해 비용과 장애를 관리한다.
🧩 배경과 문제 정의
- 일반 챗봇은 사용자가 대화를 시작해야 하고 세션을 넘나드는 기억이나 자율 실행 능력이 제한되지만, Hermes Agent는 상시 실행·지속 기억·절차 학습을 결합한다.
- 노트북에서 직접 실행하면 절전 중 작업이 멈추고 개인 파일이 에이전트의 작업 범위에 포함되므로, 월 약 6달러의 독립 서버가 자동화의 지속성과 격리된 실행 환경을 확보한다.
- 초보자도 서버, AI 모델, Telegram, 데스크톱 앱, 메모리, 스킬, 예약 작업을 연결해 약 30분 안에 자율적으로 작동하는 개인 에이전트를 구성할 수 있다.
🕒 시간순 섹션별 상세정리
1. 상시 실행형 AI 에이전트의 목표
- 서버에서 24시간 작동하며 가치 있는 정보를 발견하면 Telegram으로 먼저 알리고, 작업 과정에서 새로운 스킬을 학습하는 에이전트가 최종 목표다. [01:25]
- Hermes Agent는 Nous Research가 MIT 라이선스로 공개한 무료 오픈소스 소프트웨어이며, 사용자는 AI 모델 이용료와 실행 서버 비용만 부담한다. [01:40]
2. 서버 실행이 필요한 이유와 보안 경계
- 데스크톱 앱은 빠르게 체험하기 좋지만 노트북이 잠들면 모든 작업이 중단되므로, 새벽에도 실행해야 하는 감시·알림 자동화에는 독립 서버가 필요하다. [02:14]
- 웹 페이지의 프롬프트 인젝션이 파일 작성·코드 실행·브라우징 기능을 악용할 수 있으며, 별도 서버는 피해 범위를 개인 문서가 아닌 임대한 장비 하나로 격리한다. [03:31]
3. Hostinger 서버 요금제와 불필요한 옵션 제거
- Hostinger의 원클릭 템플릿은 Hermes 설치를 자동화하며, KVM 1 요금제는 에이전트 한 대를 무리 없이 운영하고 웹 탐색이 많아질 때만 상위 요금제로 확장하면 된다. [04:04]
- 장기 결제는 월 단가를 낮추지만 선결제액을 키우며, 미리 선택된 별도 AI 서비스 크레딧은 OpenRouter와 중복되므로 해제해야 약 12달러의 불필요한 비용을 피할 수 있다. [05:15]
4. Hermes 배포와 온보딩 오류 복구
- 결제 후 배포 화면에서 사용자명 Hermes와 관리자 비밀번호를 안전하게 저장하고, 필요 없는 유료 서비스 필드는 비운 채 배포하면 컨테이너가 생성된다. [05:53]
- 온보딩 화면이 나타나지 않으면 VPS의 Docker Manager에서 Compose, One-click deploy, Hermes Agent 순서로 진입해 같은 배포 양식을 수동으로 실행할 수 있다. [07:29]
5. 웹 대시보드의 구성과 초기 미완성 상태
- 웹 대시보드는 명령어 없이 로그인할 수 있으며, Sessions는 모든 기기의 대화와 공유 메모리, Models는 추론 모델, Cron은 예약 작업, Skills는 학습한 절차를 관리한다. [08:06]
- 설치 직후에는 모델 제공자가 없어 채팅이 응답하지 못하고, 외부 채널을 담당하는 게이트웨이도 활성 세션이 0개이므로 모델과 메시징 채널을 추가해야 한다. [09:14]
6. OpenRouter 연결과 추론 모델 선택
- OpenRouter 계정 하나로 여러 회사의 AI 모델을 사용량 기반으로 이용하며, API 키는 계정 비용을 사용할 수 있는 비밀번호이므로 비밀번호 관리자에 보관해야 한다. [09:40]
- 테스트 크레딧은 5달러로도 수주간 사용할 수 있고, API 키에 주간 10달러 같은 지출 한도를 설정하면 예상하지 못한 사용량 증가를 제한할 수 있다. [10:56]
7. Telegram 봇 생성과 게이트웨이 연결
- Telegram은 약 3분간 유효한 QR 코드로 빠르게 연결할 수 있으며, Discord·Slack·WhatsApp·이메일을 포함한 20개 이상의 지원 채널 중 첫 채널로 구성하기 쉽다. [13:48]
- 휴대전화로 QR 코드를 스캔하고 봇 이름을 지정하면 Telegram 봇이 생성되며, 별도의 BotFather 명령이나 토큰 복사 과정 없이 계정 연결이 끝난다. [14:31]
8. 홈 채널·허용 목록·기기 간 기억 공유
- Telegram을 홈 채널로 지정하면 예약 작업 결과와 부재중 알림이 해당 대화로 전달되어, 에이전트가 사용자의 입력 없이도 먼저 연락할 수 있다. [15:35]
- QR 연결을 완료한 Telegram 계정만 허용 목록에 들어가며, 봇을 우연히 발견한 다른 사용자는 응답을 받지 못해 모델과 서버 자원을 사용할 수 없다. [16:01]
9. 도구 기반 작업과 위험 작업 승인
- Hermes는 웹 검색, 브라우저 조작, 파일 처리, 코드 실행, 이미지 생성, 음성, 예약 작업과 병렬 하위 에이전트를 결합해 채팅 응답을 넘어 실제 작업을 수행한다. [16:40]
- 스탠딩 데스크 세 제품을 조사하는 요청에서는 웹을 직접 검색하고 페이지를 읽은 뒤 링크 모음이 아닌 비교 결과를 만들어, 조사 과정과 결과 합성을 한 흐름으로 처리한다. [17:34]
10. 데스크톱 앱 설치와 중복 에이전트 방지
- 브라우저 대시보드 대신 데스크톱 앱을 사용하면 작업 중인 화면 위에서 단축키로 에이전트를 호출하고 음성 입력과 응답 낭독 기능도 이용할 수 있다. [18:23]
- 설치 과정은 사전 요구사항, Python 환경, 게이트웨이 서비스와 앱 빌드를 포함한 11단계를 자동으로 수행하며 완료 후 Hermes 앱을 실행한다. [19:40]
11. 원격 게이트웨이 연결과 HUD 활용
- 데스크톱 설정에서 Remote Gateway를 선택하고 브라우저 대시보드 주소의 엔드포인트 이전 부분을 입력하면, 서버의 사용자명과 비밀번호로 인증할 수 있다. [20:15]
- 저장 후 재연결하면 Telegram 대화를 포함한 서버 세션과 DeepSeek 모델이 앱에 나타나며, 과거 첫 메시지를 묻는 테스트로 동일한 기억을 사용하는지 확인할 수 있다. [21:14]
12. 대화를 넘어 유지되는 사용자 선호
- 기본 글쓰기 결과에는 굵은 제목, 목록, 추가 수정 제안이 포함돼 사용자가 원하는 짧고 직접적인 문체와 차이가 생긴다. [22:43]
- 짧은 문장, 최대 세 문단, 제목과 목록 금지라는 교정을 평문으로 전달하고 선호로 저장하면 시스템 프롬프트를 직접 편집하지 않아도 메모리가 갱신된다. [23:24]
13. 메모리·스킬·서버 소유권
- Capabilities 화면은 도구, MCP, 스킬을 한곳에 모으며, 반복 작업에서 새 절차를 익히면 learned 표시가 붙은 재사용 가능 스킬이 추가된다. [24:42]
- 메모리, 스킬, 정체성과 행동 방식을 담은 soul.md는 외부 서비스 계정이 아니라 사용자의 서버에 남고, 각 파일을 평문으로 열어 실제 동작을 확인할 수 있다. [25:00]
14. 감시 스킬과 예약 작업의 자율 생성
- AI 생산성 동향 감시 요청 하나에 재사용 가능한 검색 스킬, 중복 방지 기록, 몇 시간 간격의 일정, 새 정보가 있을 때만 보내는 알림 조건을 함께 지정할 수 있다. [26:39]
- 에이전트는 필요한 의존성을 설치하고 YouTube를 검색한 뒤 스킬과 4시간 주기의 예약 작업을 만들며, 작업 화면에서 실행 간격·다음 실행 시각·프롬프트를 확인하거나 수동 실행할 수 있다. [27:08]
15. 실제 사용 비용과 모델 운용 전략
- 영상 제작 과정의 105개 요청은 약 400만 토큰을 사용했지만 총비용은 13센트였으며, 매 요청마다 지침·메모리·도구 목록·대화 기록을 다시 보내는 컨텍스트가 토큰 대부분을 차지한다. [28:16]
- 반복 컨텍스트의 약 75%가 제공자 캐시에서 저렴하게 처리되어 5달러로 약 4,000개 메시지를 사용할 수 있고, 별도 캐시 설정도 필요하지 않다. [28:58]
16. 모델 전환과 단계별 장애 복구
- Telegram에서는
/model명령으로 제공자와 모델을 선택할 수 있으며, 전용 버튼이 없는 인터페이스에서도 슬래시 명령으로 같은 전환 작업을 수행할 수 있다. [30:06] - 대시보드 로그에서 오류·경고·정보·디버그 메시지를 심각도별로 필터링하면 봇의 응답 중단 원인을 빠르게 좁힐 수 있고, 첫 복구 수단은 게이트웨이 재시작이다. [30:51]
17. 하위 에이전트 확장과 독립 환경 구성
- 복합 작업을 여러 하위 에이전트에 분배하면 각 작업이 병렬로 진행되고, 주 에이전트가 결과를 하나의 최종 보고서로 통합해 대기 시간을 줄인다. [32:10]
- Discord·Slack·WhatsApp·이메일 등으로 메시징 채널을 확장할 수 있고, 데스크톱 프로필을 추가하면 업무용과 개인용 에이전트를 서로 독립된 환경으로 운영할 수 있다. [33:00]
🧾 결론
- Hermes Agent의 핵심 가치는 하나의 모델 성능보다 상시 실행, 지속 기억, 절차 학습, 능동 알림을 하나의 개인 실행 환경으로 결합하는 데 있다.
- 독립 서버는 단순한 호스팅 수단이 아니라 자동화의 연속성과 개인 기기로부터의 보안 격리를 동시에 확보하는 운영 경계다.
- 첫 구축에서는 서버 배포 자체보다 모델 제공자, Telegram 홈 채널, 허용 목록, 원격 게이트웨이, 예약 작업이 실제로 이어지는지 단계별로 검증중요하다.
- 반복 업무를 스킬과 일정으로 전환하고 새 정보가 있을 때만 알리도록 설계해야 에이전트가 단순 대화 도구를 넘어 지속적으로 가치를 만드는 자동화 시스템이 된다.
📈 투자·시사 포인트
- 무료 오픈소스 에이전트 위에 서버와 사용량 기반 모델을 결합하는 구조는 소프트웨어 구매보다 저비용 인프라·추론 소비가 중심이 되는 개인 AI 시장의 가능성을 보여준다.
- 여러 모델을 한 계정에서 선택하고 일상 작업과 중요 작업에 서로 다른 모델을 배치하는 운용 방식은 모델 단독 경쟁보다 라우팅·비용 통제·도구 통합 계층의 중요성을 높인다.
- Telegram을 비롯한 메시징 채널이 에이전트의 능동 알림 인터페이스가 되면서, 기존 메신저가 개인 자동화 서비스의 배포 채널로 확장될 수 있다.
- 메모리와 스킬이 사용자의 서버에 평문 파일로 남는 구조는 데이터 소유권과 이동성을 중시하는 사용자에게 폐쇄형 클라우드 에이전트와 다른 선택지를 제공한다.
⚠️ 불확실하거나 확인이 필요한 부분
- 월 약 6달러의 서버 비용과 5달러로 약 4,000개 메시지를 사용할 수 있다는 수치는 제시된 요금제·모델·캐시 적중률·작업 복잡도에 따른 사례이므로 실제 비용은 달라질 수 있다.
- 별도 서버는 피해 범위를 격리하지만 프롬프트 인젝션 자체를 제거하지는 않는다. 파일 작성, 코드 실행, 브라우징, 패키지 설치 권한의 범위와 승인 정책을 별도로 점검해야 한다.
- DeepSeek V4 Flash의 도구 사용 적합성과 가격 경쟁력은 영상에서 제시된 선택이며, 실제 배포 시점의 OpenRouter 제공 여부와 모델별 성능·가격을 다시 확인해야 한다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 독립 서버를 배포하고 관리자 비밀번호를 비밀번호 관리자에 저장한 뒤, 중복되는 유료 AI 서비스 옵션을 제거한다.
- OpenRouter API 키에 주간 지출 한도를 설정하고 Hermes에 모델을 등록한 뒤 새 채팅에서 응답을 검증한다.
- Telegram을 연결하고 저장 및 게이트웨이 재시작을 수행한 다음, running 상태와 실제 메시지 응답을 확인한다.
- Telegram 홈 채널과 허용 목록을 확인해 예약 작업 결과가 올바른 계정으로만 전달되는지 시험한다.
❓ 열린 질문
- 어떤 주간 반복 업무가 검색 스킬, 중복 방지 기록, 예약 작업, Telegram 알림의 조합으로 전환했을 때 가장 큰 시간을 절약할 수 있는가?
- 위험 작업의 사용자 승인 범위를 어디까지 넓혀야 자율성과 안전성 사이에서 적절한 균형을 만들 수 있는가?
- 일상용 저비용 모델과 중요 작업용 고성능 모델을 나누는 기준을 작업 유형·실패 비용·예산에 따라 어떻게 정할 것인가?