YouTubeTonbi''s AI Garage·2026년 9월 18일·0

Hermes Desktop Masterclass: 3. Plugins, Kanban, Bot Mode & Pets

Quick Summary

Hermes Desktop은 플러그인으로 기능을 확장하고, Kanban으로 역할별 작업을 연결하며, Bot Mode와 펫으로 프로필 대화와 작업 상태를 다루는 개인화된 에이전트 작업 공간이다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Hermes Desktop Masterclass: 3. Plugins, Kanban, Bot Mode & Pets 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Hermes Desktop Masterclass: 3. Plugins, Kanban, Bot Mode & Pets의 핵심 내용을 4단계로 요약한 인포그래픽
Hermes Desktop Masterclass: 3. Plugins, Kanban, Bot Mode & Pets 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Hermes Desktop은 플러그인으로 기능을 확장하고, Kanban으로 역할별 작업을 연결하며, Bot Mode와 펫으로 프로필 대화와 작업 상태를 다루는 개인화된 에이전트 작업 공간이다.

📌 핵심 요점

  1. 플러그인은 적용 범위를 구분해야 한다. Capabilities에서 관리하는 데스크톱 플러그인은 앱 전체에 적용되고, 에이전트 플러그인은 프로필별로 확인한다. RSS 기반 AI 뉴스 플러그인 제작 시연에서는 생성 후 갱신 버튼과 글자 크기를 수정했다.
  2. Kanban은 작업 분해와 의존성 관리를 연결한다. 큰 작업을 등록하면 에이전트가 하위 작업과 담당 프로필을 선택한다. 지식베이스 제작에서는 연구→작성→검증 순서로 실행됐으며, 카드 상태에 따라 후속 작업이 시작됐다. 활동 내역과 worker log로 진행 상황을 확인할 수 있다.
  3. 프로필은 역할별 실행 환경이자 Bot Mode의 대화 단위다. 프로필마다 모델·스킬·도구를 구성하고 설정을 복제할 수 있다. Bot Mode에서는 여러 백엔드의 프로필을 개별 세션이나 그룹 대화로 활용한다.
  4. 브라우저와 HUD는 화면을 작업 맥락으로 활용한다. 브라우저의 게시물 요약과 화면 주석, HUD의 슬라이드·차트 인식, 메모장 입력을 시연했다. 다른 앱 조작의 상당 부분에는 computer use 드라이버가 필요하며, 이미지·영상 분석 범위는 모델에 따라 달라질 수 있다.
  5. 펫과 메모리 그래프는 상태와 축적된 맥락을 시각화한다. 펫은 사용자 정의 이미지와 애니메이션으로 만들 수 있고 작업 중·완료 상태에 반응한다. 메모리 그래프에서는 프로필의 기억과 스킬 사이 연결 및 시간에 따른 변화를 확인한다.

🧩 배경과 문제 정의

  • Hermes Desktop을 설치하고 기본 작업을 수행하는 단계를 넘어, 플러그인과 프로필로 개인 작업에 맞는 환경을 구성하는 것이 핵심이다.
  • 여러 에이전트가 협업하려면 역할별 설정뿐 아니라 작업 분해, 선행 작업 의존성, 실행 상태와 결과물 관리가 필요하다.
  • 서로 다른 백엔드의 프로필을 연결하고, 브라우저와 다른 앱의 화면을 작업 맥락으로 활용하며, 기억과 스킬의 축적 과정을 확인하는 기능을 다룬다.

🕒 시간순 섹션별 상세정리

1. 데스크톱 플러그인과 에이전트 플러그인의 적용 범위

  • 플러그인 메뉴는 설정에서 Capabilities로 이동했다. 데스크톱 플러그인은 앱 전체에 적용되어 모든 프로필에서 같고, 에이전트 플러그인은 프로필별로 확인한다 [02:35]
  • 기본 제공 플러그인은 개별적으로 켜고 끌 수 있다. Bot Mode와 Kanban도 플러그인이며, 새로 추가된 라디오는 활성화하면 하단 상태 표시줄에 나타난다 [03:23]

2. AI 뉴스 플러그인 제작과 수정

  • 직접 만든 YouTube Planner는 영상 일정을 원하는 방식으로 관리하는 달력이다. 같은 방식으로 에이전트에 RSS 기반 최신 AI 뉴스, 갱신 버튼, 상태 표시줄에서 여는 팝오버와 뉴스 3~4개를 요구한다 [04:46]
  • 첫 결과에는 Google AI·Wired·Nvidia의 뉴스가 표시됐지만 갱신 버튼과 글자 크기는 추가 수정이 필요했다. 한 번에 완성되기보다는 결과를 확인하고 다듬는 과정이 따른다 [05:38]

3. Kanban의 작업 분해와 실행 설정

  • Kanban에서는 사용자가 카드마다 직접 실행을 지시하기보다, 큰 작업을 등록하면 에이전트가 하위 작업을 나누고 사용할 프로필을 선택한다. 예시는 Hermes Desktop 플러그인 지식베이스 제작이다 [07:05]
  • 작업에는 상세 설명, 담당 에이전트, 스킬과 모델을 지정할 수 있으며 대략적인 토큰 사용량도 확인한다. 시연 작업의 예상치는 약 3만 토큰으로 표시됐다 [07:34]

4. 역할별 프로필 배정과 실행 가시성

  • 첫 실행에는 wiki researcher 프로필이 선택됐다. 사용자가 직접 지정하지 않았으며, 프로필의 이름과 설명을 바탕으로 선택됐다 [08:32]
  • 작업 카드를 열면 작업 공간, 설명, 활동 내역과 worker log를 확인할 수 있어 실제 진행 상황을 추적할 수 있다 [08:56]

5. 선행 작업 의존성과 지식베이스 결과물

  • 연구가 끝나면 작성자가 작업하고, 작성이 끝나면 검증자가 실행된다. 검증 카드는 작성 카드에 의해 대기하다가 의존성이 해소되면 ready 상태로 전환되고 worker가 가져간다 [10:09]
  • 사용자가 작성 완료를 검증자에게 따로 알릴 필요 없이 카드 상태에 따라 후속 작업이 시작된다. 하위 작업이 모두 끝나면 기본 프로필의 상위 카드가 전체 완료 여부를 확인한다 [11:31]

6. 프로필 관리와 전문화된 에이전트의 가능성

  • 프로필 선택기에서 로컬 게이트웨이와 SSH로 연결한 프로필을 전환할 수 있다. 빠른 전환을 위해 유지되는 warm 프로필 수는 설정 가능하며, 기본값은 세 개로 기억한다고 보여준다 [13:09]
  • 프로필 관리에서는 이름 변경·삭제·추가와 다른 프로필의 설정·스킬 복제가 가능하다. 프로젝트 목록도 게이트웨이와 프로필을 기준으로 정리할 수 있다 [13:47]

7. Bot Mode의 프로필별 대화와 설정

  • Bot Mode에서 봇은 프로필과 같은 의미이며, 플러그인으로 제공되는 Bots 탭에서 여러 백엔드의 프로필을 볼 수 있다. 각 프로필을 하나의 세션으로 다루는 인터페이스다 [15:10]
  • 봇 편집에서는 아바타를 생성하거나 이미지를 업로드하고 펫을 사용할 수 있다. 고급 설정에서는 모델, 스킬, 도구 세트와 MD 파일 등 프로필의 기능 구성을 조정한다 [16:08]

8. 서로 다른 백엔드의 그룹 대화와 원격 화면 기능의 상태

  • 여러 프로필을 그룹 대화에 넣으면 개인 컴퓨터, Spark, 오래된 노트북처럼 서로 다른 백엔드에서도 메시지를 공유하며 소통할 수 있다. 환경에 따라 약간의 지연이 생길 수 있다 [16:38]
  • 그룹 대화는 특정 프로젝트에서 여러 에이전트를 함께 활용하는 방법이다. 별도로 예고된 원격 게이트웨이 화면 보기·제어 기능은 당시 테스트 중이며 아직 출시되지 않았다 [17:15]

9. 내장 브라우저의 화면 이해와 주석 표시

  • 내장 브라우저는 사용자와 에이전트가 함께 볼 수 있다. 에이전트가 Google과 YouTube를 열고 현재 브라우저에 표시된 영상이 무엇인지 답하는 동작을 시연한다 [17:54]
  • 브라우저에서 연 X 게시물의 요약도 요청할 수 있으며, 시연에서는 직접 만든 도구를 소개하는 게시물이 요약됐다 [18:37]

10. HUD 모드의 화면 인식과 차트 분석

  • 우측 상단 버튼이나 Ctrl+Shift+H로 HUD 모드를 열면 앱이 작은 창으로 전환된다. 창을 확장하거나 모델을 바꿀 수 있고, 아래에 있는 화면 내용을 인식한다 [19:32]
  • HUD 아래의 Chrome 프레젠테이션 슬라이드를 읽고, 화면이 바뀌면 Nvidia 주가의 4시간 차트도 인식한다 [20:46]

11. HUD를 통한 다른 앱 조작과 필요한 조건

  • HUD 아래에 메모장을 두고 앞서 작성한 Nvidia 주가 분석을 입력하도록 요청하면, 에이전트가 실제로 메모장에 내용을 작성한다 [22:03]
  • HUD는 화면 읽기뿐 아니라 다른 앱 조작에도 활용된다. 다만 이러한 조작의 상당 부분은 computer use를 이용하므로 관련 드라이버가 컴퓨터에 설치돼 있어야 한다 [22:36]

12. 펫 선택과 사용자 정의 생성 경로

  • 펫은 설정의 Appearance 하단에서 선택하며, 필요한 경우 설치한 뒤 활성화된다. 주로 재미를 위한 요소지만 작업 상태를 표현하는 기능도 갖는다 [23:01]
  • 공개 갤러리 petdex.dev에서는 다양한 애니메이션 동반자를 고를 수 있다. 직접 만들 때는 설명과 선택적인 참조 이미지를 넣고, 후보 선택·애니메이션 생성·입양 단계를 거친다 [23:38]

13. 참조 이미지로 펫 후보와 애니메이션 만들기

  • 시연에서는 배경 없는 정면 캐릭터 이미지를 첨부하고, 금발에 파란 후디를 입은 마커 스타일 캐릭터를 요청한다. 배경 제거가 생성에 도움이 되리라는 기대는 제시하지만 확정적인 조건으로 설명하지는 않는다 [25:00]
  • 생성된 후보 중 일부는 의도에 맞았지만 고양이 모습으로 나온 후보도 있었다. 원하는 캐릭터와 가까운 후보를 선택해 hatch를 실행한다 [25:30]

14. 펫의 배치·이동과 작업 상태 반응

  • 입양한 펫은 드래그로 위치를 옮기고 Appearance 설정에서 크기를 조절할 수 있다. Roam 옵션을 켜면 대기 중 창 안을 돌아다니도록 설정된다 [26:19]
  • 프로젝트의 다음 단계를 묻자 응답 생성 중에는 동작 애니메이션이 나타났고, 답변이 끝나자 점프한 뒤 화면을 달렸다. 펫의 움직임이 작업 완료를 알리는 시각적 신호로도 쓰인다 [27:02]

15. 메모리 그래프로 보는 기억·스킬의 연결과 변화

  • Ctrl+K에서 memory graph를 열면 프로필에 축적된 기억과 스킬을 시각화한다. 시연의 프로필은 특정 프로젝트용으로 비교적 최근에 만들어져 표시되는 항목이 많지 않았다 [27:48]
  • 스킬과 기억 사이의 연결을 확인할 수 있다. 예를 들어 계정 설정을 단계별로 안내받고 싶다는 사용자 선호 기억이 계정 온보딩 스킬과 연결돼 있다 [28:25]

16. 자동화와 코딩 작업 공간으로 확장되는 활용 범위

  • Hermes Desktop은 단순한 채팅 창이 아니라 자동화와 에이전트 워크플로를 설정하고 코딩 작업도 수행할 수 있는 앱이다 [30:18]
  • 코딩 작업 공간으로 유용하다는 평가는 실제로 복잡한 코드베이스에서 사용한 경험에 기반한다 [30:24]

17. 강의 종료와 의견·질문 요청

  • 마스터클래스는 여기서 마무리되며, 시청자의 의견과 궁금한 점을 댓글로 요청한다 [30:32]
  • 다음 영상에서 다시 만난다는 인사로 끝나며, 후속 영상의 구체적인 주제는 제시되지 않는다 [30:34]

🧾 결론

  • 개인화의 출발점은 필요한 플러그인을 선택하고, 업무별 프로필에 이름·설명·스킬·도구를 구성하는 것이다.
  • 협업 자동화의 핵심은 작업을 나누는 기능뿐 아니라 선행 작업 의존성, 실행 로그, 결과물 저장 위치를 함께 관리하는 데 있다.
  • 플러그인 생성과 화면 분석은 결과를 확인하고 수정하는 과정까지 포함해야 한다. 시연에서도 초기 플러그인에 추가 수정이 필요했다.
  • Hermes Desktop은 채팅 외에 자동화와 코딩 작업을 수행하는 공간으로 소개되지만, 복잡한 코드베이스에서의 유용성 평가는 발표자의 사용 경험에 근거한다.

📈 투자·시사 포인트

  • 모델 비용과 업무 적합성을 함께 평가할 필요가 있다. 전문화된 프로필의 저렴한 모델이 비싼 모델보다 좋은 결과를 낼 수 있다는 설명은 발표자의 가설이며, 비교 검증 결과는 제시되지 않았다.
  • 플러그인 SDK와 카탈로그는 개인에게 필요한 기능을 추가하는 경로다. 다만 영상 당시 카탈로그 항목이 적어 생태계 규모나 성장성을 판단할 근거는 제한적이다.
  • 자동화 도입을 검토할 때는 작업 완료 여부뿐 아니라 로그 확인, 결과물 검증, 토큰 사용량을 함께 살펴볼 수 있다. 시연의 약 3만 토큰은 특정 작업의 예상치다.
  • Nvidia 주가 차트 시연은 화면 인식과 분석 응답 기능을 보여준다. 제공된 자료에는 매매 성과나 분석 정확도를 검증한 결과가 없다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 원격 게이트웨이 화면 보기·제어는 영상 당시 테스트 중인 미출시 기능이었다. 현재 이용 가능 여부는 이 자료만으로 확인할 수 없다.
  • 전문화된 저렴한 모델의 성능 우위는 개인적 가설이다. 작업별 품질·비용·실행 시간을 비교한 근거가 제시되지 않았다.
  • Hugging Face 모델 목록의 DGX Spark 적합성 주석과 주가 차트 분석에는 개별 판정의 정확성 검증이 제시되지 않았다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • Capabilities에서 필요한 플러그인을 확인하고 앱 전체 적용 항목과 프로필별 적용 항목을 구분한다.
  • 연구·작성·검증처럼 역할이 분명한 프로필을 만들고 이름·설명·스킬·도구 구성을 점검한다.
  • 작은 지식베이스 제작 작업을 Kanban에 등록해 작업 분해, 담당 프로필 선택, 의존성에 따른 실행 순서를 확인한다.
  • 작업 공간을 지정하고 worker log, 첨부파일, 출처 참조를 확인해 결과물의 위치와 내용을 검증한다.

❓ 열린 질문

  • 프로필의 이름과 설명이 비슷하거나 역할이 겹칠 때 Kanban은 담당 에이전트를 얼마나 일관되게 선택하는가?
  • 선행 작업이 실패하거나 검증에서 수정이 요구되면 의존 작업과 상위 카드의 상태는 어떻게 처리되는가?
  • 전문화된 프로필이 저렴한 모델의 성능을 개선하는 효과는 어떤 업무에서 얼마나 나타나는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.