LIVE: Building Agent OS with Qwen 3.8 Max!
Quick Summary
Qwen 3.8 Max로 구축하는 Agent OS의 핵심은 특정 모델의 승패가 아니라, 공통 메모리와 작업 체계를 유지하면서 과제별로 가장 적합한 모델을 교체해 쓰는 데 있다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 결론
Qwen 3.8 Max로 구축하는 Agent OS의 핵심은 특정 모델의 승패가 아니라, 공통 메모리와 작업 체계를 유지하면서 과제별로 가장 적합한 모델을 교체해 쓰는 데 있다.
📌 핵심 요점
- Agent OS는 여러 AI 에이전트가 공통 메모리를 사용하도록 구성해, Qwen·Claude·Kimi·Hermes 등 실행 모델을 바꾸더라도 기존 맥락과 자동화 흐름을 이어가는 방식을 지향한다.
- 영상 속 실전 비교에서는 Qwen 3.8 Max가 여러 게임·웹 개발 과제에서 시각적 완성도와 조작감에 강점을 보였지만, 비행 시뮬레이터와 대규모 개발에서는 Fable 5가 더 안정적이거나 일관적인 결과를 냈다.
- 모델의 벤치마크 순위보다 실제 구축 결과가 중요하며, 요구사항을 자연어로 설명하고 결과를 직접 테스트한 뒤 반복 수정하는 과정이 앱과 Agent OS 개발의 공통 성공 조건으로 제시된다.
- 무료 접근성과 이미지·영상 생성까지 포함한 멀티모달 기능은 Qwen의 장점으로 소개되지만, 본격적인 개발에서는 전용 코딩 하네스와 기존 시스템 통합 수준이 모델 자체 성능만큼 중요한 선택 기준이 된다.
- Hermes의
/learn, 음성 대화, 실시간 조향, 샌드박스 미리보기, A2A 기반 다중 에이전트 기능은 Agent OS를 단순한 코딩 도구가 아니라 학습·실행·검증·협업을 묶는 운영 계층으로 확장하려는 방향을 보여준다.
🧩 배경과 문제 정의
- 새로운 AI 모델이 등장할 때마다 이를 기존 작업 흐름에 어떻게 연결하고, 필요에 따라 무엇을 교체할지 판단하는 것이 Agent OS 운영의 핵심 과제다.
- 초보자에게는 CLI와 데스크톱 앱 중 어떤 방식을 선택할지, 특정 서비스 구독 없이도 시스템을 구축할 수 있을지가 주요 진입 장벽이다.
- 회사용 앱 개발과 기존 AI 환경의 이전 모두 자연어로 요구사항을 명확히 정의하고, 실제 테스트와 반복 개선을 거치는 과정이 성공 여부를 좌우한다.
🕒 시간순 섹션별 상세정리
1. Qwen 코딩과 Hermes 신규 릴리스
- Qwen을 실제 개발 작업에 연결하는 코딩 실습으로 방송을 시작한다. [00:24]
- 신규 Hermes 업데이트와 Herald 릴리스도 함께 다룰 예정이라고 예고한다. [00:37]
2. 데스크톱 앱보다 CLI를 선호하는 이유
- Agent OS는 데스크톱 앱 대신 CLI를 중심으로 여러 AI 코딩 도구를 연결한다. [03:51]
- 무료 CLI를 활용하면 기존 구독을 재사용하면서 추가 비용을 줄일 수 있다. [03:54]
3. 공통 메모리와 교체 가능한 AI 모델
- Agent OS Q&A를 통해 시스템의 구축·사용·최적화 방법을 보여준다. [05:51]
- 모든 AI 에이전트가 공통 메모리를 사용하므로 모델을 바꿔도 작업 맥락이 유지된다. [05:59]
4. 커뮤니티 지식을 모으는 주간 다이제스트
- Gemini Spark 기반 주간 다이제스트가 최근 커뮤니티 논의와 주요 주제를 정리한다. [07:14]
- 커뮤니티 활동이 늘면서 핵심 흐름을 놓치지 않도록 요약하는 기능의 필요성도 커졌다. [07:20]
5. 초보자를 위한 AI 앱 개발 3단계
- 초보자도 Claude Code나 Replit에 회사용 앱의 기능을 자연어로 설명하며 개발을 시작할 수 있다. [09:13]
- 요구사항 설명, 결과 테스트, 반복 수정의 세 단계를 거쳐 생성된 결과를 개선한다. [09:24]
6. Claude 구독 없이 Kimi로 Agent OS 이전
- Abacus에서 Kimi로 이전할 때 Claude 구독 없이 Kimi Code만으로 Agent OS를 설정할 수 있다. [11:26]
- Kimi Work는 Claude Code나 Codex와 비슷한 데스크톱 앱으로, CLI가 어려운 사용자에게 적합하다. [11:37]
7. ZIP 파일을 이용한 Agent OS 설치
- 강의실에서 매일 갱신되는 Agent OS ZIP 파일을 내려받는다. [12:16]
- 해당 ZIP 파일을 Kimi에 첨부한 뒤 설치를 요청하면 기본 설정을 진행할 수 있다. [12:39]
8. 이메일 인증과 아웃리치 도메인 분리
- 이메일 전달률 설정은 SEO 링크 빌딩 아웃리치 현장에서 장기간 시험한 경험을 바탕으로 한다. [13:46]
- 발송 계정에 DKIM과 DMARC를 설정하고, 필요하면 AI 에이전트의 도움을 받는다. [13:57]
9. 계정 워밍업과 발송 품질 관리
- 전달률 문제가 생길 때 교체할 별도 주소를 마련하고, 발송량은 천천히 늘린다. [15:12]
- Lemwarm 같은 도구를 사용하면 신규 발송 계정의 워밍업을 자동화할 수 있다. [15:14]
10. 하루 한 편으로 시작하는 AI 콘텐츠 마케팅
- AI 콘텐츠 마케팅은 하루 한 편씩 만들며 실전 제작 경험을 쌓는 방식으로 시작한다. [16:48]
- 첫 달의 조회수가 낮더라도 제작을 지속하면 역량과 조회수가 점진적으로 축적된다. [17:19]
11. Agent OS 학습 경로와 Unreal Engine 연동
- 과정의 1시간 가이드와 매일 갱신되는 ZIP 파일을 활용해 최신 Agent OS를 학습하고 설치한다. [19:09]
- Unreal Engine과 Hermes Agent를 연결하면 3D 그래픽과 엔진 작업을 자동화할 수 있다. [20:02]
12. 웹 가이드를 재사용 가능한 스킬로 변환
- Hermes Agent OS에서
/learn과 웹 가이드 링크를 입력하면 스킬 변환이 시작된다. [21:02] - 웹페이지 내용을 분석한 뒤, 이후 작업에서 반복 사용할 수 있는 스킬로 저장한다. [21:24]
13. Hermes의 스킬 학습력과 Agent OS 수정 방식
- 새 작업을 에이전트에게 가르치는 측면에서 Hermes는 특히 완성도 높은 선택지로 평가된다. [24:00]
- Hermes MCP·오픈코드·Tailscale 같은 구성도 원하는 결과를 자연어로 설명해 구축할 수 있다. [24:23]
14. 다중 모델 구성과 단일 모델 선택 기준
- 제조업용 Agent OS 역시 Claude·Hermes·Antigravity·Codex·Kimi·Qwen을 작업별로 조합하는 방식이 적합하다. [25:20]
- 모델을 하나만 선택한다면 신뢰성과 속도가 뛰어난 Claude CLI와 Fable 5 조합을 우선 추천한다. [25:33]
15. 커뮤니티 기반 설치 지원과 비기술 사용자의 접근성
- 커뮤니티 강의실에는 Agent OS 영상 안내서와 최신 업데이트 날짜, 설치용 ZIP 파일이 정리돼 있다. [26:05]
- 약 3,800명의 회원이 해결책을 공유하며, 운영자는 질문에 답하거나 필요한 영상 안내서를 제작한다. [26:22]
16. Qwen 3.8 Max 무료 이용과 웹 개발 절차
- Alibaba의 Qwen 3.8 Max는 무료로 이용하면서도 고성능 유료 모델과 경쟁할 수 있는 대안이다. [28:57]
- 자체 테스트에서 Fable 5와 유사한 성능을 보였으며, 구독료가 없다는 점이 뚜렷한 차별점이다. [29:14]
17. 아티팩트·미니 앱·미디어 생성 기능
- Qwen 3.8 Max는 웹페이지·이미지·아티팩트·미니 앱 등 다양한 결과물을 생성할 수 있다. [30:08]
- 습관 추적 앱을 요청하면 단순한 코드가 아니라 바로 실행할 수 있는 아티팩트로 제공한다. [30:15]
18. Fable 5와의 결과 비교 및 Agent OS 연동
- Fable 5로 만든 그래픽에서는 일부 요소가 움직이지 않고 화면이 불안정한 문제가 나타난다. [31:03]
- Qwen 결과물은 그래픽과 움직임이 매끄러워 더 자유롭고 비선형적인 경험을 제공한다. [31:14]
19. 50개 이상의 작업을 바탕으로 한 모델 비교
- Qwen 3.8과 Fable 5의 성능을 벤치마크뿐 아니라 실제 구축 결과를 통해 비교한다. [42:19]
- Qwen으로 50개 이상의 작업을 구축한 경험을 실질적인 비교 근거로 활용한다. [42:23]
20. 무료·오픈소스 모델이 만드는 경쟁 압력
- 일부 벤치마크에서 Fable 5와 Qwen 3.8 Max는 비슷한 수준의 성능을 기록한다. [42:32]
- Qwen은 무료인 데다 오픈소스 전환도 예정돼 있어 비용과 접근성 측면에서 유리하다. [42:43]
21. 벤치마크와 실제 작업 성능의 간극
- 벤치마크 순위가 높아도 실제 작업에서 같은 수준의 결과가 보장되지는 않는다. [42:58]
- 모델을 선택할 때는 정형화된 점수보다 현실적인 수행 능력을 직접 검증해야 한다. [43:03]
22. Terminal Bench 우위와 실전 검증 준비
- 터미널 에이전트 성능을 측정하는 Terminal Bench 2.1을 비교 기준으로 제시한다. [43:08]
- Qwen은 86.6점으로 Fable 5의 84.6점보다 높은 점수를 기록한다. [43:16]
23. 실시간 게임 빌드에서 나타난 Qwen의 시각적 우위
- Qwen 3.8, GT 5.6 Soul, Fable 5, Kimi K3의 실시간 게임 빌드를 나란히 비교한다. [49:52]
- Qwen 결과물은 입체적인 화면과 유연한 조작으로 첫인상과 사용성에서 높은 완성도를 보인다. [50:01]
24. 게임형 벤치마크의 평가 범위와 비행 시뮬레이터 예외
- Qwen의 다른 3D 레이서는 조작이 어려웠지만 초기 구간을 넘기면 재미를 유지했다. [51:27]
- GoldieBench에서는 모델별 결과물을 직접 플레이하거나 유사한 프롬프트로 재시험할 수 있다. [51:35]
25. 과제별 승패와 Fable의 실행 일관성 문제
- 새 게임 과제에서는 Qwen이 인트로, 팝업, 세부 그래픽과 플레이 재미를 더 충실히 구현한다. [53:05]
- Fable 5가 자동으로 Opus로 전환되면 장시간 자동 코딩 도중 결과 품질과 일관성이 무너질 수 있다. [53:09]
26. 대규모 개발에서는 Fable, 접근성과 멀티모달에서는 Qwen
- 일상 개발에서는 Fable 5가 더 안정적이며, Qwen은 수정과 재요청이 더 많이 필요하다. [54:08]
- 기존 시스템과 통합된 대규모 앱·웹사이트 개발에서는 Fable 5의 신뢰성과 낮은 전환 비용이 유리하다. [54:24]
27. 추가 게임 비교와 하네스·모델 분리 전략
- 다른 게임에서는 Fable 5가 더 많은 디테일과 풍부한 플레이 요소를 구현했다. [55:59]
- 다음 과제에서는 Qwen이 이동 버그가 적고 부드러우며 비선형적인 조작 경험을 제공했다. [56:34]
28. 최종 선택 기준과 모델 교체를 흡수하는 Agent OS
- 마지막 과제에서는 Fable 5가 앞섰지만, Qwen도 높은 생성 능력과 무료·오픈소스라는 장점이 있다. [57:55]
- 큰 프로젝트에는 Fable 5, 무료 프런티어 모델이 필요할 때는 Qwen 3.8이 적합하다. [58:04]
- Agent OS에 Qwen을 연결하면 기존 환경을 유지하면서 두 모델의 장점을 함께 활용할 수 있다. [58:19]
29. RTX GPU를 활용한 로컬 생성 환경
- RTX 5090과 ComfyUI를 조합하면 이미지와 비디오 생성 모델을 로컬에서 실행할 수 있다. [1:00:03]
- RTX GPU를 이미 보유했다면 추가 클라우드 비용 없이 생성 환경을 운용하기에 적합하다. [1:01:03]
30. Herald 릴리스와 업데이트 방법
- Hermes Agent V0의 Herald 릴리스가 공개됐으며 설치와 사용법을 함께 보여준다. [1:06:45]
- Agent OS 관리 메뉴에서 업데이트를 선택하면 최신 버전으로 올릴 수 있다. [1:06:56]
31. 음성 응답 속도와 데스크톱 기능 강화
- Talk to Hermes는 답변 생성과 동시에 음성을 출력해 대기 시간을 줄인다. [1:07:12]
- 첫 토큰 응답 시간이 4.3초에서 0.9초로 줄고 Hermes Desktop의 처리 속도도 향상됐다. [1:07:26]
32. 호출어로 시작하는 대화와 시스템 연결
- AI가 응답하는 중에도 사용자가 끼어들어 출력을 중단할 수 있는 전화 통화형 상호작용을 지원한다. [1:08:02]
- 지정한 호출어만 말하면 키보드나 버튼 없이 방 건너편에서도 대화를 시작할 수 있다. [1:08:13]
33. 중단과 수정이 가능한 핸즈프리 운용
- 사용자 음성을 감지하면 진행 중인 출력을 멈추고 새 요청에 맞춰 작업 방향을 수정한다. [1:09:58]
- Hermes Apollo에서는 에이전트와 실시간 음성 대화를 계속 이어갈 수 있다. [1:10:10]
34. 플랫폼별 음성 응답과 근거 기반 연구
- WhatsApp과 DingTalk 등 여러 플랫폼에서 음성 메시지로 Hermes에 작업을 요청할 수 있다. [1:11:07]
- Hermes는 플랫폼과 입력 형식을 인식해 음성 요청에 자동으로 TTS 음성 응답을 제공한다. [1:11:20]
35. 산출물 통합 조회와 샌드박스 미리보기
- 여러 플랫폼에서 생성한 아티팩트와 Higgsfield MCP 이미지를 데스크톱 한곳에서 통합 확인할 수 있다. [1:12:52]
- HTML 앱 같은 실행형 산출물은 격리된 샌드박스에서 안전하게 실시간 미리 보기할 수 있다. [1:13:10]
36. A2A 기반 다중 에이전트 오케스트레이션
- A2A 플러그인을 통해 Hermes는 호환 에이전트를 발견해 대화하거나 외부 에이전트의 제어를 받을 수 있다. [1:13:33]
- Agent OS와 Agent Mastermind에서는 여러 에이전트가 하나의 메시지에 응답하며 아이디어를 주고받는다. [1:13:56]
37. 실시간 조향과 안전성·응답 성능 개선
- 실행 중 자연어로 수정 사항을 입력하면 작업을 중단하거나 재시작하지 않고도 현재 진행 방향을 바꿀 수 있다. [1:14:49]
- 대화 압축은 최근 맥락과 진행 상태를 보존하며, 위험한 작업에는 스마트 승인을 요구한다. [1:15:27]
38. Agent OS의 통합 워크플로와 지원 생태계
- Agent OS 프로필은 여러 모델의 시험부터 음성 기반 결과물 생성과 컴퓨터 제어까지 하나의 워크플로로 연결한다. [1:18:23]
- Hermes Oracle은 최신 뉴스 기반 콘텐츠 제작을 자동화하고, 아웃리치 도구는 리드 생성부터 캠페인 통계 관리까지 지원한다. [1:18:46]
🧾 결론
- 하나의 모델이 모든 과제에서 우세하지 않았으며, Qwen은 접근성·시각적 생성·멀티모달 작업에서, Fable 5는 대규모 프로젝트의 안정성과 기존 통합에서 상대적인 강점을 보였다.
- 따라서 실용적인 구성은 단일 모델에 종속되기보다 공통 메모리와 코딩 하네스를 중심에 두고, 비용·속도·품질·과제 유형에 따라 실행 모델을 바꾸는 방식이다.
- 초보자도 ZIP 설치나 데스크톱 앱을 통해 시작할 수 있지만, 첫 생성 결과를 완성품으로 간주하지 않고 실제 작동 여부를 시험하며 반복 개선해야 한다.
- Agent OS의 장기적 가치는 최신 모델 하나를 채택하는 데 있지 않고, 새로운 모델이 등장할 때 기존 자동화와 지식을 다시 구축하지 않아도 되는 교체 가능성에 있다.
📈 투자·시사 포인트
- AI 시장의 경쟁 축은 모델 성능 자체에서 공통 메모리, 도구 연결, 코딩 하네스, 실시간 검증을 제공하는 에이전트 운영 계층으로 확대될 가능성이 있다.
- 무료 또는 저비용 모델이 유료 프런티어 모델에 근접하면 추론 비용과 구독료는 하락 압력을 받을 수 있으며, 여러 모델을 통합·전환하는 플랫폼의 전략적 가치가 커질 수 있다.
- 특정 모델보다 워크플로와 데이터를 중심에 둔 구조는 공급자 종속 위험을 낮춘다. 기업 도입에서는 모델 교체 비용, 기존 자동화의 재사용성, 보안 승인과 결과 검증 기능을 함께 살펴봐야 한다.
- 멀티모달 생성, 음성 인터페이스, 에이전트 간 통신이 하나의 환경으로 결합되면 개발 도구뿐 아니라 콘텐츠 제작·리서치·아웃리치·업무 자동화 시장까지 경쟁 범위가 넓어질 수 있다.
- 검증 필요: Qwen 3.8 Max의 무료·오픈소스 전환 여부, Terminal Bench 점수, 50개 이상 작업의 비교 방법, Hermes의 응답 속도 개선 수치와 기여자 규모는 영상 발표자의 설명이므로 공식 문서·공개 저장소·원본 벤치마크를 통한 별도 확인이 필요하다.
⚠️ 불확실하거나 확인이 필요한 부분
- Qwen 3.8 Max가 “무료 오픈소스 모델”이라는 설명과 “향후 오픈소스 전환 예정”이라는 설명이 영상 안에서 함께 제시된다. 현재 공개 여부, 라이선스, 무료 이용 한도는 공식 문서에서 별도로 확인해야 한다. [28:57] [42:43]
- Qwen 3.8 Max 86.6점, Fable 5 84.6점이라는 Terminal Bench 2.1 결과는 평가 환경·모델 설정·도구 사용 조건·재현 절차가 제시되지 않아 원본 리더보드와 실행 기록 확인이 필요하다. [43:08] [43:16]
- “50개 이상의 작업”을 바탕으로 한 모델 비교는 발표자의 실사용 경험이지만, 동일 프롬프트와 하네스, 반복 횟수, 실패율 등 비교 조건이 명확하지 않아 일반적인 우열로 단정하기 어렵다. [42:19] [42:23]
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- Qwen과 비교 대상 모델의 공식 가격표, 라이선스, 지역 제한, 컨텍스트 길이 및 도구 호출 지원 여부를 확인한다.
- 실제 업무를 대표하는 소형·중형·대형 과제를 선정하고, 동일 프롬프트·하네스·시간 제한·반복 횟수로 모델별 성공률과 수정 횟수를 기록한다.
- 기존 Agent OS에 새 모델을 연결하기 전에 테스트 프로필에서 메모리 호환성, 도구 권한, 실패 복구, 모델 전환 후 문맥 유지 여부를 검증한다.
- 설치용 ZIP 파일은 공식 배포처와 버전을 확인하고, 압축을 해제해 내용을 검토한 뒤 격리된 환경에서 최소 권한으로 시험한다.
❓ 열린 질문
- Qwen 3.8 Max의 정확한 공개 상태와 라이선스는 무엇이며, 무료 사용에 호출량·상업 이용·데이터 보관 제한이 있는가?
- 영상의 Terminal Bench 점수와 50개 이상 작업 비교를 재현할 수 있는 프롬프트, 실행 로그, 모델 설정 및 원본 결과가 공개되어 있는가?
- Agent OS의 공통 메모리는 모델별 컨텍스트 형식 차이를 어떻게 처리하며, 민감정보 격리와 선택적 삭제를 지원하는가?