Qwen 3.8 Agentic OS is INSANE... just watch
Quick Summary
Qwen 3.8 Agentic OS의 핵심은 특정 모델의 일시적 성능보다 두뇌·실행기·장기 기억·업무 인터페이스를 결합하고 필요할 때 모델만 교체할 수 있는 자동화 구조에 있다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 결론
Qwen 3.8 Agentic OS의 핵심은 특정 모델의 일시적 성능보다 두뇌·실행기·장기 기억·업무 인터페이스를 결합하고 필요할 때 모델만 교체할 수 있는 자동화 구조에 있다.
📌 핵심 요점
- 영상은 Qwen 3.8 Max를 판단과 문맥 처리를 담당하는 ‘두뇌’, Hermes Agent나 Claude Code를 실제 도구 호출과 작업 수행을 맡는 ‘실행기’, 대시보드와 맞춤형 자동화를 ‘워크플로 계층’으로 구분한다.
- 목표 기반 작업을 백그라운드에서 반복 실행하고 여러 에이전트와 하위 에이전트가 역할을 분담함으로써, 장시간 업무에 필요한 지속적인 프롬프트 입력과 사용자 감시를 줄일 수 있다고 설명한다.
- Obsidian에 대화와 작업 결과를 저장하고 다시 읽게 하면 사업 문맥과 실행 이력이 누적되며, 채팅·빌드·티켓·칸반·음성 기능을 하나의 환경에서 이어서 사용할 수 있다는 것이 장기 기억 구조의 핵심이다.
- 영상에서 제시된 활용 사례는 잠재 고객 검색과 정보 보강, 이메일 캠페인, 업계 뉴스 수집과 게시물 발행, 웹사이트·게임 제작 등이며, 내부 에이전트 구성을 전용 화면으로 감싸 목적별 업무 도구처럼 운영할 수 있다고 주장한다.
- 새로운 모델이 계속 등장하는 환경에서는 하나의 모델에 모든 시스템을 종속시키기보다 기존 기억·도구·워크플로를 유지한 채 Qwen·Claude·ChatGPT 등 필요한 두뇌를 선택하거나 교체할 수 있는 구조가 더 중요하다는 결론을 제시한다.
🧩 배경과 문제 정의
- 채팅·코딩·업무 도구를 따로 사용하면 메모리와 작업 이력이 단절돼, 반복 업무마다 문맥을 다시 제공해야 한다.
- 영상은 모델, 실행 에이전트, 장기 기억, 업무 인터페이스를 하나로 묶는 Agentic OS를 해결책으로 제시한다. 목표는 장기 작업의 자율 실행과 여러 에이전트의 협업이다.
- 핵심 논지는 특정 모델의 일시적인 성능 우위보다, 기존 기억과 워크플로를 유지하면서 필요에 따라 모델을 교체할 수 있는 시스템이 더 중요하다는 것이다.
- 검증 필요: Qwen 3.8 Max의 파라미터·컨텍스트 규모, Goldbench 성능 비교, 사용자 성과 자료는 영상에서 제시된 주장으로, 원본 벤치마크와 외부 자료를 통한 별도 확인이 필요하다.
🕒 시간순 섹션별 상세정리
- Qwen 3.8 Max와 Agentic OS의 결합
- 영상은 Qwen 3.8 Max의 규모와 벤치마크 결과를 근거로, 이를 Agentic OS의 핵심 두뇌로 보여준다. [00:09]
- 채팅·메모리·티켓·빌드를 하나의 Qwen 기반 워크플로로 연결해 분산된 업무 환경을 통합한다. [00:50]
- 큰 작업을 목표 루프에 넣으면 추가 프롬프트나 지속적인 감시 없이 백그라운드에서 실행을 이어갈 수 있다고 보여준다. [02:00]
- Obsidian에서 기존 문맥을 읽고 결과를 다시 저장해, 실행 이력을 장기 지식으로 누적한다. [02:22]
- 실행 하네스와 오픈소스 워크플로 확장
- Qwen을 두뇌로 두고 Hermes Agent나 Claude Code를 실행 하네스로 선택하며, 완성된 게임과 웹사이트를 빌드 기록에서 다시 확인할 수 있다. [03:45]
- Open Design을 워크플로에 결합해 획일적인 AI 디자인을 줄이고 맞춤형 웹사이트 제작을 지원한다. [04:18]
- 첫 번째 계층인 Qwen 3.8 Max가 전체 시스템의 판단과 문맥 처리를 담당한다고 보여준다. [06:18]
- 두 번째 계층인 Hermes Agent나 Claude Code는 모델의 판단을 코드 작성과 도구 호출 같은 실제 작업으로 전환한다. [06:27]
- 장기 기억과 통합 업무 인터페이스
- 대화와 작업 결과를 Obsidian 볼트에 저장해, 에이전트가 누적된 사업 문맥을 다음 작업에 재사용하도록 한다. [08:06]
- 채팅·음성 에이전트·빌드 보관함·칸반 보드·워크스페이스를 통합해 실행과 과거 프로젝트 탐색을 한 환경에서 처리한다. [08:16]
- 모델 경쟁보다 교체 가능한 시스템이 중요한 이유
- 영상은 Goldbench 결과를 인용해 Qwen 3.8 Max가 다른 주요 모델과 대등하거나 일부 항목에서 앞선다고 주장한다. [09:59]
- 비기술 사용자도 이런 환경을 구축할 수 있다는 사례를 제시하며, 모델 순위보다 기억과 워크플로를 유지한 채 두뇌를 교체할 수 있는 시스템이 중요하다는 논지로 마무리한다. [10:18]
- 설치 패키지와 지속적인 업데이트
- 영상에서 소개한 에이전트 운영체제를 바로 설치할 수 있도록 완성된 설정과 ZIP 파일을 제공한다고 안내한다. [11:09]
- 시스템을 매일 개선하며 새로운 업데이트를 계속 제공하고, 커뮤니티는 AI 자동화로 학습하고 시간을 절약하며 성장하는 것을 목표로 한다. [11:15]
- 설치 방법을 설명하는 영상 튜토리얼과 전체 설정 가이드를 제공하고, 새로운 기능이 등장할 때마다 튜토리얼을 추가한다. [11:36]
- 커뮤니티 지원과 최종 참여 안내
- 커뮤니티에서 질문하면 발표자와 다른 구성원들에게 직접 답변과 도움을 받을 수 있다. [11:39]
- 주간 코칭 통화에서 화면을 공유하고 질문하며 실시간 지원을 받을 수 있다. [11:45]
- 지도 기능으로 가까운 지역의 구성원들을 만날 수도 있다. [11:50]
- 댓글과 설명란의 링크 또는 안내된 웹사이트에서 프로그램을 확인하라고 권하며 영상을 마친다. [11:59]
🧾 결론
- 이 영상이 말하는 Agentic OS는 단순한 모델 실행 화면이 아니라 모델, 실행 에이전트, 장기 기억, 작업 기록과 사용자 인터페이스를 하나의 연속된 업무 환경으로 묶는 개념이다.
- 가장 중요한 가치는 개별 모델의 벤치마크 순위보다 작업 문맥과 결과물이 보존되고, 다음 모델로 전환해도 기존 자동화 자산을 계속 사용할 수 있다는 점에 있다.
- 자동 실행과 다중 에이전트 협업은 반복 업무의 개입 비용을 낮출 가능성이 있지만, 실제 운영에서는 오류 복구, 권한 통제, 결과 검수와 비용 관리가 함께 설계되어야 한다.
- 영상에 등장한 구축 사례와 패키지·가이드·코칭은 초기 진입 장벽을 낮추는 수단으로 소개되지만, 각 조직의 데이터 구조와 업무 절차에 맞는 별도 설정은 여전히 필요할 수 있다.
📈 투자·시사 포인트
- 모델 성능이 빠르게 평준화되면 가치의 중심은 단일 모델 공급자에서 장기 기억, 에이전트 조율, 실행 기록, 업무별 인터페이스를 제공하는 통합 계층으로 이동할 가능성이 있다.
- 모델을 교체해도 기억과 워크플로가 유지되는 구조는 공급자 종속을 낮출 수 있으므로, 개방형 모델과 상용 모델을 함께 연결하는 오케스트레이션·관측·권한 관리 도구의 중요성이 커질 수 있다.
- 잠재 고객 발굴, 이메일 운영, 콘텐츠 발행처럼 반복성과 측정 가능성이 높은 업무는 Agentic OS의 초기 상용화 영역이 될 수 있지만, 자동화 성과는 데이터 품질과 외부 서비스 연동 안정성에 크게 좌우된다.
- 무료 API나 로컬 모델을 하위 에이전트로 활용하면 추론 비용을 낮출 가능성이 있으나, 실제 총비용은 인프라 운영, 응답 품질, 지연 시간, 보안과 사람의 검수 비용까지 포함해 비교해야 한다.
- 검증 필요: 영상에서 언급된 Qwen 3.8 Max의 2.4조 파라미터·100만 토큰 컨텍스트, Goldbench 성능 비교, 비기술 사용자의 구축 사례와 207페이지 이상의 성과 자료는 원본 모델 문서, 평가 방법론과 개별 사례 자료를 통해 독립적으로 확인해야 한다.
⚠️ 불확실하거나 확인이 필요한 부분
- 영상은 Qwen 3.8 Max가 2.4조 파라미터와 100만 토큰 컨텍스트를 지원한다고 설명하지만, 정확한 모델명·활성 파라미터 규모·컨텍스트 제한은 공식 모델 카드와 기술 문서에서 별도로 확인해야 한다. [00:09] [06:18]
- Qwen 3.8 Max가 일부 벤치마크에서 Fable 5 및 GPT-5.6 Soul보다 우수하다는 비교는 영상과 Goldbench 자료에 기반한 주장이다. 평가 데이터셋, 채점 방식, 실행 조건, 반복 측정 여부가 제시되지 않아 일반적인 성능 우위로 단정하기 어렵다. [09:59]
- Hunter API를 이용한 잠재 고객 검색부터 이메일 작성·예약 발송·받은편지함 관리까지의 자동화는 시연된 구성으로 보이지만, 실제 정확도·API 비용·발송 제한·개인정보 및 스팸 규정 준수 여부는 확인이 필요하다. [02:55] [03:18]
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- Qwen 3.8 Max의 공식 모델 카드에서 파라미터 구조, 최대 컨텍스트, 라이선스, API 제공 방식과 가격을 확인한다.
- Goldbench 원문을 찾아 비교 대상 모델, 평가 과제, 채점 기준, 프롬프트, 추론 비용 및 재현 가능한 실행 결과가 공개되어 있는지 검토한다.
- 작은 실험 과제 하나를 선정해
모델 → 실행 하네스 → 워크플로 인터페이스의 3계층 구조로 구현하고, 성공률·소요 시간·토큰 및 API 비용을 기록한다. - Obsidian 연동을 전체 볼트가 아닌 테스트용 폴더에 먼저 적용하고, 읽기·쓰기 권한, 민감정보 제외 규칙, 출처 기록 및 오래된 기억의 갱신 방식을 정의한다.
❓ 열린 질문
- 영상에서 말하는 Qwen 3.8 Max와 Goldbench의 정확한 공식 문서 및 재현 가능한 벤치마크 결과는 어디에 공개되어 있는가?
- 장기 실행 중 에이전트가 잘못된 방향으로 반복하거나 외부 시스템을 오작동시킬 때 이를 감지하고 자동 중단하는 장치는 무엇인가?
- 여러 모델과 에이전트가 같은 Obsidian 기억을 사용할 때 충돌, 중복, 오래된 정보와 잘못된 기억은 어떻게 식별하고 정리하는가?