YouTubeAlex Ziskind·2026년 8월 31일·0

I Gave Local AI and the Cloud the Exact Same Job

Quick Summary

I Gave Local AI and the Cloud the Exact Same Job를 중심으로, 로컬 환경은 512GB 통합 메모리를 갖춘 Mac Studio 4대를 RDMA와 Thunderbolt 5 메시로 연결해 대형 Ki를 핵심 판단 포인트로 압축 정리한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

I Gave Local AI and the Cloud the Exact Same Job 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

I Gave Local AI and the Cloud the Exact Same Job의 핵심 내용을 4단계로 요약한 인포그래픽
I Gave Local AI and the Cloud the Exact Same Job 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

I Gave Local AI and the Cloud the Exact Same Job를 중심으로, 로컬 환경은 512GB 통합 메모리를 갖춘 Mac Studio 4대를 RDMA와 Thunderbolt 5 메시로 연결해 대형 Ki를 핵심 판단 포인트로 압축 정리한다.

📌 핵심 요점

  1. 로컬 환경은 512GB 통합 메모리를 갖춘 Mac Studio 4대를 RDMA와 Thunderbolt 5 메시로 연결해 대형 Kimmy K3 모델을 구동했다.
  2. 비교 조건은 동일한 프롬프트로 TypeScript 기반 실리콘 컴퓨트 거래소 프런트엔드를 만들고, 다크 모드·마이크로인터랙션·접근성·단위 테스트와 자체 검증을 요구하는 것이었다.
  3. 로컬 Kimmy K3는 긴 프롬프트 처리와 생성 속도가 느렸지만, 약 4시간 뒤 필터·비교·차트·예약·라이트 및 다크 모드를 갖춘 앱을 완성했다.
  4. Abacus AI Supercomputer는 상시 가동되는 가상 머신과 에이전트 환경에서 같은 작업을 약 15분 만에 끝냈으며, 생성 파일·터미널·데스크톱·GitHub 연동을 한곳에서 제공했다.
  5. 결과는 로컬 실행의 가능성을 확인하는 동시에, 빠른 일회성 도구 개발에는 클라우드가 유리하고 데이터 반출 제한이나 직접 운영의 가치가 크면 로컬이 적합하다는 선택 기준을 제시한다.

🧩 배경과 문제 정의

영상은 동일한 프런트엔드 개발 작업을 대형 모델이 구동되는 로컬 Mac Studio 클러스터와 상시 가동형 클라우드 에이전트에 각각 맡겨, 완성 가능성·속도·비용·운영 통제권을 비교한다. 로컬 측은 Kimmy K3를 Open Code에서 실행하고, 클라우드 측은 여러 모델과 가상 머신을 결합한 Abacus AI Supercomputer를 사용한다.

🕒 시간순 섹션별 상세정리

1. 대형 로컬 모델과 비교 목표

  • 제작자는 2.8조 파라미터 규모로 소개한 Kimmy K3가 원본 8비트 기준 1.56TB이기 때문에 단일 Mac Studio에 들어가지 않는다고 보여준다. [00:30]
  • 512GB Mac Studio 4대를 연결한 총 2TB 통합 메모리 환경에서 로컬 모델과 Abacus AI Supercomputer에 같은 웹 앱 제작 작업을 맡기겠다고 선언한다. [00:42]

2. Mac Studio 클러스터 구성

  • 모델은 네 장비에 분산돼 실행되며, 축소된 양자화에서도 896개 전문가 전체와 디스크상 817GB의 가중치를 사용한다. [01:44]
  • 텐서 병렬화는 모델 차원을 노드에 균등 분할해야 하므로 세 대가 아닌 네 대가 필요하고, 장비들은 여섯 개 케이블로 구성된 Thunderbolt 5 메시와 RDMA로 연결된다. [02:22]

3. 클라우드 경쟁자와 동일 과제 설정

  • Abacus AI Supercomputer는 100개 이상의 모델 라우팅, 상시 가동 가상 머신, 저장소·데이터베이스·GitHub·SSH와 Hermes agent를 결합한 환경으로 묶인다. [03:51]
  • 양쪽에는 TypeScript 기반 실리콘 컴퓨트 거래소 프런트엔드를 만들고 다크 모드, 마이크로인터랙션, 접근성, 단위 테스트와 자체 검증을 수행하라는 동일한 긴 프롬프트가 주어진다. [04:32]
  • 클라우드는 파일·터미널·데스크톱에 접근하고, 로컬은 Open Code를 통해 네 대의 Mac Studio에서 실행되는 Kimmy K3에 연결된다. [05:24]

4. 실행 초기의 속도 차이

  • 로컬 장비 네 대의 GPU 사용률은 100%에 도달했지만 긴 프롬프트를 처리하는 동안 한동안 출력이 나타나지 않았고, 클라우드는 이미 Next.js 앱 파일을 생성하기 시작했다. [07:18]
  • 제작자가 측정한 로컬 프롬프트 처리 속도는 초당 약 238토큰, 생성 속도는 초당 약 14.7토큰으로 빠르지 않았다. [07:33]
  • 클라우드 가상 머신에는 Next.js·Tailwind·TypeScript 설정과 앱 구조가 생성됐고, 터미널에서 내부 파일을 직접 확인할 수 있었다. [07:56]

5. 로컬 지연 진단과 최종 완성

  • 로컬 모델은 짧은 인사와 단순 웹 앱 요청에는 응답했으며, 147줄짜리 기본 앱을 만드는 데 약 3분이 걸려 모델 자체가 작동한다는 점은 확인됐다. [10:18]
  • 긴 전체 프롬프트를 다시 맡기고 기다리자 약 4시간 뒤 필터·비교·차트·예약과 라이트 및 다크 모드를 갖춘 완성 앱이 나왔다. [11:11]
  • 클라우드 결과물도 빌드와 실행에 성공했고, 애니메이션이 포함된 실시간 필터와 대시보드·예약·비교·재고 탐색 화면을 제공했다. [12:08]

6. 비용·용도 비교와 최종 판단

  • 같은 프롬프트로 양쪽 모두 앱을 완성했지만 소요 시간은 클라우드 약 15분, 로컬 약 4시간이었고 Mac Studio 한 대의 당시 가격은 약 1만6000달러로 제시됐다. [12:57]
  • Abacus 구독은 월 10달러부터 시작한다고 소개됐으며, 쉬운 작업은 저렴한 모델로 보내고 어려운 작업에 비싼 모델을 쓰는 라우팅도 지원한다. [13:21]
  • 제작자는 빠른 고품질 결과와 일괄 호스팅에는 클라우드가 이겼지만, 데이터가 외부로 나갈 수 없거나 직접 운영하려는 경우에는 로컬 클러스터가 유효하다고 결론짓는다. [14:01]

🧾 결론

  • 결과물 완성 여부만 보면 로컬과 클라우드 모두 성공했으며, 대형 모델을 개인 소유 장비에서 실행하는 것 자체가 현실적인 선택지가 됐다.
  • 생산성 기준에서는 15분 대 4시간이라는 차이로 클라우드가 이 비교에서 분명한 우위를 보였다.
  • 로컬은 데이터 통제와 장비 소유권을 제공하고, 클라우드는 빠른 실행과 통합된 개발·호스팅 환경을 제공하므로 두 방식의 시장은 공존할 수 있다.

📈 투자·시사 포인트

  • AI 개발 인프라의 경쟁축은 모델 성능뿐 아니라 프롬프트 처리 속도, 에이전트 실행 환경, 배포 편의성까지 포함하는 방향으로 이동하고 있다.
  • 고가 로컬 하드웨어의 일회성 지출과 저가 구독형 클라우드의 운영비 구조가 대비되며, 사용 빈도와 데이터 정책에 따른 총비용 비교가 중요하다.
  • 여러 모델을 작업 난도에 따라 라우팅하는 서비스는 고가 모델 사용을 줄이면서 품질과 비용을 조정할 수 있는 플랫폼 경쟁력이 될 수 있다.
  • 대형 오픈 모델의 로컬 구동 가능성은 보안·규제·데이터 주권이 중요한 조직을 위한 별도 인프라 시장이 유지될 가능성을 보여준다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 영상은 Abacus AI의 후원을 받았으며, 제작자가 이를 공개했더라도 평가와 시연 방식에 후원 관계가 영향을 미쳤을 가능성은 별도로 고려해야 한다.
  • 동일한 프롬프트를 사용했지만 로컬과 클라우드에서 선택한 모델·에이전트·실행 환경이 달라, 순수한 하드웨어 성능이나 동일 모델의 성능만 비교한 실험은 아니다.
  • 완성된 두 앱의 테스트 통과 여부, 코드 품질, 접근성 충족 수준, 오류 수와 유지보수성은 정량적으로 제시되지 않았다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 로컬과 클라우드 후보를 동일 모델·동일 에이전트·동일 프롬프트로 다시 실행해 소요 시간, 토큰 처리량과 실패율을 기록한다.
  • 생성된 두 앱에 같은 테스트 스위트와 접근성 검사, 빌드 검사 및 코드 리뷰 기준을 적용해 결과물 품질을 비교한다.
  • 예상 작업량과 데이터 반출 정책을 기준으로 로컬 장비비·전력비·유지보수비와 클라우드 구독·사용량 비용을 함께 계산한다.
  • 민감 데이터는 로컬 모델로 처리하고 빠른 일회성 개발은 클라우드 에이전트에 맡기는 혼합 운영 방식을 검토한다.

❓ 열린 질문

  • 15분 대 4시간의 차이 가운데 모델 선택, 프롬프트 처리 성능, 에이전트 구현과 하드웨어가 각각 차지한 비중은 얼마나 될까?
  • 두 앱에 실제 백엔드와 실데이터를 연결했을 때도 완성도와 개발 속도의 차이가 유지될까?
  • 로컬 클러스터를 장기간 반복 사용하면 어느 작업량부터 구독형 클라우드보다 경제적이 될까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.