I Ran A 27B Model On A Hand-Sized PC…Didn''t Expect This
Quick Summary
손바닥 크기 PC에서도 27B 모델은 실행됐고, 외장 GPU 도크와 VRAM에 맞는 양자화·추측 디코딩을 조합하자 생성 속도가 초당 44토큰까지 올라갔다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
손바닥 크기 PC에서도 27B 모델은 실행됐고, 외장 GPU 도크와 VRAM에 맞는 양자화·추측 디코딩을 조합하자 생성 속도가 초당 44토큰까지 올라갔다.
📌 핵심 요점
- 64GB 메모리와 Intel Panther Lake 내장 GPU를 갖춘 소형 PC는 약 18GB의 27B 모델을 실행했지만, 기본 생성 속도는 초당 5토큰 안팎이었다. 실행 가능 여부와 실용적인 응답 속도는 별개의 문제였다.
- 프롬프트 처리와 토큰 생성은 따로 평가해야 한다. OpenVINO는 프롬프트 처리에서 CPU의 약 17토큰/초를 446토큰/초로 끌어올렸지만, 생성 속도는 2.6토큰/초로 비교한 다른 경로보다 낮았다.
- 작은 드래프트 모델로 후보 토큰을 미리 만드는 추측 디코딩은 내장 GPU 생성 속도를 약 5에서 11토큰/초로 높였다. 이번 실험에서는 예측 깊이 Nmax 3이 가장 좋았고, 8로 늘리면 오히려 약 3.5토큰/초로 떨어졌다.
- 16GB VRAM에 약 17.6GB 모델을 억지로 올리면 성능이 급락했다. GPU에 56개 레이어를 배치했을 때 약 14토큰/초였지만, 60개에서는 0.82토큰/초로 떨어졌다. 약 13GB 양자화 파일로 바꿔 전체를 VRAM에 넣자 27토큰/초를 기록했다.
- VRAM에 들어간 모델에 추측 디코딩까지 적용한 최종 결과는 44토큰/초였다. 이 조건에서는 생성 중 도크 연결 트래픽이 평균 약 2MB/초에 그쳐, 연결 규격보다 모델의 VRAM 수용 여부가 구매 판단의 핵심으로 제시됐다.
🧩 배경과 문제 정의
영상은 손바닥 크기 PC에서 27B급 AI 모델을 얼마나 실용적인 속도로 실행할 수 있는지 묻는다. 시험 장비는 64GB 시스템 메모리와 Arc B390 내장 그래픽을 갖춘 Mind Pro이며, 별도로 16GB VRAM의 5060 Ti GPU 도크를 연결한다.
핵심 문제는 모델을 메모리에 올릴 수 있는지에 그치지 않는다. 입력을 읽는 프롬프트 처리와 출력을 만드는 토큰 생성의 병목을 구분하고, 공유 메모리 대역폭·VRAM 용량·양자화·추측 디코딩·외장 연결이 각각 어떤 영향을 주는지 비교한다. 후반에는 측정 오류와 전원·드라이버 문제를 공개해 결과를 해석할 때 필요한 조건도 설명한다.
🕒 시간순 섹션별 상세정리
1. 손바닥 크기 PC와 27B 모델의 조합
- 발표자는 한 손에 들어가는 Mind Pro를 보여준다. Core Ultra X7 358H, Panther Lake, 64GB 메모리, Arc B390 내장 그래픽을 갖춘 장비다. [00:43]
- 전용 커넥터로 연결하는 GPU 도크와 일반 확장 도크를 구분하고, 약 18GB 크기의 Q4KM 양자화 27B 모델을 시험 대상으로 제시한다. [01:40]
- 실험의 질문은 실행 가능 여부보다 실용적인 속도다. 생성이 초당 4토큰 수준이면 클라우드 API로 돌아갈 수 있다는 문제의식을 제시한다. [02:05]
2. 입력 처리와 생성 속도는 다른 순위를 보인다
- CPU와 내장 GPU의 Vulkan·SYCL·OpenVINO 경로를 비교하고, 입력을 읽는 prefill과 출력을 만드는 decode를 구분한다. [02:29]
- 프롬프트 처리 속도는 CPU 약 17토큰/초에서 OpenVINO 446토큰/초로 증가한다. [02:42]
- 생성 속도는 CPU 5토큰/초 미만, Vulkan 약 5.4, SYCL 5.7, OpenVINO 2.6으로 제시돼 입력 처리 결과와 다른 양상을 보인다. [02:54]
3. 공유 메모리 대역폭이 생성 속도를 제한한다
- 발표자는 메모리 용량을 탱크 크기, 대역폭을 파이프 너비에 비유한다. 내장 GPU는 CPU와 시스템 메모리를 공유하며, 토큰 생성 때 모델 가중치를 읽는 비용이 병목이라는 설명이다. [03:24]
- 모델 크기 17.66과 생성 속도 5.42를 곱해 유효 대역폭을 약 100GB/초로 추정하고, 백엔드 교체만으로 이 제약을 없애기 어렵다고 드러낸다. [03:39]
4. 추측 디코딩으로 한 번에 여러 후보를 검증한다
- 작은 드래프트 모델이 여러 토큰을 먼저 예측하고 큰 모델이 이를 함께 검증하는 추측 디코딩을 보여준다. 추가 모델 크기는 약 1.5GB로 보여준다. [04:15]
- 내장 GPU에서는 생성 속도가 약 5에서 11토큰/초로 상승한다. 내장 GPU와 5060 Ti 모두 이번 실험에서는 예측 깊이 Nmax 3에서 최고 성능을 보였다. [04:50]
- Nmax 8에서는 약 3.5토큰/초로 오히려 느려졌다. 발표자는 llama.cpp의 당시 기본값인 3을 출발점으로 삼고 예측 깊이를 무작정 늘리지 말라고 권한다. [05:30]
5. 여러 모델을 묶어 쓰는 서비스 소개
- 영상은 연구·코딩·대규모 문맥·이미지·영상 등 작업에 따라 모델을 바꿔 쓴다는 설명과 함께 Abacus AI의 ChatLM 홍보 구간으로 전환한다. [06:03]
- 모델 선택과 자동 라우팅, 콘텐츠 제작, 앱·웹사이트 구축 및 호스팅 기능을 소개하고 월 10달러부터라는 가격을 제시한다. 이 구간은 로컬 장비 성능 측정과 구분해 읽어야 한다. [06:56]
6. VRAM 한계를 넘으면 레이어 추가가 역효과를 낸다
- 5060 Ti 도크의 VRAM은 16GB인데 모델은 약 17.6GB라 전체가 들어가지 않는다. 발표자는 약 62개 레이어 중 GPU에 배치할 수를 정하는 NGL 설정을 시험한다. [07:56]
- GPU 배치가 0개 레이어일 때 4.54토큰/초, 48개에서 약 11, 56개에서 약 14로 증가하지만, 60개에서는 0.82토큰/초로 급락한다. [08:35]
- 발표자는 이를 용량 초과에 따른 반복 전송 문제로 보여준다. 전체 배치를 강제하는 NGL99 대신 자동 배치를 쓰면 10.48토큰/초, 56개 수동 설정에서는 약 14토큰/초를 얻었다. [09:48]
7. 양자화 파일을 바꿔 모델 전체를 GPU에 넣는다
- Q4KM 약 18GB 파일을 IQ4 XS 약 13GB 파일로 교체하자 모델 전체가 16GB VRAM에 들어간다. [10:24]
- 발표된 프롬프트 처리 속도는 약 474에서 943토큰/초, 생성 속도는 14에서 27토큰/초로 거의 두 배가 된다. 파일 교체의 효과가 앞선 레이어 배치 조정보다 컸다는 평가다. [10:58]
8. 품질 검증은 영어 산문 범위에 한정된다
- 발표자는 양자화에 따른 품질 저하를 느낌으로 판단하지 않고 perplexity로 비교한다. 영어 산문 평가에서 두 파일 모두 약 6.8로 비슷했고, 작은 파일의 미세한 우세는 잡음 수준으로 해석한다. [12:06]
- 비교 대상은 서로 다른 제작자가 만든 두 파일이다. 영어 다음 토큰 예측 결과는 코드·산술·긴 추론의 손상을 검출하지 못하므로 자신의 작업으로 별도 검증하라고 강조한다. [12:39]
9. 모델이 상주하면 외장 연결 사용량은 작다
- 전용 Mind Link의 실제 연결은 PCIe 4.0 x8이며 약 15.8GB/초로 드러난다. 발표자는 다른 외장 연결보다 빠른 규격이 텍스트 생성에도 유리한지 묻는다. [13:38]
- 모델 로딩은 약 17GB를 3초 정도에 옮기지만, 가중치가 GPU에 상주한 상태의 생성 트래픽은 최대 19MB/초, 평균 2MB/초로 드러난다. [13:56]
- 발표자는 이 관측치로부터 해당 생성 작업에서는 고속 연결의 여유가 매우 크다고 해석한다. 다만 다른 연결에서의 직접 성능 비교 결과는 뒤에서 제약이 드러난다. [14:22]
10. 잔류 프로세스와 장치 선택이 측정을 왜곡한다
- 종료한 것으로 생각한 llama-bench가 약 18.5GB 메모리를 점유한 채 남아 이후 측정값을 절반 이하로 떨어뜨렸다. 발표자는 해당 측정을 폐기하고 재부팅이나 명시적인 프로세스 종료를 권한다. [15:12]
- 두 번째 GPU 연결 후 OpenVINO가 CPU에서 실행돼 약 30배의 측정 오류가 생겼다. 발표자는 장치 지정에 GPU.0이 필요했던 문제를 보여준다. [15:31]
11. 전원 공급과 외장 도크 안정성의 한계
- 내장 배터리가 있는 PC에 30W 수준의 전원을 연결한 채 부하를 주자 배터리가 서서히 소진돼 꺼졌다. 발표자는 100W 케이블 연결 후 정상화됐다고 보여준다. [16:35]
- 별도로 시험한 도크는 모델을 VRAM에 옮기는 중 두 번 충돌했고 Windows 디스플레이 드라이버가 응답하지 않았다. Linux는 전용 연결 드라이버에 대한 우려로 아직 시험하지 않았다. [17:02]
- 따라서 전용 도크와 Thunderbolt 도크의 직접 비교는 완성되지 않았다. LLM 생성에서 차이가 작을 것이라는 설명은 이 단계에서는 발표자의 예상이다. [17:19]
12. 최종 성능과 구매 우선순위
- 최종 비교는 CPU 5토큰/초 미만, 내장 GPU 약 5.5, 내장 GPU와 드래프트 모델 11, 외장 GPU 분할 배치 14, 전체 VRAM 상주 27, 여기에 드래프트 모델 추가 시 44토큰/초다. 프롬프트 처리도 17에서 900토큰/초 이상으로 증가했다. [17:56]
- 모델 파일 변경과 설정 조정은 추가 하드웨어 구매 없이 시도할 수 있지만 GPU 도크는 별매다. 발표자는 약 1,000달러로 기억한다고 말하며, 구매 전에 모델이 VRAM에 들어가는지 확인하고 NGL99를 무작정 복사하지 말라고 권한다. [18:41]
- 발표자는 다중 사용자 환경에서 드래프트 예측이 실제 요청과 자원을 경쟁할 수 있다고 경고하고, 연결 대역폭보다 VRAM을 우선하라는 메시지로 정리한다. 이어 다른 외장 GPU 실험 영상을 안내하며 마친다. [19:10]
🧾 결론
- 가장 큰 전환점은 모델 전체가 GPU 메모리에 들어가도록 만든 것이다. 이번 사례에서는 양자화 파일 교체가 레이어 분할 조정보다 더 큰 성능 개선을 냈다.
- 추측 디코딩과 GPU 레이어 설정은 실제 작업에 맞춰 검증해야 한다. 예측 깊이나 GPU 배치량을 늘리는 것만으로 속도가 계속 좋아지지는 않았다.
- 두 양자화 파일의 영어 산문 perplexity는 약 6.8로 비슷했지만, 이것만으로 코드·산술·긴 추론의 품질까지 같다고 결론낼 수는 없다.
- 초당 44토큰은 소형 PC 단독 성능이 아니라 별도 GPU 도크와 설정 최적화를 포함한 결과다.
📈 투자·시사 포인트
- 로컬 AI 장비를 구매할 때는 사용할 모델과 양자화 파일의 크기를 먼저 정하고, 해당 구성이 VRAM에 들어가는지 확인하는 순서가 합리적이다.
- 고속 외장 연결의 가격 프리미엄은 작업별로 판단해야 한다. 영상에서 관측한 VRAM 상주 상태의 텍스트 생성은 연결 대역폭을 거의 사용하지 않았지만, 이를 모델 로딩이나 다른 작업에 그대로 적용할 수는 없다.
- 소프트웨어 설정과 모델 파일 선택만으로도 기존 장비의 활용도가 크게 달라질 수 있다. 추가 하드웨어 구매 전에 양자화·자동 배치·드래프트 모델을 비교할 가치가 있다.
- 도크는 별도 구매품이며 발표자는 가격을 약 1,000달러로 언급했다. 실제 구매 판단에는 최신 가격과 호환성 확인이 필요하고, 영상은 특정 기업의 투자 수익성을 판단할 근거를 제공하지 않는다.
⚠️ 불확실하거나 확인이 필요한 부분
- 전사에는 모델명과 제품명, 일부 수치의 표기가 불명확하다. 특히 모델명이 ‘Quen 3.8’로 기록돼 있으므로, 동일 실험을 재현하려면 정확한 모델 저장소와 파일명을 확인해야 한다.
- 양자화 비교는 서로 다른 제작자가 만든 두 파일에 대한 결과다. 영어 산문 perplexity가 비슷하다는 사실을 모든 Q4 계열과 IQ4 계열의 품질 동등성으로 일반화할 수 없다.
- 전용 도크와 다른 외장 도크의 직접 성능 비교는 완료되지 않았다. 다른 도크는 모델 로딩 중 두 차례 충돌했으며, Linux 환경도 시험하지 않았다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 사용할 27B 모델의 정확한 버전, 양자화 파일, 파일 크기를 확인하고 목표 GPU의 VRAM 수용 여부를 점검한다.
- 동일한 프롬프트와 실행 조건에서 프롬프트 처리 속도와 토큰 생성 속도를 따로 기록한다.
-
NGL99를 그대로 복사하지 말고 자동 배치 결과를 기준으로 GPU 레이어 수를 조정해 성능 급락 구간을 확인한다. - 호환되는 드래프트 모델을 적용하고 Nmax 3을 출발점으로 비교하되, 동시 사용자 조건에서도 다시 측정한다.
❓ 열린 질문
- 더 작은 양자화 파일이 실제 코딩과 장문 추론에서도 기존 파일과 비슷한 품질을 유지할까?
- 정상 작동하는 다른 외장 도크를 같은 조건에서 비교하면 전용 연결의 속도·안정성 이점은 얼마나 남을까?
- Linux 환경에서는 드라이버 호환성과 성능, 모델 로딩 안정성이 어떻게 달라질까?