ArticleJulie Bort·2026년 9월 17일·0

PrismML hopes its tiny LLM will change how we all use AI

Quick Summary

PrismML은 원본 대비 메모리를 9~10배 줄이고 종합 벤치마크 점수의 98%를 유지한 Bonsai 2 27B를 통해, 고성능 추론 모델을 PC와 스마트폰에서 실행하는 AI를 지향한다.

PrismML hopes its tiny LLM will change how we all use AI 관련 대표 이미지

🖼️ 인포그래픽

PrismML hopes its tiny LLM will change how we all use AI 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

PrismML hopes its tiny LLM will change how we all use AI의 핵심 내용을 4단계로 요약한 인포그래픽
PrismML hopes its tiny LLM will change how we all use AI 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

PrismML은 원본 대비 메모리를 9~10배 줄이고 종합 벤치마크 점수의 98%를 유지한 Bonsai 2 27B를 통해, 고성능 추론 모델을 PC와 스마트폰에서 실행하는 AI를 지향한다.

📌 핵심 요약

  • Caltech 연구진이 설립한 PrismML은 압축 기술 전문가인 Babak Hassibi 교수가 이끌며, 2,225만 달러의 시드 투자를 유치했다. Ion Stoica가 자문을 맡고 Khosla Ventures, Cerberus Capital, Caltech가 투자했다.
  • PrismML이 공개한 Bonsai 2 27B는 Alibaba의 공개 모델 Qwen3.8 27B를 5.9GB로 압축해 원본 대비 메모리를 9~10배 줄였다. PC에 들어갈 크기이며 고급 스마트폰에서도 실행할 가능성이 있다.
  • 회사에 따르면 Bonsai 2는 Qwen의 종합 벤치마크 점수의 98%를 유지해 첫 Bonsai의 95%보다 개선됐다. 첫 모델은 1,100만 회 이상, 더 작은 모델들은 추가로 260만 회 다운로드됐다.
  • PrismML은 통상 가중치당 16비트를 사용하는 모델을 +1, −1, 0의 세 값으로 표현하는 방식으로 압축한다. Hassibi는 압축이 성능에 어느 정도 영향을 미칠 가능성을 인정하면서도, 향후 수개월 내 수천억 매개변수 규모의 모델을 출시하고 더 높은 성능 보존율을 달성하기를 기대한다.
  • 기사는 벤치마크 점수 2% 하락이 실제 사용에 유의미한 차이를 만들지는 불확실하며 실행 소프트웨어도 정확도에 영향을 준다고 설명한다. Stoica는 기기 내 실행이 이미 구매한 기기를 활용한 무료 이용과 클라우드 전송 없는 개인정보 보호를 가능하게 할 것으로 기대한다.

🧩 주요 포인트

  1. GB로 줄어든 Bonsai 2 27B → 고성능 추론 모델의 PC 실행 가능성을 넓히지만, 고급 스마트폰에서의 실행은 아직 가능성으로 제시된다.
  2. 벤치마크 보존율 95%에서 98%로 개선 → 압축 기술의 진전을 보여주지만, 100% 성능 동등성과 실제 사용 품질은 별도로 확인할 문제다.
  3. 수천억 매개변수 모델로의 확장과 기기 내 실행 → 성능 보존 개선 및 비용·개인정보 보호상의 이점이 기대되지만, 향후 출시와 실제 구현에 달려 있다.

🧠 상세 정리

1. 작은 추론 모델에 거는 PrismML의 승부

PrismML은 유능하고 성능이 높은 추론형 대형 언어 모델이 반드시 큰 메모리 공간을 차지해야 하는 것은 아니라는 판단에서 출발한다. 목표는 추론 모델을 PC와 스마트폰에 들어갈 만큼 줄여, 사용자가 자신의 기기에서 실행할 수 있게 만드는 것이다. 회사는 Caltech 연구진이 설립했으며, Caltech 교수이자 압축 기술 전문가인 Babak Hassibi가 이끌고 있다. 시드 투자 규모는 2,225만 달러로, 기사는 막대한 자금보다 참여한 기술 인력과 개발 중인 기술의 잠재력에 주목한다. Apple과 협의 중이라는 소문도 소개하지만, Hassibi가 논평을 거부했으므로 협력 여부가 확인된 것은 아니다.

2. Bonsai 2 27B의 크기와 연구·투자 기반

새로 공개한 Bonsai 2 27B는 Alibaba의 널리 쓰이는 공개 모델 Qwen3.8 27B를 5.9GB로 압축한 모델이다. 원본과 비교하면 메모리 사용량이 9~10배 줄어 PC에 들어갈 수 있으며, 고급 스마트폰에서도 가능성이 있는 크기라고 기사는 설명한다. PrismML의 자문인 Ion Stoica는 Databricks 등의 공동 창업자이자 Berkeley의 Sky Computing Lab 소장으로, 이 연구실에서는 Letta와 SGLang 등 여러 기술과 스타트업이 나왔다. 투자자로는 Khosla Ventures, Cerberus Capital, Caltech가 참여하고 있다. 다만 LLM 압축은 PrismML만의 분야가 아니며, 기사는 스페인 Donostia International Physics Center의 저명한 교수가 설립하고 많은 자금을 유치한 Multiverse Computing도 경쟁 사례로 든다.

3. 벤치마크 성능 보존과 다운로드 실적

Hassibi는 원본 모델에 비해 성능이 거의 떨어지지 않는다는 점을 PrismML 압축 기술의 차별점으로 주장한다. 회사가 제시한 수치에 따르면 Bonsai 2는 Qwen의 종합 벤치마크 점수의 98%를 유지하며, 이는 3월에 공개한 첫 Bonsai의 95%보다 높은 수준이다. 회사는 첫 모델이 이미 1,100만 회 이상 다운로드됐고, 그보다 더 작은 모델들도 추가로 260만 회 다운로드됐다고 밝혔다. 이러한 수치는 출시를 거치며 성능 보존율이 개선됐다는 주장과 모델에 대한 이용자 관심을 뒷받침한다. 그러나 벤치마크 성능을 원본의 100%까지 보존할 수 있을지는 아직 확인되지 않았고, Hassibi 역시 압축이 어느 정도 영향을 미칠 가능성은 인정한다.

4. 벤치마크 차이와 실제 사용 품질의 관계

기사는 원본과 벤치마크 점수가 완전히 같은지를 따지는 일이 실제 사용에서는 다소 학술적인 문제일 수 있다고 지적한다. 압축하지 않은 LLM 자체도 완벽하게 정확하지 않고, 벤치마크 역시 실제 작업을 완벽히 반영하지 못하기 때문이다. 따라서 종합 점수가 2% 낮아진다는 사실만으로 사용자가 체감하는 성능이 유의미하게 나빠진다고 단정하기 어렵다는 것이 기사의 논지다. 또한 모델을 둘러싼 실행 소프트웨어, 즉 모델이 작동하는 하네스도 정확도에 큰 영향을 미친다고 설명한다. 이는 98%라는 수치를 모든 실제 작업에서 동일한 품질을 보장하는 값으로 읽기보다, 압축의 영향을 보여주는 제한된 지표로 해석해야 한다는 의미다.

5. 세 가지 가중치 값으로 줄이는 저장 공간

PrismML은 모델을 구성하는 가중치를 줄이는 방식으로 압축을 달성한다고 설명한다. 가중치는 본질적으로 모델이 학습 과정에서 습득하고 저장하는 정보이며, 기사에 따르면 일반적으로 각 가중치에 16비트가 필요하다. 회사가 사용하는 삼진 가중치 방식은 이를 +1, −1, 0이라는 세 가지 값으로 단순화한다. 가중치마다 저장해야 하는 값의 표현이 작아지므로 모델 전체가 차지하는 공간도 크게 줄어든다는 설명이다. 기사는 이 원리를 압축의 핵심으로 소개하고 더 자세한 기술 내용은 프로젝트의 Hugging Face 페이지로 안내하지만, 본문에서 구체적인 구현 절차까지 제시하지는 않는다.

6. 더 큰 모델로의 확장과 기기 내 AI의 기대

PrismML의 다음 목표는 같은 압축 기술을 더 큰 모델에 적용하는 것이다. Hassibi는 향후 수개월 안에 수천억 매개변수 규모의 모델을 출시하기를 희망하며, 그 규모에서는 지능을 유지하기가 더 쉬울 것으로 예상한다고 말했다. 모델이 커질수록 지능을 잃지 않고 압축할 여지가 늘어나므로, 일반적인 추세로는 원본 성능의 100%에 접근하기가 더 쉽다는 것이 그의 주장이다. Stoica는 이러한 기술이 고급 모델을 사용자 기기에서 실행할 수 있게 한다는 점에 기대를 나타냈다. 그는 이미 구매한 기기에서 실행하므로 무료로 지능을 활용하고 클라우드로 정보를 보내지 않아 개인정보도 보호할 수 있다고 전망하지만, 이는 기술이 가져올 이점에 대한 기대이지 모든 환경에서 검증된 결과로 제시된 것은 아니다.

🧾 핵심 주장 / 시사점

  • PrismML의 핵심 제안은 추론 모델의 능력을 최대한 유지하면서 저장 공간을 줄여, 고급 AI가 실행될 수 있는 기기의 범위를 넓히는 데 있다.
  • 벤치마크 성능 보존율의 개선은 압축 기술의 진전을 보여주지만, 실제 품질은 작업 특성과 실행 소프트웨어까지 함께 고려해야 판단할 수 있다.
  • 더 큰 모델이 오히려 성능을 보존하며 압축하기 쉽다는 Hassibi의 예상이 실현되는지가 향후 확장의 관건이며, 기기 내 실행의 비용·개인정보 보호상 이점도 실제 구현을 통해 확인할 부분이다.

✅ 액션 아이템

  • Bonsai 2 27B의 5.9GB 크기를 기준으로 PC 및 고급 스마트폰에서의 실제 실행 가능성 확인.
  • 벤치마크 보존율 98%가 실제 사용 품질에 미치는 영향을 실행 소프트웨어의 영향과 함께 검토.
  • 수천억 매개변수 모델의 향후 출시 여부와 성능 보존율 개선 여부 확인.

❓ 열린 질문

  • 5.9GB인 Bonsai 2 27B는 고급 스마트폰에서 실제로 어느 수준의 실행 성능을 제공할 수 있는가?
  • 벤치마크 보존율 98%와 실행 소프트웨어의 차이는 실제 사용 품질에 각각 어떤 영향을 미치는가?
  • 수천억 매개변수 모델에서는 Hassibi의 기대대로 100% 성능 동등성에 더 가까워질 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.