GSQ Explained: Smaller Quants, Same Great Performance
Quick Summary
GSQ는 학습 기반 양자화로 모델 파일을 더 작게 만들면서 이번 짧은 테스트에서 대체로 비슷한 품질과 생성 속도를 보였지만, 일부 평가 수치는 확인이 필요하다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
GSQ는 학습 기반 양자화로 모델 파일을 더 작게 만들면서 이번 짧은 테스트에서 대체로 비슷한 품질과 생성 속도를 보였지만, 일부 평가 수치는 확인이 필요하다.
📌 핵심 요점
- GSQ는 가중치를 가장 가까운 값으로 즉시 고정하는 대신, 인접한 후보들의 선택 확률을 학습해 저비트 양자화의 품질을 개선한다. 영상이 강조하는 목표 구간은 2~3비트다.
- Gumbel Softmax의 온도를 20회 학습 동안 2.0에서 0.05로 낮추며 탐색을 최종 선택으로 바꾼다. 소개된 분석에서는 가중치의 84.6%가 기존 위치를 유지했고, 이동한 가중치는 인접한 위치로만 움직였다.
- GSQ가 가중치의 위치를 결정한다면 RCO는 텐서별 비트 수를 배분한다. 테스트 파일은 평균 약 3.5비트이며, 하나의 파일 안에 11가지 정밀도를 섞어 사용한다.
- 파일 제작 비용은 크다. 영상에 소개된 8B 모델의 양자화 학습은 H200 8장으로 10시간, 70B 모델은 68시간이 걸렸다. 반면 사용자는 제공된 GGUF 파일을 llama.cpp 등에서 실행할 수 있다.
- 테스트한 GSQ 파일은 11.8GB로, 결말에서 비교한 EXL3 파일의 16.5GB보다 작았다. 생성 속도는 GSQ 16토큰/초와 EXL2 16.1토큰/초로 비슷했지만, 긴 문맥의 프리필에서는 EXL2가 우세했다. 품질 비교에는 자막 수치와 발표자의 해석이 맞지 않는 부분이 있다.
🧩 배경과 문제 정의
큰 언어 모델을 작은 장비에서 실행하려면 가중치가 차지하는 공간을 줄여야 한다. 양자화는 정밀한 가중치를 더 적은 허용 값으로 표현하는 방법이지만, 비트 수가 낮아질수록 품질을 유지하기 어려워진다. 영상은 이전 EXL3 소개에 달린 시청자 의견을 계기로 GSQ를 설명하고, 실제 파일의 크기·속도·품질을 비교한다.
GSQ가 제시하는 접근은 가까운 값을 한 번 선택하고 끝내는 방식에서 벗어나, 후보 값들의 확률을 학습하며 선택을 수정하는 것이다. 여기에 텐서별 비트 예산을 배분하는 RCO를 결합한 파일을 시험한다. 핵심 판단 기준은 작은 파일의 실사용 성능과 그 파일을 만드는 데 필요한 자원의 균형이다.
🕒 시간순 섹션별 상세정리
1. 시청자 반응에서 시작한 GSQ 탐구
- 이전 EXL3 영상에 대한 반응과 GSQ 관련 댓글을 계기로 새로운 양자화 방식을 조사했다고 보여준다. [00:24]
- GSQ를 가중치 크기를 줄여 큰 모델을 작은 장비에서 실행하게 하는 방법으로 소개하며, 단순 변환을 넘어 학습 과정이 필요하다고 강조한다. [00:50]
- 수학 설명을 최소화하고 실제 GSQ 모델을 내려받아 실행 속도와 품질을 시험하겠다고 예고한다. [01:21]
2. Agent Wiki’s 소개와 본론 복귀
- 지능형 에이전트 개발에 사용하는 지식 베이스와 로컬 AI 도구 등을 다루는 Agent Wiki’s를 보여준다. [01:35]
- 표준 위키는 무료이며, Pro는 월 9.99달러로 추가 위키와 맞춤 스킬을 제공한다고 안내한다. 당시 가입 가격 유지와 향후 가격 인상 계획도 언급한다. [01:57]
- 서비스 안내를 마치고 양자화의 문제를 설명하는 본론으로 돌아간다. [02:04]
3. 기존 양자화와 GSQ의 문제의식
- 전통적 양자화는 실제 가중치를 더 적은 허용 위치 중 가까운 값에 맞추는 방식이라고 보여준다. [02:47]
- NVFP4는 가중치 분포에 맞춘 눈금, EXL3는 여러 가중치를 하나의 경로로 근사하는 방식에 비유한다. GSQ는 기존 눈금을 사용하면서 더 좋은 선택을 탐색하는 접근으로 보여준다. [03:32]
- GSQ는 2비트 품질의 한계를 표현 형식보다 탐색 방식의 문제로 본다고 설명하며, 주로 2~3비트 구간을 목표로 한다고 드러낸다. [03:53]
4. 논문과 선행 연구의 계보
- 논문을 ‘올해 4월’ 제출된 연구로 소개하고, GSQ가 Gumbel Softmax를 활용하는 저비트 스칼라 양자화 방식임을 보여준다. [04:17]
- ISTA, ETH Zurich, TU Wien, Red Hat AI 등이 참여한 연구진과 공개 코드를 보여준다. [04:38]
- GPTQ를 출발점으로 삼고, MaskLM의 부드러운 결정 방식과 2019년의 선행 연구를 참고했다고 보여준다. [05:03]
5. 확률적 선택과 온도 낮추기
- 기존의 탐욕적 방식은 가까운 값을 즉시 선택하지만, GSQ는 인접한 값들에 선택 확률을 부여한다. [05:26]
- 예시에서는 처음에 가까운 값인 -1을 선택할 법한 가중치가 학습 후 0을 99% 확률로 선택한다. 원본 모델과 층의 출력을 비교하며 확률을 조정한다고 보여준다. [06:47]
- 20회 학습 동안 온도를 2.0에서 0.05로 낮춘다. 처음부터 낮은 온도로 고정하면 학습에 필요한 기울기가 부족하므로, 탐색을 거쳐 결정을 굳히는 과정이 필요하다고 보여준다. [07:46]
6. 일부 가중치의 작은 이동과 탐색 비용 절감
- 소개된 분석에서는 가중치의 84.6%가 기존 위치를 유지했고, 이동한 가중치는 한 단계만 움직였다. [08:08]
- 이 관찰을 바탕으로 전체 눈금 대신 바로 이웃한 후보만 탐색해 비용을 줄일 수 있다고 보여준다. 별도 그림에서는 400개 중 70개 가중치가 선택을 바꾼 사례를 보여준다. [08:39]
- 관련 정보와 도구가 있는 IST-DAS Lab/GSQ 저장소를 보여준다. [08:50]
7. 직접 제작에 필요한 학습 자원
- GSQ는 층별로 수백만 토큰을 사용하고 최적화기를 20회 학습시키는 과정이므로, 영상 안에서 기존 방식처럼 직접 변환하지는 못한다고 보여준다. [09:19]
- 소개된 연구의 8B 모델 작업은 H200 8장으로 10시간, 70B 모델 작업은 68시간이 걸렸다고 드러낸다. [09:44]
- 일반 장비에서 EXL2 작업이 3시간 반 걸렸던 사례와 비교하며, GSQ의 제작 비용을 주요 절충점으로 제시한다. [09:54]
8. RCO의 비트 배분과 저비트 품질
- GSQ는 가중치의 위치를, RCO는 텐서별 비트 수를 결정한다고 구분한다. 고정된 총예산을 효과가 큰 곳에 배분하며, 예시 파일은 평균 3.5비트와 11가지 정밀도를 사용한다. [11:24]
- 소개된 평가 점수는 원본 8비트 65, Unsloth 2비트 50, GSQ 적용 후 56.28이다. 낮은 비트 구간에서 개선이 있지만 원본 점수에는 못 미친다. [12:00]
- 기존 실행 도구에서 사용할 수 있는 파일이라는 장점과 함께, 1비트 파일 제작 불가, 2비트의 남은 한계, 논문의 편차 수치 부족 및 저장소 업데이트 상황을 언급한다. [12:48]
9. DGX Spark에서 파일 크기·속도·품질 비교
- 자막상 ‘Quen 3.8 27B’의 GSQ 파일을 DGX Spark에서 llama.cpp로 실행한다. Unsloth에서 받은 일반 GGUF 파일이며, 크기는 11.8GB, 평균 약 3.5비트라고 보여준다. [13:10]
- 생성 속도는 GSQ 16토큰/초, EXL2 16.1토큰/초다. 작은 파일이 더 빠르지 않은 이유로 11가지 혼합 정밀도의 복원 비용을 추정한다. [13:44]
- GSM8K는 GSQ 82/100, EXL3 94, NVFP4 83, 원본 82~83으로 보여준다. 이어 IFEval에서 GSQ가 더 높다고 말하지만, 자막의 80.87·0.85·0.83은 척도가 불명확해 순위를 확인해야 한다. [14:57]
10. 문맥 길이에 따른 속도와 최종 평가
- 완성된 파일 공급자에게 의존해야 한다는 부담을 언급한다. 프리필은 긴 문맥에서 EXL2의 이점이 커지고, GSQ는 약 16K 이후 하락하며, 디코딩 곡선은 거의 겹친다고 보여준다. [15:58]
- 결말에서는 EXL3 16.5GB와 GSQ 11.8GB를 비교한다. 짧은 평가의 품질은 비슷해 보이지만 긴 문맥의 프리필에는 차이가 있다는 절충점을 정리한다. [16:45]
- 작은 파일로 좋은 성능을 유지하는 점을 인기의 이유로 꼽는다. 첫 시험임을 밝히고 다른 모델에서도 결과가 이어지는지 살펴보겠다고 말하며, 시청자의 경험 공유를 요청하고 마친다. [17:25]
🧾 결론
- GSQ의 핵심은 새로운 표현 형식만 도입하는 것이 아니라, 허용된 양자화 값 중 더 좋은 선택을 학습으로 찾는 데 있다.
- 작은 파일로 유용한 품질을 유지한다는 결과는 유망하다. 다만 이 영상의 짧은 테스트만으로 모든 모델과 작업에서 같은 성능을 보장할 수는 없다.
- 실사용의 장점과 제작의 부담이 함께 존재한다. 완성된 파일은 쉽게 실행할 수 있지만, 직접 제작하려면 상당한 학습 자원이 필요하다.
📈 투자·시사 포인트
- 로컬 AI 도입에서는 모델 파일 크기와 실행 품질을 함께 비교필요가 있다. GSQ는 더 작은 파일로 비슷한 결과를 얻을 가능성을 보여준다.
- 파일 크기 감소가 곧바로 속도 향상으로 이어지지는 않는다. 이번 테스트에서는 생성 속도가 거의 같았고, 긴 문맥 처리에서는 비교 방식에 따른 차이가 나타났다.
- 경제성을 판단할 때는 양자화 파일 제작에 드는 연산 비용과 완성된 파일의 사용 편익을 함께 봐야 한다. 영상의 사례는 사용자에게 유용한 파일을 공급하는 제작자의 역할을 부각한다.
⚠️ 불확실하거나 확인이 필요한 부분
- IFEval 자막에는 GSQ 80.87, EXL3 0.85, NVFP4 0.83이 나오지만 발표자는 GSQ가 더 높다고 설명한다. 점수의 척도와 전사 정확성이 불명확하므로 정확한 순위와 차이를 확정하기 어렵다.
- GSM8K 자막 수치는 GSQ 82/100, EXL3 94, NVFP4 83, 원본 고정밀 모델 82~83이다. 발표자는 오차 범위 안이라고 설명하지만, EXL3와의 차이까지 그 해석이 성립하는지 판단할 통계 자료는 제시되지 않는다.
- 테스트 모델명은 자막에 ‘Quen 3.8 27B’로 표기되어 있다. 모델의 정확한 이름과 배포 파일 식별 정보는 원본 화면이나 배포처에서 확인해야 한다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 원본 평가 화면에서 IFEval의 점수 척도와 각 모델의 실제 수치를 확인한다.
- 배포처에서 정확한 모델명, GSQ·RCO 적용 여부, GGUF 파일 크기와 평균 비트 수를 확인한다.
- 동일한 장비와 실행 조건에서 GSQ와 비교 파일의 생성 속도 및 문맥 길이별 프리필 속도를 측정한다.
- 수학과 지시 준수 평가를 반복하고, 실제 사용 작업에서도 품질 차이를 확인한다.
❓ 열린 질문
- IFEval의 실제 수치는 무엇이며, GSQ가 더 높다는 설명과 자막의 숫자는 어떻게 일치하는가?
- GSQ와 RCO 각각이 파일 크기와 품질 개선에 얼마나 기여했는가?
- 다른 모델과 더 긴 평가에서도 작은 파일의 품질 유지가 재현되는가?