YouTubeTonbi''s AI Garage·2026년 9월 30일·0

GSQ Explained: Smaller Quants, Same Great Performance

Quick Summary

GSQ는 학습 기반 양자화로 모델 파일을 더 작게 만들면서 이번 짧은 테스트에서 대체로 비슷한 품질과 생성 속도를 보였지만, 일부 평가 수치는 확인이 필요하다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

GSQ Explained: Smaller Quants, Same Great Performance 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

GSQ Explained: Smaller Quants, Same Great Performance의 핵심 내용을 4단계로 요약한 인포그래픽
GSQ Explained: Smaller Quants, Same Great Performance 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

GSQ는 학습 기반 양자화로 모델 파일을 더 작게 만들면서 이번 짧은 테스트에서 대체로 비슷한 품질과 생성 속도를 보였지만, 일부 평가 수치는 확인이 필요하다.

📌 핵심 요점

  1. GSQ는 가중치를 가장 가까운 값으로 즉시 고정하는 대신, 인접한 후보들의 선택 확률을 학습해 저비트 양자화의 품질을 개선한다. 영상이 강조하는 목표 구간은 2~3비트다.
  2. Gumbel Softmax의 온도를 20회 학습 동안 2.0에서 0.05로 낮추며 탐색을 최종 선택으로 바꾼다. 소개된 분석에서는 가중치의 84.6%가 기존 위치를 유지했고, 이동한 가중치는 인접한 위치로만 움직였다.
  3. GSQ가 가중치의 위치를 결정한다면 RCO는 텐서별 비트 수를 배분한다. 테스트 파일은 평균 약 3.5비트이며, 하나의 파일 안에 11가지 정밀도를 섞어 사용한다.
  4. 파일 제작 비용은 크다. 영상에 소개된 8B 모델의 양자화 학습은 H200 8장으로 10시간, 70B 모델은 68시간이 걸렸다. 반면 사용자는 제공된 GGUF 파일을 llama.cpp 등에서 실행할 수 있다.
  5. 테스트한 GSQ 파일은 11.8GB로, 결말에서 비교한 EXL3 파일의 16.5GB보다 작았다. 생성 속도는 GSQ 16토큰/초와 EXL2 16.1토큰/초로 비슷했지만, 긴 문맥의 프리필에서는 EXL2가 우세했다. 품질 비교에는 자막 수치와 발표자의 해석이 맞지 않는 부분이 있다.

🧩 배경과 문제 정의

큰 언어 모델을 작은 장비에서 실행하려면 가중치가 차지하는 공간을 줄여야 한다. 양자화는 정밀한 가중치를 더 적은 허용 값으로 표현하는 방법이지만, 비트 수가 낮아질수록 품질을 유지하기 어려워진다. 영상은 이전 EXL3 소개에 달린 시청자 의견을 계기로 GSQ를 설명하고, 실제 파일의 크기·속도·품질을 비교한다.

GSQ가 제시하는 접근은 가까운 값을 한 번 선택하고 끝내는 방식에서 벗어나, 후보 값들의 확률을 학습하며 선택을 수정하는 것이다. 여기에 텐서별 비트 예산을 배분하는 RCO를 결합한 파일을 시험한다. 핵심 판단 기준은 작은 파일의 실사용 성능과 그 파일을 만드는 데 필요한 자원의 균형이다.

🕒 시간순 섹션별 상세정리

1. 시청자 반응에서 시작한 GSQ 탐구

  • 이전 EXL3 영상에 대한 반응과 GSQ 관련 댓글을 계기로 새로운 양자화 방식을 조사했다고 보여준다. [00:24]
  • GSQ를 가중치 크기를 줄여 큰 모델을 작은 장비에서 실행하게 하는 방법으로 소개하며, 단순 변환을 넘어 학습 과정이 필요하다고 강조한다. [00:50]
  • 수학 설명을 최소화하고 실제 GSQ 모델을 내려받아 실행 속도와 품질을 시험하겠다고 예고한다. [01:21]

2. Agent Wiki’s 소개와 본론 복귀

  • 지능형 에이전트 개발에 사용하는 지식 베이스와 로컬 AI 도구 등을 다루는 Agent Wiki’s를 보여준다. [01:35]
  • 표준 위키는 무료이며, Pro는 월 9.99달러로 추가 위키와 맞춤 스킬을 제공한다고 안내한다. 당시 가입 가격 유지와 향후 가격 인상 계획도 언급한다. [01:57]
  • 서비스 안내를 마치고 양자화의 문제를 설명하는 본론으로 돌아간다. [02:04]

3. 기존 양자화와 GSQ의 문제의식

  • 전통적 양자화는 실제 가중치를 더 적은 허용 위치 중 가까운 값에 맞추는 방식이라고 보여준다. [02:47]
  • NVFP4는 가중치 분포에 맞춘 눈금, EXL3는 여러 가중치를 하나의 경로로 근사하는 방식에 비유한다. GSQ는 기존 눈금을 사용하면서 더 좋은 선택을 탐색하는 접근으로 보여준다. [03:32]
  • GSQ는 2비트 품질의 한계를 표현 형식보다 탐색 방식의 문제로 본다고 설명하며, 주로 2~3비트 구간을 목표로 한다고 드러낸다. [03:53]

4. 논문과 선행 연구의 계보

  • 논문을 ‘올해 4월’ 제출된 연구로 소개하고, GSQ가 Gumbel Softmax를 활용하는 저비트 스칼라 양자화 방식임을 보여준다. [04:17]
  • ISTA, ETH Zurich, TU Wien, Red Hat AI 등이 참여한 연구진과 공개 코드를 보여준다. [04:38]
  • GPTQ를 출발점으로 삼고, MaskLM의 부드러운 결정 방식과 2019년의 선행 연구를 참고했다고 보여준다. [05:03]

5. 확률적 선택과 온도 낮추기

  • 기존의 탐욕적 방식은 가까운 값을 즉시 선택하지만, GSQ는 인접한 값들에 선택 확률을 부여한다. [05:26]
  • 예시에서는 처음에 가까운 값인 -1을 선택할 법한 가중치가 학습 후 0을 99% 확률로 선택한다. 원본 모델과 층의 출력을 비교하며 확률을 조정한다고 보여준다. [06:47]
  • 20회 학습 동안 온도를 2.0에서 0.05로 낮춘다. 처음부터 낮은 온도로 고정하면 학습에 필요한 기울기가 부족하므로, 탐색을 거쳐 결정을 굳히는 과정이 필요하다고 보여준다. [07:46]

6. 일부 가중치의 작은 이동과 탐색 비용 절감

  • 소개된 분석에서는 가중치의 84.6%가 기존 위치를 유지했고, 이동한 가중치는 한 단계만 움직였다. [08:08]
  • 이 관찰을 바탕으로 전체 눈금 대신 바로 이웃한 후보만 탐색해 비용을 줄일 수 있다고 보여준다. 별도 그림에서는 400개 중 70개 가중치가 선택을 바꾼 사례를 보여준다. [08:39]
  • 관련 정보와 도구가 있는 IST-DAS Lab/GSQ 저장소를 보여준다. [08:50]

7. 직접 제작에 필요한 학습 자원

  • GSQ는 층별로 수백만 토큰을 사용하고 최적화기를 20회 학습시키는 과정이므로, 영상 안에서 기존 방식처럼 직접 변환하지는 못한다고 보여준다. [09:19]
  • 소개된 연구의 8B 모델 작업은 H200 8장으로 10시간, 70B 모델 작업은 68시간이 걸렸다고 드러낸다. [09:44]
  • 일반 장비에서 EXL2 작업이 3시간 반 걸렸던 사례와 비교하며, GSQ의 제작 비용을 주요 절충점으로 제시한다. [09:54]

8. RCO의 비트 배분과 저비트 품질

  • GSQ는 가중치의 위치를, RCO는 텐서별 비트 수를 결정한다고 구분한다. 고정된 총예산을 효과가 큰 곳에 배분하며, 예시 파일은 평균 3.5비트와 11가지 정밀도를 사용한다. [11:24]
  • 소개된 평가 점수는 원본 8비트 65, Unsloth 2비트 50, GSQ 적용 후 56.28이다. 낮은 비트 구간에서 개선이 있지만 원본 점수에는 못 미친다. [12:00]
  • 기존 실행 도구에서 사용할 수 있는 파일이라는 장점과 함께, 1비트 파일 제작 불가, 2비트의 남은 한계, 논문의 편차 수치 부족 및 저장소 업데이트 상황을 언급한다. [12:48]

9. DGX Spark에서 파일 크기·속도·품질 비교

  • 자막상 ‘Quen 3.8 27B’의 GSQ 파일을 DGX Spark에서 llama.cpp로 실행한다. Unsloth에서 받은 일반 GGUF 파일이며, 크기는 11.8GB, 평균 약 3.5비트라고 보여준다. [13:10]
  • 생성 속도는 GSQ 16토큰/초, EXL2 16.1토큰/초다. 작은 파일이 더 빠르지 않은 이유로 11가지 혼합 정밀도의 복원 비용을 추정한다. [13:44]
  • GSM8K는 GSQ 82/100, EXL3 94, NVFP4 83, 원본 82~83으로 보여준다. 이어 IFEval에서 GSQ가 더 높다고 말하지만, 자막의 80.87·0.85·0.83은 척도가 불명확해 순위를 확인해야 한다. [14:57]

10. 문맥 길이에 따른 속도와 최종 평가

  • 완성된 파일 공급자에게 의존해야 한다는 부담을 언급한다. 프리필은 긴 문맥에서 EXL2의 이점이 커지고, GSQ는 약 16K 이후 하락하며, 디코딩 곡선은 거의 겹친다고 보여준다. [15:58]
  • 결말에서는 EXL3 16.5GB와 GSQ 11.8GB를 비교한다. 짧은 평가의 품질은 비슷해 보이지만 긴 문맥의 프리필에는 차이가 있다는 절충점을 정리한다. [16:45]
  • 작은 파일로 좋은 성능을 유지하는 점을 인기의 이유로 꼽는다. 첫 시험임을 밝히고 다른 모델에서도 결과가 이어지는지 살펴보겠다고 말하며, 시청자의 경험 공유를 요청하고 마친다. [17:25]

🧾 결론

  • GSQ의 핵심은 새로운 표현 형식만 도입하는 것이 아니라, 허용된 양자화 값 중 더 좋은 선택을 학습으로 찾는 데 있다.
  • 작은 파일로 유용한 품질을 유지한다는 결과는 유망하다. 다만 이 영상의 짧은 테스트만으로 모든 모델과 작업에서 같은 성능을 보장할 수는 없다.
  • 실사용의 장점과 제작의 부담이 함께 존재한다. 완성된 파일은 쉽게 실행할 수 있지만, 직접 제작하려면 상당한 학습 자원이 필요하다.

📈 투자·시사 포인트

  • 로컬 AI 도입에서는 모델 파일 크기와 실행 품질을 함께 비교필요가 있다. GSQ는 더 작은 파일로 비슷한 결과를 얻을 가능성을 보여준다.
  • 파일 크기 감소가 곧바로 속도 향상으로 이어지지는 않는다. 이번 테스트에서는 생성 속도가 거의 같았고, 긴 문맥 처리에서는 비교 방식에 따른 차이가 나타났다.
  • 경제성을 판단할 때는 양자화 파일 제작에 드는 연산 비용과 완성된 파일의 사용 편익을 함께 봐야 한다. 영상의 사례는 사용자에게 유용한 파일을 공급하는 제작자의 역할을 부각한다.

⚠️ 불확실하거나 확인이 필요한 부분

  • IFEval 자막에는 GSQ 80.87, EXL3 0.85, NVFP4 0.83이 나오지만 발표자는 GSQ가 더 높다고 설명한다. 점수의 척도와 전사 정확성이 불명확하므로 정확한 순위와 차이를 확정하기 어렵다.
  • GSM8K 자막 수치는 GSQ 82/100, EXL3 94, NVFP4 83, 원본 고정밀 모델 82~83이다. 발표자는 오차 범위 안이라고 설명하지만, EXL3와의 차이까지 그 해석이 성립하는지 판단할 통계 자료는 제시되지 않는다.
  • 테스트 모델명은 자막에 ‘Quen 3.8 27B’로 표기되어 있다. 모델의 정확한 이름과 배포 파일 식별 정보는 원본 화면이나 배포처에서 확인해야 한다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 원본 평가 화면에서 IFEval의 점수 척도와 각 모델의 실제 수치를 확인한다.
  • 배포처에서 정확한 모델명, GSQ·RCO 적용 여부, GGUF 파일 크기와 평균 비트 수를 확인한다.
  • 동일한 장비와 실행 조건에서 GSQ와 비교 파일의 생성 속도 및 문맥 길이별 프리필 속도를 측정한다.
  • 수학과 지시 준수 평가를 반복하고, 실제 사용 작업에서도 품질 차이를 확인한다.

❓ 열린 질문

  • IFEval의 실제 수치는 무엇이며, GSQ가 더 높다는 설명과 자막의 숫자는 어떻게 일치하는가?
  • GSQ와 RCO 각각이 파일 크기와 품질 개선에 얼마나 기여했는가?
  • 다른 모델과 더 긴 평가에서도 작은 파일의 품질 유지가 재현되는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.