Articlehuggingface.co·2026년 8월 14일·0

State of Open Models: Summer 2026 Observations

Quick Summary

2026년 1~8월 공개 모델 생태계는 중국 연구소의 초대형 프런티어 공개, 미국의 하드웨어·인프라 중심 참여, Qwen 파생 생태계의 확대, 그리고 다운로드를 지배하는 소형 모델·GGUF 실행 계층의 공존으로 재편됐다.

State of Open Models: Summer 2026 Observations 관련 대표 이미지

🖼️ 인포그래픽

State of Open Models: Summer 2026 Observations 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

State of Open Models: Summer 2026 Observations의 핵심 내용을 4단계로 요약한 인포그래픽
State of Open Models: Summer 2026 Observations 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

2026년 1~8월 공개 모델 생태계는 중국 연구소의 초대형 프런티어 공개, 미국의 하드웨어·인프라 중심 참여, Qwen 파생 생태계의 확대, 그리고 다운로드를 지배하는 소형 모델·GGUF 실행 계층의 공존으로 재편됐다.

📌 핵심 요약

  • HF Hub의 공개 모델 저장소는 243만 개에서 296만 개로 늘었지만, 전체 모델의 85.6%는 누적 다운로드 200회 미만이고 저장소의 1.5%가 전체 다운로드의 99.2%를 차지했다.
  • 중국 연구소의 월별 최대 공개 모델 규모는 754B에서 2.78T 사이였으며, 미국에서는 AMD와 NVIDIA가 각각 200개가 넘는 저장소를 공개하면서 참여의 중심이 모델 연구소에서 하드웨어·인프라 기업으로 이동했다.
  • 연간 다운로드 상위 25개와 좋아요 상위 25개에 동시에 포함된 저장소는 하나뿐이었고, Moonshot의 다운로드 3,700만 건과 전 크기대를 제공한 Qwen의 20억 4,500만 건은 관심과 실제 채택 및 포트폴리오 폭의 차이를 보여줬다.
  • 20B 초과 중국 모델 178개 중 59%는 Apache 2.0, 22%는 MIT였고 비상업 제한은 하나도 없어, 공개 가중치의 가치는 라이선스 수익보다 API·클라우드·하드웨어·플랫폼 및 생태계 지위에 축적되는 구조를 나타냈다.
  • Qwen 기반 파생 저장소는 151,448개에 이르렀으며, 파라미터를 공개한 모델 중 1B 미만이 누적 다운로드의 83%를 차지하고 70B 초과 모델의 2026년 다운로드 비중은 3%에 그친 가운데 Qwen GGUF는 월 3,960만 건의 다운로드를 기록했다.

🧩 주요 포인트

  1. 규모와 포트폴리오: Moonshot·MiniMax 등의 70B 이상 집중은 벤치마크와 API 수요를 겨냥한 프런티어 전용 전략인 반면, Qwen의 1B 미만부터 2.4T까지 이어지는 범위는 개발자가 표준화할 모델군을 지향한다.
  2. 관심과 채택: 좋아요는 신규 프런티어 모델에 대한 주목을 보여주지만 다운로드는 반복 실행되는 파이프라인의 의존도를 반영하며, Moonshot과 Qwen의 약 55배 차이는 모델 크기보다 폭넓은 사용 범위와 초기 채택이 장기 사용량에 미치는 영향을 드러낸다.
  3. 개방성과 가치 축적: Apache 2.0·MIT 기반 공개와 커뮤니티 양자화는 대형 모델의 수정·재배포·실행 장벽을 낮추고, 직접적인 라이선스 수익 대신 API·클라우드·하드웨어·플랫폼 및 파생 생태계로 가치가 이동하게 한다.

🧠 상세 정리

1. 관찰 범위와 극단적인 사용 집중

이 글은 2026년 8월 14일 공개됐으며, 봄 보고서 이후인 2026년 1월부터 8월까지 HF Hub에서 관찰한 공개 모델 생태계의 변화를 데이터로 정리한다. 이 기간 공개 모델 저장소는 243만 개에서 296만 개로, 데이터세트는 71만 1천 개에서 100만 개로, Spaces는 100만 개에서 144만 개로 늘어 공급 기반이 매일 확대됐다. 그러나 분포는 매우 불균등해 전체 모델의 약 85.6%가 누적 다운로드 200회 미만에 머물렀다. 반대로 저장소의 1.5%가 전체 다운로드의 99.2%를 차지해 수적 성장과 실제 사용의 집중이 동시에 나타났다. 보고서는 이후의 프런티어 경쟁, 채택, 라이선스, 파생 생태계, 로컬 실행 변화를 모두 이 극단적인 집중 구조 안에서 해석한다.

2. 빠르게 높아진 중국 프런티어의 상한

과거에는 연구소가 소형 모델부터 공개한 뒤 점차 최대 규모로 올라가는 경로가 일반적이었지만, 2026년에는 여러 중국 연구소가 이 단계를 건너뛰고 처음부터 대형 모델을 내놓았다. 거의 매월 중국 연구소가 공개한 최대·최고 성능 모델은 미국 연구소의 자체 모델보다 컸으며, 중국의 월별 상한은 754B에서 2.78T 사이였다. 미국의 자체 공개 상한은 조사된 7개월 중 5개월 동안 130B 미만이었고, 주요 예외로 NVIDIA의 561B Nemotron 3 Ultra와 Thinking Machines Lab의 Inkling이 제시됐다. Moonshot, MiniMax, Xiaomi, Z.ai는 70B 미만 모델을 거의 공개하지 않은 반면 Tencent와 Alibaba Qwen은 1B 미만부터 대형 모델까지 전 범위를 제공했다. Xiaomi와 Meituan이 모두 1T를 넘기면서 대형 모델 구축 자체는 차별화 요소가 약해졌고, 커뮤니티 양자화가 공개 후 며칠 안에 대형 모델을 실행 가능한 형태로 바꾸면서 소형 모델 없이도 사용자에게 도달할 수 있게 됐다. 이에 따라 프런티어 전용 포트폴리오는 벤치마크 위치와 API 수요를, 전 크기대 포트폴리오는 개발자가 표준화할 모델군의 지위를 각각 목표로 하는 전략이 됐다.

3. 미국 공개 모델 참여의 중심 이동

미국이 공개 모델 생태계에서 사라진 것은 아니지만, 신규 공개를 이끄는 조직의 성격이 달라졌다. 2026년 가장 많은 새 공개 모델을 낸 두 조직은 하드웨어 기업인 AMD와 NVIDIA로, 각각 200개가 넘는 모델 저장소를 공개했으며 약 100개를 공개한 LiquidAI가 뒤를 이었다. 보고서는 특정 하드웨어에 최적화된 무료 모델이 해당 하드웨어의 작동과 성능을 입증하고 칩 판매를 지원하는 수단이 됐다고 설명한다. 소형 모델과 임베딩 모델까지 포함하면 Google, Microsoft, IBM Granite, OpenAI의 기존 비전·음성 모델이 매년 수억 건의 다운로드를 만들고 있어 미국의 전체 참여는 계속 증가했다. 다만 Google과 Meta의 신규 공개 순위는 NVIDIA보다 낮아졌고 Meta가 대표 모델을 폐쇄형으로 전환하면서, 공개 모델의 중심은 과거의 모델 연구소에서 하드웨어·인프라 기업으로 이동했다. 100B 초과 구간에서는 다수의 미국 공개물이 중국 모델을 기반으로 했고, 주요 미국 독자 모델은 Inkling 952B, Nemotron 3 Ultra 561B, Nemotron 3 Super 124B, Trinity-Large 399B 정도로 제시됐다. AMD의 변환 작업은 독자 대형 모델 제작은 아니지만 중국의 초대형 모델을 미국 하드웨어에서 효율적으로 실행하게 했으며, 중국에서도 자국 칩에 맞춘 모델 최적화가 확대됐다.

4. 좋아요와 다운로드가 측정하는 서로 다른 행동

2026년에 누적된 다운로드 상위 25개 저장소와 좋아요 상위 25개 저장소를 비교했을 때 두 목록에 동시에 포함된 저장소는 정확히 하나뿐이었다. 저장소가 오래 존재한 데 따른 이점을 줄이기 위해 해당 연도 안의 다운로드만 집계했음에도, 2026년에 공개된 모델은 다운로드 상위 25개에 하나도 없었고 그중 13개는 2022년에 공개된 모델이었다. all-MiniLM-L6-v2는 7개월 동안 15억 5천만 회 다운로드됐지만 좋아요는 5,156개였으며, Kimi-K3는 좋아요 한 개당 약 60회의 다운로드를 기록했다. 좋아요는 출시 직후 프런티어 모델이 얼마나 중요하거나 흥미롭게 받아들여지는지를 나타내고, 다운로드는 소형·안정형 모델이 정기 실행 파이프라인에 얼마나 깊이 연결돼 있는지를 나타낸다. 따라서 좋아요는 현재의 관심을 읽는 지표이고 다운로드는 현재의 실질적 의존도를 읽는 지표이며, 보고서는 둘 중 하나를 다른 하나의 대리 지표로 사용하는 것을 Hub 분석에서 반복된 오류로 지적한다.

5. 포트폴리오 폭과 채택의 시간 구조

중국 프런티어 연구소는 대형 모델 구간이 실제 다운로드량까지 담당한다는 점에서 미국의 대형 계정과 구별됐다. MiniMax의 2026년 다운로드는 사실상 전부 70B 초과 모델에서 발생했고, 같은 비율은 Moonshot 88%, DeepSeek 55%, Z.ai 39%였다. 반면 Google, Microsoft, IBM Granite는 70B 초과 모델의 다운로드가 사실상 없었고 NVIDIA는 14%, Meta는 9%에 그쳤다. 프런티어 전용 포트폴리오인 Moonshot은 연간 3,700만 건을 기록했지만 다양한 크기를 제공한 Qwen은 파라미터가 명시된 저장소에서 20억 4,500만 건, 전체 저장소에서 20억 6,100만 건을 기록해 약 55배의 차이를 보였다. Qwen은 2.4T 규모의 Qwen 3.8 Max부터 27B와 더 작은 변형까지 확장하며 서로 다른 사용 환경을 포괄했다. 대부분의 모델은 출시 직후 사용량이 급격히 감소한 뒤 안정적인 긴 꼬리를 형성하고, 채택 수준은 첫 몇 달 안에 상당 부분 결정되므로 현재 다운로드는 최신 모델보다 이미 기반 시설로 자리 잡은 모델에 집중됐다.

6. 관대한 라이선스와 가치 축적 지점의 변화

프런티어 모델이 라이선스 판매 사업의 핵심이라면 최대 규모 모델일수록 제한적인 조건을 가질 것으로 예상할 수 있지만, 조사 결과는 반대 방향을 보였다. 2026년에 공개된 20B 초과 중국 모델 178개 중 59%는 Apache 2.0, 22%는 MIT였으며 비상업적 사용 제한을 둔 모델은 하나도 없었다. DeepSeek과 Z.ai는 700B에서 1.65T 사이의 모델도 일반 MIT 조건으로 공개해 대형 모델과 소형 모델의 개방성에 큰 차이를 두지 않았다. 같은 규모의 미국 모델은 Apache 2.0 또는 MIT가 29%, 별도 조건이 41%, 라이선스 미표기가 30%여서 중국 모델보다 허용 범위가 좁거나 불명확한 비중이 높았다. 이 구조에서 공개 가중치의 직접적인 목적은 라이선스 수익이 아니며, 수익과 전략적 가치는 API·클라우드 사업, 하드웨어·플랫폼의 위치, 생태계 영향력에서 확보돼야 한다. 보고서는 Z.ai와 Kimi의 기업가치가 커뮤니티의 관심과 성장 기회를 얻는 공개 전략의 효과를 가리킨다고 설명하면서도, 앞으로는 공개 모델 채택을 수익화하는 경로가 더 명확해질 가능성을 제시한다.

7. Qwen을 기반 모델로 선택한 커뮤니티

모델의 생태계 지위는 자체 공개물의 수뿐 아니라 다른 개발자가 그 위에 얼마나 많은 결과물을 구축했는지로도 측정되며, 이 기준에서 Qwen은 가장 큰 기반 중 하나가 됐다. Qwen 기반 파생 저장소는 151,448개로 Meta 전체 기반 파생물의 2.6배이자 Llama 저장소만 비교했을 때 4.7배였고, Google은 82,506개로 뒤를 이었다. 세 번째로 큰 출처인 Unsloth는 양자화 및 미세조정 준비가 된 빌드를 공개하는 커뮤니티 계정이며, 그중 다수도 Qwen 생태계를 확장한다. 2026년 첫 7개월 동안 Qwen 파생 저장소는 하루 약 180~210개씩 꾸준히 증가해 특정 출시의 일시적 관심이 아니라 개발자의 기본 미세조정·배포 흐름에 편입됐음을 보여줬다. 정기적인 출시 주기, 소형 로컬 모델부터 대형 배포 모델까지 포괄하는 범위, 수정·재배포·상업 이용의 마찰을 낮추는 Apache 2.0이 이러한 위치를 만드는 요인으로 제시됐다. 넓은 모델군이 개발자를 끌어들이고, 개발자가 만든 파생물이 다시 생태계의 매력을 높이는 순환이 형성된 것이다. 151,448개 파생물은 Qwen 자체 공개물이 아니라 하위 개발자의 작업이며, Qwen 모델의 GGUF 변환 28,531개 중 Qwen이 직접 공개한 것은 54개뿐이었다.

8. 실제 사용을 지배하는 소형 모델

파라미터 수를 밝힌 모델만 보면 1B 미만 모델이 누적 다운로드의 83%를 차지하는 반면 100B 초과 모델은 1%에 그쳤다. 2026년에 쌓인 다운로드만 따로 봐도 70B 초과 모델의 비중은 3%여서, 시간 구간을 바꿔도 사용량 분포의 핵심은 달라지지 않았다. 이는 3월 보고서에서 확인한 소형 모델 중심의 실용 계층이 여름까지 유지됐다는 의미이며, 최신 초대형 모델에 쏠리는 관심과 실제 실행량이 서로 다름을 다시 보여준다. 보고서는 그 이유를 소형 모델이 대부분의 개발자가 실제로 보유한 하드웨어에서 직접 실행할 수 있는 유일한 크기대이기 때문이라고 설명한다. 따라서 초대형 프런티어 경쟁이 공개 모델의 성능 상한을 높이는 동안에도, 일상적인 파이프라인과 로컬 환경에서 발생하는 다운로드의 대부분은 접근 가능한 소형 모델이 담당했다.

9. llama.cpp와 GGUF가 넓힌 로컬 실행 경로

초대형 모델이 사용자에게 도달하는 대안 경로는 llama.cpp와 커뮤니티의 GGUF 변환에서 형성됐다. 2026년 2월 ggml 팀이 Hugging Face에 합류한 뒤에도 프로젝트는 완전한 오픈소스와 커뮤니티 거버넌스, 기존 기술 방향을 유지했으며 로컬 추론의 핵심 프로젝트에 지속 가능한 자원이 추가됐다. 7월 기준 GGUF 빌드에는 약 284B의 DeepSeek-V4-Flash와 약 2.8T의 Kimi-K3까지 포함돼 llama.cpp가 지원하는 규모의 상한이 크게 높아졌다. 이에 따라 로컬 추론은 노트북에서 8B 모델을 실행하는 수준을 넘어, 몇 대의 소비자용 장비에 1T급 혼합 전문가 모델을 분산하는 형태까지 확장됐다. Qwen 기반 GGUF는 월 3,960만 건 다운로드돼 Gemma의 2,080만 건에 근접한 두 배, Llama의 750만 건에는 다섯 배가 넘는 사용량을 기록했다. Llama 기반 GGUF 저장소 수가 Qwen보다 약간 많았는데도 트래픽은 훨씬 적었으므로 이 격차는 공급량만으로 설명되지 않았다. 같은 7개월 동안 전체 모델 저장소는 21.5% 증가한 반면 gguf 라이브러리 선언 저장소는 464%, lerobot은 194%, 애플 mlx는 148% 증가했고 transformers와 peft는 각각 16%, diffusers는 21% 늘어 실행·변환 계층이 더 빠르게 성장했다.

🧾 핵심 주장 / 시사점

  • 모델 규모의 분포는 더 이상 단순한 구축 능력의 차이가 아니라, 벤치마크·API 수요를 택할지 개발자의 표준 모델군을 택할지를 나타내는 포트폴리오 의도의 차이다.
  • 프런티어 모델이 관심을 주도해도 다운로드는 기존 파이프라인에 정착한 소형 모델에 집중되므로, 공개 모델 생태계의 영향력은 출시 시점의 반응과 장기 의존도를 분리해 해석해야 한다.
  • Qwen의 지위와 초대형 모델의 로컬 실행 가능성은 원 제작사의 공개물만이 아니라 파생 모델, 양자화, GGUF 변환을 생산하는 커뮤니티 계층에 크게 의존한다.

✅ 액션 아이템

  • HF Hub 성과 평가는 좋아요와 다운로드를 분리해 전자는 관심, 후자는 실제 의존도의 지표로 적용.
  • Qwen 채택 평가는 151,448개 파생 저장소, 1B 미만 모델의 다운로드 비중 83%, 월 3,960만 건의 GGUF 사용량을 함께 반영.
  • 70B 초과 프런티어 전략 평가는 2026년 다운로드 비중 3%와 Apache 2.0·MIT 기반의 API·클라우드·하드웨어·플랫폼 가치 축적을 함께 고려.

❓ 열린 질문

  • Qwen의 151,448개 파생 저장소와 Moonshot의 3,700만 건 다운로드 격차는 포트폴리오 폭이 채택에 미치는 영향을 어디까지 설명하는가?
  • 70B 초과 모델의 2026년 다운로드 비중 3%는 GGUF 실행 계층의 확장과 함께 어떻게 달라질까?
  • Apache 2.0·MIT 중심 공개는 API·클라우드·하드웨어·플랫폼에서 어떤 수익 경로를 만들 수 있을까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.