ArticleJacob Nulty·2026년 8월 13일·0

What is Kimi K3? A Complete Developer Guide for 2026

Quick Summary

Kimi K3는 Moonshot AI가 공개한 2.8조 매개변수의 오픈 웨이트 멀티모달 모델로, 1,048,576토큰 문맥과 프런티어급 벤치마크 성능을 제공하지만 자체 호스팅에는 최소 8개의 엔터프라이즈급 가속기와 높은 초기 비용이 필요하다.

What is Kimi K3? A Complete Developer Guide for 2026 관련 대표 이미지

🖼️ 인포그래픽

What is Kimi K3? A Complete Developer Guide for 2026 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

What is Kimi K3? A Complete Developer Guide for 2026의 핵심 내용을 4단계로 요약한 인포그래픽
What is Kimi K3? A Complete Developer Guide for 2026 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Kimi K3는 Moonshot AI가 공개한 2.8조 매개변수의 오픈 웨이트 멀티모달 모델로, 1,048,576토큰 문맥과 프런티어급 벤치마크 성능을 제공하지만 자체 호스팅에는 최소 8개의 엔터프라이즈급 가속기와 높은 초기 비용이 필요하다.

📌 핵심 요약

  • Moonshot AI는 2026년 7월 16일 Kimi K3 API를 공개하고 7월 27일 전체 가중치를 배포했으며, 원문 작성 시점인 2026년 8월 기준 2.8조 매개변수와 1,048,576토큰 문맥을 갖춘 최대 규모의 오픈 웨이트 모델로 소개됐다.
  • Kimi K3는 토큰당 104B 매개변수를 활성화하는 Mixture-of-Experts 구조를 사용하며, 총 896개 전문가와 Stable LatentMoE·Kimi Delta Attention·Attention Residuals를 통해 Kimi K2 대비 약 2.5배의 전체 스케일링 효율 향상을 제시한다.
  • Moonshot AI가 공개한 평가에서 Kimi K3는 DeepSWE 67.5, FrontierSWE 81.2, Program Bench 77.8, BrowseComp 91.2를 기록했고, Python 도구를 사용한 시각 평가에서는 CharXiv 91.3과 ZeroBench 41.0을 기록해 Claude Fable 5와 GPT-5.6 Sol 등 프런티어 모델들과 경쟁했다.
  • Kimi K3는 Hugging Face, OpenRouter, Fireworks AI, Baseten, Together AI와 Moonshot 공식 플랫폼에서 이용할 수 있으며, 표준 API 요금은 입력·캐시 입력·출력 100만 토큰당 각각 $3.00·$0.30·$15.00이고 OpenRouter의 최저 경로는 $2.80·$0.29·$14.00이다. OpenCode에서 실행할 수 있고 Firecrawl MCP를 연결하면 실시간 웹 데이터에 접근할 수 있다.
  • 공식 체크포인트는 약 1.561TB이고 vLLM의 VRAM 계획 하한은 1,680GB이며, 자체 호스팅의 최소 단일 노드 구성은 8개의 B300·GB300·MI355X이다. 8개 B300 기반 장비는 높은 6자리 달러 비용이 예상되는 반면, 약 594GB의 1비트 GGUF 양자화판은 하드웨어 요구량을 줄이지만 정확도 손실을 수반한다.

🧩 주요 포인트

  1. 규모와 구조: 2.8조 매개변수·104B 활성 매개변수·896개 전문가의 MoE 구조와 1,048,576토큰 문맥은 Kimi K3가 장문 및 텍스트·이미지·비디오 통합 작업을 겨냥한 대형 모델임을 보여준다.
  2. 성능과 평가 조건: Program Bench 77.8과 BrowseComp 91.2 등은 프런티어급 경쟁력을 나타내지만, Python 도구 제공 여부와 문맥 압축 전략에 따라 시각 및 브라우징 점수가 크게 달라지므로 순위와 실행 조건을 함께 해석해야 한다.
  3. 도입 방식과 제약: OpenRouter를 포함한 API는 토큰 단위로 이용할 수 있지만 자체 호스팅은 최소 8개의 엔터프라이즈급 가속기와 1,680GB 수준의 VRAM 계획이 필요해 비용·문맥 길이·정확도 요구에 따른 선택이 중요하다.

🧠 상세 정리

1. Kimi K3의 정의와 공개 일정

Kimi K3는 Moonshot AI가 Kimi K2.7 Code의 후속으로 공개한 오픈 웨이트 모델이며, 원문 작성 시점인 2026년 8월 기준 총 2.8조 매개변수로 공개 가중치 모델 가운데 가장 큰 규모로 소개됐다. Moonshot AI는 2026년 7월 16일 API 접근을 먼저 개방한 뒤 7월 27일 Hugging Face를 통해 전체 가중치를 배포했다. 모델은 텍스트뿐 아니라 이미지와 비디오를 네이티브로 처리하며, 한 번의 문맥에 최대 1,048,576토큰을 담을 수 있어 262,144토큰이었던 Kimi K2.7 Code보다 문맥 길이가 정확히 4배 늘었다. 다만 원문의 일부 표현과 달리 라이선스는 일반적인 MIT가 아니라 별도의 Kimi K3 License이므로, 가중치 공개와 사용 조건을 동일한 의미로 간주해서는 안 된다. 배포나 상업적 이용을 검토할 때에는 Hugging Face에 게시된 공식 라이선스 조건을 기준으로 삼아야 한다.

2. MoE 구조와 멀티모달 사양

Kimi K3는 Mixture-of-Experts와 Stable LatentMoE 구조를 채택해 전체 2.8조 매개변수 가운데 토큰마다 104B를 활성화한다. 총 896개 전문가가 있으며 토큰당 16개가 선택되고 2개는 공유 전문가로 제시돼, 전체 규모를 유지하면서 계산에 참여하는 범위를 제한한다. 구조 사양에는 93개 층, 69개 KDA, 24개 Gated MLA와 1개 dense layer가 기재돼 있고, 전문가 가중치는 MXFP4, 활성값은 MXFP8을 사용하며 비전 인코더로 401M 매개변수의 MoonViT-V2를 탑재한다. 양자화 인식 학습은 SFT 단계부터 적용됐고 전문가 이외의 구성요소는 더 높은 정밀도로 유지된다. Moonshot AI의 기술 보고서는 Kimi Delta Attention, Attention Residuals와 Stable LatentMoE를 포함한 구조 및 학습 변경이 Kimi K2 대비 전체 스케일링 효율을 약 2.5배 높였다고 설명한다.

3. 코딩 벤치마크 성능

Moonshot AI의 기술 블로그에 따르면 Kimi K3는 DeepSWE에서 67.5를 기록해 GPT-5.5의 67.0을 근소하게 앞섰고, GPT-5.6 Sol의 73.0과 Claude Fable 5의 70.0 뒤를 이었다. FrontierSWE에서는 81.2로 GPT-5.6 Sol, GLM-5.2, Claude Opus 4.8과 GPT-5.5를 제치고 Claude Fable 5의 86.6에 이어 2위를 기록했다. 내부 평가인 Kimi Code Bench 2.0에서는 72.9, Terminal Bench 2.1에서는 88.3으로 각각 Claude Fable 5와 GPT-5.6 Sol에 근접했다. Program Bench에서는 77.8로 GPT-5.6 Sol의 77.6을 포함한 모든 비교 모델을 앞섰고, SWE Marathon에서도 42.0으로 평가 대상 중 가장 높은 점수를 기록했다. SWE Marathon에서 Claude Fable 5의 점수는 작업의 35%에서 발생한 하네스 폴백의 영향을 받았다는 조건도 함께 제시됐다. 또한 기술 블로그와 출시 후 개정된 arXiv 보고서 사이에는 일부 점수 차이가 있으므로 특정 수치를 사용할 때는 양쪽 자료의 평가 버전을 구분해야 한다.

4. 일반 에이전트와 브라우징 평가

일반 에이전트 평가에서 Kimi K3는 GDPval-AA V2 Elo 기준 Claude Fable 5와 GPT-5.6 Sol 다음에 위치했고, AA-Briefcase에서는 1548로 Claude Fable 5의 1583에 이어 2위를 기록했다. Automation Bench에서는 30.8로 GPT-5.6 Sol의 29.7을 포함한 모든 비교 모델을 앞섰으며, JobBench에서는 52.9로 Claude Fable 5의 57.4에 이어 2위였다. SpreadsheetBench 2에서는 34.8을 기록해 Claude Fable 5의 34.7을 근소하게 웃돌았다. BrowseComp에서는 문맥 압축 전략을 적용했을 때 91.2로 GPT-5.6 Sol의 90.4보다 높았지만, 별도 문맥 관리 없이 전체 100만 토큰 문맥을 사용한 실행에서는 90.4로 내려가 GPT-5.6 Sol과 동률을 이뤘다. 이 차이는 최대 문맥 길이 자체뿐 아니라 긴 문맥을 정리하고 유지하는 실행 전략이 브라우징 성능에 직접 영향을 준다는 점을 보여준다.

5. 시각 에이전트 성능과 도구 효과

시각 평가에 제시된 대표 수치는 모두 Python 도구를 사용할 수 있는 조건에서 측정됐다. Kimi K3는 CharXiv의 RQ 평가에서 91.3을 기록해 Claude Fable 5의 93.5에 이어 2위를 차지했고, ZeroBench에서는 41.0으로 GPT-5.5와 동률을 이루면서 Claude Fable 5의 46.0보다 낮았다. 같은 ZeroBench 평가에서 GPT-5.6 Sol과 Claude Opus 4.8은 모두 40점 미만을 기록했다. 그러나 Python 도구가 없으면 Kimi K3의 점수는 CharXiv 84.8과 ZeroBench 23.0으로 내려가며, ZeroBench에서는 Claude Fable 5와 동률이 된다. 따라서 이미지·도표 해석이나 시각 기반 에이전트 자동화에 관한 성능 수치는 모델 단독 능력과 Python 도구 보조 실행을 분리해 해석해야 한다.

6. 제공 경로와 API 가격

Kimi K3의 공식 가중치는 Hugging Face에서 무료로 내려받을 수 있으며, 관리형 API는 OpenRouter, Fireworks AI, Baseten, Together AI와 Moonshot의 platform.kimi.ai에서 제공된다. Fireworks AI, Baseten, Together AI와 공식 Kimi 플랫폼의 표준 요금은 입력 100만 토큰당 $3.00, 캐시 입력 $0.30, 출력 $15.00으로 제시됐다. OpenRouter의 최저 경로는 각각 $2.80, $0.29, $14.00이지만, 개별 엔드포인트는 입력 $2.80~$6.00과 출력 $14.00~$22.50 범위이므로 최저 요금이 모든 경로에 적용되는 것은 아니다. OpenRouter는 자동 장애 조치와 Balanced·Nitro·Exacto 라우팅 모드를 제공하고 전체 1,048,576토큰 문맥을 지원하지만 최대 출력 토큰은 연결된 제공자마다 달라진다. Fireworks AI는 속도 및 미국 전용 등급과 기본 제로 데이터 보존을 제공하며, 공식 Kimi API는 kimi-k3라는 모델명과 OpenAI·Anthropic 호환 형식을 사용한다. Baseten의 모델 페이지가 라이선스를 MIT로 표시한 것은 원문에서 오류로 지적됐으며, 라이선스 판단의 기준은 Hugging Face의 공식 Kimi K3 License이다.

7. 자체 호스팅의 인프라 하한

공식 Kimi K3 저장소는 96개의 Safetensors 샤드와 설정·토크나이저 파일을 합쳐 1,561,018,243,668바이트, 약 1.561TB 규모다. vLLM의 출시 전 추산은 가중치와 20% 여유분을 기준으로 VRAM 계획 하한을 1,680GB로 잡지만, 이 수치는 실제 측정치가 아니며 KV 캐시 용량도 포함하지 않는다. 최소 단일 노드 구성은 각각 288GB 메모리를 갖춘 B300, GB300 또는 MI355X 8개로 제시됐다. H200 16개 또는 B200 16개 구성도 가중치를 적재할 수 있지만 KV 캐시 여유가 적으며, vLLM의 Hopper 레시피는 문맥을 32,768토큰으로 제한하고 100만 토큰 설정은 fp8 KV 캐시를 사용하는 Blackwell 프로필에만 나타난다. Moonshot AI가 제시한 권장 프로덕션 구성은 슈퍼노드 형태의 가속기 64개 이상이고, 체크포인트 보관과 변환·양자화 공간을 고려한 4TB NVMe는 Kingy AI가 제시한 경험적 기준이다.

8. 하드웨어 비용과 양자화의 절충

원문의 자체 계산에 따르면 B300 한 개 가격을 약 $53,000으로 잡았을 때 8개의 가속기만 약 $424,000이며, CPU·NVSwitch 패브릭·네트워크·스토리지·액체 냉각을 포함한 완성 노드는 대략 $400,000~$500,000 범위로 제시된다. AMD MI355X 기반 구성은 약 $250,000~$350,000으로 더 낮게 추산됐지만 여전히 대규모 자본 지출이다. 임대 사례에서는 B300 8개가 시간당 약 $59, 연속 운용 시 월 약 $43,000으로 계산됐다. 이 요구량은 공식 MXFP4 체크포인트를 기준으로 하며, Unsloth의 1비트 GGUF 커뮤니티 양자화판은 크기를 약 594GB까지 줄여 고용량 RAM 워크스테이션이나 최소 4개의 데이터센터 GPU에서 실행할 가능성을 제시한다. 다만 원문은 이 양자화가 실제 정확도 손실을 동반하므로 모델을 시험하는 용도에는 적합할 수 있지만 서비스 운영을 위한 동등한 대안은 아니라고 구분한다.

9. OpenCode 실행과 Firecrawl 웹 연결

원문은 Kimi K3를 개발 환경에서 사용하는 사례로 OpenCode를 제시하며, 먼저 npm install -g opencode-ai 명령으로 전역 설치하도록 안내한다. 설치 후에는 opencode auth login으로 선택한 모델 제공자에 인증하고 opencode 명령으로 OpenCode를 실행하는 순서를 설명한다. 실시간 웹 접근을 추가하기 위한 첫 단계로 npm install -g firecrawl-cli 명령을 제시하며, Firecrawl MCP를 연결하면 Kimi K3가 정적인 모델 지식에 더해 최신 웹 데이터를 조회할 수 있다고 설명한다. 저자가 실제로 Kimi K3를 OpenCode에서 실행하고 Firecrawl MCP로 라이브 웹 접근을 부여했다는 결과도 명시돼 있다. 다만 제공된 source_body는 Firecrawl CLI 설치 이후의 상세 설정 과정에서 중단되므로, MCP 등록이나 인증에 관한 후속 명령은 이 원문 범위만으로 확정할 수 없다.

🧾 핵심 주장 / 시사점

  • Kimi K3는 가중치를 공개했지만 별도의 Kimi K3 License을 사용하고 최소 8개의 엔터프라이즈급 가속기를 요구하므로, 오픈 웨이트라는 특성이 곧 낮은 운영 장벽을 의미하지는 않는다.
  • 1,048,576토큰은 모델의 최대 문맥 사양이지만 Hopper 자체 호스팅 레시피는 32,768토큰으로 제한되며 API의 최대 출력도 제공자마다 달라, 명목 사양과 실제 이용 가능한 문맥 조건을 구분해야 한다.
  • BrowseComp의 문맥 압축과 CharXiv·ZeroBench의 Python 도구 사용 여부가 점수를 바꾼다는 결과는 Kimi K3의 성능 비교에서 모델명뿐 아니라 도구와 실행 전략도 핵심 평가 조건임을 보여준다.

✅ 액션 아이템

  • Kimi K3 API 도입 시 OpenRouter의 $2.80·$0.29·$14.00 최저 경로와 Fireworks AI·Baseten·Together AI·Moonshot의 $3.00·$0.30·$15.00 표준 요금 비교가 필요함.
  • Program Bench 77.8, BrowseComp 91.2, CharXiv 91.3의 적용 가능성은 Python 도구와 문맥 압축 전략을 포함한 실제 실행 조건에서 검증할 필요가 있음.
  • Kimi K3 자체 호스팅은 최소 8개의 B300·GB300·MI355X와 1,680GB VRAM 계획을 기준으로 검토하고, 594GB 1비트 GGUF의 정확도 손실도 함께 고려할 필요가 있음.

❓ 열린 질문

  • 실제 개발 작업에서 Kimi K3의 1,048,576토큰 문맥과 텍스트·이미지·비디오 네이티브 처리가 모두 필요한가?
  • OpenRouter의 $2.80·$0.29·$14.00 최저 경로와 Moonshot의 $3.00·$0.30·$15.00 API 중 비용과 제공 조건에 더 부합하는 방식은 무엇인가?
  • 최소 8개의 엔터프라이즈급 가속기를 사용하는 Kimi K3 자체 호스팅과 관리형 API 중 높은 6자리 달러 비용 제약에 부합하는 방식은 무엇인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.