Articleaws.amazon.com·2026년 9월 18일·0

Introducing Kimi K3 on Amazon Bedrock

Quick Summary

AWS가 Amazon Bedrock에 Moonshot AI의 Kimi K3를 출시해 대규모 문맥을 활용하는 코딩·지식 업무와 명시적 프롬프트 캐싱을 지원한다.

Introducing Kimi K3 on Amazon Bedrock 관련 대표 이미지

🖼️ 인포그래픽

Introducing Kimi K3 on Amazon Bedrock 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Introducing Kimi K3 on Amazon Bedrock의 핵심 내용을 4단계로 요약한 인포그래픽
Introducing Kimi K3 on Amazon Bedrock 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

AWS가 Amazon Bedrock에 Moonshot AI의 Kimi K3를 출시해 대규모 문맥을 활용하는 코딩·지식 업무와 명시적 프롬프트 캐싱을 지원한다.

📌 핵심 요약

  • Moonshot AI에 따르면 Kimi K3는 자사 최고 성능 모델이자 최초로 2.8조 개 파라미터에 도달한 오픈 모델이며, 네이티브 시각 기능과 100만 토큰 문맥 창을 제공하고 Kimi K2 대비 스케일링 효율이 약 2.5배 개선됐다.
  • Amazon Bedrock은 2025년부터 수십 개의 오픈 웨이트 모델을 추가했고, 2026년에는 도구 호출, 구조화된 출력, 추론, 응답 스트리밍, Responses 및 Chat Completions API 지원을 플랫폼 기능으로 확장했다.
  • Kimi K3의 데이터는 AWS 데이터 경계 내에서 처리되며 모델 제공자에게 공유되거나 기반 모델 학습에 사용되지 않는다. 추론 요청에는 제로 데이터 보존이 항상 적용되고, 제로 운영자 접근으로 AWS 운영자도 추론 중 프롬프트와 완성 응답에 접근할 수 없다.
  • Kimi K3는 US 및 Global 교차 리전 추론 프로필로 제공된다. 지역 제한이 없는 워크로드에 권장되는 global.moonshotai.kimi-k3는 지원되는 전 세계 상용 AWS 리전으로 요청을 라우팅하며 지리적 프로필보다 비용이 약 10% 낮고, us.moonshotai.kimi-k3는 처리를 미국 지리적 범위 안에 유지한다.
  • Kimi K3는 Amazon Bedrock에서 명시적 프롬프트 캐싱을 지원하는 첫 오픈 웨이트 모델이다. 최소 1,024토큰의 재사용 접두부를 지정할 수 있고, 캐시 쓰기는 더 높은 요율이 적용되지만 최소 30분 보관되며, 캐시 적중 입력 토큰은 할인되고 분당 입력 토큰 할당량에서 제외된다.

🧩 주요 포인트

  1. 만 토큰 문맥 창과 네이티브 시각 기능 → 대규모 저장소·문서·이미지의 문맥을 유지해야 하는 장시간 코딩·지식 작업에 적합한 선택지로 제시된다.
  2. 명시적 프롬프트 캐싱의 쓰기 할증과 적중 할인 → 반복 문맥의 재사용 정도가 지연 시간·입력 비용 절감 효과를 판단하는 핵심 조건이다.
  3. OpenAI 호환 API와 Amazon Bedrock 연동 지원 → OpenCode의 코딩 작업과 Hermes Agent의 생산성 작업에 Kimi K3를 활용할 수 있지만, Hermes Agent의 이름 있는 AWS 프로필 사용에는 작성 시점 기준 설정 제약이 있다.

🧠 상세 정리

1. 오픈 웨이트 모델 확대와 Kimi K3 출시

AWS는 오픈 웨이트 모델의 지능과 효율이 빠르게 향상되면서 기업이 워크로드에 맞춰 성능·속도·비용의 균형을 선택할 수 있게 됐다는 배경에서 Kimi K3 출시를 소개한다. Moonshot AI에 따르면 Kimi K3는 자사 최고 성능 모델이며, 최초로 2.8조 개 파라미터에 도달한 오픈 모델이다. 네이티브 시각 기능과 100만 토큰 문맥 창을 결합하고 Kimi K2보다 스케일링 효율이 약 2.5배 개선됐다고 설명한다. 이러한 특성은 대규모 저장소·문서·이미지의 문맥을 지속적으로 유지해야 하는 장시간 코딩 및 지식 업무에 적합한 근거로 제시된다. 또한 Amazon Bedrock의 오픈 웨이트 모델 중 처음으로 명시적 프롬프트 캐싱을 지원해 여러 호출에서 같은 문맥을 재사용할 때 지연 시간과 입력 비용을 줄일 수 있다.

2. 플랫폼 기능 확장과 데이터 보호

Amazon Bedrock은 2025년부터 DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI, Qwen 등 여러 제공자의 오픈 웨이트 모델 수십 개를 추가했다. AWS는 이 선택지 확대와 함께 모델을 대규모로 제공하는 추론 기술도 발전시키고 있다고 설명한다. 2026년에 추가된 도구 호출, 구조화된 출력, 추론, 응답 스트리밍, Responses 및 Chat Completions API 지원은 개별 모델 전용 통합이 아니라 플랫폼 기능이므로 새 모델도 이를 활용할 수 있다. 데이터 보호 측면에서는 기존 보안 태세를 바꾸지 않고 Kimi K3를 도입할 수 있으며, 데이터는 AWS 데이터 경계 내에서 처리되고 모델 제공자에게 공유되거나 기반 모델 학습에 사용되지 않는다고 밝힌다. 추론 요청의 제로 데이터 보존은 항상 활성화되며, 제로 운영자 접근은 AWS 운영자도 추론 중 프롬프트와 완성 응답에 접근하지 못하게 한다.

3. 호출 방법과 교차 리전 프로필 선택

콘솔에서는 Amazon Bedrock의 Test > Playground로 이동해 Kimi K3를 선택하고 프롬프트를 시험할 수 있다. 프로그램에서는 bedrock-runtime 엔드포인트를 통해 OpenAI 호환 Responses·Chat Completions API와 Amazon Bedrock Invoke·Converse API를 사용할 수 있다. 지역 제한이 없는 워크로드에는 global.moonshotai.kimi-k3가 권장되며, 지원되는 전 세계 상용 AWS 리전으로 요청을 라우팅하고 지리적 프로필보다 비용이 약 10% 낮다. 미국 내 데이터 상주 요구가 있으면 처리를 미국 지리적 범위 안에 유지하는 us.moonshotai.kimi-k3를 사용할 수 있다. 예제 실행에는 Amazon Bedrock 접근이 가능한 AWS 계정, Python 3.10 이상, bedrock:InvokeModel·bedrock:InvokeModelWithResponseStream·bedrock:CreateInference 권한이 필요하다. 제공된 Python 예제는 OpenAI SDK와 aws-bedrock-token-generator로 단기 베어러 토큰을 생성해 인증하며, 지원 리전의 전체 목록과 가격은 각각 Bedrock 문서와 가격 페이지에서 확인하도록 안내한다.

4. 명시적 프롬프트 캐싱의 조건과 비용

장시간 코딩·지식 워크플로에서는 저장소 지침, 도구 정의, 참고 문서처럼 변하지 않는 문맥을 반복 전송하는 경우가 많다. 명시적 프롬프트 캐싱은 재사용할 프롬프트 접두부를 지정하고 후속 요청이 그 접두부와 일치하면 캐시를 활용해 응답 지연 시간과 입력 토큰 비용을 줄이는 기능이다. Kimi K3에서는 최소 1,024토큰 이후의 지원되는 입력 콘텐츠에 prompt_cache_breakpoint를 추가해 재사용 접두부의 끝을 표시할 수 있다. 명시적 모드에서 캐시에 쓰는 토큰은 더 높은 요율로 청구되지만 최소 30분 동안 보관된다. 이후 캐시에 적중한 입력 토큰은 할인 요율이 적용되고 분당 입력 토큰 할당량에 포함되지 않는다. OpenAI Python API 예제는 prompt_cache_options의 mode를 explicit으로 설정하고 여러 중단점을 통한 계층적 캐싱 및 cached_tokens를 통한 적중 확인 방법을 보여준다.

5. OpenCode를 통한 코딩 작업

Kimi K3는 API로 직접 호출하는 것 외에도 Amazon Bedrock이나 OpenAI 호환 모델 제공자를 지원하는 코딩 도우미와 에이전트 프레임워크에서 사용할 수 있다. 원문은 오픈 소스이자 특정 모델에 종속되지 않는 OpenCode를 코딩 에이전트의 예로 들며, 기본 제공되는 amazon-bedrock 공급자가 Converse API를 사용한다고 설명한다. 사용자 수준 또는 프로젝트 수준의 opencode.json에서 공급자를 설정하면 OpenCode가 이용 가능한 Amazon Bedrock 모델을 자동으로 탐지한다. 예제 설정에는 amazon-bedrock/global.moonshotai.kimi-k3 모델, us-west-2 리전, 사용자의 AWS 프로필 이름이 들어가며, 설정 후 /models 명령으로 모델을 선택하거나 전환할 수 있다. 원문은 Kimi K3가 상당한 규모의 기능 구현과 장기 작업을 수행할 수 있다고 소개하고, 단일 파일로 된 브라우저 게임을 만드는 영상을 활용 사례로 제시한다.

6. Hermes Agent 활용과 자격 증명 제약

일반 생산성 작업의 예로 제시된 Hermes Agent는 데스크톱 앱, 메시징 앱, 터미널에서 사용할 수 있는 오픈 소스 도우미이며 심층 조사와 작업 자동화를 지원한다. Amazon Bedrock 모델을 기본 지원하므로 hermes model을 실행한 뒤 제공자 목록에서 AWS Bedrock으로 잘못 표기된 항목을 선택하고, 요청을 보낼 AWS 리전을 지정하면 된다. 인증은 기존 AWS Command Line Interface 자격 증명을 사용하는 기본 자격 증명 체인이 권장되며, Amazon Bedrock API 키를 생성하는 방법도 제공된다. 자동 탐지 목록에서 Kimi K3를 선택하거나 목록에 없으면 global.moonshotai.kimi-k3를 사용자 지정 모델 이름으로 입력할 수 있다. 다만 작성 시점에 이름 있는 AWS 프로필을 사용하는 경우 AWS_PROFILE 환경 변수를 설정하거나 기본 프로필을 사용해야 하며, API 키로 전환하는 대안도 있다. Hermes 설정 파일에서 AWS 프로필을 지정하는 기능은 관련 공개 이슈를 통해 진행 상황을 확인하도록 안내하며, 개인 맞춤 학습 계획을 만드는 영상으로 활용 예를 보여준다.

🧾 핵심 주장 / 시사점

  • Kimi K3의 활용 가치는 큰 문맥 창 자체뿐 아니라 동일한 문맥을 여러 호출에서 유지하고 재사용하는 코딩·지식 업무와의 적합성에 있다.
  • 명시적 프롬프트 캐싱은 최초 쓰기 비용이 높으므로, 캐시 적중 할인과 최소 30분 보관 조건을 함께 고려해야 비용 절감 가능성을 판단할 수 있다.
  • Global 프로필의 약 10% 비용 이점과 US 프로필의 미국 내 처리 조건은 비용과 데이터 상주 요구를 함께 고려해야 하는 선택 기준이다.

✅ 액션 아이템

  • 대규모 저장소·문서·이미지를 다루는 코딩·지식 작업에서 Kimi K3의 100만 토큰 문맥 창과 네이티브 시각 기능의 적합성을 검토한다.
  • 명시적 프롬프트 캐싱의 최소 1,024토큰 조건, 최소 30분 보관, 쓰기 할증과 적중 할인을 기준으로 반복 문맥의 재사용 효과를 평가한다.
  • 지역 제한과 미국 내 처리 요구를 확인해 global.moonshotai.kimi-k3의 약 10% 비용 이점과 us.moonshotai.kimi-k3의 처리 범위를 비교한다.

❓ 열린 질문

  • 대상 코딩·지식 작업은 Kimi K3의 100만 토큰 문맥 창과 네이티브 시각 기능을 얼마나 활용할 수 있는가?
  • 최소 30분 보관되는 명시적 프롬프트 캐싱에서 반복 요청의 적중 할인은 더 높은 캐시 쓰기 비용을 상쇄할 수 있는가?
  • 대상 워크로드의 지역 제한은 global.moonshotai.kimi-k3 사용을 허용하는가, 아니면 미국 내 처리를 유지하는 us.moonshotai.kimi-k3가 필요한가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.