Articleaws.amazon.com·2026년 9월 23일·0

Use open weight models as your AI coding agent with Amazon Bedrock

Quick Summary

AWS는 로컬 코딩 에이전트 OpenCode와 Amazon Bedrock의 오픈 웨이트 모델을 결합해 데이터 상주 요건을 고려하면서 작업별 모델 선택과 사용량 기반 과금을 적용하는 구성을 소개한다.

Use open weight models as your AI coding agent with Amazon Bedrock 관련 대표 이미지

🖼️ 인포그래픽

Use open weight models as your AI coding agent with Amazon Bedrock 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Use open weight models as your AI coding agent with Amazon Bedrock의 핵심 내용을 4단계로 요약한 인포그래픽
Use open weight models as your AI coding agent with Amazon Bedrock 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

AWS는 로컬 코딩 에이전트 OpenCode와 Amazon Bedrock의 오픈 웨이트 모델을 결합해 데이터 상주 요건을 고려하면서 작업별 모델 선택과 사용량 기반 과금을 적용하는 구성을 소개한다.

📌 핵심 요약

  • OpenCode는 Go로 작성된 오픈 소스 터미널 코딩 에이전트로, 파일 읽기·수정, 셸 명령 실행, LSP 진단을 지원하며 Amazon Bedrock을 포함한 75개 이상의 LLM 제공자와 연결된다. 제시된 구성은 OpenCode를 로컬에서 실행하고 Bedrock에서 추론하며, 좌석당 요금과 추론 인프라 관리가 필요 없다고 설명한다.
  • 원문이 인용한 McKinsey의 2025년 보고서에 따르면 조직의 76%가 오픈 소스 AI 사용 확대를 예상하며, 선도적인 AI 도입 조직은 오픈 웨이트 모델을 사용할 가능성이 40% 더 높다. Gartner의 2026년 분석은 에이전트 워크플로가 토큰 소비를 5~30배 늘린다고 설명하며, 원문은 작업별 성능과 토큰 비용을 함께 평가해야 한다고 강조한다.
  • Amazon Bedrock은 데이터의 모델 학습 미사용, IAM·CloudTrail·PrivateLink·암호화 통제와 사용량 기반 추론을 제공한다고 설명한다. Kimi K3의 global.moonshotai.kimi-k3는 지원되는 전 세계 상용 AWS 리전으로 요청을 라우팅하며 지리적 프로파일보다 약 10% 저렴하고, us.moonshotai.kimi-k3는 미국 지리적 범위 안에서 처리한다. Flex는 가변 지연 워크로드에 50% 낮은 비용으로 제시된다.
  • 모델 선택 기준은 추론 깊이, 지연 시간, 토큰 비용, 컨텍스트 크기, 리전 가용성이다. Kimi K3는 상시 추론과 1M 토큰 컨텍스트를 갖춘 계획·디버깅용 모델, GPT-OSS 120B는 복잡한 다중 파일 생성용 모델, Nemotron 3 Super 120B는 높은 처리량을 위한 모델로 소개된다. Artificial Analysis Coding Index와 Amazon Bedrock Evaluations를 통한 비교도 제안한다.
  • opencode.json 예시는 Kimi K3를 plan, Nemotron 3 Super 120B를 build, GPT-OSS 120B를 기본 모델에 배정한다. 설정에는 AWS 계정과 모델 접근 권한, AWS 자격 증명이 필요하며 기업 환경에는 IAM Identity Center가 권장된다. 실습은 GPT-OSS 120B로 Python·FastAPI·DynamoDB·Lambda·CDK 기반 CQRS 주문 서비스를 생성하고, 집계당 50개 이벤트마다 스냅샷을 요구한다. 제공된 본문은 이 실습 설명 도중 끊긴다.

🧩 주요 포인트

  1. 에이전트 워크플로의 토큰 소비가 5~30배 증가한다는 분석 → 좌석당 요금뿐 아니라 작업별 토큰 소비와 모델 성능을 함께 고려하는 비용 판단이 중요해진다.
  2. Kimi K3의 글로벌·미국 지리적 프로파일은 처리 범위와 가격이 다름 → 데이터 상주 요건과 리전 가용성이 추론 경로 선택을 제한한다.
  3. OpenCode가 plan·build·기본 모델을 분리하고 Amazon Bedrock Evaluations가 자체 데이터 비교를 지원함 → 역할별 모델 배정을 실제 작업의 품질·지연 시간·비용으로 검증할 수 있다.

🧠 상세 정리

1. OpenCode와 Bedrock을 결합하는 이유

원문은 AI 코딩 에이전트가 소프트웨어 작성·디버깅·리팩터링의 핵심 도구가 되었지만, 독점 데이터를 제3자 API로 보내거나 단일 모델 제공자에 종속되거나 사용량과 무관한 좌석당 구독료를 부담하는 제약이 있다고 설명한다. 이러한 제약은 데이터 상주 요건이 있거나 비용에 민감하거나 모델 선택의 유연성이 필요한 환경에서 특히 문제가 된다는 주장이다. 대안으로 소개하는 OpenCode는 Go로 작성된 오픈 소스 터미널 에이전트이며, 파일을 읽고 수정하고 셸 명령을 실행하며 LSP 진단을 통해 프로젝트 구조를 파악한다. Amazon Bedrock을 포함한 75개 이상의 LLM 제공자에 연결할 수 있고, 제시된 구성에서는 에이전트가 로컬에서 실행되는 동안 추론은 AWS 계정 안에서 안전하게 이루어진다고 설명한다. 원문은 이 조합이 별도 추론 인프라 관리와 좌석당 요금 없이 코딩 지원을 제공하며, 작업에 따라 오픈 웨이트 모델을 바꿀 수 있다는 점을 핵심 장점으로 내세운다.

2. 오픈 웨이트 모델의 채택 근거와 비용 논리

원문이 인용한 McKinsey의 2025년 보고서에 따르면 조직의 76%가 오픈 소스 AI 사용을 늘릴 것으로 예상하며, 선도적인 AI 도입 조직은 오픈 웨이트 모델을 사용할 가능성이 40% 더 높다. 성능 근거로는 CrowdStrike가 미세 조정한 NVIDIA Nemotron의 유효 쿼리 정확도 96%를 제시하고, GPT-4o의 61% 및 Claude Sonnet 4.5의 94%와 비교하지만 이는 특정 도메인 작업의 결과다. 비용 측면에서는 Gartner의 2026년 분석을 인용해 에이전트 워크플로가 토큰 소비를 5~30배 늘리므로 토큰당 가격이 중요해진다고 설명한다. 월 수백만 건의 대화 규모에서는 Bedrock의 오픈 웨이트 모델로 전환해 연간 환산 비용을 줄일 수 있다고 주장하되, 구체적인 절감액은 제시하지 않는다. 이 밖에도 미세 조정·증류·도메인 적응을 통한 소형 모델 활용, Bedrock의 단일 API 매개변수 변경을 통한 모델 전환, 모델 구조와 동작을 살펴볼 수 있는 투명성을 채택 이유로 든다.

3. 데이터 상주와 기업 보안 통제

Amazon Bedrock은 GPU를 직접 준비하거나 추론 인프라를 관리할 필요 없이 오픈 웨이트 모델에 접근하는 완전 관리형 서버리스 백엔드로 소개된다. 원문은 코드·프롬프트·응답이 AWS 계정 안에 머물며, 리전 내 또는 지리적 프로파일을 사용하면 해당 리전이나 지리적 범위에서 모델이 실행된다고 설명한다. Kimi K3의 global.moonshotai.kimi-k3는 지원되는 전 세계 상용 AWS 리전으로 요청을 라우팅하고 지리적 프로파일보다 약 10% 저렴하므로, 지역 제한이 없는 워크로드에 권장한다. 반면 us.moonshotai.kimi-k3는 처리를 미국 지리적 범위 안으로 제한해 데이터 상주 요건에 대응한다. 오픈 웨이트 모델에도 IAM 정책, CloudTrail 로깅, PrivateLink 연결, 암호화 통제가 적용되며, Bedrock은 HIPAA·SOC 2·ISO 27001·FedRAMP·GDPR 등 일반적인 규정 준수 프로그램의 범위에 포함된다고 설명한다. 또한 입력과 출력을 기반 모델의 학습이나 개선에 사용하지 않는다고 명시해, 지역별 처리 범위와 데이터 활용 정책을 각각 설명한다.

4. 가격 계층과 모델 평가 기준

Bedrock의 가격 체계는 지연 시간에 민감한 운영 워크로드를 위한 Priority, 토큰당 과금하는 온디맨드 추론용 Standard, 지연 시간 변동을 수용하는 워크로드에 50% 낮은 비용으로 제시되는 Flex의 세 계층으로 설명된다. 원문은 기본 한도로 분당 100M 토큰과 분당 10K 요청을 제시하며, 팀 규모가 커질 때 처리량 병목을 줄이는 데 도움이 된다고 주장한다. 그러나 모든 코딩 작업에 같은 모델이 필요한 것은 아니므로, 모델 선택에서는 성능뿐 아니라 작업당 비용과 지연 시간을 함께 비교해야 한다고 강조한다. 외부 비교 수단인 Artificial Analysis Coding Index는 SWE-Bench·Terminal-Bench·SWE-Atlas를 결합해 실제 소프트웨어 엔지니어링 작업의 성능을 평가하는 지표로 소개된다. 자체 프롬프트와 데이터에는 Amazon Bedrock Evaluations를 이용해 자동 점수화, LLM-as-a-judge 또는 사람의 검토로 모델을 나란히 비교할 수 있다고 안내한다.

5. 세 모델의 강점과 선택 시 고려할 차이

Kimi K3는 답변 전에 추론하는 모델로, 복잡한 디버깅·아키텍처 판단·계획 생성에 적합하며 reasoning_config의 low·high·max 설정으로 추론 깊이를 조절한다고 설명한다. 깊은 추론은 어려운 문제의 정확성을 위해 지연 시간을 더 쓰는 선택이며, 1M 토큰 컨텍스트는 대략 수만 줄의 코드를 담아 여러 파일에 걸친 추론을 지원하는 특성으로 제시된다. GPT-OSS 120B는 1,200억 매개변수의 오픈 웨이트 모델로, 강한 추론과 코드 생성을 결합해 전체 서비스 생성이나 다중 파일 구현에 적합하다고 소개한다. Nemotron 3 Super 120B는 처리량 중심 모델이며, NVIDIA에 따르면 전체 120B 매개변수 중 토큰당 12B만 활성화하는 Mixture-of-Experts 구조로 최대 7배 높은 처리량을 제공한다. 원문은 코드 완성·상용구 생성·대화형 페어 프로그래밍에서는 낮은 지연 시간이 중요하고, 대규모 일괄 리팩터링에서는 토큰 비용이 누적된다고 설명한다. 모델의 목표 리전 가용성도 데이터 주권과 지연 시간 요건에 영향을 주므로 함께 확인할 항목으로 제시한다.

6. 로컬 에이전트와 서버리스 추론의 연결

솔루션은 개발자의 로컬 컴퓨터에서 터미널 사용자 인터페이스로 실행되는 OpenCode와, 모델을 완전 관리형 서버리스 엔드포인트로 제공하는 Amazon Bedrock의 두 부분으로 구성된다. OpenCode는 추론을 위해 Bedrock Converse API를 호출하고, 각 요청은 AWS IAM으로 인증되며 API 활동은 AWS CloudTrail에 기록된다. OpenCode의 에이전트 구조는 계획에는 추론 모델을, 코드 생성에는 빠른 모델을 배정할 수 있어 하나의 세션 안에서 여러 모델을 사용하는 워크플로를 지원한다. 시작 조건으로는 Bedrock 접근이 활성화된 AWS 계정, Kimi K3·GPT-OSS 120B·Nemotron 3 Super 120B의 모델 접근 권한, 구성된 AWS 자격 증명이 제시된다. 설치 방법에 따라 npm에는 Node.js 18 이상이 필요하고 macOS·Linux에서는 Homebrew를 사용할 수 있으며, 원문은 설치 스크립트 방식도 제공하고 버전 확인 출력 예시로 1.18.20을 보여준다.

7. 인증 설정과 역할별 모델 배정

OpenCode의 Bedrock 제공자는 표준 AWS 자격 증명 체인을 사용하며, 원문은 IAM Identity Center, IAM 액세스 키, Bedrock API 키의 세 가지 인증 방법을 안내한다. 기업 환경에서는 IAM Identity Center를 권장하고, 운영 환경에서는 장기 액세스 키보다 IAM Identity Center나 IAM 역할을 우선하도록 설명한다. 예시는 AWS 프로파일과 us-west-2 리전을 설정하며, 지속적인 구성을 위해 프로젝트 루트의 .env 파일에 설정을 보관할 수도 있다고 안내한다. 프로젝트 루트의 opencode.json에서는 최상위 model에 GPT-OSS 120B를 기본값으로 두고, plan 에이전트에는 Kimi K3의 글로벌 프로파일을, build 에이전트에는 Nemotron 3 Super 120B를 지정한다. 이 배정은 깊은 추론이 유용한 계획·아키텍처 작업과 처리량이 중요한 코드 생성·구현을 나누려는 구성이며, 사용 가능한 Bedrock 모델은 OpenCode에서 /models로 탐색할 수 있다.

8. GPT-OSS 120B 주문 서비스 실습과 제공 범위

실습은 OpenCode에서 /model로 GPT-OSS 120B를 명시적으로 선택한 뒤 Python과 FastAPI를 사용하는 이벤트 소싱 기반 CQRS 주문 서비스를 생성하도록 요청한다. 요구사항에는 DynamoDB의 추가 전용 이벤트 저장소와 멱등성을 갖춘 명령 처리기, DynamoDB Streams로 실행되어 읽기 모델을 구축하는 프로젝션 Lambda가 포함된다. 조회 측면에서는 고객별 주문과 상태별 주문 접근에 맞춘 비정규화 읽기 모델을 요구하고, 프로젝션을 처음부터 다시 만드는 이벤트 재생 CLI도 포함한다. 재생 시간을 제한하기 위해 집계당 50개 이벤트마다 스냅샷을 생성하고 CDK 인프라까지 제공하도록 지정한다. 원문은 IAM 인증을 사용하는 Bedrock Converse API를 통해 모델이 호출되고, 처리기·이벤트 저장소·프로젝션·CDK 스택을 포함한 서비스 구조가 로컬 파일 시스템에 생성되며 호출은 CloudTrail에 기록된다고 설명한다. 다만 제공된 본문은 이어지는 데이터 보관 설명 도중 끊겨 있어, 도입부에서 예고한 다른 모델의 실습과 Ethara.AI의 운영 환경 다중 에이전트 사례에 대한 구체적인 내용은 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • 원문의 성능 우위 근거는 미세 조정된 모델의 특정 쿼리 작업 결과이므로, 모든 코딩 작업의 우열로 일반화하기보다 자체 프롬프트와 데이터로 모델을 비교하라는 평가 지침과 함께 해석해야 한다.
  • Bedrock의 관리형 추론은 인프라 운영 부담을 줄이지만, 글로벌 프로파일의 비용 이점과 지리적 프로파일의 처리 범위 제한 사이에서 워크로드별 선택은 여전히 필요하다.
  • 계획과 구현에 다른 모델을 배정하는 구성은 추론 깊이와 처리량을 작업 역할에 맞추려는 접근이다. 제공된 실습에는 품질·지연 시간·비용의 측정 결과가 없어 실제 효과의 크기는 판단하기 어렵다.

✅ 액션 아이템

  • Artificial Analysis Coding Index와 Amazon Bedrock Evaluations를 활용해 Kimi K3, GPT-OSS 120B, Nemotron 3 Super 120B의 작업별 품질·지연 시간·비용 비교.
  • 데이터 상주 요건과 리전 가용성을 기준으로 global.moonshotai.kimi-k3와 us.moonshotai.kimi-k3의 적용 가능성 검토.
  • AWS 계정·모델 접근 권한·IAM Identity Center 인증을 확인하고, opencode.json의 plan·build·기본 모델 배정 적용.

❓ 열린 질문

  • Amazon Bedrock Evaluations에서 자체 코딩 작업을 비교하면 Kimi K3, GPT-OSS 120B, Nemotron 3 Super 120B의 품질·지연 시간·비용은 어떻게 달라지는가?
  • 적용 대상의 데이터 상주 요건은 global.moonshotai.kimi-k3를 허용하는가, 아니면 us.moonshotai.kimi-k3처럼 처리 범위를 제한해야 하는가?
  • 에이전트 워크플로의 토큰 소비가 5~30배 증가한다는 조건에서 사용량 기반 과금과 Flex의 50% 낮은 비용은 전체 비용에 어떤 영향을 주는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.