Introducing Anthropic models on Amazon Bedrock for in-region inference in Seoul and Singapore
Quick Summary
Amazon Bedrock이 서울에서 Claude Opus 5와 Claude Sonnet 5, 싱가포르에서 Claude Sonnet 5의 리전 내 추론을 지원해 요청과 데이터를 지정한 AWS 리전 안에서 처리한다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Amazon Bedrock이 서울에서 Claude Opus 5와 Claude Sonnet 5, 싱가포르에서 Claude Sonnet 5의 리전 내 추론을 지원해 요청과 데이터를 지정한 AWS 리전 안에서 처리한다.
📌 핵심 요약
- 서울 리전(ap-northeast-2)에서는 Claude Opus 5와 Claude Sonnet 5, 싱가포르 리전(ap-southeast-1)에서는 Claude Sonnet 5를 bedrock-runtime 엔드포인트로 사용할 수 있다.
- 리전 내 추론은 요청의 전체 수명주기 동안 입력 프롬프트와 출력 결과를 지정한 단일 리전에 유지하며, 한국·싱가포르의 금융 서비스·의료·공공 부문처럼 엄격한 데이터 상주 요건이 있는 애플리케이션에 활용할 수 있다.
- 교차 리전 추론 프로필과 달리 라우팅 계층이 없으며, 처리량은 해당 리전의 용량과 서비스 할당량에 제한된다. 요금은 호출한 리전의 표준 온디맨드 가격을 따른다.
- Amazon Bedrock 콘솔의 Playground에서 모델을 시험할 수 있으며, 직접 모델 ID를 사용하는 Anthropic Messages API, Amazon Bedrock InvokeModel API와 Converse API로도 호출할 수 있다. Amazon Bedrock Guardrails와 intelligent prompt routing도 지원한다.
- 할당량 사용량, Amazon CloudWatch 지표와 AWS CloudTrail 로그는 호출한 리전에 귀속된다. CloudWatch와 AWS Cost Explorer로 사용량·성능·비용을 모니터링할 수 있으며, 최신 리전별 모델 지원 정보는 Amazon Bedrock User Guide에서 확인할 수 있다.
🧩 주요 포인트
- 단일 리전 처리 보장 → 데이터 상주 요건에 대응할 수 있지만, 처리량 설계는 해당 리전의 용량과 서비스 할당량을 기준으로 해야 한다.
- bedrock-runtime과 직접 모델 ID 지원 → 콘솔에서 모델을 시험한 뒤 Anthropic Messages API, InvokeModel API 또는 Converse API로 애플리케이션에 연동할 수 있다.
- 리전별 과금·관측 정보의 일치 → 호출한 리전을 기준으로 비용과 운영 상태를 파악할 수 있으며, 모델 선택에는 서울·싱가포르의 지원 범위와 최신 가용성 확인이 필요하다.
🧠 상세 정리
1. 서울·싱가포르에서 제공되는 모델과 도입 목적
Amazon Bedrock은 서울 리전에서 Anthropic의 Claude Opus 5와 Claude Sonnet 5를, 싱가포르 리전에서는 Claude Sonnet 5를 리전 내 추론 방식으로 제공한다. 서울의 리전 식별자는 ap-northeast-2이고 싱가포르는 ap-southeast-1이며, 두 리전 모두 bedrock-runtime 엔드포인트를 사용한다. 이번 지원은 한국이나 싱가포르 안에서 데이터를 처리해야 하는 금융 서비스·의료·공공 부문 등의 요구에 대응하기 위한 것이다. 원문은 이러한 요건을 가진 애플리케이션에서 해당 모델을 규모 있게 활용할 수 있다고 설명하며, 추론 요청과 데이터의 처리가 호출한 리전을 벗어나지 않는다는 점을 핵심으로 제시한다.
2. 리전 내 처리 보장과 처리량의 제약
리전 내 추론에서는 사용자가 지정한 하나의 AWS 리전이 요청 전체를 처리하며, 입력 프롬프트와 출력 결과도 요청의 전체 수명주기 동안 그 리전 안에 머문다. 교차 리전 추론 프로필과 달리 라우팅 계층이 없어 서울 또는 싱가포르로 보낸 요청은 해당 리전에서만 처리된다. 이 구조는 엄격한 단일 리전 데이터 처리 요건에 대응하지만, 처리량은 해당 리전이 제공하는 용량에 제한되고 요청에는 리전별 서비스 할당량이 적용된다. 요금 역시 호출한 리전의 표준 온디맨드 가격을 따르므로, 데이터 처리 위치와 함께 그 리전의 용량·할당량·가격 조건을 고려해야 한다.
3. bedrock-runtime의 호출 방식과 지원 기능
원문은 새로운 애플리케이션에 bedrock-runtime 엔드포인트를 사용할 것을 권장하며, 모델 호출에는 직접 모델 ID를 사용한다고 설명한다. 예시 ID는 Claude Opus 5의 anthropic.claude-opus-5와 Claude Sonnet 5의 anthropic.claude-sonnet-5다. 이 엔드포인트는 Anthropic Messages API와 Amazon Bedrock의 InvokeModel API 및 Converse API를 지원해 여러 호출 방식을 제공한다. 또한 Amazon Bedrock Guardrails와 intelligent prompt routing 같은 Bedrock 기능도 지원한다고 명시한다. 다만 사용할 모델은 리전별 지원 범위를 따라야 하므로, 서울의 두 모델 지원과 싱가포르의 Claude Sonnet 5 지원을 구분해야 한다.
4. 콘솔 Playground에서 모델 시험하기
Amazon Bedrock 콘솔의 텍스트 Playground에서는 코드를 작성하거나 SDK를 설정하지 않고도 Claude 모델을 시험할 수 있다. 사용자는 프롬프트를 보내고 추론 매개변수를 조정하며 모델 변형을 바꿔 보면서 API 연동 전에 각 모델의 응답을 살펴볼 수 있다. 원문이 제시한 절차는 사용할 리전에서 콘솔을 열고, 탐색 메뉴의 Test 아래에서 Playground를 선택한 뒤 Select model로 모델을 고르는 순서다. Claude Opus 5 예시에서는 anthropic.claude-opus-5를 검색하고 Inference에서 On-Demand를 선택한 다음 Apply를 누른다. 이후 프롬프트를 입력하고 Run을 선택하면 응답이 생성되며, 제시된 그림은 리전 내 추론으로 선택한 Opus 5 모델을 보여준다.
5. 개발 환경 준비와 세 가지 API 예제
원문은 Amazon Bedrock 접근 권한이 있는 활성 AWS 계정, 설치·설정된 AWS CLI, Python 3.8 이상과 Boto3, Anthropic SDK, Amazon Bedrock Token Generator를 사전 준비 항목으로 제시한다. Boto3의 InvokeModel 예제는 ap-southeast-1에 bedrock-runtime 클라이언트를 만들고 anthropic.claude-sonnet-5를 호출하며, anthropic_version을 bedrock-2023-05-31로, max_tokens를 4096으로 설정한다. 통합된 다중 모델 경험을 제공하는 Converse API 예제는 ap-northeast-2에서 anthropic.claude-opus-5를 호출하고 maxTokens를 4096으로 지정한다. Anthropic Messages API 예제는 provide_token으로 서울 리전 인증 토큰을 생성한 뒤 Anthropic 클라이언트의 base_url을 https://bedrock-runtime.ap-northeast-2.amazonaws.com/anthropic으로 설정한다. 이 클라이언트는 anthropic.claude-sonnet-5에 메시지를 전달하고 max_tokens를 1024로 지정해 응답을 받는다. 각 예제는 Amazon Bedrock의 기능을 설명해 달라는 사용자 메시지를 보내며, SDK별로 반환된 응답을 읽거나 출력하는 방법을 보여준다.
6. 리전 기준 운영과 최신 가용성 확인
리전 내 추론에서는 할당량 사용량, Amazon CloudWatch 지표와 AWS CloudTrail 로그 항목이 모두 요청을 호출한 동일 리전에 귀속된다. 따라서 모니터링할 때 요청의 출발 리전과 처리 목적지 리전을 따로 구분할 필요가 없으며, 원문은 CloudWatch와 AWS Cost Explorer로 사용량·성능·비용을 관찰하면서 수요 증가에 맞춰 애플리케이션을 확장할 수 있다고 설명한다. 결론에서는 서울의 Claude Opus 5·Claude Sonnet 5와 싱가포르의 Claude Sonnet 5 지원을 통해 엄격한 데이터 상주 요건을 가진 생성형 AI 애플리케이션을 구축할 수 있다는 점을 강조한다. 최신 리전별 모델 가용성은 Amazon Bedrock User Guide의 Regional availability by models에서 확인하도록 안내하며, 본문의 지원 범위와 별도로 현재 정보를 확인할 경로를 제시한다.
🧾 핵심 주장 / 시사점
- 리전 내 추론의 핵심 선택 기준은 데이터 상주 요건이며, 단일 리전 처리 보장과 해당 리전의 처리량 제약을 함께 평가해야 한다.
- 서울과 싱가포르는 지원 모델 구성이 다르므로, 데이터 처리 위치와 Claude Opus 5 또는 Claude Sonnet 5의 가용성을 함께 고려해야 한다.
- 과금·할당량·지표·로그가 동일 리전에 귀속되므로, 호출한 리전을 기준으로 운영 상태와 비용을 연결해 파악할 수 있다.
✅ 액션 아이템
- 한국·싱가포르의 데이터 상주 요건과 서울·싱가포르의 Claude Opus 5·Claude Sonnet 5 지원 범위를 대조해 사용할 리전과 모델을 검토한다.
- Amazon Bedrock 콘솔의 Playground에서 모델을 시험하고, bedrock-runtime 연동에 사용할 Anthropic Messages API, InvokeModel API 또는 Converse API를 선택한다.
- 호출할 리전의 서비스 할당량과 표준 온디맨드 가격, CloudWatch·AWS Cost Explorer 관측 방법 및 최신 모델 가용성을 확인한다.
❓ 열린 질문
- 애플리케이션의 데이터 상주 요건에는 서울(ap-northeast-2)과 싱가포르(ap-southeast-1) 중 어느 리전이 부합하는가?
- 예상 요청량을 처리하기에 선택한 리전의 용량과 서비스 할당량이 충분한가?
- bedrock-runtime 연동에는 Anthropic Messages API, InvokeModel API, Converse API 중 어떤 방식이 적합한가?