Accessing OpenAI models on Amazon Bedrock from Australia with global cross-Region inference
Quick Summary
호주 시드니·멜버른의 Amazon Bedrock에서 글로벌 교차 리전 추론으로 GPT 5.6 Sol·Terra·Luna를 호출하고, 캐싱·임시 자격 증명·할당량·모니터링을 구성하는 방법을 설명한다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
호주 시드니·멜버른의 Amazon Bedrock에서 글로벌 교차 리전 추론으로 GPT-5.6 Sol·Terra·Luna를 호출하고, 캐싱·임시 자격 증명·할당량·모니터링을 구성하는 방법을 설명한다.
📌 핵심 요약
- 시드니(ap-southeast-2)와 멜버른(ap-southeast-4)의 Amazon Bedrock Runtime으로 요청하면 지원되는 상용 AWS 리전으로 라우팅되며, 애플리케이션이 목적지 리전을 직접 관리할 필요가 없다.
- GPT-5.6 Sol은 고난도 추론·코딩·에이전트 작업, Terra는 일상적인 운영 환경의 성능·비용 균형, Luna는 대량 요청과 지연 시간에 민감한 용도에 적합하며, 모두 텍스트·이미지 입력과 텍스트 출력, 최대 100만 토큰 문맥을 지원한다.
- Responses API·Chat Completions API·Converse API로 모델을 호출할 수 있고, 프롬프트 캐싱은 기본 활성화되는 암시적 방식과 재사용 접두부·캐시 경계·키를 지정하는 명시적 방식을 지원한다.
- Codex는 Amazon Bedrock Runtime 공급자와 글로벌 추론 프로필을 사용할 수 있으며, OIDC 인증 도우미로 임시 AWS 자격 증명을 받아 SigV4로 요청에 서명하는 구성에서는 추론 경로에 API 키가 필요하지 않다.
- GPT-5.6 할당량은 분당 요청 수(RPM)와 분당 토큰 수(TPM)로 관리하며 출력 토큰 1개는 할당량 토큰 10개를 소비한다. 모델 호출 로깅과 Codex의 OpenTelemetry, CloudWatch Coding Agent Insights를 통해 호출 정보와 사용량을 관찰할 수 있다.
🧩 주요 포인트
- 호주 리전의 진입점과 글로벌 처리 리전 분리 → 애플리케이션의 목적지 라우팅 관리 없이 더 넓은 처리 용량 풀에 접근.
- 세 가지 API와 두 가지 프롬프트 캐싱 방식 지원 → 기존 호출 방식에 맞춰 연동하고 반복 입력의 추론 비용 최적화.
- OIDC 임시 자격 증명과 출력 토큰의 10배 할당량 소비 → 인증 구성과 출력 길이를 함께 고려한 운영 관리 필요.
🧠 상세 정리
1. 호주 리전에서 접근하는 글로벌 추론과 모델 선택
호주 사용자는 시드니 또는 멜버른의 Amazon Bedrock Runtime 엔드포인트를 통해 GPT-5.6 Sol, Terra, Luna를 호출할 수 있다. Amazon Bedrock은 요청을 지원되는 상용 AWS 리전으로 라우팅하므로, 애플리케이션은 목적지 리전을 직접 관리하지 않고 더 넓은 처리 용량 풀을 이용한다. Sol은 까다로운 추론·코딩·에이전트 작업에 적합하고, Terra는 일상적인 운영 환경에서 성능과 비용의 균형을 제공하며, Luna는 대량 요청과 지연 시간에 민감한 애플리케이션을 대상으로 한다. 세 모델은 모두 텍스트와 이미지를 입력받아 텍스트를 생성하고 최대 100만 토큰의 문맥을 지원한다. 호주 리전은 요청의 진입점이며, 실제 처리는 글로벌 프로필이 지원하는 상용 리전에서 수행되는 구조다.
2. 글로벌 추론 프로필과 사전 준비
글로벌 추론 프로필 ID는 global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra, global.openai.gpt-5.6-luna이며, 원문은 시드니와 멜버른을 소스 리전으로 다룬다. 사용하려면 해당 소스 리전이 활성화된 AWS 계정과 프로필 호출 권한을 갖춘 IAM 역할 또는 사용자가 필요하고, 조직이 서비스 제어 정책인 SCP를 사용한다면 선택한 리전에서 프로필을 허용하는지 확인해야 한다. Python 예제를 위한 준비 사항은 Python 3.9 이상과 openai, boto3, aws-bedrock-token-generator 패키지 설치다. AWS CLI에서는 list-inference-profiles로 활성 프로필을 조회하고 get-inference-profile로 개별 프로필을 확인하며, 콘솔에서는 리전을 선택한 뒤 추론 프로필을 검색한다. 프로필 구성과 모델 가용성은 바뀔 수 있으므로 배포 전에 교차 리전 추론 지원 정보를 확인하도록 안내한다.
3. OpenAI 호환 API를 통한 호출
Responses API와 Chat Completions API는 리전별 Amazon Bedrock Runtime 엔드포인트의 /openai/v1 경로로 호출하며, 원문에서는 AWS SDK 대신 OpenAI 클라이언트를 사용하는 예제를 제시한다. 엔드포인트는 SigV4 또는 Amazon Bedrock 모델 추론 API 키를 허용하고, 예제는 현재 AWS 자격 증명으로 단기 API 키를 생성하는 토큰 생성기를 사용해 정적 키 저장을 피한다. Responses API 예제는 Terra 글로벌 프로필에 입력을 전달하고 최대 출력 토큰을 300으로 설정하며, 스트리밍에서는 stream=True와 텍스트 델타 이벤트를 사용한다. Chat Completions API 예제도 같은 엔드포인트와 프로필을 사용하되 메시지 배열, 최대 완료 토큰 300, 낮은 추론 강도를 지정한다. 시드니 예제를 멜버른으로 전환하려면 리전 값을 ap-southeast-4로 변경한다.
4. Converse API와 프롬프트 캐싱
AWS SDK를 통해 Amazon Bedrock을 호출하는 애플리케이션에는 Converse API 사용 예제가 제공되며, Boto3는 표준 AWS 자격 증명 체인을 통해 인증 정보를 해석한다. 예제는 bedrock-runtime 클라이언트에 리전과 Terra 글로벌 프로필을 지정하고, 메시지와 최대 출력 토큰 300을 전달한 뒤 응답의 텍스트를 읽는다. 스트리밍에는 converse_stream을 사용하고 반환된 이벤트에서 콘텐츠 블록의 텍스트 델타를 추출하며, 멜버른에서도 리전 값만 바꾸어 같은 흐름을 적용한다. 별도의 비용 최적화 기능인 GPT-5.6 프롬프트 캐싱은 지원 API에서 사용할 수 있고, 암시적 캐싱은 기본 활성화되어 코드 변경이 필요하지 않다. 명시적 캐싱은 재사용할 접두부와 캐시 경계, 캐시 키를 직접 정의하는 방식이며, 구체적인 예제는 별도의 GPT-5.6 소개 글로 연결한다.
5. Codex 설치와 OIDC 연동 준비
Codex도 Amazon Bedrock Runtime의 동일한 글로벌 추론 프로필을 사용할 수 있으며, 원문은 네이티브 모델 공급자 사용을 위해 최신 Codex CLI 설치를 안내한다. 제시된 설치 명령은 @openai/codex@alpha를 대상으로 하고, 설명한 구성은 시드니의 GPT-5.6 Sol과 codex-cli 0.149.1 조합에서 검증했다고 명시한다. Okta, Auth0, Microsoft Entra ID, Amazon Cognito, AWS IAM Identity Center를 사용하는 조직에는 AWS OIDC Auth Helper 저장소의 샘플 자격 증명 도우미가 제시된다. 연동 준비에는 자격 증명 공급자, 대응하는 AWS 연동 리소스, Amazon Bedrock 권한을 가진 IAM 역할 구성이 포함된다. 이후 ~/.aws/config에 이름 있는 프로필을 추가하고 credential_process에 도우미 경로와 프로필을 지정하여 기본 프로필이 해석하는 자격 증명을 대체하지 않도록 한다.
6. Codex의 임시 자격 증명과 요청 서명
OIDC 인증 도우미는 OIDC 토큰을 임시 AWS 자격 증명으로 교환하고, Codex는 표준 AWS 자격 증명 체인을 통해 이를 읽는다. ~/.codex/config.toml에서는 모델을 global.openai.gpt-5.6-sol, 공급자를 amazon-bedrock-runtime, 추론 강도를 high로 지정하고 AWS 프로필과 리전을 참조한다. 유효한 캐시 세션이 없으면 도우미가 브라우저에서 로그인 페이지를 열며, 인증 후 credential_process를 통해 임시 자격 증명을 반환한다. 이 구성의 추론 요청은 AWS SigV4로 서명되므로 API 키가 필요하지 않고, AWS IAM Identity Center 기반 프로필의 자격 증명은 단기이며 단일 로그인 세션에 맞춰 교체된다. 멜버른을 사용하려면 AWS 프로필과 Codex 설정 양쪽의 리전을 ap-southeast-4로 변경해야 한다.
7. 할당량 계산과 운영 전 검증
GPT-5.6 온디맨드 할당량은 분당 요청 수인 RPM과 분당 토큰 수인 TPM으로 측정하며, 각 요청의 TPM 소비는 토큰 차감 비율에 따라 결정된다. 원문이 제시한 GPT-5.6 계산에서는 입력 토큰과 캐시 쓰기 입력 토큰이 각각 1대1로 반영되는 반면, 출력 토큰 하나는 할당량에서 토큰 10개를 소비한다. 따라서 출력 길이는 단순한 생성량을 넘어 할당량 소비에 직접 영향을 주는 요소이며, 입력과 출력을 같은 비율로 계산해서는 원문이 설명하는 소비량을 반영할 수 없다. 할당량은 애플리케이션이 사용하는 시드니 또는 멜버른 소스 리전의 Service Quotas 콘솔에서 확인한다. 운영 배포 전에는 필요한 증액을 일찍 요청하고 사용률을 관찰하며, 대표 프롬프트·출력 길이·스트리밍 동작·동시성·최대 트래픽을 시험하고 최신 할당량과 차감 비율을 확인하도록 안내한다.
8. 모델 호출 기록과 Codex 사용량 관찰
GPT-5.6 요청은 Amazon Bedrock Runtime API를 사용하므로, 글로벌 추론 프로필을 통한 요청도 다른 온디맨드 요청처럼 모델 호출 로깅에 나타난다. 로깅을 활성화하면 기록에는 호출에 사용한 모델 또는 추론 프로필 ID와 호출 메타데이터가 포함되어, 어떤 식별자로 요청했는지 확인할 수 있다. Codex는 OpenTelemetry를 사용하고 OTLP/HTTP로 지표를 내보내며, 원문은 관련 설정 방법을 별도의 안내 문서로 연결한다. CloudWatch Coding Agent Insights는 토큰 사용량을 포함하는 Codex 텔레메트리 대시보드를 제공한다고 설명한다. 다만 제공된 원문은 이 기능의 지표를 열거하는 도중에 끝나므로, 그 이후의 지표 종류나 구체적인 내보내기 설정은 확인할 수 없다.
🧾 핵심 주장 / 시사점
- 시드니·멜버른 엔드포인트를 사용한다는 사실과 실제 요청이 처리되는 리전은 구분되며, 글로벌 추론의 핵심은 지원 리전으로의 자동 라우팅이다.
- 기존 OpenAI API를 사용하는 애플리케이션과 AWS SDK를 사용하는 애플리케이션 모두 각자의 호출 방식에 맞춰 같은 글로벌 추론 프로필에 접근할 수 있다.
- 캐싱을 통한 비용 최적화와 TPM 할당량 관리는 함께 고려할 주제이며, 출력 토큰에 적용되는 10배 차감 비율 때문에 출력 길이도 운영 용량 판단에 중요하다.
✅ 액션 아이템
- GPT-5.6 Sol·Terra·Luna의 작업 특성과 최대 100만 토큰 문맥 지원을 기준으로 사용할 모델 검토.
- 기존 호출 방식에 맞는 Responses API·Chat Completions API·Converse API와 프롬프트 캐싱 방식 검토.
- Codex의 OIDC 임시 자격 증명 구성과 출력 토큰 1개당 할당량 토큰 10개 소비를 반영한 RPM·TPM 및 사용량 관찰 방식 검토.
❓ 열린 질문
- 대상 작업에는 GPT-5.6 Sol의 고난도 처리, Terra의 성능·비용 균형, Luna의 대량 요청·지연 시간 특성 중 무엇이 가장 중요한가?
- 기존 애플리케이션에는 Responses API·Chat Completions API·Converse API 중 어떤 호출 방식과 프롬프트 캐싱 방식이 적합한가?
- 예상 출력 길이는 출력 토큰 1개당 할당량 토큰 10개를 소비하는 GPT-5.6의 TPM 사용량에 얼마나 영향을 주는가?