Articleaws.amazon.com·2026년 8월 20일·0

Introducing cross-Region inference for OpenAI GPT-5.6 models on Amazon Bedrock

Quick Summary

아마존 베드록은 OpenAI GPT 5.6의 Sol·Terra·Luna를 25개가 넘는 AWS 리전에서 제공하며, 지리적 또는 글로벌 추론 프로필을 통해 처리 용량과 데이터 처리 범위를 선택할 수 있게 했다.

Introducing cross-Region inference for OpenAI GPT-5.6 models on Amazon Bedrock 관련 대표 이미지

🖼️ 인포그래픽

Introducing cross-Region inference for OpenAI GPT-5.6 models on Amazon Bedrock 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Introducing cross-Region inference for OpenAI GPT-5.6 models on Amazon Bedrock의 핵심 내용을 4단계로 요약한 인포그래픽
Introducing cross-Region inference for OpenAI GPT-5.6 models on Amazon Bedrock 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

아마존 베드록은 OpenAI GPT-5.6의 Sol·Terra·Luna를 25개가 넘는 AWS 리전에서 제공하며, 지리적 또는 글로벌 추론 프로필을 통해 처리 용량과 데이터 처리 범위를 선택할 수 있게 했다.

📌 핵심 요약

  • 아마존 베드록에서 GPT-5.6 Sol, Terra, Luna 세 범용 변형이 교차 리전 추론을 지원하며, 각 변형은 성능과 비용의 서로 다른 균형에 맞게 조정되었다.
  • 교차 리전 추론은 모델과 라우팅 가능한 리전 집합을 정의한 추론 프로필을 사용하며, 요청을 실시간 가용 용량이 있는 대상 리전으로 전달해 처리량과 부하 상황의 성능 일관성을 높인다.
  • 세 모델은 텍스트와 이미지 입력, 텍스트 출력, 100만 토큰 컨텍스트 창, 추론 모드, 서버 측 도구 호출, 프롬프트 캐싱을 지원한다.
  • 지리적 프로필은 사전 정의된 지리 범위 안에서만 요청을 처리하고, 글로벌 프로필은 모델이 배포된 지원 상용 리전 전체의 용량을 활용한다.
  • 모델은 콘솔뿐 아니라 OpenAI Responses API, Chat Completions API, 아마존 베드록 Converse API로 호출할 수 있으며, IAM·VPC 엔드포인트·CloudTrail 등 기존 베드록 보안 체계가 동일하게 적용된다.

🧩 주요 포인트

  1. 추론 프로필이 여러 리전의 컴퓨팅 용량을 하나의 호출 대상으로 묶음 → 단일 리전 용량에 고정되지 않고 높은 부하에서 더 넓은 처리 자원을 활용할 수 있다.
  2. OpenAI 호환 엔드포인트와 기존 SDK 형식을 제공함 → 기존 애플리케이션은 엔드포인트·인증 방식·모델 프로필 ID를 변경해 GPT-5.6을 연동할 수 있다.
  3. 지리적 프로필과 글로벌 프로필의 처리 범위가 명확히 구분됨 → 데이터 거주 요건이 있는 워크로드는 처리 지역을 제한하고, 제약이 없는 워크로드는 가장 넓은 용량 풀을 선택할 수 있다.

🧠 상세 정리

1. GPT-5.6 교차 리전 추론 출시 범위

아마존 베드록은 OpenAI GPT-5.6 모델을 25개가 넘는 AWS 리전에서 교차 리전 추론과 함께 제공한다. 교차 리전 추론을 지원하는 범용 변형은 Sol, Terra, Luna 세 가지이며, 각각 모델 역량과 비용 사이의 서로 다른 균형에 맞게 조정되었다. GPT-5.6 제품군 자체에는 범용 모델과 사이버 보안 특화 변형이 포함되지만, 이 글이 구체적으로 다루는 대상은 세 범용 변형이다. 글에서는 모델의 공통 기능뿐 아니라 미국 지리적 프로필과 글로벌 프로필의 작동 방식, 콘솔 및 코드 호출 절차, 보안과 데이터 처리 고려사항을 설명한다. 세 변형에는 동일한 소스 리전과 대상 리전의 라우팅 구성이 적용되므로, 프로필 유형과 모델 변형을 별도의 선택 기준으로 다룰 수 있다.

2. 교차 리전 추론의 작동 원리

아마존 베드록의 교차 리전 추론은 모델과 요청을 전달할 수 있는 AWS 리전 집합을 정의한 추론 프로필을 통해 작동한다. 애플리케이션이 소스 리전에서 프로필을 호출하면 베드록이 해당 요청을 대상 리전으로 라우팅하고, 실제 추론은 대상 리전의 컴퓨팅 자원을 사용해 수행된다. 이 기능의 주된 목적은 단일 리전의 가용 용량에 요청을 고정하지 않고 더 넓은 컴퓨팅 자원 풀을 활용하도록 하는 것이다. 그 결과 높은 부하에서도 처리량을 개선하고 보다 일관된 성능을 유지하는 데 도움이 된다. 애플리케이션은 원시 모델 ID 대신 논리적 식별자인 추론 프로필 ID를 전달하며, 라우팅은 그 프로필에 정의된 리전 범위 안에서 이루어진다.

3. 세 모델의 공통 기능과 호출 형식

Sol, Terra, Luna는 모두 텍스트와 이미지 입력을 받아 텍스트를 출력하며, 최대 100만 토큰의 컨텍스트 창을 제공한다. 세 모델은 추론 모드, 서버 측 도구 호출, 프롬프트 캐싱도 공통으로 지원하므로 입력 형식과 주요 실행 기능은 동일한 기반을 가진다. 호출 인터페이스로는 OpenAI Responses API, OpenAI Chat Completions API, 아마존 베드록 Converse API가 제공된다. 스트리밍은 Responses API와 Chat Completions API에서 stream 매개변수를 사용하거나, 베드록의 ConverseStream을 이용해 처리할 수 있다. 따라서 사용자는 원하는 성능·비용 균형에 따라 변형을 선택하면서도 기존 애플리케이션에 적합한 API 형식과 스트리밍 방식을 유지할 수 있다.

4. 지리적 프로필과 글로벌 프로필의 차이

지리적 추론 프로필은 us.와 같은 지리 코드로 시작하며, 요청 처리를 해당 프로필에 미리 정의된 지리 범위 안으로 제한한다. 소스 리전에서 들어온 요청은 그 지리 범위에 속한 대상 리전으로만 전달되므로, 데이터 처리 위치에 제약이 있는 워크로드도 경계를 유지하면서 여러 리전의 용량을 활용할 수 있다. global.로 시작하는 글로벌 프로필은 모델이 배포된 지원 상용 AWS 리전 가운데 실시간 용량에 따라 대상 리전을 선택하며, 가장 넓은 용량 풀을 제공한다. 어떤 백엔드 리전이 요청을 처리하더라도 비용 청구와 할당량 소비는 호출한 계정에 귀속되어 하나의 지출 및 처리량 관점으로 관리된다. 글로벌 프로필의 데이터는 해당 모델의 적격 리전 집합을 넘나들 수 있으므로, 특정 지리 안에서만 처리해야 한다면 지리적 프로필이나 단일 리전 직접 호출을 사용해야 한다.

5. 미국 및 글로벌 프로필의 라우팅 범위

미국 교차 리전 추론 프로필은 us.openai.gpt-5.6-sol, us.openai.gpt-5.6-terra, us.openai.gpt-5.6-luna 형식으로 제공된다. 버지니아 북부, 오리건, 오하이오에서 호출한 요청은 기본적으로 이 세 리전 사이에서 처리될 수 있다. 캘리포니아 북부에서 호출하면 이 세 리전에 캘리포니아 북부가 대상 리전으로 추가된다. 캐나다 중부에서 호출하는 경우에는 미국의 세 기본 리전과 캐나다 중부가 대상이 되며, 캐나다 서부에서 호출하면 미국의 세 기본 리전과 캐나다 서부가 대상이 된다. 글로벌 프로필은 미국·캐나다·유럽·아시아 태평양·중동·남미에 열거된 소스 리전에서 호출할 수 있고, 모델이 배포된 지원 상용 AWS 리전 전체를 대상으로 실시간 용량에 따라 라우팅한다.

6. 베드록 콘솔에서 모델 시험하기

GPT-5.6을 가장 빠르게 시험하는 방법은 별도의 코드나 SDK 설정이 필요 없는 아마존 베드록 콘솔의 텍스트 플레이그라운드를 사용하는 것이다. 사용자는 프롬프트를 전송하고 추론 매개변수를 조절하면서 Sol, Terra, Luna 사이를 전환해 각 모델의 응답을 확인할 수 있다. 먼저 버지니아 북부처럼 모델이 제공되는 리전에서 베드록 콘솔을 열고, 탐색 창의 테스트 항목 아래에서 플레이그라운드를 선택한다. 이어 모델 선택 화면에서 OpenAI GPT-5.6 Sol을 검색하고, 미국 프로필 또는 글로벌 프로필 가운데 하나를 선택해 적용한다. 마지막으로 프롬프트를 입력해 실행하면 되며, 모델 선택기에서 지리적 프로필과 글로벌 프로필을 모두 제공하므로 API 코드를 작성하기 전에 두 라우팅 방식을 시험할 수 있다.

7. OpenAI SDK와 호환 API 연동

GPT-5.6은 아마존 베드록에서 OpenAI Responses API 형식을 기본적으로 지원하므로, 기존 OpenAI SDK 클라이언트를 베드록의 OpenAI 호환 엔드포인트로 연결할 수 있다. 클라이언트의 기본 URL을 호출할 소스 리전의 bedrock-runtime 엔드포인트로 지정하고, model 매개변수에는 global.openai.gpt-5.6-terra 같은 글로벌 또는 지리적 추론 프로필 ID를 전달한다. 인증에는 표준 AWS 자격 증명이나 아마존 베드록 API 키를 사용할 수 있으며, OpenAI SDK에는 베어러 토큰으로 전달되는 API 키 방식이 직접적으로 맞는다. 운영 환경에서는 기존 AWS 자격 증명으로 최대 12시간 유효한 단기 키를 생성하는 aws-bedrock-token-generator 패키지의 사용이 제시되며, 장기 키는 탐색 용도로만 권장된다. 같은 클라이언트로 Chat Completions API도 호출할 수 있어 기존 애플리케이션이 해당 메시지 형식을 사용한다면 인터페이스 구조를 유지할 수 있다.

8. Converse API와 스트리밍 처리

OpenAI SDK를 거치지 않고 아마존 베드록을 직접 호출하려면 boto3의 bedrock-runtime 클라이언트와 Converse API를 사용할 수 있다. 클라이언트를 생성할 때 소스 리전을 지정하고, modelId에는 원시 모델 ID 대신 global.openai.gpt-5.6-terra 같은 추론 프로필 ID를 전달한다. 메시지는 역할과 텍스트 콘텐츠로 구성하며, inferenceConfig의 maxTokens 같은 설정을 통해 최대 출력 토큰 수를 지정할 수 있다. 이 요청 형식은 베드록에서 다른 모델을 호출할 때 사용하는 Converse API 구조와 동일하다. 스트리밍이 필요하면 같은 인수로 converse_stream을 호출한 뒤 반환되는 이벤트 스트림을 순회하고, contentBlockDelta 이벤트에 포함된 텍스트 조각을 차례로 처리하면 된다.

9. 보안, 규정 준수와 처리 위치 기록

교차 리전 추론에는 리전 내부 직접 호출과 동일한 아마존 베드록 보안 모델이 적용되며, 요청은 AWS IAM 자격 증명으로 인증되고 IAM 정책이 역할별 추론 프로필 호출 권한을 통제한다. 베드록은 칩 수준에서 시행되는 운영자 무접근 보안 모델을 사용하므로 AWS 운영자가 프롬프트나 완성 결과에 접근할 수 없다고 설명한다. 모든 모델 호출은 IAM 정책 아래에서 실행되며, VPC 엔드포인트를 통해 가상 사설 클라우드에서 비공개로 접근할 수 있고 AWS CloudTrail에도 기록된다. 데이터 경계 정책은 계정 및 네트워크 경계를 넘어선 데이터 유출을 방지하는 데 사용된다. GPT-5.6을 포함한 일부 모델에서는 자동화된 악용 탐지 분류기가 표시한 콘텐츠를 오프라인 악용 탐지를 위해 최대 30일간 보관할 수 있으므로 관련 보관 문서를 확인해야 한다. 교차 리전 요청의 CloudTrail 기록은 소스 리전에 나타나며, additionalEventData.inferenceRegion 필드에는 실제 요청을 처리한 리전이 기록된다.

🧾 핵심 주장 / 시사점

  • 교차 리전 추론은 주로 용량 확보를 위한 기능이며, 단일 리전의 가용 용량 대신 프로필에 포함된 여러 리전의 컴퓨팅 풀을 활용해 처리량과 부하 시 성능 일관성을 높인다.
  • 프로필 선택 기준은 데이터 처리 위치 요건이다. 특정 지리 안에서 처리해야 하면 지리적 프로필이나 단일 리전 호출을 사용하고, 그러한 제한이 없으면 글로벌 프로필로 가장 넓은 용량 풀에 접근할 수 있다.
  • 기존 OpenAI SDK 사용자는 베드록 호환 엔드포인트, 인증 토큰, 추론 프로필 ID를 설정해 Responses 또는 Chat Completions 형식을 유지할 수 있으며, 베드록 직접 연동에는 Converse와 ConverseStream을 사용할 수 있다.

✅ 액션 아이템

  • 아마존 베드록의 GPT-5.6 Sol·Terra·Luna에 대해 지리적 프로필과 글로벌 프로필의 처리량 범위를 비교해 배치 우선순위를 정의한다.
  • 추론 프로필에서 라우팅 가능한 리전 집합을 설정하고 실시간 가용 용량 기반으로 대상 리전 전환 정책을 점검한다.
  • 텍스트·이미지 입력, 100만 토큰 컨텍스트, 서버 측 도구 호출, 프롬프트 캐싱까지 포함한 GPT-5.6 호출을 Responses API·Chat Completions API·Converse API로 동일하게 정합성 점검한다.

❓ 열린 질문

  • GPT-5.6 Sol·Terra·Luna 각각에서 지리적 프로필과 글로벌 프로필은 처리량 및 부하 상황에서 어떤 성능 차이를 보일까?
  • 텍스트 출력 중심 워크로드에서 추론 모드와 100만 토큰 컨텍스트를 사용할 때 지리적 프로필은 데이터 거주 제약을 어떻게 충족할 수 있는가?
  • IAM·VPC 엔드포인트·CloudTrail가 동일 적용될 때 OpenAI Responses API와 Chat Completions API, Converse API 간 감사 경계는 어디까지 일치하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.