Introducing OpenAI models on Amazon Bedrock for in-country inferencing in India
Quick Summary
Amazon Bedrock은 인도 내 데이터 처리를 유지하는 지역 간 추론으로 OpenAI GPT 5.6 Terra와 Luna를 제공하며, 다양한 API와 프롬프트 캐싱을 지원한다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Amazon Bedrock은 인도 내 데이터 처리를 유지하는 지역 간 추론으로 OpenAI GPT-5.6 Terra와 Luna를 제공하며, 다양한 API와 프롬프트 캐싱을 지원한다.
📌 핵심 요약
- GPT-5.6 Terra와 Luna는 100만 토큰 컨텍스트 창을 제공하고 텍스트·이미지를 입력받아 텍스트를 출력하며, 긴 문서와 대규모 코드베이스를 단일 요청으로 처리할 수 있다.
- 인도 지역 추론 프로필인 in.openai.gpt-5.6-terra와 in.openai.gpt-5.6-luna는 뭄바이와 하이데라바드 사이에서 용량에 따라 요청을 라우팅한다. 과금·할당량 사용량과 CloudWatch·CloudTrail 로그는 요청을 보낸 소스 리전을 기준으로 관리된다.
- 인도 지역 프로필은 추론 처리를 인도 안으로 제한하지만 global. 프로필은 전 세계 지원 리전으로 요청을 보낼 수 있다. Amazon Bedrock은 기본적으로 입력·출력을 저장하지 않지만, GPT-5.6에서 자동 악용 탐지로 표시된 콘텐츠는 오프라인 악용 탐지를 위해 보관한다.
- 신규 애플리케이션에는 bedrock-runtime 엔드포인트가 권장되며, Responses·Chat Completions·Converse API를 사용할 수 있다. 추론 노력 수준은 none·low·medium·high·xhigh·max이고, 서버 측 대화 연결에는 앞선 응답의 store=True 설정이 필요하며 스트리밍도 지원된다.
- 프롬프트 캐싱은 인도 지역 추론 프로필에서도 작동하며, 캐시 읽기는 비캐시 입력 토큰 대비 90% 할인된다. 암시적 캐싱의 최소 접두부 길이는 1,024토큰이고, 명시적 캐싱은 경계를 직접 지정하며 캐시된 접두부를 최소 30분간 유지한다.
🧩 주요 포인트
- 국가 내부의 용량 공유 → 뭄바이·하이데라바드 간 라우팅으로 인도 내 처리 요건을 유지하면서 트래픽 증가에 대응하고, 운영 기록은 소스 리전에 모을 수 있다.
- 라우팅 범위와 보관 조건의 구분 → 인도 내 처리가 필요하면 in. 프로필을 선택해야 하며, 데이터 보관 판단에는 기본 미저장 정책과 악용 탐지 예외, store=True 사용을 함께 고려해야 한다.
- API 선택과 반복 문맥 처리 → 기존 OpenAI 형식이나 AWS SDK에 맞춰 통합할 수 있으며, 추론 노력 설정과 프롬프트 캐싱으로 처리 방식과 반복 입력 비용을 조정할 수 있다.
🧠 상세 정리
1. 인도에서 제공되는 모델과 입력 처리 범위
Amazon Bedrock은 인도 지역 간 추론을 통해 OpenAI GPT-5.6 Terra와 Luna를 제공하며, 추론 요청과 데이터를 인도 안에서 처리한다고 설명한다. 원문은 금융 서비스, 의료, 공공 부문처럼 인도 내 데이터 처리 요건이 있는 분야에서도 이 모델들을 규모 있게 사용할 수 있다는 점을 도입 배경으로 제시한다. 두 모델은 모두 100만 토큰 컨텍스트 창을 제공하고 텍스트와 이미지를 입력받으며, 결과는 텍스트로 생성한다. 따라서 애플리케이션은 긴 문서, 대규모 코드베이스, 텍스트와 이미지가 섞인 작업을 하나의 요청에 담아 처리할 수 있다. 다만 원문은 Terra와 Luna 사이의 성능이나 가격 차이를 비교하지 않으며, 공통 기능과 인도 내 추론 경로를 중심으로 사용 방법을 설명한다.
2. 지역 간 용량 공유와 소스 리전 기준 운영
지역 간 추론은 여러 AWS 리전으로 요청을 자동 분산해 더 넓은 컴퓨팅 용량을 활용하도록 하는 기능으로, 원문은 이를 주로 용량 확보를 위한 메커니즘으로 설명한다. 인도 지역 추론에서는 뭄바이 ap-south-1 또는 하이데라바드 ap-south-2를 소스 리전으로 호출하면 Amazon Bedrock이 용량에 따라 인도 내 목적지 리전으로 요청을 보낸다. 호출 시 모델 값으로 사용하는 프로필 ID는 Terra의 경우 in.openai.gpt-5.6-terra, Luna의 경우 in.openai.gpt-5.6-luna이며, 프로필이 모델과 라우팅 가능한 리전을 정의한다. 이 방식은 개별 리전의 용량을 직접 관리하는 부담을 줄이고 트래픽이 몰릴 때 처리량과 일관된 성능을 유지하는 데 도움을 준다. 실제 처리 리전과 관계없이 과금과 할당량 사용량은 소스 리전의 계정에 기록되고, Amazon CloudWatch와 AWS CloudTrail 로그도 소스 리전에만 남는다.
3. 인도 내 처리 경계와 데이터 보관 예외
인도 지역 프로필을 사용하면 요청은 ap-south-1과 ap-south-2 사이에서만 라우팅되며, 입력 프롬프트와 출력 결과가 두 리전 사이를 이동할 수 있다. 이 전송은 Amazon 네트워크에서 암호화되므로, 원문이 말하는 인도 내 처리는 두 리전 사이의 데이터 이동을 포함한다. Amazon Bedrock은 기본적으로 모델 입력과 출력을 저장하지 않는 제로 데이터 보관 모델을 사용하지만, GPT-5.6을 포함한 일부 모델에서는 자동 악용 탐지 분류기가 표시한 콘텐츠를 오프라인 악용 탐지를 위해 보관한다. 한편 global. 접두부의 글로벌 추론 프로필은 인도 엔드포인트에서 호출하더라도 전 세계의 지원 상용 AWS 리전으로 요청을 라우팅할 수 있고, GPT-5.6 Sol·Terra·Luna를 지원한다. 따라서 원문은 현지 데이터 처리 요건이 있는 작업에는 국가 내부로 추론을 제한하는 in. 접두부의 인도 프로필을 사용하도록 안내한다.
4. 권장 엔드포인트와 콘솔에서의 모델 체험
원문은 신규 애플리케이션에 bedrock-runtime 엔드포인트를 권장하며, 이 엔드포인트에서 지원하는 API와 Amazon Bedrock 기능을 함께 소개한다. 지원 인터페이스에는 Bedrock 고유의 InvokeModel과 Converse, OpenAI 호환 Responses와 Chat Completions, Anthropic Messages API가 포함된다. Guardrails, 지능형 프롬프트 라우팅, 지역 간 추론도 이 엔드포인트에서 제공되는 기능으로 명시된다. 코드를 통합하기 전에는 모델이 제공되는 뭄바이 등의 리전에서 Amazon Bedrock 콘솔의 Test 아래 Playground를 열어 SDK 설정 없이 모델을 시험할 수 있다. 모델 선택 화면에서 OpenAI GPT-5.6 Terra를 검색하고 IN OpenAI GPT-5.6 Terra를 적용한 뒤 프롬프트를 실행하면 되며, 추론 매개변수를 조절하거나 모델 변형을 전환해 응답을 살펴볼 수 있다.
5. OpenAI Responses API 연결과 인증
Amazon Bedrock의 GPT-5.6 모델은 OpenAI Responses API 형식을 기본 지원하므로, 기존 OpenAI SDK 클라이언트의 연결 주소를 인도 리전의 Bedrock 엔드포인트로 지정하고 모델 매개변수에 인도 지역 추론 프로필 ID를 전달할 수 있다. 원문의 예제는 뭄바이의 bedrock-runtime.ap-south-1.amazonaws.com/openai/v1 주소와 in.openai.gpt-5.6-terra를 사용한다. 인증에는 표준 AWS 자격 증명 또는 Amazon Bedrock API 키를 사용할 수 있으며, OpenAI SDK는 API 키를 베어러 토큰으로 전달한다. 운영 환경에는 aws-bedrock-token-generator로 기존 AWS 자격 증명에서 단기 키를 생성하는 방식을 안내하며, 예제 주석에는 키의 유효기간이 최대 12시간이라고 적혀 있다. Responses API는 input으로 입력을 전달하고 output_text에서 생성 텍스트를 읽으며 max_output_tokens로 출력 한도를 지정하고, 같은 클라이언트로 Chat Completions API도 사용할 수 있다.
6. 추론 노력 설정과 서버 측 대화 상태 연결
GPT-5.6의 추론 깊이는 선택적인 reasoning 매개변수로 조절하며, 지원하는 effort 값은 none, low, medium, high, xhigh, max의 여섯 가지다. 원문은 reasoning={"effort": "high"}와 같은 설정 예제를 제시하고, 이 매개변수를 생략하면 모델 기본값을 사용한다고 설명한다. 여러 차례 이어지는 대화에서는 store=True로 응답을 서버 측에 보관하고 다음 요청의 previous_response_id에 앞선 응답 ID를 넣어 연결할 수 있다. 이 경우 클라이언트는 이전 대화 이력을 다시 전송하지 않고 새로운 차례의 입력만 보내며, 원문은 좋아하는 숫자 42를 전달한 뒤 다음 요청에서 그 숫자를 묻는 예제로 동작을 보여준다. 연결 대상 응답은 반드시 store=True로 생성되어 있어야 하며, 저장하지 않은 응답을 previous_response_id로 참조하면 오류가 발생한다.
7. 스트리밍 응답과 Converse API 사용
Responses API에서 스트리밍을 사용하려면 요청에 stream=True를 설정하고 반환되는 이벤트를 순회하면 된다. 원문의 코드는 response.output_text.delta 유형의 이벤트가 도착할 때마다 event.delta를 출력해 생성되는 텍스트 조각을 순차적으로 표시한다. API 키 대신 AWS SDK와 SigV4 인증을 선호하는 경우에는 Amazon Bedrock Converse API로 동일한 GPT-5.6 모델을 호출할 수 있다. 예제는 boto3로 뭄바이의 bedrock-runtime 클라이언트를 만들고 modelId에 인도 지역 프로필을 지정한 뒤, 사용자 메시지와 inferenceConfig의 maxTokens를 전달하는 구조다. Converse는 Bedrock의 다른 모델에도 제공되는 통합 인터페이스를 사용하며, 해당 인터페이스에서 스트리밍이 필요한 경우에는 ConverseStream을 사용할 수 있다고 설명한다.
8. 프롬프트 캐싱의 할인과 적용 조건
GPT-5.6의 프롬프트 캐싱은 시스템 지침, 지식 기반 발췌문, 소수 예시처럼 길고 안정적인 공통 접두부를 여러 요청에서 반복 사용하는 경우에 적용할 수 있다. 캐시 읽기는 비캐시 입력 토큰보다 90% 할인되며, 원문은 같은 문맥을 여러 차례 사용하는 검색 증강 생성과 에이전트 작업에서 비용 절감 효과가 누적될 수 있다고 설명한다. 캐싱은 인도 지역 추론 프로필에서도 작동하므로, 인도 내 데이터 처리 경계를 유지하면서 사용할 수 있다. 암시적 방식에서는 Amazon Bedrock이 캐시 분기점을 자동 배치하고 최소 접두부 길이는 1,024토큰이며, 명시적 방식에서는 사용자가 경계를 지정하고 캐시된 접두부가 최소 30분간 유지된다. 예제는 동일한 prompt_cache_key와 명시적 경계 설정을 사용해 고정 지침과 매번 달라지는 사용자 질문을 구분하지만, 제공된 원문은 응답의 캐시 정보 설명 도중에 끝나 해당 반환 정보의 구체적인 내용은 확인할 수 없다.
🧾 핵심 주장 / 시사점
- 인도 지역 간 추론은 한 리전의 용량에만 의존하지 않으면서 국가 내부의 데이터 처리 경계를 유지하도록 구성된다.
- 인도 엔드포인트로 요청을 보내는 것만으로 인도 내 처리가 보장되지는 않으며, 실제 라우팅 범위를 정하는 in. 또는 global. 프로필 선택이 중요하다.
- 기본 미저장 정책, 악용 탐지 목적의 콘텐츠 보관, store=True에 따른 대화 상태 보관은 서로 다른 조건이므로 데이터 처리 위치와 보관 여부를 구분해 이해해야 한다.
✅ 액션 아이템
- 인도 내 데이터 처리 요건이 있는 작업에 in.openai.gpt-5.6-terra 또는 in.openai.gpt-5.6-luna 적용 검토.
- bedrock-runtime 통합 시 Responses·Chat Completions·Converse API 선택과 store=True 사용에 따른 데이터 보관 조건 확인.
- 반복 문맥에 대한 프롬프트 캐싱 적용 가능성을 1,024토큰 조건, 최소 30분 유지, 캐시 읽기 90% 할인 기준으로 검토.
❓ 열린 질문
- 대상 작업은 인도 내 데이터 처리가 필수여서 in. 프로필을 사용해야 하는가?
- 서버 측 대화 연결을 위한 store=True 사용과 악용 탐지 콘텐츠 보관 예외가 대상 작업의 데이터 보관 요건에 부합하는가?
- 반복 입력에 1,024토큰 이상의 공통 접두부가 있어 프롬프트 캐싱의 90% 읽기 할인을 활용할 수 있는가?