xAI’s Grok 4.6 is now available in Amazon Bedrock
Quick Summary
xAI의 Grok 4.6이 2026년 8월 18일 Amazon Bedrock에 출시되어, 500K 토큰 컨텍스트와 4단계 추론 강도를 제공하고 bedrock runtime 및 Converse API 지원으로 통합 선택지를 넓혔다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
xAI의 Grok 4.6이 2026년 8월 18일 Amazon Bedrock에 출시되어, 500K 토큰 컨텍스트와 4단계 추론 강도를 제공하고 bedrock-runtime 및 Converse API 지원으로 통합 선택지를 넓혔다.
📌 핵심 요약
- Grok 4.6은 Amazon Bedrock에 도입된 xAI의 두 번째 모델로, 장시간 실행 에이전트·코딩·지식 작업을 겨냥하며 500K 토큰 컨텍스트와 low·medium·high·xhigh 추론 강도를 지원한다.
- xAI는 Grok 4.5보다 보강된 학습으로 자기 점검과 시각적·상호작용형 작업의 초안 품질이 개선됐다고 설명하며, 2026년 8월 12일 공개한 Grok 4.6 High 성적으로 AA Intelligence Index 61과 GDPVal-AA v2 1753 등을 제시했다.
- Grok 4.6은 bedrock-mantle과 bedrock-runtime에서 Responses·Chat Completions API를 지원하고 Converse API도 제공한다. JSON Schema 구조화 출력은 bedrock-mantle을, Converse API·호출 로깅·Amazon Bedrock Guardrails는 bedrock-runtime을 선택할 근거이며, 도구 호출은 양쪽에서 가능하다.
- bedrock-mantle은 US West (Oregon)의 리전 내 추론을 제공하지만 bedrock-runtime은 교차 리전 추론 프로필을 사용한다. us.xai.grok-4.6은 미국 내에서, global.xai.grok-4.6은 전 세계로 요청을 라우팅하며, 입력 100만 토큰 요금은 각각 $2.20과 $2.00으로 제시됐다.
- 서비스 티어는 Standard·Priority·Flex이며 Priority는 Standard 요금의 1.75배, Flex는 0.5배다. 캐시 입력은 일반 입력 요금의 약 4분의 1로 청구되므로 추론 강도·티어·프롬프트 캐싱이 비용 판단에 중요하고, 실제 적용 요금은 Amazon Bedrock 가격 페이지에서 확인해야 한다.
🧩 주요 포인트
- bedrock-runtime과 Converse API 지원 확대 → AWS SDK 및 모델 공통 메시지 형식으로 통합하고 Guardrails와 호출 로깅을 활용할 수 있지만, JSON Schema 구조화 출력 요구는 엔드포인트 선택을 제한한다.
- K 토큰 컨텍스트와 xhigh를 포함한 추론 강도 → 복잡하고 긴 에이전트 작업의 선택지가 늘어나지만, xAI가 보고한 성능과 실제 작업의 추론 토큰 비용·지연을 함께 판단해야 한다.
- 미국 내·전 세계 교차 리전 추론과 Standard·Priority·Flex 제공 → 데이터 상주 제약, 처리 우선순위, 비용을 함께 고려해야 하며, 제시된 가격에서는 리전 선택보다 티어 선택의 비용 차이가 크다.
🧠 상세 정리
1. 출시 배경과 모델의 기본 구성
Grok 4.6은 2026년 8월 18일 Amazon Bedrock에 출시됐으며, 장시간 실행되는 에이전트와 코딩, 지식 작업을 위한 모델로 소개됐다. 컨텍스트 윈도는 500K 토큰이고 추론 강도는 low, medium, high, xhigh의 네 단계로 설정할 수 있어 작업에 따라 추론 수준을 선택할 수 있다. xAI가 Amazon Bedrock에 제공하는 두 번째 모델이라는 점에서, 이번 출시는 Grok 4.3 도입 당시의 제공 범위를 확장한다. Grok 4.3은 OpenAI 호환 추론 엔진인 Bedrock Mantle을 통해 접근할 수 있었지만, Grok 4.6은 bedrock-mantle과 bedrock-runtime 양쪽에서 제공된다. API 선택지도 Chat Completions와 Responses에 더해 Converse까지 넓어졌으며, 원문은 모델 역량에 대한 xAI의 설명과 Bedrock에서의 제공 방식, 첫 요청 준비 사항을 차례로 다룬다.
2. 학습 방식과 xAI가 설명하는 행동 개선
원문의 역량 및 학습 설명은 xAI의 출시 발표에 근거하며, Grok 4.6은 Grok 4.5를 바탕으로 복잡한 작업을 여러 단계에 걸쳐 지속하는 능력과 시각적·상호작용형 작업을 강화한 모델로 소개된다. xAI는 추론과 고급 기술 개념을 위한 선별된 모델 생성 데이터, 고품질 엔지니어링 데이터, 개선된 최적화 기법과 학습 방식을 사용해 Grok 4.5보다 긴 추가 학습을 수행했다고 밝혔다. 이어 Grok 4.5로 추론 강도와 에이전트 실행 환경, STEM·소프트웨어 엔지니어링·지식 작업에 걸친 지도 미세조정 궤적을 재생성하고 모델 기반 검사로 문제가 있는 궤적을 걸러냈다고 설명한다. 강화학습은 일반 코딩과 지식 작업뿐 아니라 커널 최적화, 웹 개발, 컴퓨터 지원 설계 등의 환경을 포함했다. xAI가 강조한 행동 변화는 긴 작업에서 다음 단계로 넘어가기 전 자기 점검과 검증이 늘었다는 점, 그리고 애플리케이션 구조와 시각적 표현을 첫 시도에 더 충실하게 마련한다는 점이다. 안전성에 대해서도 역량에 맞춰 보호 장치를 개선·조정했으며, 자사 최대 규모의 배포 전 평가와 배포 후·제3자 테스트를 수행했다고 주장한다.
3. 공개 벤치마크와 평가 지표의 의미
xAI가 2026년 8월 12일 출시 당시 공개한 Grok 4.6 High의 결과는 AA Intelligence Index 61, GDPVal-AA v2 1753, CursorBench v3.2 69.9%, DeepSWE v1.1 65.9%, FrontierCode v1.1 (Extended) 61.3%다. 나머지 제시 성적은 APEX-Agents 57.5%, Terminal-Bench v3.0 26%, APEX-SWE 56.4%, AA-Briefcase 1577, Harvey LAB (Vals) 15.8%이며, 모두 원문이 인용한 xAI 발표 수치다. Artificial Analysis의 설명에 따르면 Intelligence Index v4.1.1은 GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR의 아홉 평가를 종합한다. 이 구성은 에이전트 도구 사용, 추론과 지식, 지식 신뢰성, 긴 컨텍스트 추론, 스프레드시트와 문서의 정량 분석 등을 포괄한다. AA-Briefcase는 에이전트 기반 지식 작업 평가로, Elo 점수에 평가 기준 통과율과 분석 품질, 표현 품질을 종합하며 높을수록 좋다. Artificial Analysis는 지능 외에 비용과 지연도 추적하며, 작업당 비용에는 입력·캐시 적중·캐시 쓰기·추론·답변 토큰 가격이 반영되므로 추론 비중이 높은 작업의 경제성을 해석하는 데 의미가 있다.
4. runtime과 Converse가 넓힌 통합 방식
Grok 4.6의 bedrock-runtime 지원으로 OpenAI 호환 클라이언트 외에도 AWS SDK와 표준 Bedrock 인터페이스를 통해 모델을 사용할 수 있게 됐다. Converse API는 converse와 converse_stream을 모두 제공하므로 모델 간에 공통 메시지 형식을 사용하고 일반적인 Converse 이벤트로 스트리밍을 처리할 수 있다. 원문은 messageStart, contentBlockDelta, contentBlockStop, messageStop, metadata 이벤트를 제시하며, 서버 전송 이벤트인 SSE를 직접 파싱할 필요가 없다는 점을 실무적 이점으로 설명한다. 추론 강도의 최상위 선택지인 xhigh는 더 깊은 처리가 토큰 소비를 정당화할 수 있는 문제를 위한 옵션이다. Converse에서 이 값을 지정할 때는 별도의 reasoning 매개변수가 아니라 additionalModelRequestFields의 reasoning_effort 필드를 사용한다. 도구 호출과 구조화 출력, 이미지 입력, 응답 스트리밍, 암호화된 추론 콘텐츠는 Grok 4.3 도입 때부터 제공된 기능이므로, 원문은 이를 이번 모델에서 새로 추가된 Bedrock 기능과 구분한다.
5. 정책 적용·호출 관찰·캐싱
Grok 4.6은 bedrock-runtime의 API에서 Amazon Bedrock Guardrails를 지원하며, 콘텐츠 필터와 금지 주제, 개인 식별 정보인 PII의 가림 처리, 단어 정책을 적용할 수 있다. 요청에 가드레일 ID와 버전을 붙이면 프롬프트와 모델 응답을 모두 평가하므로, 여러 단계를 무인으로 실행할 수 있는 에이전트에 일관된 정책 경계를 제공한다는 것이 원문의 설명이다. 모델 호출 로깅을 활성화하면 요청 본문과 응답 본문, 추론 토큰을 포함한 토큰 수, 사용한 추론 프로필이 Amazon CloudWatch 기록에 담긴다. 이는 에이전트 실행을 감사할 때 모델에 실제로 전달한 내용을 확인하는 데 활용할 수 있다. 프롬프트 캐싱에서는 캐시된 입력이 일반 입력 요금의 약 4분의 1로 청구되며, 큰 시스템 프롬프트나 문서를 반복 전송하는 에이전트에서 비용상 의미가 있다. 캐싱은 반복되는 접두부에 적용되므로 안정적인 내용을 요청 앞부분에 두고, 비용 추정에 할인율을 반영하기 전 사용량 정보의 캐시 토큰 수로 실제 적용 여부를 확인하도록 원문은 안내한다.
6. 엔드포인트별 기능과 입력·출력 제약
Grok 4.6은 텍스트와 이미지 입력을 받아 텍스트를 반환하며, 오디오·음성·비디오·임베딩 모달리티와 이미지 생성은 지원하지 않는다. bedrock-mantle에서는 모델 ID로 xai.grok-4.6을 사용하고, bedrock-runtime에서는 us.xai.grok-4.6 또는 global.xai.grok-4.6 추론 프로필을 사용하며 Invoke API는 지원하지 않는다. bedrock-mantle의 지원 기능에는 클라이언트 측 도구 호출, 추론, 구조화 출력, 프롬프트 캐싱, 응답 스트리밍, 프로젝트, 악용 탐지가 포함된다. bedrock-runtime은 추론·캐싱·스트리밍·호출 로그와 기본 프로젝트를 지원하지만, 구조화 출력과 서버 측 도구 사용, 지능형 프롬프트 라우팅, 토큰 수 계산, 애플리케이션 추론 프로필은 지원하지 않는다. 도구 호출 자체는 두 엔드포인트에서 모두 가능하며, 모델이 구조화된 함수 요청을 반환하면 애플리케이션 코드가 실행한 뒤 결과를 모델에 돌려주는 방식이다. runtime에서는 Converse의 toolConfig 또는 OpenAI 호환 tools 매개변수로 이 반복 과정을 구현할 수 있으므로, JSON Schema 구조화 출력이 필요하면 mantle을, Converse나 호출 로깅이 필요하면 runtime을 선택하는 것이 원문이 제시한 구분이다.
7. 리전 선택과 첫 요청의 전제
bedrock-mantle의 Grok 4.6은 US West (Oregon), 즉 us-west-2에서 리전 내 추론을 제공하지만, bedrock-runtime은 리전 내 추론 대신 교차 리전 추론 프로필을 사용한다. 미국 내 Geo 교차 리전 추론은 us-east-1, us-east-2, us-west-1, us-west-2에서 호출할 수 있으며, us.xai.grok-4.6은 데이터 상주 요구에 맞춰 미국 내에서 트래픽을 처리한다. global.xai.grok-4.6은 상주 제약이 없을 때 전 세계 용량을 활용하는 방식이고, 호출 가능 리전 목록은 미국·캐나다·유럽·아시아 태평양·중동·아프리카·남미에 걸쳐 30개를 넘는다고 설명된다. 원문은 전체 지원 목록이 바뀔 수 있으므로 리전을 확정하기 전에 모델 카드와 모델별 리전 가용성 페이지를 확인하도록 안내하며, 이는 리전 내 추론만 제공했던 Grok 4.3과 다른 제공 방식이다. 첫 호출 전에는 사용할 리전의 Bedrock 콘솔에서 모델 이용 가능 여부를 확인하고, runtime 요청에는 기본 모델 ID 대신 해당 추론 프로필을 지정해야 한다. 제공된 source_body는 첫 요청 설명 도중에 끝나므로, 실제 요청 코드와 이후 절차는 이 자료만으로 확인할 수 없다.
8. 서비스 티어와 가격 판단
Grok 4.6의 Standard는 약정 없이 토큰 사용량에 따라 지불하는 티어이며 service_tier를 default로 설정하거나 생략하면 적용된다. Priority는 더 빠르고 우선적인 처리를 제공하는 대신 Standard의 1.75배를 청구하고, Flex는 시간에 민감하지 않은 작업에 Standard의 0.5배 요금을 적용한다. 원문은 Standard 리전 내 입력 100만 토큰에 $2.20이 드는 작업을 예로 들어 Priority에서는 $3.85, Flex에서는 $1.10이 된다고 설명하며, 티어 선택의 비용 영향이 리전 선택보다 크다고 평가한다. 교차 리전 프로필의 입력 100만 토큰 가격은 Global $2.00과 미국 Geo $2.20으로 제시돼, 데이터 상주 제약이 없다면 Global을 일반적으로 더 나은 기본 선택으로 권한다. 별도로 xAI가 안내한 시작 가격은 입력 100만 토큰당 $2, 출력 100만 토큰당 $6이며 빠른 변형은 두 배 가격이라고 소개한다. 다만 원문은 가격과 티어가 바뀔 수 있음을 명시하므로, 이 수치들을 고정된 현행 요금으로 간주하지 않고 Amazon Bedrock 가격 페이지에서 실제 적용 요금을 확인해야 한다.
🧾 핵심 주장 / 시사점
- 엔드포인트 선택은 기능 요구에 직접 좌우된다. 도구 호출은 양쪽에서 가능하지만, JSON Schema 구조화 출력과 Converse·호출 로깅은 서로 다른 선택 근거가 된다.
- xAI가 보고한 벤치마크 성적과 자기 검증 개선은 장시간 에이전트 활용의 근거지만, 이를 실제 작업의 비용·지연과 분리해 해석하기는 어렵다.
- 비용 최적화에는 Global과 Geo의 가격 차이뿐 아니라 서비스 티어, 추론 강도, 반복 입력의 캐시 적용 여부가 함께 작용한다.
✅ 액션 아이템
- JSON Schema 구조화 출력, Converse API, 호출 로깅 요구를 기준으로 bedrock-mantle과 bedrock-runtime의 적합성 비교.
- Grok 4.6의 low·medium·high·xhigh별 실제 작업 성능과 추론 토큰 비용·지연 평가.
- 데이터 상주 제약에 맞는 us.xai.grok-4.6 또는 global.xai.grok-4.6 선택과 Standard·Priority·Flex 및 프롬프트 캐싱의 적용 비용 확인.
❓ 열린 질문
- 현재 작업에서는 JSON Schema 구조화 출력과 Converse API·호출 로깅 중 어떤 요구가 엔드포인트 선택을 결정하는가?
- Grok 4.6의 xhigh는 실제 작업에서 추가 추론 토큰 비용·지연에 상응하는 성능 개선을 제공하는가?
- 데이터 상주 제약과 처리 우선순위를 고려할 때 us.xai.grok-4.6·global.xai.grok-4.6 및 Standard·Priority·Flex 중 어떤 조합이 적합한가?