Articleaws.amazon.com·2026년 10월 5일·0

Introducing GLM 5.3 on Amazon Bedrock

Quick Summary

Amazon Bedrock이 Z.ai의 753B 파라미터 MoE 모델 GLM 5.3을 적격 기업 고객에게 제공하며, 관리형 API와 프롬프트 캐싱으로 코딩·장기 에이전트 작업 및 허가된 보안 테스트를 지원한다.

Introducing GLM 5.3 on Amazon Bedrock 관련 대표 이미지

🖼️ 인포그래픽

Introducing GLM 5.3 on Amazon Bedrock 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Introducing GLM 5.3 on Amazon Bedrock의 핵심 내용을 4단계로 요약한 인포그래픽
Introducing GLM 5.3 on Amazon Bedrock 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Amazon Bedrock이 Z.ai의 753B 파라미터 MoE 모델 GLM 5.3을 적격 기업 고객에게 제공하며, 관리형 API와 프롬프트 캐싱으로 코딩·장기 에이전트 작업 및 허가된 보안 테스트를 지원한다.

📌 핵심 요약

  • Z.ai(Zhipu AI)의 GLM 5.3은 코딩과 장기 에이전트 작업에 최적화된 753B 파라미터 혼합 전문가(MoE) 모델이다. Amazon Bedrock에서는 적격 기업 고객이 추론 인프라를 직접 운영하지 않고 완전 관리형 API로 이용할 수 있다.
  • Z.ai는 GLM 5.3이 여러 코딩 벤치마크에서 경쟁력 있는 성능을 보이며, 자체 내부 코딩 벤치마크에서 GLM 5.2 대비 50% 개선됐다고 보고했다. 출시 시점 CyberGym 점수는 84.5로 보고됐으며, 벤치마크 자체가 변경되어 GLM 5와의 직접 비교 결과는 제시되지 않았다.
  • GLM 5.3은 Responses·Chat Completions·Invoke·Converse API, US·Global 리전 간 추론, Flex·Priority·Standard 서비스 티어를 지원한다. 기본 자동 프롬프트 캐싱과 명시적 캐싱으로 반복 입력의 비용·지연을 줄일 수 있으며, 명시적 캐싱의 각 재사용 접두부는 최소 1,024토큰이어야 한다.
  • 새 애플리케이션에는 기능 지원이 더 완전한 OpenAI 호환 API가 권장된다. 예제는 Python 3.10 이상, OpenAI Python SDK와 aws-bedrock-token-generator를 사용하며, 필요한 IAM 권한을 갖춘 AWS CLI 자격 증명에서 단기 토큰을 생성한다. AWS는 가능한 경우 장기 API 키보다 단기 자격 증명을 권장한다.
  • Strix 예제는 소유하거나 명시적 서면 허가를 받은 애플리케이션만 테스트하며, 로컬 OWASP Juice Shop을 대상으로 취약점을 탐색하고 개념 증명으로 검증한다. 작성 시점 LiteLLM은 bedrock/global.zai.glm-5.3을 아직 해석하지 못해 Converse 경로와 추론 프로파일 ARN을 명시하는 우회 설정이 필요하다.

🧩 주요 포인트

  1. 관리형 제공과 선택 가능한 API·리전 간 추론·서비스 티어 → GLM 5.3을 자체 추론 인프라 없이 연동하고, 작업의 비용·지연 요구에 맞춰 사용 방식을 선택할 수 있다.
  2. 반복되는 시스템 프롬프트·도구 정의·저장소 문맥과 최소 1,024토큰의 캐싱 조건 → 안정적으로 재사용되는 접두부를 명시하면 자동 캐싱보다 적중률을 높여 입력 비용과 지연을 추가로 줄일 수 있다.
  3. 허가된 Strix 테스트와 개념 증명 검증 → 개발자가 로컬 빌드에서 결과를 검토하고 오탐 분류 부담을 줄이는 데 도움이 된다. 직접 실행하고 세밀하게 조정하는 Strix와 대규모 관리형 평가를 수행하는 AWS Continuum은 상호 보완적이다.

🧠 상세 정리

1. GLM 5.3의 Amazon Bedrock 출시 배경

원문은 수백 개 파일에 걸친 저장소 리팩터링, 문맥을 유지하는 수 시간의 에이전트 작업, 단계마다 도구를 활용하는 복잡한 시스템 추론처럼 AI 모델에 대한 요구가 커졌다는 문제에서 출발한다. 이러한 작업에 오픈 웨이트 모델을 사용하려면 과거에는 추론 인프라를 직접 마련하고 운영해야 하는 경우가 많았다. Amazon Bedrock에 출시된 Z.ai(Zhipu AI)의 GLM 5.3은 Hugging Face Hub에 공개된 753B 파라미터 혼합 전문가 모델로, 코딩과 장기 에이전트 작업에 최적화되어 있다. Bedrock에서는 리전 간 추론, 프롬프트 캐싱, 서비스 티어를 갖춘 완전 관리형 API로 이용하므로 사용자가 추론 인프라를 관리할 필요가 없다. 다만 접근 대상은 적격 기업 고객이며, 원문은 모든 고객이 제한 없이 사용할 수 있다고 설명하지 않는다.

2. GLM 5 계열의 개선과 성능 주장 범위

GLM 5는 같은 해 앞서 Amazon Bedrock에 출시됐으며, GLM 5.3은 같은 계열에서 코딩과 보안 작업의 성능 개선을 내세운다. Z.ai는 DeepSWE, Terminal Bench 3.0, FrontierSWE 등 여러 코딩 벤치마크에서 경쟁력 있는 성능을 보인다고 주장하고, 자체 내부 코딩 벤치마크에서는 GLM 5.2 대비 50% 개선됐다고 보고했다. 그러나 GLM 5.1 발표 이후 개선 폭 때문에 벤치마크 시험 자체를 갱신했으므로, GLM 5와의 직접 비교 결과는 보고하지 않았다고 설명한다. 보안 분야에서는 출시 시점 CyberGym에서 선도적인 점수인 84.5를 측정했다고 Z.ai가 보고했으며, 원문은 이를 방어적 보안 작업에 적합한 근거로 제시한다. 이러한 수치는 Z.ai의 보고와 주장으로 제시된 것이며, 원문에 없는 독립 검증이나 모든 실제 작업에서의 우월성으로 확대해서 해석할 수는 없다.

3. API·리전 간 추론·서비스 티어 선택

GLM 5.3은 복잡한 시스템 엔지니어링, 다단계 추론, 도구를 결합한 작업, 대규모 코드베이스의 문맥을 지속적으로 유지하는 에이전트 작업을 겨냥한다. 호출 방식은 OpenAI 호환 Responses 및 Chat Completions API와 Amazon Bedrock의 Invoke 및 Converse API를 지원하며, 이전 계열보다 OpenAI 호환 API의 기능 지원 범위도 개선됐다. 리전 간 추론은 US 프로파일인 us.zai.glm-5.3과 Global 프로파일인 global.zai.glm-5.3을 제공하고, 사용자가 선택한 원본 AWS 리전으로 요청을 보내면 Bedrock이 처리할 곳으로 안전하게 라우팅한다. 서비스 티어 중 Flex는 시간 민감도가 낮은 작업의 비용 최적화에, Priority는 더 높은 가격을 지불하는 지연 민감 요청의 우선 처리에 사용된다. Standard는 가격과 속도의 기본 균형을 제공하므로, 원문은 작업 특성에 따라 추론 방식과 서비스 수준을 선택하도록 설명한다.

4. 실행 준비와 Responses API 시작

예제를 실행하려면 Amazon Bedrock에 접근할 수 있는 AWS 계정과 기본 모델 및 대상 추론 프로파일을 호출할 IAM 권한이 필요하며, 원문은 bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream, bedrock:CallWithBearerToken을 명시한다. 코드 예제에는 Python 3.10 이상이 필요하고, 선택 사항인 보안 테스트 예제에는 Docker와 bedrock 추가 의존성을 포함한 Strix 설치가 요구된다. 코드 없이 시작하려면 Amazon Bedrock 콘솔의 Test > Playground에서 GLM 5.3을 선택해 채팅으로 프롬프트를 보낼 수 있다. 프로그램에서는 bedrock-runtime 엔드포인트를 사용하며, 신규 애플리케이션에는 기능 지원이 더 완전한 OpenAI 호환 API가 권장된다. Python 예제는 openai와 aws-bedrock-token-generator를 설치하고, AWS CLI 자격 증명에서 생성한 단기 토큰으로 us-west-2의 OpenAI 호환 엔드포인트에 연결해 global.zai.glm-5.3을 호출한다. Bedrock은 API 키 생성도 지원하지만, 원문은 가능한 경우 장기 API 키보다 단기 자격 증명을 우선 사용하라고 권장한다.

5. 명시적 프롬프트 캐싱으로 반복 입력 최적화

장시간 이어지는 코딩·지식 작업에서는 시스템 프롬프트, 도구 정의, 저장소 파일처럼 변하지 않는 문맥을 여러 대화 차례에 걸쳐 다시 전송하는 경우가 많다. GLM 5.3은 같은 초기 프롬프트 접두부를 공유하는 반복 호출의 응답 지연과 입력 토큰 비용을 줄이는 자동 프롬프트 캐싱을 기본 지원한다. 명시적 캐싱은 재사용할 접두부를 직접 지정하므로, 자동 캐싱보다 적중률을 높여 비용과 지연 절감 효과를 추가로 개선할 수 있다. 설정할 때는 요청의 prompt_cache_options에서 mode를 explicit으로 선택하고, 입력 콘텐츠 블록의 prompt_cache_breakpoint로 재사용 접두부의 끝을 포함해 표시하며, 각 지점까지의 접두부는 최소 1,024토큰이어야 캐싱 대상이 된다. 예제는 시스템 메시지와 사용자 메시지에 여러 경계점을 두어 계층적으로 캐싱할 수 있음을 보여주고, 응답의 usage.input_tokens_details.cached_tokens로 캐시 사용 여부를 확인한다.

6. 허가된 보안 테스트와 Strix의 역할

원문은 GLM 5.3의 보안 역량을 활용하는 사례로 자신이 소유한 애플리케이션의 자동 보안 테스트를 소개한다. 오픈소스 AI 침투 테스트 에이전트 Strix는 코드를 동적으로 실행하고 취약점을 찾은 뒤 개념 증명 테스트로 검증하며, 글 작성 시점의 Strix 문서는 GLM 5.3을 기본 모델로 사용한다. Strix를 Amazon Bedrock의 GLM 5.3에 연결하면 모델 추론이 사용자의 AWS 계정 통제 아래에서 실행된다. 테스트 대상은 자신이 소유하거나 명시적 서면 허가를 받은 애플리케이션으로 제한되며, 원문은 무허가 테스트가 대부분의 관할권에서 불법이고 AWS Acceptable Use Policy를 위반한다고 명시한다. 예제 대상은 로컬에서 실행되는 의도적으로 취약한 샘플 애플리케이션 OWASP Juice Shop이다. 직접 에이전트를 운영하는 범위를 넘어서는 관리형·지속적 보안 테스트에는 AWS Continuum을 소개하고, 로컬 빌드에서 개발자가 개입하며 세밀하게 조정하는 Strix와 대규모 관리형 평가를 상호 보완적인 접근으로 설명한다.

7. Strix 실행 절차와 결과 검증

보안 테스트 예제는 Docker로 bkimminich/juice-shop 이미지를 실행하고 로컬 3000번 포트에 연결하는 것으로 시작한다. Strix는 내부적으로 LiteLLM을 사용하며 AWS CLI 자격 증명을 자동으로 가져오므로 API 키가 필요하지 않고, 필요에 따라 AWS_PROFILE과 AWS_REGION 환경 변수로 연결을 구성할 수 있다. 다만 작성 시점 LiteLLM은 bedrock/global.zai.glm-5.3을 아직 해석하지 못하므로, STRIX_LLM에 bedrock/converse 경로와 global.zai.glm-5.3 추론 프로파일의 ARN을 명시하고 리전 및 계정 ID를 채우는 우회 설정을 제시한다. 이후 strix --target http://localhost:3000으로 테스트를 실행하고 루트 에이전트가 완료될 때까지 기다린 뒤 결과를 검토한다. Strix는 여러 하위 에이전트를 구성해 공격 표면을 파악하고 다양한 취약점 범주를 탐색하며, 각 발견 사항을 작동하는 개념 증명으로 검증하려 시도해 오탐 분류에 드는 시간을 줄이는 데 도움을 준다. 성공적으로 실행되면 발견 사항별 심각도, 증거, 수정 지침을 포함한 보고서가 생성된다.

8. 정리 절차와 후속 이용 경로

예제를 마친 뒤에는 Juice Shop을 실행한 터미널에서 Ctrl+C를 누르거나, docker ps로 컨테이너 ID를 확인한 뒤 docker stop으로 해당 컨테이너를 중지한다. Amazon Bedrock 추론은 토큰 사용량에 따라 과금되고 지속적으로 유지되는 리소스가 없으므로, 요청 처리가 끝난 뒤에는 해당 추론으로 인한 추가 요금이 발생하지 않는다고 원문은 설명한다. 실습 중 Amazon Bedrock API 키를 생성했고 더 이상 필요하지 않다면 콘솔에서 삭제하는 정리 절차도 제시한다. GLM 5.3의 이용 경로로는 Amazon Bedrock 콘솔, OpenCode 같은 코딩 도우미, 지원 API를 통한 사용자 애플리케이션 연결이 소개된다. OpenCode 활용은 Kimi K3를 다룬 최근 게시물의 예시를 참조하도록 안내하며, 마지막에는 팀의 Amazon Bedrock 활용을 논의하기 위한 AWS 연락 경로를 제시한다.

🧾 핵심 주장 / 시사점

  • GLM 5.3의 도입 가치는 모델 성능뿐 아니라 관리형 추론, API 선택, 리전 간 라우팅을 함께 제공해 대규모 코딩·에이전트 작업의 운영 부담을 줄이는 데 있다.
  • 명시적 프롬프트 캐싱의 효과는 반복되는 문맥과 재사용 접두부의 구성에 달려 있다. 원문은 비용·지연 절감 가능성과 최소 1,024토큰 조건을 제시하지만, 구체적인 절감률을 제시하지는 않는다.
  • Z.ai의 보안 벤치마크 보고와 Strix의 개념 증명 검증은 서로 다른 근거다. 전자는 모델 역량에 관한 보고이고, 후자는 허가된 특정 애플리케이션에서 발견 사항의 타당성을 확인하는 절차다.

✅ 액션 아이템

  • 적격 기업 고객의 Amazon Bedrock 접근 조건과 필요한 IAM 권한을 확인하고, GLM 5.3 연동에 OpenAI 호환 API와 단기 자격 증명 사용을 검토한다.
  • 반복되는 시스템 프롬프트·도구 정의·저장소 문맥에서 최소 1,024토큰의 재사용 접두부를 식별하고, 명시적 프롬프트 캐싱의 비용·지연 효과를 확인한다.
  • 소유하거나 명시적 서면 허가를 받은 대상에 한해 Strix 테스트를 진행하고, LiteLLM의 GLM 5.3 해석 제약에 맞는 Converse 경로 설정과 개념 증명 검증 결과를 확인한다.

❓ 열린 질문

  • GLM 5.3을 Amazon Bedrock에서 이용할 수 있는 적격 기업 고객의 구체적인 접근 조건은 무엇인가?
  • 반복되는 저장소 문맥에 최소 1,024토큰 조건을 충족하는 명시적 프롬프트 캐싱을 적용하면 실제 입력 비용과 지연은 얼마나 줄어드는가?
  • LiteLLM이 bedrock/global.zai.glm-5.3을 직접 해석해 Converse 경로와 추론 프로파일 ARN을 명시하는 우회 설정이 필요 없어지는 시점은 언제인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.