Articleaws.amazon.com·2026년 9월 8일·0

How HPE Zerto built an agentic troubleshooting system with Amazon Bedrock

Quick Summary

HPE Zerto는 Amazon Bedrock과 온프레미스 다중 에이전트를 결합해 실제 운영 상태와 제품 지식에 근거한 자연어 문제 해결 시스템을 구축했으며, 모델 선택에서는 품질·성능·비용의 균형을 검토했다.

How HPE Zerto built an agentic troubleshooting system with Amazon Bedrock 관련 대표 이미지

🖼️ 인포그래픽

How HPE Zerto built an agentic troubleshooting system with Amazon Bedrock 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

How HPE Zerto built an agentic troubleshooting system with Amazon Bedrock의 핵심 내용을 4단계로 요약한 인포그래픽
How HPE Zerto built an agentic troubleshooting system with Amazon Bedrock 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

HPE Zerto는 Amazon Bedrock과 온프레미스 다중 에이전트를 결합해 실제 운영 상태와 제품 지식에 근거한 자연어 문제 해결 시스템을 구축했으며, 모델 선택에서는 품질·성능·비용의 균형을 검토했다.

📌 핵심 요약

  • HPE Zerto는 여러 사이트와 보호 대상 워크로드에 걸쳐 분산된 알림·이벤트·문서 때문에 상태 파악과 장애 조사가 지연되는 문제를 해결하고, SLA 준수와 복구 준비 상태에 관한 판단을 지원하고자 시스템을 개발했다.
  • 시스템은 고객 온프레미스 환경의 Zerto 제품 내부에서 pod로 실행되며 기존 UI의 채팅 인터페이스로 제공된다. Strands Agents 기반 에이전트는 로컬 대화 이력, ZVM API를 제공하는 MCP 서버, Amazon Bedrock Knowledge Bases를 통한 문서 검색을 활용한다.
  • Amazon Bedrock은 보안·거버넌스, 모델 선택의 유연성, 운영 통합을 이유로 채택됐다. Amazon Bedrock Guardrails는 추론 전후에 적용되며, IAM 역할 태그로 테넌트별 요청을 식별하고 Amazon CloudWatch·Amazon DynamoDB·AWS Lambda로 테넌트별 한도와 할당량을 관리한다.
  • Orchestrator는 일상적인 질문에 직접 답하고 복잡한 로그 조사는 ZVM agent 또는 VRA agent에 위임한다. 하위 에이전트는 독립적인 컨텍스트와 전용 도구, 더 강력한 모델을 사용하며, 압축된 조사 결과를 반환하고 Orchestrator는 최종 응답에서 비밀정보와 원시 로그를 제거한다.
  • 개발팀은 초기 POC에서 크고 강력한 모델로 실현 가능성을 확인한 뒤 에이전트 평가 체계를 구현해 더 빠르고 작고 저렴한 모델을 비교했다. 제공된 원문은 다중 모델 아키텍처에 관한 문장 중간에서 끝나므로 최종 모델 구성과 평가 결과는 확인할 수 없다.

🧩 주요 포인트

  1. 분산된 운영 정보와 기존 Zerto UI의 결합 → 자연어 질문을 실제 환경에 근거한 답변으로 연결해 장애 조사와 복구 판단의 부담을 줄이는 설계다.
  2. 온프레미스 에이전트와 Amazon Bedrock 추론의 결합 → 로컬 운영 데이터 접근과 클라우드 모델 활용을 함께 구성하며, 추론 전후의 Guardrails와 테넌트별 한도 관리가 운영 통제의 핵심이다.
  3. Orchestrator의 위임과 하위 에이전트의 독립 컨텍스트 → 로그 중심 조사가 상위 컨텍스트를 불필요하게 확대하는 것을 억제하고, 작업별 모델 선택으로 품질·성능·비용을 조정하려는 접근이다.

🧠 상세 정리

1. 복잡한 복구 운영과 분산된 정보

HPE Zerto Software는 사이버 복원력, 재해 복구, 지속적 데이터 보호를 지원하며, 원문은 이를 통해 데이터 손실과 중단 시간을 줄이고 랜섬웨어나 장애 이후 신속한 복구를 지원할 수 있다고 설명한다. 데이터 보호와 재해 복구 팀은 규모와 복잡성, 업무 중요도가 커지는 환경에서 보호 상태를 감시하고 SLA 준수 여부를 검증하며 알림과 실패 원인을 조사해야 한다. 이러한 업무는 여러 사이트와 다수의 보호 대상 워크로드에 걸쳐 이루어지지만, 필요한 정보는 제품 알림·이벤트·문서에 흩어져 있다. 운영자는 상황과 대응 방법을 이해하기 위해 화면과 보고서, 지식 자료를 오가며 수작업으로 맥락을 모으고, 경험이 적은 관리자는 증상 해석과 안전한 대응 경로 선택에 어려움을 겪을 수 있다. 관리자에게도 위험과 SLA 노출, 복구 준비 상태를 빠르게 파악할 수 있는 요약이 필요하며, 장애나 사이버 사고 중에는 이러한 지연과 불확실성의 비용이 더욱 커진다.

2. 제품 내부에서 제공하는 자연어 지원

HPE Zerto가 제시한 목표는 서로 다른 배포 환경에서도 복잡한 복원력 데이터를 실행 가능한 답변으로 바꾸면서 고객의 운영 부담을 늘리지 않는 것이다. 시스템은 지원 티켓을 생성하지 않고도 구성 문제와 장애를 해결하도록 돕는 지원 도우미 역할을 하며, 시스템 상태 문제를 알리고 완화 조치를 지원하도록 설계됐다. 사용자를 대신해 작업을 수행하여 초기 설정 시간을 줄이고 기능 도입을 촉진하는 역할도 포함한다. 배포 단위는 고객 온프레미스 환경의 Zerto 제품 안에서 실행되는 pod이며, 사용자는 일상적인 운영에 사용하는 기존 UI에서 자연어로 상호작용한다. 시스템은 환경의 현재 상태에 근거해 추론하고 행동하며 맥락에 맞는 답변을 제공하도록 설계됐지만, 제공된 본문에는 이러한 목표의 달성 정도를 보여 주는 정량적 성과가 제시되지 않는다.

3. Amazon Bedrock 선택과 정책 통제

개발팀은 기업 환경에 필요한 보안, 모델 선택의 유연성, 운영 통제를 지원한다는 이유로 Amazon Bedrock을 선택했다. 보안과 거버넌스 측면에서는 기반 모델에 대한 접근을 통제하여 기업의 보안·규정 준수·데이터 보호 요구에 AI 사용을 맞출 수 있다는 점을 강조한다. 모델 유연성 측면에서는 여러 기반 모델에 접근하고 평가하여 품질과 지연 시간, 비용에 따라 적합한 모델을 선택할 수 있다는 점을 들었다. 운영 통합 측면에서는 가드레일, 관측성, 지식 검색에 사용하는 AWS 서비스와의 연계가 운영 환경의 아키텍처를 관리하는 데 도움이 된다고 설명한다. 콘텐츠 보안에는 Amazon Bedrock Guardrails를 사용하며, 사용자 프롬프트와 시스템 출력이 회사 정책과 규정 준수, 보안 요구에 부합하도록 통제하는 구조를 제시한다.

4. UI와 에이전트의 데이터 접근 구조

UI 계층은 기존 Zerto UI에 내장된 채팅 인터페이스로 구성되며, Server-Sent Events(SSE)를 이용한 실시간 스트리밍으로 조사 진행 상황을 보여 준다. 에이전트 계층은 Strands Agents 프레임워크로 구축되며 고객의 온프레미스 환경에서 pod로 실행된다. 이 계층은 로컬에 저장된 과거 채팅과 맥락을 세션 이력으로 활용하고, 로컬 Model Context Protocol(MCP) 서버가 노출하는 ZVM(Zerto Manager) API를 호출해 실제 환경 데이터에 구조적으로 접근한다. 외부 지식 도구는 Amazon Bedrock Knowledge Bases를 이용하여 공개 문서, 관련 런북, 운영 지식을 검색하며, 관리형 Retrieval Augmented Generation(RAG) 기능과 의미 검색으로 필요한 맥락을 가져온다. 따라서 답변을 구성하는 근거는 대화 이력, 현재 환경 데이터, 제품과 운영 지식으로 나뉘며, 자연어 질문에 답하기 위해 이들 정보를 함께 활용하는 구조다.

5. 추론·테넌트별 한도·관측성

인텔리전스 계층은 추론, 보안, 한도와 할당량이라는 세 구성 요소로 설명된다. 추론 요청은 Amazon Bedrock으로 전송되고 선택된 기반 모델로 전달되므로, 온프레미스에서 에이전트가 실행되는 구조와 모델 추론 요청의 경로를 구분할 필요가 있다. 테넌트별 요청 태깅은 각 테넌트가 사용하는 AWS Identity and Access Management(IAM) 역할의 태그를 통해 이루어진다. 보안 구성 요소는 추론 전후에 Amazon Bedrock Guardrails를 적용해 콘텐츠 경계를 통제하고 응답이 운영 관련 주제 안에 머무르도록 돕는다. 한도와 할당량에는 Amazon CloudWatch, Amazon DynamoDB, AWS Lambda를 함께 사용하여 테넌트별 제한을 적용하고 비용 효율적인 운영을 지원한다. 별도의 관측성 계층에서는 시스템의 텔레메트리를 Amazon CloudWatch로 보내 에이전트 성능과 오류율, 사용 패턴을 파악한다.

6. Orchestrator의 직접 응답과 조사 위임

시스템은 여러 하위 에이전트로 구성되며, Orchestrator가 작업에 따라 각 하위 에이전트를 도구처럼 호출한다. 보호 그룹 상태 확인, 최근 알림 검토, 구성 모범 사례에 관한 일상적인 질문은 직접 처리하고, 현재 시스템에 존재하는 문제를 조사할 때는 하위 에이전트 사이의 문제 해결 흐름을 조정한다. 깊이 있는 로그 분석이 필요한 조사는 해당 구성 요소를 담당하는 전문 하위 에이전트에 위임하며, 각 하위 에이전트는 새로운 독립 컨텍스트와 전용 시스템 프롬프트, 자체 도구를 갖는다. 추론 부담이 큰 작업에는 더 강력한 모델을 사용하고, 조사 결과는 원시 로그나 중간 조사 작업을 포함하지 않는 압축된 보고 형태로 반환한다. 이 방식은 상위 에이전트의 컨텍스트가 조사 자료로 불필요하게 커지는 것을 억제하며, Orchestrator는 최종 답변을 전달하기 전에 비밀정보와 원시 로그를 제거한다.

7. ZVM과 VRA의 전문 문제 해결

ZVM agent는 ZVM과 관련된 서비스 충돌, 네트워크 문제, 업그레이드 실패 등의 조사를 담당한다. 이 에이전트는 도메인 지식과 특정 로그 패턴을 제공하는 전용 스킬을 사용해 로그를 분석하고, MCP를 통해 얻은 환경 데이터를 더하여 문제와 가능한 원인을 조사한다. VRA agent는 VRA(Zerto Replication Engine)와 관련된 복제 문제와 지연, 사이트 간 네트워크와 설치 관련 문제를 담당한다. VRA agent에도 도메인 지식 스킬이 제공되며, 구조화된 로그 패턴의 맥락을 실제 로그 및 MCP로 접근할 수 있는 환경 데이터와 대조한다. 두 하위 에이전트의 역할은 담당 구성 요소별 지식과 도구를 조사에 집중시키는 것이며, 원문은 가능한 원인 분석을 설명할 뿐 개별 장애에 대한 확정적 진단 결과나 해결 성공률을 제시하지 않는다.

8. 모델 비교와 제공된 원문의 한계

개발 과정의 주요 공학적 판단에는 모델 선택, 평가 방법, 온프레미스 배포의 제약이 포함됐다. 개발팀은 추론과 모델 실행에 여러 모델을 비교하고 조합하면서 품질과 성능, 비용 사이의 균형을 검토했다고 설명한다. 초기 개념 증명(POC)에서는 크고 강력한 모델을 먼저 평가해 실현 가능성을 확인했으며, 이후 에이전트 평가 체계를 구현하고 더 빠르고 작고 저렴한 모델을 포함해 다른 선택지를 비교했다. 앞서 설명한 에이전트 구조에서도 추론 부담이 큰 하위 작업에 더 강력한 모델을 사용하는 방식이 나타나지만, 구체적인 모델 이름과 작업별 배정은 제공되지 않는다. 제공된 원문은 다중 모델 아키텍처에 관한 문장 중간에서 끝나므로, 최종 구성과 평가 방법의 세부 내용, 품질·지연 시간·비용의 비교 결과는 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • 기존 Zerto UI와 실제 환경 데이터를 연결하는 설계는 운영자가 여러 정보원을 오가며 맥락을 수집해야 하는 문제에 직접 대응한다. 다만 조사 시간이나 복구 판단 속도가 얼마나 개선됐는지는 제공된 원문에서 확인되지 않는다.
  • 하위 에이전트의 독립 컨텍스트와 압축된 조사 결과는 전문적인 로그 분석을 수행하면서도 Orchestrator의 컨텍스트가 불필요하게 커지는 것을 억제하는 핵심 설계다.
  • 온프레미스 에이전트 배포와 Amazon Bedrock 추론이 함께 사용되므로, 보안 통제는 로컬 데이터 접근뿐 아니라 모델 요청과 응답에도 걸쳐 있다. 최종 모델 선택의 타당성을 판단하려면 잘린 원문 이후의 구성과 평가 결과가 필요하다.

✅ 액션 아이템

  • 분산된 알림·이벤트·문서로 인한 조사 지연을 기준으로 기존 Zerto UI의 자연어 지원 적용 가능성 검토.
  • 온프레미스 에이전트와 Amazon Bedrock의 결합 구조에서 추론 전후 Guardrails와 테넌트별 한도 관리의 적합성 평가.
  • 품질·성능·비용의 균형을 판단하기 위한 최종 모델 구성과 에이전트 평가 결과 확인.

❓ 열린 질문

  • 기존 Zerto UI의 자연어 지원은 분산된 알림·이벤트·문서로 인한 조사 지연을 얼마나 줄였는가?
  • 온프레미스 에이전트와 Amazon Bedrock 사이에서 전달되는 운영 데이터의 범위는 무엇이며, 추론 전후 Guardrails는 어떤 경계를 적용하는가?
  • 최종 모델 구성은 무엇이며, 에이전트 평가에서 품질·성능·비용은 어떻게 비교됐는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.