Articleaws.amazon.com·2026년 10월 5일·0

Evaluating multi-agent systems for explainability and helpfulness with Amazon Bedrock AgentCore

Quick Summary

Amazon Bedrock AgentCore Evaluations를 활용해 다중 에이전트 공급망 시스템의 유용성, 업무 타당성, 설명가능성을 구분하여 평가하는 접근법을 제시한다.

Evaluating multi-agent systems for explainability and helpfulness with Amazon Bedrock AgentCore 관련 대표 이미지

🖼️ 인포그래픽

Evaluating multi-agent systems for explainability and helpfulness with Amazon Bedrock AgentCore 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Evaluating multi-agent systems for explainability and helpfulness with Amazon Bedrock AgentCore의 핵심 내용을 4단계로 요약한 인포그래픽
Evaluating multi-agent systems for explainability and helpfulness with Amazon Bedrock AgentCore 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Amazon Bedrock AgentCore Evaluations를 활용해 다중 에이전트 공급망 시스템의 유용성, 업무 타당성, 설명가능성을 구분하여 평가하는 접근법을 제시한다.

📌 핵심 요약

  • 기업용 다중 에이전트 시스템은 유창한 응답뿐 아니라 정확한 도구 선택, 지시 준수, 업무 제약 충족, 의사결정 근거 설명이 필요하며, Amazon Bedrock AgentCore Evaluations는 개발·운영 단계의 성능 평가를 지원한다.
  • 가상의 AnyCompany Retail 사례는 Strands Agents SDK로 오케스트레이터와 최적화·분배·라우팅·분석 에이전트를 구성하고, Amazon Bedrock AgentCore runtime, memory, Observability를 사용해 재고 배분과 물류 의사결정을 지원한다.
  • 평가 체계는 기본 평가자, 업무별 사용자 정의 평가자, 설명가능성 평가자의 3개 계층으로 구성되며, 모든 에이전트에 Helpfulness를 적용하고 각 역할에 맞는 추가 평가를 수행한다.
  • 사용자 정의 평가자는 제약 충족, 재고 데이터에 대한 근거성, 경로 실행 가능성, SQL 정확성, 계획 일관성 등을 검사하며, 설명가능성은 결정 이유·근거 출처·제약·상충 관계·도구 사용 이유·가정을 각각 평가한다.
  • 온디맨드 평가는 개발 벤치마킹·회귀 테스트·CI/CD 게이트에, 온라인 평가는 운영 모니터링·알림에 사용된다. 온라인 구성은 같은 사용자 정의 평가자를 재사용하고 운영 트레이스의 1–10% 같은 샘플링 비율을 지정할 수 있으며, 본문은 온디맨드 모드를 다룬다.

🧩 주요 포인트

  1. 응답 품질과 업무 정확성, 설명가능성을 별도로 측정하므로, 정확하지만 설명이 부족한 추천과 설명은 충분하지만 잘못된 추천을 구분할 수 있다.
  2. 오케스트레이터의 도구 선택, 최적화·분배의 응답 관련성, 라우팅의 지시 준수, 분석의 충실성을 역할별로 검사해 각 에이전트의 주요 실패 유형을 겨냥한다.
  3. 온디맨드 평가에서 사용한 사용자 정의 평가자를 온라인 평가에 재사용할 수 있어 개발 검증과 운영 관찰을 연결하며, Amazon Bedrock Guardrails는 실행 중 안전 제약을 적용해 실행 후 평가를 보완한다.

🧠 상세 정리

1. 운영 단계에서 필요한 다중 에이전트 품질 보장

다중 에이전트 시스템이 실험 단계에서 실제 운영으로 이동하면, 다양한 현실 상황에서 일관되게 유용하고 정확하며 설명 가능한 결과를 내는지가 핵심 문제가 된다. 기업은 공급망 계획, 재무 분석, 고객 운영처럼 여러 데이터 출처와 도구, 업무 제약을 함께 고려해야 하는 문제에 이러한 시스템을 도입하고 있다. 이 시스템들은 단순한 질문 응답을 넘어 여러 전문 에이전트를 조율해 의사결정을 내리고, 업무 흐름을 실행하며, 실행 가능한 추천을 생성한다. 대규모 언어 모델이 유창한 문장을 생성할 수 있다는 사실만으로는 기업용 애플리케이션에 필요한 품질을 보장할 수 없다. 따라서 평가 대상에는 응답 내용뿐 아니라 지시 준수, 적절한 도구 선택, 제약 충족, 결과를 뒷받침하는 명확한 이유가 포함되어야 한다.

2. AgentCore Evaluations와 Guardrails의 역할

Amazon Bedrock AgentCore는 프레임워크나 모델에 관계없이 에이전트를 대규모로 구축·연결·최적화하는 플랫폼이며, Amazon Bedrock AgentCore Evaluations는 개발과 운영 전반의 에이전트 성능을 평가하는 완전관리형 기능이다. 이 기능은 정확성, 작업 성공, 행동을 여러 품질 차원에서 측정하며, 모델의 최종 응답 품질만 보는 기존 평가 방식의 한계를 보완한다. 기본 평가자는 유용성, 작업 성공, 지시 준수 같은 공통 항목의 초기 기준을 빠르게 마련하도록 지원하고, 사용자 정의 평가자는 기업별 업무 규칙을 반영하는 검사를 가능하게 한다. 운영 배포에는 책임 있는 AI 통제도 필요하며, Amazon Bedrock Guardrails는 콘텐츠 필터링, 금지 주제 탐지, 근거 검증 같은 설정 가능한 보호 기능을 제공한다. Evaluations가 실행 후 품질을 평가하는 반면 Guardrails는 실행 중 안전 제약을 적용하므로, 두 기능은 서로 보완하는 역할을 한다.

3. AnyCompany Retail의 공급망 사례와 에이전트 구성

가상의 다국적 소매기업 AnyCompany Retail은 전자상거래 채널, 지역별 주문 처리 센터, 유통 센터, 수천 개의 오프라인 매장을 운영하며, 판촉 기간의 지역별 품절과 다른 지역의 과잉 재고 문제를 겪는다. 운송팀은 배송 속도, 운송사 수용 능력, 비용을 함께 고려해야 하므로, 계획 담당자는 재고 배분 최적화와 분배 조정, 재고 상태 분석, 경로 및 주문 처리 시나리오 시뮬레이션을 지원하는 에이전트형 도우미를 필요로 한다. 참조 솔루션은 Strands Agents SDK, Amazon Bedrock AgentCore MCP Server, Amazon Bedrock AgentCore Evaluations를 사용하며, 오케스트레이터와 최적화·분배·라우팅·분석의 네 전문 에이전트를 구성한다. 오케스트레이터는 요청을 받아 도구로 노출된 전문 에이전트에 작업을 위임하고, 최적화 에이전트는 모의 Amazon API Gateway REST 인터페이스에 연결된 MCP 도구에서 최적화 결정을 받는다. 분배 에이전트는 재고 재배치 추천 API를, 라우팅 에이전트는 운송사와 경로 추천을 위한 물류 API를 호출하며, 분석 에이전트는 공급망 진단 질문에 답한다.

4. 실행 환경과 온디맨드·온라인 평가의 연결

각 에이전트는 Amazon Bedrock AgentCore runtime에서 실행되며, Amazon Bedrock AgentCore memory와 Amazon Bedrock AgentCore Observability가 활성화된다. 솔루션은 에이전트 루프에 Amazon Bedrock의 기반 모델을 사용하고, 모델의 리전별 가용성은 Supported models by AWS Region in Amazon Bedrock 문서를 참조하도록 안내한다. 온디맨드 모드는 개발 벤치마킹, 회귀 테스트, CI/CD 게이트를 위한 것이고, 온라인 모드는 지속적인 운영 모니터링과 알림을 위한 것이며, 본문에서 실제로 다루는 범위는 온디맨드 테스트다. 온라인 평가에서는 동일한 사용자 정의 평가자의 ARN을 OnlineEvaluationConfig에 지정하고, 운영 트레이스의 1–10% 같은 샘플링 비율과 선택적 세션 필터를 설정할 수 있다. 이후 서비스는 AgentCore Observability의 트레이스를 자동으로 읽어 점수를 계산하고 결과를 Amazon CloudWatch 대시보드와 경보로 전달하며, 두 모드는 사용자 피드백에 따라 개선하는 과정을 지원한다.

5. 첫 번째 계층: 역할별 기본 평가

평가 체계의 첫 번째 계층은 별도 설정이 필요 없는 기본 평가자를 이용해 일반적인 품질을 측정하며, 모든 에이전트에 Helpfulness를 공통 기준으로 적용한다. 여기에 각 에이전트의 주요 실패 유형을 겨냥하는 두 번째 기본 평가자를 추가하므로, 역할마다 평가 조합이 달라진다. 오케스트레이터에는 Tool Selection Accuracy를 적용해 적절한 도구를 선택하는지 평가하고, 최적화와 분배 에이전트에는 Response Relevance를 적용해 응답의 관련성을 확인한다. 라우팅 에이전트에는 Instruction Following을, 분석 에이전트에는 Faithfulness를 적용해 각각 지시 준수와 근거에 대한 충실성을 검사한다. 이 계층은 공통적인 유용성과 역할별 응답 품질의 기준을 제공하며, 이후 계층에서 업무 규칙 준수와 설명의 투명성을 추가로 검증하는 출발점이 된다.

6. 두 번째 계층: 공급망 업무 규칙의 검증

사용자 정의 평가자는 공급망의 업무 규칙을 반영해 추천이 예산을 지키고 실제 재고 데이터를 사용하며 운영상 올바른 결과를 내는지 검사한다. 오케스트레이터에는 하위 에이전트 결과를 모순 없는 추천으로 결합하는 계획 일관성 평가와 올바른 하위 에이전트에 작업을 전달하는 도구 경로 평가를 제시한다. 최적화 에이전트는 예산, 재고 범위인 demand ≤ qty ≤ 2× demand, 창고 용량을 검사하고, 주문 충족률이나 매출 개선 목표 달성 여부도 평가한다. 분배 에이전트는 현재 재고·수요 데이터에 추천이 근거하는지와 품절·과잉 재고 위험을 개선하는지를 검증하고, 라우팅 에이전트는 배송 시간대, 비용, 운송사 수용 능력, 지역 제약 및 목표 서비스 수준을 확인한다. 분석 에이전트에는 사용자 의도에 맞는 SQL인지, 응답이 Amazon Relational Database Service(Amazon RDS)의 조회 결과로 뒷받침되는지, 근거 없는 주장이 포함되지 않았는지를 평가하는 항목을 둔다.

7. 세 번째 계층: 정확성과 분리한 설명가능성 평가

설명가능성은 여러 에이전트에 공통으로 적용되는 독립적인 계층이며, 추천이 맞는지와 그 이유를 충분히 설명하는지를 별도로 측정한다. Decision rationale quality와 Assumption disclosure는 모든 에이전트에 적용해 추천 이유를 설명하는지, 데이터가 불완전할 때 가정을 명시하는지 확인한다. Evidence attribution은 분석·분배·라우팅 에이전트가 사용한 데이터 필드, API 응답, SQL 결과를 인용하는지 검사하고, Constraint reasoning은 최적화·라우팅 에이전트가 최종 응답에 영향을 준 제약을 설명하는지 평가한다. Trade-off explanation은 최적화·분배·라우팅 에이전트가 비용, 서비스 수준, 재고 위험 사이의 상충 관계를 설명하는지 확인하며, Tool-use explainability는 오케스트레이터가 각 하위 에이전트나 MCP 도구를 호출한 이유를 설명하는지 검사한다. 이러한 분리는 업무 평가를 통과했지만 설명가능성 평가에는 실패한 응답을 식별해, 의사결정 논리의 개선과 설명 방식의 개선을 구분할 수 있게 한다.

8. 개발 환경의 사전 요구사항과 자료 범위

솔루션을 배포하기 전에는 AWS Command Line Interface(AWS CLI)를 설치하고, AWS Serverless Application Model(AWS SAM) CLI v1.100.0 이상을 준비하도록 안내한다. 개발 환경의 다른 요구사항은 Docker v20.x 이상, Node.js v18.x 이상, Python v3.11 이상이며, 본문은 이를 사전 설치 도구로 제시한다. Strands Agents 구현에 필요한 의존성은 DockerFile에 포함되는 것으로 설명하며, 제공된 의존성 목록에는 다중 에이전트 프레임워크인 strands-agents가 나타난다. 다만 제공된 source_body는 이 의존성 목록에서 끝나므로, 이후의 배포 명령이나 평가 실행 코드, 실제 점수 및 결과는 확인할 수 없다. 따라서 이 자료에서 확인되는 내용은 참조 아키텍처와 평가 설계, 실행 모드 및 개발 환경 요구사항이며, 구현 후 성능이 실증되었다고 해석할 근거는 제시되지 않는다.

🧾 핵심 주장 / 시사점

  • 유용한 응답이라는 평가만으로 공급망 추천의 업무 타당성을 판단하기는 어렵다. 기본 평가에 도메인 제약 검증을 더해야 실제 운영 조건을 충족하는지 구분할 수 있다.
  • 설명가능성을 정확성과 독립적으로 평가하면, 잘못된 의사결정과 올바른 결정의 불충분한 설명을 서로 다른 개선 대상으로 식별할 수 있다.
  • 같은 사용자 정의 평가자를 온디맨드와 온라인 모드에 재사용하는 구조는 개발 단계의 검증 기준을 운영 중 관찰에도 적용하도록 지원한다.

✅ 액션 아이템

  • Amazon Bedrock AgentCore Evaluations의 기본 평가자·업무별 사용자 정의 평가자·설명가능성 평가자를 함께 적용해 유용성, 업무 타당성, 설명가능성을 구분하여 평가한다.
  • 오케스트레이터·최적화·분배·라우팅·분석 에이전트의 역할에 맞춰 도구 선택, 응답 관련성, 지시 준수, 충실성과 업무 제약 검증을 연결한다.
  • 온디맨드 평가를 개발 벤치마킹·회귀 테스트·CI/CD 게이트에 활용하고, 온라인 평가에서는 사용자 정의 평가자 재사용과 운영 트레이스의 1–10% 샘플링 적용을 검토한다.

❓ 열린 질문

  • AnyCompany Retail의 최적화·분배·라우팅·분석 에이전트는 업무 타당성 평가와 설명가능성 평가에서 각각 어떤 결과를 보이는가?
  • 오케스트레이터의 도구 선택과 계획 일관성은 어떤 기준으로 통과 여부를 판단하는가?
  • 온라인 평가에서 운영 트레이스의 1–10% 샘플링 비율은 어떤 기준으로 선택하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.