Articleaws.amazon.com·2026년 9월 8일·0

How DiDi built intelligent contact center QA with Amazon Bedrock

Quick Summary

DiDi는 AWS와 Amazon Bedrock 기반의 자체 고객센터 QA 시스템을 구축해 운영 환경 검증에서 문의 의도 검증 정확도를 38%에서 86%로 높였으며, 규정 준수 점수 산정 정확도는 90%를 넘고 VOC 요약 작업은 수시간에서 수분으로 단축됐다고 보고했다.

How DiDi built intelligent contact center QA with Amazon Bedrock 관련 대표 이미지

🖼️ 인포그래픽

How DiDi built intelligent contact center QA with Amazon Bedrock 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

How DiDi built intelligent contact center QA with Amazon Bedrock의 핵심 내용을 4단계로 요약한 인포그래픽
How DiDi built intelligent contact center QA with Amazon Bedrock 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

DiDi는 AWS와 Amazon Bedrock 기반의 자체 고객센터 QA 시스템을 구축해 운영 환경 검증에서 문의 의도 검증 정확도를 38%에서 86%로 높였으며, 규정 준수 점수 산정 정확도는 90%를 넘고 VOC 요약 작업은 수시간에서 수분으로 단축됐다고 보고했다.

📌 핵심 요약

  • DiDi International Business Group은 14개 국가·지역에서 차량 호출, 음식 배달, 금융 서비스 사업을 운영하며, CX 부서는 스페인어와 포르투갈어 상담을 처리한다. 기존 외부 QA 솔루션의 불투명성과 유연성 부족을 해결하기 위해 AWS와 자체 AI 아키텍처를 구축했다.
  • Amazon Bedrock 기반 시스템은 문의 의도 검증, 규정 준수 평가, Voice of Customer(VOC) 분석의 세 파이프라인으로 구성된다. 채팅과 전화 상담을 공통 형식으로 전처리하고, 각 판단에 추론 근거를 붙여 구조화된 결과를 제공한다.
  • 문의 의도 검증에서는 전체 문의 사유 분류 체계인 CR Tree를 처음부터 보여주던 방식을 바꿨다. 현재 라벨만으로 타당성을 검증하고 실패한 경우에만 전체 분류 체계로 대안을 찾도록 분리하면서, DiDi의 운영 환경 검증 정확도가 38%에서 86%로 개선됐다.
  • 규정 준수 평가 점수 산정 정확도는 90%를 넘었다고 보고됐다. Amazon Bedrock Guardrails의 민감정보 마스킹과 근거 확인, 코드 기반 사실 계산과 판정 재검증, 사람의 검토를 위한 추론 근거가 판단의 감사 가능성과 신뢰성을 뒷받침한다.
  • 규정 준수 평가와 비즈니스 인사이트 추출은 언어·사업·평가 기준의 외부 설정을 동적으로 결합해 단일 LLM 호출에서 수행한다. VOC 분석은 운영팀 요청에 따라 특정 기간의 유사 상담을 집계하며, 수시간의 수작업 요약을 수분으로 단축했다고 보고됐다.

🧩 주요 포인트

  1. 전체 CR Tree를 보여주면 더 정밀한 대안을 찾는 과정에서 타당한 라벨까지 오답으로 판정할 수 있다 → 검증과 재분류의 정보 범위를 분리하는 맥락 관리가 정확도 개선의 핵심이다.
  2. 스페인어·포르투갈어와 세 사업 영역의 평가 기준을 외부 설정으로 관리한다 → 조합별 프롬프트를 따로 유지하지 않고 설정 변경으로 평가 범위를 확장할 수 있다.
  3. 민감정보 마스킹, 코드 기반 판정 재검증, 판단별 추론 근거를 결합한다 → 대규모 상담 평가에서 모델 출력을 검토하고 과거 판단을 추적할 수 있는 구조를 만든다.

🧠 상세 정리

1. DiDi의 해외 사업과 자체 QA 구축 배경

DiDi International Business Group은 DiDi Global의 해외 사업 조직으로, 14개 국가·지역에서 차량 호출, 음식 배달, 금융 서비스의 세 사업을 운영하며 수천만 명의 이용자에게 서비스를 제공한다. 고객 경험을 담당하는 CX 부서는 매달 대량의 스페인어·포르투갈어 상담을 채팅과 전화로 처리하고, 이 과정의 서비스 품질은 이용자 유지와 브랜드 신뢰에 직접 영향을 준다. 사업 규모가 커지고 QA 기준이 빠르게 달라지면서 기존 외부 솔루션의 불투명성과 유연성 부족이 중요한 문제가 됐다. 이에 DiDi는 AWS와 협력해 Amazon Bedrock 위에 자체 소유의 투명한 AI 아키텍처를 구축하고, 문의 의도 검증·규정 준수 평가·VOC 분석을 중심으로 고객센터 품질 관리 기능을 전환했다.

2. 기존 품질 관리가 직면한 네 가지 문제

기존 시스템은 QA 판단이 규정 준수 감사와 서비스 개선 우선순위에 영향을 주는데도 판단 근거를 보여주지 않았으며, 처리량과 비용의 제약을 받는 수작업 표본 검사 역시 과거 결정의 감사 추적을 제공하지 못했다. 여러 언어와 사업 영역의 조합마다 서로 다른 규정과 평가 규칙이 적용되면서, 조합이 늘수록 규칙 유지 비용이 커지고 결과의 일관성을 보장하기 어려워졌다. QA 기준이 바뀔 때마다 분석 담당자를 재교육하거나 실행 지침을 수정해야 했고, 전환 기간에는 기존 기준과 새 기준이 함께 사용돼 판정이 달라질 수 있었다. 특정 문제가 짧은 시간에 급증하더라도 상담을 하나씩 읽고 수작업으로 집계해야 했으므로, 추세를 조기에 파악하고 적시에 개입하기도 어려웠다.

3. Amazon Bedrock 선택과 보안·거버넌스 기반

DiDi가 Amazon Bedrock을 선택한 첫 번째 이유는 단일 API로 다양한 기반 모델에 접근할 수 있어, 아키텍처를 다시 설계하지 않고도 각 파이프라인에 적합한 모델을 선택할 수 있다는 점이었다. 두 번째 이유는 기존 외부 솔루션에서 부족했던 투명성과 감독 기능을 지원하고, 민감한 고객 상담 데이터를 DiDi의 네트워크 경계 안에서 다루도록 하는 보안·거버넌스 통제였다. 원문은 AWS PrivateLink로 제공되는 Amazon VPC 엔드포인트의 비공개 연결, 전송 중·저장 시 암호화, AWS Identity and Access Management(IAM)의 세분화된 접근 통제를 구체적으로 제시한다. 세 번째 이유는 Amazon Bedrock Guardrails의 콘텐츠 필터링과 민감정보 삭제 같은 설정 가능한 보호 기능으로, 책임 있는 AI 원칙에 맞춰 QA 시스템을 구축할 기반을 확보하는 것이었다.

4. 공통 전처리와 세 파이프라인의 역할

시스템은 채팅 데이터와 음성 인식으로 생성한 전화 상담 기록을 채널별로 전처리한 뒤, 공통 대화 형식으로 정규화해 세 개의 병렬 파이프라인에 전달한다. 문의 의도 파이프라인은 상담원이 부여한 문의 사유인 CR과 Sub-CR의 정확성을 검증하고, 잘못된 경우 대안을 제안하며, 기존 분류에 넣을 수 없어 ‘Other’로 표시된 상담은 별도로 분석한다. 평가 파이프라인은 하나의 LLM 호출에서 여러 규정 준수 항목을 채점하는 동시에 비즈니스 인사이트를 추출한다. VOC 파이프라인은 운영팀 요청에 따라 특정 시간 범위의 유사 상담 묶음을 집계해 체계적인 문제와 추세를 드러내는 구조화된 분석 보고서를 만든다. 각 파이프라인의 결과는 판단 근거와 함께 제공되며, 운영팀이 조회하고 시각화할 수 있도록 구성된다.

5. 모델 판단을 검증하는 책임 있는 AI 통제

실제 고객 대화를 대규모로 분류하고 평가하기 때문에, 시스템은 Amazon Bedrock Guardrails로 개인식별정보(PII) 같은 민감정보를 모델에 전달하기 전에 마스킹하고 맥락적 근거 확인으로 근거 없는 응답을 표시한다. 모델의 출력은 최종 판정으로 그대로 받아들이지 않으며, 규칙으로 확정할 수 있는 평가 기준은 프로그램 기반 후처리 계층이 원본 대화와 대조해 다시 검증한다. 예를 들어 모델이 지적한 철자 오류는 상담원 자신의 메시지에서만 확인하고, 통과·실패 기준도 모델이 센 오류 수가 아니라 검증된 수에 적용한다. 상담원 응답 대기 시간처럼 계산 가능한 사실은 코드로 결정적으로 산출해 프롬프트에 넣어 모델의 추론에 맡기지 않는다. 모든 점수에는 사람이 검토할 수 있는 추론 근거가 붙으며, 원문은 이러한 통제가 운영 환경에서 규정 준수 판단의 감사 가능성과 신뢰성을 유지한다고 설명한다.

6. 전체 분류 체계를 제공한 접근의 한계

DiDi의 문의 사유 분류 체계인 CR Tree는 넓은 범주에서 여러 단계의 세부 범주로 내려가며, 단계가 깊어질수록 구분이 미묘해져 대규모 상담 처리에서 라벨 오류가 발생하기 쉽다. 초기에는 전체 CR Tree와 상담 대화를 한 번에 LLM에 제공했지만, 검증 정확도는 기대에 크게 못 미쳤다. 팀은 모델이 전체 선택지를 하나씩 비교하면서 현재 라벨이 충분히 타당해도 조금 더 정밀한 대안을 발견하면 기존 라벨을 잘못됐다고 판단하는 것이 원인이라고 설명한다. 여러 차례 프롬프트 문구를 조정해도 이 행동은 바뀌지 않았고, 문제의 중심은 표현 방식보다 각 호출에서 모델이 보는 정보의 범위에 있었다. 이 관찰은 현재 라벨의 타당성을 확인하는 작업과 더 적합한 라벨을 찾는 작업을 분리하는 설계 전환으로 이어졌다.

7. 작업·정보 분리와 문의 의도 검증 개선

개선된 문의 의도 파이프라인은 일반 라벨의 검증과 ‘Other’ 라벨 분석을 서로 다른 작업으로 보고 독립된 경로로 분리했다. ‘Other’ 상담은 먼저 같은 상위 범주 아래의 형제 범주에서 적합한 라벨을 찾고, 없으면 전체 CR Tree를 검색하며, 그래도 일치하는 항목이 없으면 분류 체계의 누락으로 보고 새 라벨을 제안한다. 일반 라벨의 검증 단계에서는 모델에 현재 문의 사유 라벨만 제공하고, 대화 내용에 비춰 그 라벨이 타당한지 판단하게 한다. 검증에 실패한 경우에만 전체 CR Tree와 앞선 검증 근거를 전달하는 재분류 단계로 넘어가며, 이 단계는 대안 라벨과 신뢰도 점수 및 판단 이유를 제시한다. 이러한 작업 분리와 정보 분리의 두 수준 설계를 통해 DiDi의 운영 환경 검증에서 문의 의도 검증 정확도는 38%에서 86%로 높아졌다.

8. 동적 평가 설정과 원문에서 확인되는 성과 범위

평가 파이프라인은 여러 규정 준수 항목의 점수와 비즈니스 인사이트를 한 번에 생성하며, 언어·사업 조합별로 별도의 프롬프트를 유지하는 대신 외부 설정을 결합하는 공통 템플릿을 사용한다. 언어 맥락, 사업 맥락, 각 평가 기준의 정의와 판정 규칙을 외부에 두고 상담 메타데이터에 따라 호출 시 조립하므로, 평가 항목이나 언어·사업을 추가할 때는 설정을 갱신하는 방식으로 대응한다. 원문은 동적 프롬프트 조립과 Amazon Bedrock의 Tool Use를 함께 사용해 스키마로 검증되는 JSON을 반환하도록 하는 예시를 소개하며, 제시된 코드에서는 평가 항목 수에 따라 판단 근거와 정수 점수 필드를 갖는 출력 스키마를 만든다. 보고된 성과는 규정 준수 점수 산정 정확도 90% 초과와 VOC 수작업 요약의 수시간에서 수분으로의 단축이며, 제공된 본문은 프롬프트 조립 함수의 선언 도중 끝나므로 이후 구현 세부사항이나 추가 계획은 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • 분류 대안을 많이 제공하는 것이 검증 정확도를 항상 높이지는 않는다. DiDi 사례에서는 현재 라벨의 타당성 판단과 대안 탐색을 분리해 모델이 불필요한 비교에 이끌리는 문제를 줄였다.
  • 평가 기준을 언어·사업 맥락과 함께 외부 설정으로 관리하면, 빈번한 기준 변경과 조합 증가에 공통 템플릿으로 대응할 수 있다.
  • 추론 근거 제공과 코드 기반 사실 검증은 서로 보완적이다. 판단 이유를 검토할 수 있게 하는 동시에 계산 가능한 사실과 규칙 판정은 별도로 확인해 감사 가능성을 높인다.

✅ 액션 아이템

  • 문의 의도 검증에서 현재 라벨 확인과 전체 CR Tree를 활용한 재분류를 분리하는 정보 범위 설계 검토.
  • 스페인어·포르투갈어와 세 사업 영역의 평가 기준을 외부 설정으로 관리하는 동적 프롬프트 구성 검토.
  • 규정 준수 평가에 민감정보 마스킹, 코드 기반 판정 재검증, 판단별 추론 근거를 결합하는 방식 검토.

❓ 열린 질문

  • 문의 의도 검증 정확도 38%에서 86%로의 개선은 어떤 검증 표본과 정답 기준으로 측정됐는가?
  • 규정 준수 점수 산정 정확도 90% 초과는 스페인어·포르투갈어와 세 사업 영역에서 각각 어떻게 나타났는가?
  • VOC 요약을 수시간에서 수분으로 단축한 비교에서 상담 규모와 요약 품질은 어떻게 평가됐는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.