Articlelangchain.com·2026년 8월 5일·0

Customer Experience (CX) Agents in Production: Lessons from Lyft, Vodafone, and LATAM Airlines

Quick Summary

고객 경험 에이전트의 생산 운영 성패는 다중 에이전트 구조 자체보다 현실적인 평가, 세밀한 라우팅, 전 과정 추적, 현업 전문가가 참여하는 지속적 개선 체계에 달려 있다.

Customer Experience (CX) Agents in Production: Lessons from Lyft, Vodafone, and LATAM Airlines 관련 대표 이미지

🖼️ 인포그래픽

Customer Experience (CX) Agents in Production: Lessons from Lyft, Vodafone, and LATAM Airlines 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Customer Experience (CX) Agents in Production: Lessons from Lyft, Vodafone, and LATAM Airlines 내용을 설명하는 본문 이미지

💡 한 줄 요약

고객 경험 에이전트의 생산 운영 성패는 다중 에이전트 구조 자체보다 현실적인 평가, 세밀한 라우팅, 전 과정 추적, 현업 전문가가 참여하는 지속적 개선 체계에 달려 있다.

📌 핵심 요약

  • 고객 경험 에이전트는 응답 속도, 상담원 전환 감소, 해결 성공률처럼 투자 효과를 측정하기 쉬운 영역에서 빠르게 확산되고 있으며, 생산 단계에서는 실제 대화를 기반으로 행동과 업무 흐름을 계속 개선해야 한다.
  • 주요 활용 방식은 고객용 셀프서비스, 현장 직원용 보조 에이전트, 비개발자가 새 에이전트를 만드는 셀프서비스 플랫폼, 모호한 요청을 처리하는 의미 기반 라우팅, 기술팀과 현업팀이 공유하는 평가 체계로 정리된다.
  • 리프트의 인공지능 지원 서비스는 일곱 개 이상의 운영 에이전트로 월 약 27만 건의 상호작용을 처리하며, 상담원 전환 회피율 65%와 인공지능 해결률 35%를 기록했다.
  • 리프트는 메타 에이전트가 전문 하위 에이전트로 요청을 보내고 필요하면 대화 중 다시 라우팅하는 구조를 사용하며, 설정형 에이전트 도입으로 신규 개발 기간을 약 6개월에서 약 2주로 단축했다.
  • 리프트는 현실적인 모의 고객, 행동별 통과·실패 기준표, 사람과 보정한 언어 모델 판정자, 운영 기록 추적과 주석 대기열을 결합해 실패를 프롬프트·업무 흐름·데이터셋 개선으로 환류한다.

🧩 주요 포인트

  1. 응답 속도와 문제 해결 결과를 매출·비용 지표에 연결할 수 있다 → 고객 경험은 에이전트의 운영 효과를 비교적 명확하게 검증할 수 있는 분야다.
  2. 설정형 플랫폼이 에이전트 제작 시간을 크게 줄였다 → 개발 기반보다 프롬프트 작성 규칙과 평가 품질이 새로운 확장 병목으로 이동했다.
  3. 일반적인 품질 점수는 수정 방향을 제시하지 못했다 → 구체적인 행동별 통과·실패 기준과 운영 기록 분석이 실행 가능한 개선 과제를 만든다.

🧠 상세 정리

1. 고객 경험 에이전트가 생산 시스템으로 전환되는 배경

고객 경험 에이전트가 빠르게 확산되는 이유는 응답 속도, 상담원 전환, 해결 성공률을 매출과 비용, 고객 유지 같은 지표에 연결하기 쉽기 때문이다. 그러나 운영 단계의 핵심 과제는 에이전트를 처음 만드는 데서 끝나지 않고, 실제 대화를 학습 재료로 삼아 행동을 고치고 어떤 대화를 구조화된 업무 흐름으로 바꿀지 정하는 데 있다. 앞선 팀들은 이를 지속적인 시험, 배포, 관찰, 반복 개선이 필요한 생산 시스템으로 다룬다. 글은 리프트의 셀프서비스 지원 플랫폼, 패스트웹·보다폰의 고객 및 상담센터 지원 도구, 라탐항공의 여행 지원 에이전트와 대화 신호화 시스템을 주요 사례로 제시한다. 제공된 본문은 이 가운데 공통적으로 나타나는 운영 패턴과 리프트의 구현 및 평가 체계를 구체적으로 설명한다.

2. 고객용 셀프서비스와 현장 직원용 보조 에이전트

소비자 대상 셀프서비스는 청구, 계정 접근, 보상 요청, 예약 같은 업무를 직접 처리하며 가장 눈에 띄는 출발점이다. 포디움의 인공지능 직원은 자동차 판매점과 냉난방 설비업체 등에서 들어오는 잠재 고객 문의에 대응하며, 이들 사업에서는 5분 안에 답할 때 한 시간 안에 답하는 경우보다 잠재 고객 전환율이 46% 높았다. 반면 현장 직원용 보조 에이전트는 고객과 직접 말하기보다 사람 상담원이나 기술자 옆에서 다음 행동을 제안하므로 더 큰 지렛대가 될 수 있다. 시스코의 고객 경험 조직은 수천 개의 가능성 중 중요한 소수만 추려, ‘도와줘’처럼 모호한 요청도 적절한 문제로 연결한다. 두 유형은 자동화의 목적이 단순히 답변을 생성하는 것이 아니라 응답 지연을 줄이고 사람이 판단해야 할 범위를 좁히는 데 있음을 보여준다.

3. 셀프서비스 제작 플랫폼과 의미 기반 라우팅

엔지니어링팀이 모든 에이전트를 직접 만들 수 없는 규모에 이르면 셀프서비스 제작 플랫폼이 필요해진다. 리프트는 운영 담당자와 제품 관리자가 프롬프트와 설정 파일을 작성해 기계학습 엔지니어 없이 새 지원 에이전트를 출시하도록 했고, 포디움도 내부에서 사용하는 공통 구성 요소로 여러 업종을 지원하는 체계를 만들었다. 동시에 고객 요청이 불완전하거나 모호할 때는 의미 기반 라우팅과 분류가 운영 성능을 좌우한다. 라탐항공의 여행 지원 에이전트에서 처음 범위 밖으로 분류된 메시지는 13%였지만, 검토 결과 그중 95%가 체크인과 수하물 등 실제 승객의 요구였다. 고객 관리 전문 역할을 추가하자 범위 밖 분류율이 13%에서 1%로 낮아졌으며, 운영 대화를 검토하는 일이 지원 범위와 라우팅 설계를 바로잡는 근거가 됐다.

4. 평가를 기술팀과 현업팀의 공통 언어로 만들기

비기술 직군까지 에이전트 제작에 참여하면 평가는 기술팀과 현업팀이 좋은 행동을 합의하는 공통 언어가 된다. 리프트는 플랫폼을 개방한 뒤 기반 기술보다 프롬프트와 평가 품질이 병목이 된다는 점을 확인했다. 이에 구조화된 프롬프트 작성 틀을 도입하고, 상충하는 지시나 끝까지 이어지지 않는 대화 경로를 운영 배포 전에 찾는 자동 검사를 마련했다. 평가는 도메인 전문가의 암묵적 기준을 구체적이고 시험 가능한 조건으로 바꾸어 엔지니어, 제품 관리자, 운영 담당자가 같은 기준으로 출시 가능 여부를 판단하게 한다. 따라서 셀프서비스화는 개발 권한만 넓히는 것으로 끝나지 않으며, 작성 규칙과 품질 문턱을 함께 표준화해야 실제 운영 확장으로 이어진다.

5. 리프트 인공지능 지원 서비스의 규모와 해결 기준

리프트의 인공지능 지원 서비스는 계정 접근, 차량 손상 청구, 요금 검토, 운전자 수입 분쟁 등을 다룬다. 리프트가 월 7천9백만 건의 운행을 중개하는 가운데, 일곱 개 이상의 운영 에이전트가 월 약 27만 건의 상호작용을 처리했고 상담원 전환 회피율 65%, 인공지능 해결률 35%를 기록했다. 리프트는 단지 사람 상담원에게 가지 않게 한 경우가 아니라 문제를 처음부터 끝까지 해결한 경우만 해결로 인정하는 높은 기준을 둔다. 운전자 차량 손상 청구처럼 복잡한 흐름에서는 정보와 사진 수집, 도구를 통한 데이터 조회, 사기 신호 적용, 결정, 결과 설명까지 포함한다. 이 전 과정을 15분 안에 수행하는 방식은 지원 에이전트가 단순 문답기가 아니라 실제 업무 결정을 완결하는 시스템으로 설계됐음을 보여준다.

6. 메타 에이전트와 전문·설정형 에이전트의 결합

현재 리프트 시스템은 랭그래프로 구현한 라우터 기반 다중 에이전트 구조다. 메타 에이전트가 들어온 요청을 분류해 승객과 운전자 경로의 전문 하위 에이전트로 보내며, 각 하위 에이전트도 하나의 완전한 상태 그래프로 등록된다. 대화 도중 일반 운전자 의도 에이전트가 손상 청구처럼 더 전문적인 처리가 필요하다고 판단하면 메타 에이전트에 제어권을 돌려주고 다시 라우팅하므로, 잘못 선택된 경로에 대화를 억지로 고정하지 않는다. 고위험의 복잡한 업무는 기계학습 엔지니어가 만드는 전문 에이전트가 맡고, 설정형 에이전트는 제이슨 설정과 프롬프트 허브의 프롬프트를 실행 시점에 불러와 도메인 전문가도 구성할 수 있게 했다. 이 구분으로 첫 운전자 에이전트에 약 6개월이 걸렸던 개발 기간은 새 설정형 에이전트 기준 약 2주로 줄었다.

7. 현실적인 모의 대화와 행동별 통과·실패 기준

출시 전 리프트는 대형 언어 모델이 고객 역할을 맡아 에이전트와 여러 차례 대화하는 모의 시험을 수행한다. 각 시험은 실제 운영에서 만날 법한 과업, 사용자 성향, 환경으로 구성되며, 대화 궤적은 올바른 보상 조치, 적절한 상담원 전환, 예상 턴 수 안의 해결 여부 등을 코드 단언과 언어 모델 판정자로 평가한다. 다양한 오프라인 시나리오는 실제 고객을 시험 대상으로 삼지 않으면서도 품질 기준을 충족한 에이전트만 운영으로 보내는 출시 관문이다. 초기의 도움 정도, 자연스러움, 도구 사용 적절성, 대화 완결성 같은 일반 점수는 무엇을 고쳐야 하는지 알려주지 못했다. 그래서 운영 및 품질 전문가와 함께 실제 지원 행동을 겨냥한 좁은 기준표를 만들고, 넓은 연속 점수 대신 통과와 실패로 판정하도록 바꿨다. 교육 기준표는 반복 설명, 성급한 전환, 사실 오류를 실패로 보고, 상담원 전환 기준표는 첫 요청에는 한 차례 자체 해결을 유도하되 반복 요청 뒤에는 전환해야 한다고 명시해 각 실패를 구체적인 제품·프롬프트·업무 흐름 수정으로 연결한다.

8. 판정자 보정과 운영 기록을 활용한 지속적 개선

자동 평가의 신뢰성을 높이기 위해 리프트는 언어 모델 판정 결과를 사람 검토자의 라벨과 비교하고, 충분한 일치율에 도달할 때까지 판정자를 조정한다. 초기 모의 고객은 지나치게 명료하고 인내심 있으며 협조적이어서 오프라인 통과율이 90%를 넘었지만 실제 운영 행동을 반영하지 못했다. 팀은 실제 고객 표현으로 모의 사용자를 미세 조정하고, 환불을 원하는 사람, 인공지능을 불신하는 사람, 반드시 사람에게 연결되려는 사람 같은 성향을 추가해 시험을 더 어렵고 현실적으로 만들었다. 출시 뒤에도 개발·시험·운영의 모든 호출을 랭스미스에서 추적해 라우팅, 문맥, 도구 실행, 최종 답변 중 어디서 실패했는지 찾는다. 제품 관리자와 운영 전문가도 통과·실패 조건과 기준표, 판정자를 직접 구성하며, 실패한 운영 기록은 주석 대기열로 보내 자유 서술 라벨을 구조화된 제품 통찰로 바꾼다. 이 결과는 프롬프트, 업무 흐름, 데이터셋, 다음 오프라인 시험에 다시 반영된다. 다음 단계는 과업·데이터셋·사용자 성향·채점기를 버전 관리 가능한 공통 구성 요소로 표준화해 모든 프롬프트 변경의 회귀 시험, 같은 시나리오에서의 모델 비교, 지속적으로 확장되는 평가 집합을 가능하게 하는 것이다.

🧾 핵심 주장 / 시사점

  • 에이전트 제작을 비개발자에게 개방하면 개발 속도는 빨라지지만, 품질을 유지하려면 프롬프트 작성 틀과 공유 가능한 평가 기준을 함께 제공해야 한다.
  • 모의 시험의 예측력은 언어 모델의 성능만이 아니라 실제 고객처럼 불완전하고 반복적이며 특정 목적을 가진 사용자를 얼마나 충실히 재현하는지에 좌우된다.
  • 실패한 운영 대화를 추적하고 현업 담당자가 실패 유형을 라벨링하면 개별 오류가 지원 범위, 라우팅, 프롬프트, 업무 흐름을 개선하는 구조화된 제품 정보로 전환된다.

✅ 액션 아이템

  • 응답 속도·상담원 전환 회피율·인공지능 해결률을 매출·비용 지표와 연결해 운영 효과 측정 기준을 정의한다.
  • 메타 에이전트 하위 라우팅과 대화 중 재라우팅 경계를 행동 단위로 나눠 실패 지점을 점검한다.
  • 모의 고객·행동별 통과·실패 기준·운영 기록 주석을 결합해 실패를 프롬프트·업무 흐름·데이터셋 개선으로 환류한다.

❓ 열린 질문

  • 상담원 전환 회피율 65%와 인공지능 해결률 35% 중 어떤 지표를 우선 개선 목표로 둘 것인가?
  • 설정형 에이전트로 개발 기간이 2주로 줄 때 프롬프트 작성 규칙과 평가 품질 병목은 어디에 남는가?
  • 일반 품질 점수 대신 행동별 통과·실패 기준을 만들 때 현업·기술팀이 공유할 판정 기준은 무엇인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.