Ringg’s AI agents resolve up to 65% of customer calls with OpenAI
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Ringg는 OpenAI 모델을 업무별로 배치해 일상적인 고객 문의의 최대 65%를 사람 없이 해결하며, 일부 실시간 작업을 GPT‑4.1에서 GPT‑5.6 Luna로 이전해 모델 비용을 약 90% 절감했다.
📌 핵심 요약
- Ringg는 음성·채팅·WhatsApp·웹을 지원하는 기업용 에이전트 플랫폼으로, 매월 700만 건 이상의 연결된 통화를 처리하며 고객사들의 평균 고객 만족도(CSAT)는 4.8이다.
- Ringg는 고객 정보와 기업 지식을 바탕으로 도구를 선택하고 여러 단계의 업무를 수행하며, 필요한 경우 대화 요약과 함께 사람에게 이관한다. 실시간 음성·채팅 트래픽 대부분은 GPT‑4.1이 처리하고, 요청 특성에 따라 GPT‑5.6 Luna를 사용하며, GPT‑5.6 Terra는 통화 후 분석, GPT‑5.6 Sol은 평가와 프롬프트 개선 등을 담당한다.
- 과거 대화와 모의 고객 흐름, 언어·지역별 평가를 거쳐 모델을 소규모 운영 트래픽에 적용한 뒤 확대한다. Ringg의 평가에서 GPT‑5.6 Terra는 Gemini 2.5 Flash보다 우수했고 주요 지역 언어에서 최대 97% 정확도를 기록했으며, 일부 실시간 작업의 GPT‑5.6 Luna 이전은 모델 비용을 약 90% 줄였다.
- Policybazaar는 통화의 67%를 사람 개입 없이 처리하고 평균 응답 시간을 8~12분에서 60초 미만으로 줄였다. Practo는 첫 통화 해결률 85%, 응답 시간 3초 미만, 운영 비용 70% 감소와 하루 1,000건 이상의 예약 완료를 달성했으며, Groww는 IPO·선물·옵션 관련 인바운드 문의의 72%를 완전한 셀프서비스로 해결하고 평균 처리 시간 2분을 기록했다.
- Ringg는 OpenAI의 컴퓨터 사용 기능으로 온보딩·고객확인(KYC)·IT 문제 해결·온콜 사고 지원·보험금 청구 처리를 위한 브라우저 에이전트를 개발 중이다. 채널과 상호작용 사이의 정보를 보존하는 컨텍스트 계층도 개발하며, 향후 고객 운영의 성과를 완료된 업무 결과와 자동화 깊이로 측정하려 한다.
🧩 주요 포인트
- 도구 실행과 전문 하위 에이전트의 역할 분담 → 단순 응답을 넘어 고객 요청의 실제 완료를 지원하고, 사람에게 이관할 때도 대화 맥락을 전달한다.
- GPT‑4.1과 GPT‑5.6 계열의 업무별 배치 및 단계적 운영 평가 → 품질·지연 시간·신뢰성·비용을 함께 조정하며, 약 90%의 모델 비용 절감은 일부 실시간 작업의 이전 결과로 한정된다.
- 최대 65%의 일상 문의 자동 해결과 고객사별로 다른 성과 지표 → 자동화 효과는 문의 유형과 업무 범위에 맞춰 해석해야 하며, 개발 중인 브라우저 에이전트와 컨텍스트 계층은 채널을 넘나드는 업무 완료로 확장하려는 방향을 보여준다.
🧠 상세 정리
1. 인력 확대의 한계에서 출발한 고객 업무 자동화
Ringg는 인도의 대형 소비자 대상 기업들과 협력하면서 통화량 증가를 인력 충원으로 해결할 때 비용과 운영 복잡성이 함께 커지는 문제를 확인했다. 상담원들은 더 많은 전화에 응대하는 동시에 분절된 수작업 시스템을 이용해 보험 구매나 예약 같은 고객 업무를 도와야 했다. Ringg는 이를 해결하기 위해 GPT‑5.6 같은 고효율 모델을 중심으로 음성·채팅·WhatsApp·웹을 아우르는 기업용 에이전트 플랫폼을 구축했다. 공동창업자 Siddharth Tripathi는 모델 품질뿐 아니라 낮은 지연 시간, 신뢰할 수 있는 도구 사용, 강한 지시 준수와 대규모 운영에 맞는 경제성이 필요했다고 설명했다. 현재 Ringg의 에이전트는 매월 700만 건 이상의 연결된 통화를 처리하며, 고객사들의 평균 고객 만족도(CSAT)는 4.8이다.
2. 고객 요청을 실제로 완료하는 실행 구조
고객 요청을 완료하려면 보험 계약을 확인하거나 계정 기록을 조회하고, 예약을 잡거나 CRM을 갱신하며, 관련 맥락을 유지한 채 전문가에게 대화를 넘기는 작업이 필요할 수 있다. Ringg는 실시간 상호작용에서 GPT‑5.6 Luna와 다른 모델을 활용해 요청을 해석하고 도구를 선택하며 고객을 여러 단계의 업무로 안내한다. 오케스트레이션 계층은 CRM, 티켓 관리 플랫폼, 결제 시스템, 일정 도구와 내부 API에서 작업을 실행하고, 필요한 경우 대화 요약과 함께 사람에게 이관한다. 지식 시스템은 데이터셋·PDF·CSV·업무 문서에 대한 구조화된 필터링과 의미 기반 검색을 결합해 관련 기업 정보에 근거한 응답을 지원한다. 또한 자격 확인, 지원, 검증, 일정 조정, 이관을 전문 하위 에이전트에 나누어 맡기면서 여러 채널에서 고객과 일관된 대화를 유지한다.
3. 업무별 모델 배치와 장기 대화의 맥락 관리
Ringg는 대화 품질, 지연 시간, 지시 준수, 도구 호출, 다국어 성능, 신뢰성과 비용을 기준으로 대안을 평가한 뒤 OpenAI가 실제 운영에 가장 균형 잡힌 선택이라고 판단했다. 실제 배치에서는 GPT‑4.1이 실시간 음성·채팅 트래픽 대부분을 처리하고, GPT‑5.6 Luna는 성능이나 지연 시간, 가격 대비 성능이 해당 요청에 더 적합할 때 사용된다. GPT‑5.6 Terra는 통화 요약과 감정 분류 등 통화 후 분석을 맡고, GPT‑5.6 Sol은 평가와 프롬프트 개선, 모델을 평가자로 활용하는 작업을 지원한다. 고객 입력이 들어오면 오케스트레이션 시스템은 에이전트 지침, 대화 이력, 고객별 데이터, 관련 지식과 사용 가능한 도구를 결합하고 라우팅 계층이 모델과 설정을 선택한다. 긴 대화에서는 컨텍스트가 약 80,000토큰에 가까워질 때 구조화된 요약을 만들어, 전체 이력을 반복 전송하지 않고도 중요한 정보를 유지하며 대화를 이어간다.
4. 평가와 단계적 배포를 통한 품질·비용 개선
Ringg는 운영 배포 전에 과거 대화와 모의 고객 흐름으로 모델을 시험하고, 평가 결과에서 약점을 찾아 프롬프트 개선을 권고하는 반복 개선 체계를 운영한다. 통화 후 분석 평가에서는 GPT‑5.6 Terra가 Gemini 2.5 Flash 등 대안보다 우수해 요약과 감정 분류를 Terra로 이전했으며, 높은 정확도를 유지하면서 단위당 경제성을 개선했다고 설명한다. 언어 전환이나 영어와 현지어 표현의 혼용을 포함한 언어·지역별 평가에서도 Terra는 Gemini 2.5 Flash를 앞섰고 주요 지역 언어에서 최대 97% 정확도를 기록했다. 오프라인 시험을 통과한 모델은 운영 트래픽의 일부에 먼저 도입하며, 라우터는 지역별 지연 시간과 엔드포인트 상태를 감시해 장애나 지연 기준 초과 시 트래픽을 전환한다. 전용 노드, 알림과 버전 관리된 배포로 문제의 영향을 제한하며, 일부 실시간 작업을 GPT‑4.1에서 GPT‑5.6 Luna로 이전한 결과 모델 비용이 약 90% 감소했다. Siddharth Tripathi는 모델 이전 과정에서 전용 Slack 지원과 핵심 엔지니어링 팀에 대한 접근이 엔지니어링 불확실성을 줄이고 출시를 앞당기는 데 도움이 됐다고 밝혔다.
5. 보험·의료·투자 분야에서 보고된 고객 성과
Ringg는 고객사의 일상적인 고객 문의 가운데 최대 65%를 상담원 개입 없이 해결한다고 설명한다. 인도의 대형 온라인 보험 플랫폼 Policybazaar는 Ringg로 57,000건 이상의 고객 요청을 연결하고 통화의 67%를 사람 없이 처리했으며, 평균 응답 시간을 8~12분에서 60초 미만으로 줄여 약 88% 개선했다고 보고했다. 글로벌 의료 플랫폼 Practo에서는 의료 예약과 서비스 요청을 지원한 결과 첫 통화 해결률 85%와 3초 미만의 응답 시간을 달성했다. Practo의 운영 비용은 기존 사람 중심 업무 방식 대비 70% 감소했고, Ringg는 현재 하루 1,000건 이상의 예약을 완료한다. 온라인 투자 플랫폼 Groww는 IPO·선물·옵션 관련 인바운드 문의의 72%를 완전한 셀프서비스로 해결하고 평균 처리 시간 2분을 기록했으며, 이 사례들은 각각 일상 문의 해결률, 통화 무인 처리율, 첫 통화 해결률 등 서로 다른 범위의 지표를 제시한다.
6. 브라우저와 채널 간 연속성으로 확장
Ringg는 OpenAI의 컴퓨터 사용 기능을 활용해 플랫폼 온보딩, 고객확인(KYC), IT 문제 해결, 온콜 사고 지원과 보험금 청구 처리를 위한 브라우저 에이전트를 개발하고 있다. 이와 함께 채널과 상호작용이 달라져도 정보를 보존하는 컨텍스트 계층을 개발 중이며, 이는 이미 완료된 배포 성과와 구분되는 향후 확장 작업이다. 회사가 제시한 이용 흐름은 고객이 음성으로 요청을 시작하고 WhatsApp에서 이어간 다음 브라우저에서 마무리하더라도 같은 정보를 반복 설명할 필요가 없도록 하는 것이다. Siddharth Tripathi는 컴퓨터 사용 기능이 화면에서 일어나는 일과 대화 맥락을 결합해 복잡한 업무를 실시간으로 안내하는 브라우저 에이전트 개발을 앞당겼다고 설명했다. Ringg는 차세대 고객 운영을 평가할 기준으로 통화량이나 인원수보다 완료된 업무 결과와 자동화의 깊이를 제시한다.
🧾 핵심 주장 / 시사점
- Ringg 사례에서 자동화의 핵심은 대화 생성뿐 아니라 기업 정보 검색, 도구 실행과 사람에게의 맥락 전달을 연결해 고객 업무를 완료하는 데 있다.
- GPT‑4.1이 실시간 트래픽 대부분을 계속 담당한다는 점은 GPT‑5.6 활용 확대가 전면 교체가 아니라 업무별 적합성과 평가 결과에 따른 선택적 배치임을 보여준다.
- 모델 비용 약 90% 절감과 Practo의 운영 비용 70% 감소는 대상과 비교 기준이 다른 성과이며, 고객사별 자동 처리율 역시 문의 유형과 측정 범위를 구분해 해석할 필요가 있다.
✅ 액션 아이템
- GPT‑4.1과 GPT‑5.6 Luna의 업무별 적합성을 품질·지연 시간·비용으로 비교하고, 약 90%의 모델 비용 절감은 일부 실시간 작업의 이전 결과로 한정해 검토.
- 최대 65%의 일상 문의 자동 해결, Policybazaar의 67%, Practo의 첫 통화 해결률 85%, Groww의 72%를 각 문의 유형과 업무 범위에 맞춰 해석.
- 개발 중인 브라우저 에이전트와 컨텍스트 계층이 채널 간 정보 보존과 완료된 업무 결과에 기여하는지 확인.
❓ 열린 질문
- GPT‑4.1과 GPT‑5.6 Luna 사이에서 요청을 배분할 때 품질·지연 시간·비용의 구체적인 선택 기준은 무엇인가?
- Ringg의 최대 65% 일상 문의 자동 해결과 Policybazaar의 67%, Groww의 72%는 각각 어떤 문의 범위와 측정 기준에 해당하는가?
- 개발 중인 브라우저 에이전트와 컨텍스트 계층의 효과를 완료된 업무 결과와 자동화 깊이로 어떻게 측정할 것인가?