How Podium optimized agent behavior and reduced engineering intervention by 90% with LangSmith
Quick Summary
Podium은 LangSmith를 활용해 AI Employee의 대화 종료 판단 품질을 높이고 고객지원에 필요한 엔지니어 개입을 90% 줄였다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Podium은 LangSmith를 활용해 AI Employee의 대화 종료 판단 품질을 높이고 고객지원에 필요한 엔지니어 개입을 90% 줄였다.
📌 핵심 요약
- Podium 데이터에 따르면 고객 문의에 5분 이내 응답할 때의 잠재고객 전환율은 1시간 뒤 응답할 때보다 46% 높았으며, AI Employee는 고객 응대·예약·판매를 지원하기 위해 출시됐다.
- Podium은 상호작용당 20~30회의 LLM 호출을 파악하기 위해 LangSmith를 도입하고, 기본 데이터셋과 오프라인 평가, 사용자 피드백, 온라인 평가, 최적화, 회귀 테스트를 연결했다.
- 대화 종료 판단 문제에 모델 증류와 균형 잡힌 데이터셋을 활용한 미세조정을 적용한 결과, F1 점수가 91.7%에서 98.6%로 올라 품질 기준인 98%를 넘었다.
- 기술 제품 전문가인 TPS 팀은 LangSmith로 문제 원인을 구분하고 불완전한 맥락과 지침 불일치를 직접 수정했으며, 엔지니어 개입 필요성이 90% 줄고 고객 만족도 점수도 개선됐다.
- Podium은 LangSmith와 LangChain으로 LLM 애플리케이션의 설계·테스트·모니터링을 지원하고, LangGraph를 업무 흐름에 통합하면서 에이전트 오케스트레이션의 복잡성을 줄이고 대화 제어력을 높이고 있다.
🧩 주요 포인트
- 상호작용당 20~30회의 LLM 호출을 추적으로 연결 → 복잡한 에이전트 동작을 분석하고 평가·개선에 활용할 근거 확보.
- 균형 잡힌 데이터셋과 모델 증류·미세조정을 쌍대 평가로 검증 → 대화 종료 판단을 품질 기준 98%와 비교해 확인.
- TPS 팀이 맥락·지침 문제를 직접 해결하고 애플리케이션 버그·LLM 문제는 엔지니어가 담당 → 원인에 따른 대응 분담으로 개발 인력의 지원 부담 감소.
🧠 상세 정리
1. 신속한 고객 응대와 AI Employee의 도입 배경
Podium은 전화, 문자, 이메일, 소셜 미디어를 통해 소규모 사업체와 고객의 소통을 지원하는 플랫폼이다. 자동차 판매점, 보석상, 자전거 매장처럼 고객과 긴밀한 상호작용이 필요하지만 인력이 부족한 사업체가 주요 대상이다. Podium 데이터에서는 문의에 5분 이내 응답했을 때 잠재고객 전환율이 1시간 뒤 응답했을 때보다 46% 높았다. 이에 고객 응대와 예약, 판매를 지원하는 대표 제품 AI Employee를 출시했다. 처음에는 LangChain으로 단일 턴 상호작용을 처리했지만, 고객군과 업무 영역이 다양해지면서 복잡한 LLM 호출과 상호작용을 파악하기 위해 LangSmith의 테스트·관측 기능을 도입했다.
2. 개발과 운영을 연결하는 반복 평가
Podium은 AI Employee의 성능을 지속적으로 개선하기 위해 개발 전 과정에 피드백을 반영하는 평가 흐름을 구축했다. 먼저 기본 사용 사례와 요구사항을 대표하는 데이터셋을 만들고, 배포 전에 오프라인 평가로 기본 요건 충족 여부를 확인했다. 운영 중에는 사용자 피드백을 수집하고 LLM을 활용한 온라인 평가로 응답 품질을 감시하면서 조사할 문제를 표시했다. 이후 프롬프트와 검색 방식을 조정하고, 추적 데이터를 활용해 특정 작업에 맞도록 모델을 미세조정했다. 개선 결과는 과거 사례 재검증과 쌍대 비교 등으로 평가했으며, 새로운 시나리오와 예외 사례를 데이터셋에 계속 추가해 변경 사항이 기존 기능에 악영향을 주는지 확인했다.
3. 대화 종료 판단을 개선한 데이터셋과 미세조정
Podium에서는 상호작용마다 LLM 호출이 20~30회 발생해 고객 문의와 에이전트의 처리 단계를 이해하기 어려웠으나, LangSmith로 추적 기록을 수집하고 살펴보면서 분석이 쉬워졌다. 대표적인 문제는 AI Employee가 대화의 자연스러운 종료 시점을 인식하지 못해 작별 인사를 반복하는 현상이었다. 팀은 다양한 대화 종료 사례를 데이터셋으로 만들고, 더 큰 모델의 출력을 선별해 작은 모델에 활용하는 모델 증류를 적용했다. 자동으로 기록된 모델 입출력에 고객 프로필과 업종 등의 메타데이터를 더하고 식별자로 관련 기록을 묶어, 과적합을 피하도록 균형 잡힌 데이터를 구성했다. 미세조정한 모델과 기존 대형 모델을 쌍대 평가한 결과, 대화 종료 판단의 F1 점수는 91.7%에서 98.6%로 높아져 내부 품질 기준 98%를 넘었다.
4. 문제 원인에 따른 고객지원 역할 분담
AI Employee가 1월에 공개 출시된 뒤, 소규모 사업체 고객을 지원하는 기술 제품 전문가인 TPS 팀이 사용자 문제를 실시간으로 진단하는 일이 중요해졌다. LangSmith 접근 권한을 얻은 TPS 팀은 문제가 애플리케이션 버그, 불완전한 맥락, 지침 불일치, LLM 자체의 오류 중 어디에서 비롯됐는지 구분할 수 있었다. 연동 기능이 데이터를 반환하지 못하는 등의 애플리케이션 문제와 필요한 맥락이 있어도 잘못된 답을 생성하는 LLM 문제는 엔지니어가 처리했다. 반면 답변에 필요한 정보가 빠진 경우 TPS 팀이 콘텐츠를 추가하고, 업무 요구사항에 맞지 않는 지침은 콘텐츠 작성 시스템에서 수정했다. 이처럼 문제 원인을 확인한 뒤 해당 원인을 해결할 수 있는 담당자가 개입하는 방식으로 지원 업무를 나눴다.
5. 지원팀의 직접 진단과 엔지니어 개입 감소
자동차 판매점에 관한 문의에서 AI Employee가 오일 교환 서비스를 제공하지 않는다고 잘못 답하는 상황은 TPS 팀의 진단 방식을 보여주는 사례다. TPS 팀은 LangSmith Playground에서 시스템 출력을 수정해 보면서 관리 화면의 간단한 설정 변경으로 해결할 수 있는지 확인할 수 있었다. 이전에는 에이전트 동작에 문제가 생기면 엔지니어가 모델 입출력을 검토하고 코드를 다시 작성하거나 구조를 바꾸는 과정이 자주 필요했다. TPS 팀에 추적 기록을 제공한 뒤 Podium은 엔지니어 개입 필요성을 90% 줄였고, 엔지니어가 지원 업무보다 개발에 집중할 수 있게 됐다. 지원팀은 문제를 더 빠르고 독립적으로 해결했으며, 지원 상호작용과 AI 서비스 양쪽에서 고객 만족도 점수도 개선됐지만 구체적인 상승 수치는 제시되지 않았다.
6. LangGraph 통합과 에이전트 운영의 확장
Podium은 LangSmith와 LangChain을 함께 활용해 고객 경험 도구 시장에서 경쟁력을 확보했다고 설명한다. LangSmith는 에이전트 동작의 관측 가능성을 높이고, 대규모 데이터셋 관리와 모델 성능 최적화를 더 쉽게 만들었다. 이어 Podium은 LangGraph도 업무 흐름에 통합하면서 다양한 대상 고객을 지원하는 에이전트 오케스트레이션의 복잡성을 줄이고 대화에 대한 제어력을 높이고 있다. 이러한 도구의 결합은 LLM 애플리케이션을 효율적으로 설계하고 테스트하며 모니터링하는 데 활용됐다. 원문은 이 같은 기술적 개선을 소규모 사업체가 잠재고객을 더 효과적으로 확보하도록 돕는다는 Podium의 핵심 사업 가치와 연결하며 사례를 마무리한다.
🧾 핵심 주장 / 시사점
- 추적 기록은 오류 분석에 그치지 않고 데이터셋 구성, 모델 증류, 미세조정, 비교 평가를 연결하는 공통 근거로 활용됐다.
- 대화 종료처럼 구체적인 행동 문제를 대상으로 데이터와 평가 기준을 마련한 덕분에 개선 결과를 F1 점수와 품질 기준으로 확인할 수 있었다.
- 엔지니어 개입 감소에는 관측 도구의 도입뿐 아니라 TPS 팀의 접근 권한과 문제 원인별 해결 역할 분담이 함께 작용했다.
✅ 액션 아이템
- LangSmith 추적과 사용자 피드백을 기본 데이터셋·오프라인 평가·온라인 평가·회귀 테스트에 연결하는 방식 검토.
- 대화 종료 판단의 F1 점수 91.7%→98.6%와 품질 기준 98%를 바탕으로 모델 증류·미세조정 결과 확인.
- TPS 팀의 맥락·지침 수정과 엔지니어의 애플리케이션 버그·LLM 문제 대응을 구분하는 역할 분담 검토.
❓ 열린 질문
- 엔지니어 개입 필요성이 90% 줄었다는 결과는 어떤 측정 기간과 비교 기준으로 산출됐는가?
- 대화 종료 판단의 F1 점수 98.6%는 어떤 규모와 구성의 평가 데이터셋에서 확인됐는가?
- LangGraph 통합에 따른 에이전트 오케스트레이션 복잡성 감소와 대화 제어력 향상은 어떻게 평가하고 있는가?