Articlelangchain.com·2026년 8월 18일·0

Introducing LangSmith Tuned Evaluators

Quick Summary

LangSmith Tuned Evaluators는 Perceived Error를 시작으로 전문화된 관리형 판정 모델이 적격 생산 대화를 평가하고 결과와 설명을 추적에 첨부해, 평가 정확도와 범위를 확보하면서 비용과 운영 부담을 낮추는 서비스다.

Introducing LangSmith Tuned Evaluators 관련 대표 이미지

🖼️ 인포그래픽

Introducing LangSmith Tuned Evaluators 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Introducing LangSmith Tuned Evaluators의 핵심 내용을 4단계로 요약한 인포그래픽
Introducing LangSmith Tuned Evaluators 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

LangSmith Tuned Evaluators는 Perceived Error를 시작으로 전문화된 관리형 판정 모델이 적격 생산 대화를 평가하고 결과와 설명을 추적에 첨부해, 평가 정확도와 범위를 확보하면서 비용과 운영 부담을 낮추는 서비스다.

📌 핵심 요약

  • 각 Tuned Evaluator는 특정 평가 목적에 맞춰 완성되고 버전이 관리되는 평가기로, 팀은 필요한 평가기를 선택해 LangSmith 추적 프로젝트에 연결할 수 있다.
  • LangChain은 평가기 프롬프트의 작성·시험·버전 관리뿐 아니라 판정 모델 선정과 벤치마킹, 공급자 자격 증명, 추론 인프라까지 종단 간 관리한다.
  • 기존 평가 방식은 비싼 프런티어 모델과 신뢰도가 낮은 소형 모델 사이에서 정확도와 평가 범위를 절충해야 했지만, Tuned Evaluators는 좁고 명확한 목적에 맞게 사후 학습된 전문 모델로 이 문제를 다룬다.
  • 첫 평가기인 Perceived Error는 에이전트의 실수·요청 오해·잘못된 대화 방향을 나타내는 증거를 탐지하며, LangChain의 벤치마크에서 비교한 모든 프런티어 모델보다 높은 성능을 기록하고 평가 비용을 최대 82% 줄였다. 일부 초기 파트너 작업에서는 대화 구성에 따라 최대 98%의 절감 효과가 나타났다.
  • Perceived Error는 인간-AI 메시지 쌍이 최소 두 개이고 설정된 유휴 기간에 도달한 스레드를 대상으로 적격 시점부터 12시간 이내 평가하며, 현재 미국의 Plus 및 Cloud Enterprise 플랜에서 제공되고 성공한 평가만 과금된다.

🧩 주요 포인트

  1. 프런티어 모델은 정확하지만 대규모 적용 비용이 높고 소형 모델은 저렴하지만 신뢰하기 어렵다 → 목적별 전문 모델은 적격 대화의 평가 범위를 넓히면서 비용·품질 절충을 완화한다.
  2. 신뢰할 수 있는 평가기에는 행동 정의, 모호한 사례 해소, 라벨 생성, 판정 모델 비교와 지속적 유지가 필요하다 → LangChain의 종단 간 관리는 팀이 직접 감당하던 평가기 구축·운영 부담을 줄인다.
  3. Perceived Error는 명시적 사용자 평점이 없어도 수정 요청, 반복 요청, 모순된 답변, 해결되지 않은 결과를 통해 실패 신호를 찾는다 → 결과와 설명은 실패 조사, 반복 유형 비교, 평가 데이터셋 구축과 에이전트 개선 검증에 활용된다.

🧠 상세 정리

1. 생산 대화 평가의 기존 한계

프로덕션의 대화형 에이전트에는 사용자가 실제로 도움을 받았는지 판단할 평가가 필요하며, 글은 Perceived Error를 이를 보여주는 가장 명확한 신호 중 하나로 제시한다. 그러나 지금까지 Perceived Error 평가는 비용이 높고 확장하기 어려워, 팀들이 프런티어 모델을 호출하면서 전체 추적 중 일부만 표본으로 선택하는 경우가 많았다. 프런티어 모델은 강한 판단 성능을 제공하지만 수많은 생산 대화에 적용하면 추론 비용이 커진다. 반대로 소형 모델은 비용이 낮아도 정확도가 떨어져 어떤 추적을 우선 조사해야 하는지 신뢰하기 어렵다. 이 때문에 제한된 표본만 평가하는 방식은 고객에게 좋지 않은 경험을 준 중요한 대화를 놓칠 위험을 남겼고, 정확도와 평가 범위 사이의 선택이 핵심 제약으로 작용했다.

2. 완제품형 관리 평가기

Tuned Evaluators는 특정 목적을 위해 완성되고 버전이 관리되는 평가기로, 팀이 직접 복잡한 평가 프롬프트나 판정 체계를 구축하지 않고 추적 프로젝트에 연결할 수 있도록 설계됐다. 팀은 필요한 평가기를 선택해 저장하면 되며, LangChain이 해당 목적을 생산 환경에서 사용할 수 있는 판정기로 구현하고 유지한다. 관리 범위에는 프롬프트 작성·시험·버전 관리, 판정 모델 선정, 프런티어 모델과의 벤치마킹, 공급자 자격 증명, 추론 인프라가 포함된다. 이는 행동 정의, 모호한 사례 판정, 라벨 제작, 모델 비교처럼 신뢰할 수 있는 평가기에 필요한 작업도 제품 안에 묶어 제공한다는 의미다. 모델과 생산 환경의 행동이 바뀔 때 발생하는 유지 작업까지 LangChain이 맡기 때문에, 팀은 평가기 자체의 운영보다 결과를 활용한 에이전트 개선에 집중할 수 있다.

3. 평가 실행과 피드백 연결 방식

사용 과정은 Tuned Evaluator를 LangSmith 추적 프로젝트에 추가하고 저장하는 단계에서 시작한다. LangSmith는 선택된 평가기의 요구 조건을 기준으로 평가할 수 있는 추적이나 스레드를 식별하며, 모든 데이터가 아니라 조건을 충족한 대상만 판정 단계로 보낸다. 이후 LangChain이 관리하는 전문 판정 모델이 각 적격 추적 또는 스레드를 평가한다. 판정 결과와 그 이유를 설명하는 내용은 원래 상호작용이 기록된 추적이나 스레드에 피드백으로 첨부된다. 팀은 이 피드백을 바탕으로 문제가 있는 추적을 조사하고, 유용한 사례를 데이터셋에 추가하거나 자체 평가 체계와 개선 흐름에 연결할 수 있다. 따라서 평가 결과는 별도의 고립된 점수가 아니라 원래 대화와 함께 검토하고 후속 개선에 재사용할 수 있는 신호로 제공된다.

4. Perceived Error의 탐지 범위와 성능

첫 Tuned Evaluator인 Perceived Error는 에이전트가 실수했거나 요청을 오해했거나 대화를 잘못된 방향으로 이끈 증거가 포함된 대화를 탐지한다. 명시적인 증거에는 사용자의 정정, 같은 요청의 반복, 에이전트가 수행한 행동에 대한 거부가 포함된다. 판정 모델은 모순되는 응답, 스스로 인정한 실수, 지속되는 오해, 해결되지 않은 결과처럼 대화에 간접적으로 드러난 신호도 추론할 수 있다. 대부분의 사용자가 명시적 평점을 제출하지 않기 때문에, 이러한 대화 증거는 에이전트가 사용자의 요구를 충족했는지 판단하는 대리 지표로 쓰인다. LangChain은 대화형 에이전트의 라벨이 지정된 추적으로 전문 모델을 사후 학습했고, 자체 벤치마크에서 비교한 모든 프런티어 모델보다 높은 성능을 기록하면서 평가 비용을 최대 82% 줄였다고 밝혔다. 일부 초기 파트너 작업에서는 최대 98%까지 비용이 절감됐지만, 실제 절감 폭은 스레드 구성에 따라 달라졌다.

5. 에이전트 개선 흐름에서의 활용

Tuned Evaluators가 보강한 추적은 분석, 코딩 에이전트, 지속적 통합, 사람 검토, 평가 작업 등 팀이 이미 사용하는 흐름에 연결할 수 있다. 특히 시스템 오류나 명시적 사용자 평점이 없었던 실패를 찾아내고, 조사할 가치가 있는 대화만 필터링하는 데 활용된다. 검토자는 평가기의 설명을 원래 상호작용과 함께 확인하고, 표시된 여러 추적을 비교해 반복되는 실패 유형을 찾을 수 있다. 태그가 붙은 추적은 평가 데이터셋에 추가할 수 있으며, 판단이 모호한 대화는 사람 검토로 보낼 수 있다. 이렇게 축적된 사례는 에이전트 변경 사항을 시험하고 검증하는 입력으로 다시 사용된다. 초기 파트너인 Vanta는 자체 업무별 평가기를 개발하는 동안에도 이 기본 평가기로 첫날부터 실패 유형을 포착하는 안전망과 품질 평가 범위를 확보할 수 있었다고 설명했다.

6. 적격 조건, 제공 범위와 과금

Perceived Error 평가 대상이 되려면 하나의 스레드에 인간-AI 메시지 쌍이 최소 두 개 있어야 하며, 해당 스레드가 설정된 유휴 기간에 도달해야 한다. 이 두 조건을 충족해 적격 상태가 되면 평가는 그 시점부터 12시간 이내 완료된다. Perceived Error Tuned Evaluator는 현재 미국 지역의 모든 Plus 및 Cloud Enterprise 플랜에서 사용할 수 있다. 과금은 성공적으로 완료된 평가마다 Tuned Evaluation 요금이 발생하는 방식이며, 건너뛴 평가와 실패한 평가는 청구되지 않는다. 사용자는 LangSmith에 로그인하거나 가입한 뒤 Perceived Error 평가기를 사용할 수 있고, 세부 설정과 사용법은 관련 문서에서 확인할 수 있다. LangChain은 이 평가기로 시작하는 동시에 다른 Tuned Evaluator가 필요한 팀으로부터 구체적인 사용 사례도 접수하고 있다.

🧾 핵심 주장 / 시사점

  • 적격 생산 대화마다 적용할 수 있는 저비용 전문 평가기는 소량 표본 평가에서 놓치기 쉬웠던 실패 신호를 더 넓게 확보하는 수단이 된다.
  • 평가기 프롬프트와 판정 모델, 벤치마크, 자격 증명, 추론 인프라를 함께 관리하는 구조는 평가기 유지 업무를 LangChain으로 이전하고 팀의 엔지니어링 부담을 줄인다.
  • Perceived Error는 명시적 평점이 드문 환경에서도 대화 속 정정·반복·모순·미해결 결과를 이용해 사용자 요구 충족 여부를 판단할 수 있는 대리 신호를 제공한다.

✅ 액션 아이템

  • LangSmith 추적 프로젝트에 Perceived Error Tuned Evaluator를 연결하고, 적격 대화에 첨부된 결과와 설명을 실패 조사 및 에이전트 개선에 활용.
  • 인간-AI 메시지 쌍 최소 두 개, 설정된 유휴 기간, 적격 후 12시간 이내 완료라는 Perceived Error 평가 조건을 운영 전제로 반영.
  • 미국의 Plus 및 Cloud Enterprise 플랜에서 성공한 평가만 과금되고 건너뛰거나 실패한 평가는 과금되지 않는 조건 확인.

❓ 열린 질문

  • Perceived Error의 최대 82% 평가 비용 절감과 일부 초기 파트너 작업의 최대 98% 절감은 대화 구성에 따라 어느 범위로 달라지는가?
  • LangSmith의 결과와 설명을 실패 조사 및 평가 데이터셋 구축에 연결할 때 어떤 반복 실패 유형이 가장 많이 드러나는가?
  • 미국 외 지역이나 Plus 및 Cloud Enterprise 외 플랜에서도 Perceived Error Tuned Evaluator를 사용할 수 있게 되는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.