Articlelangchain.com·2026년 7월 29일·0

How Similarweb Evaluates Agent Reports with LangSmith

Quick Summary

시밀러웹은 랭스미스에서 단답형 질의에는 정답 예시와 도구 검사를, 장문 연구 보고서에는 다차원 평가표·근거 충실성 검사·기준 실행 비교를 적용하고, 모든 점수를 설명과 실행 추적에 연결해 에이전트 변경을 검증한다.

How Similarweb Evaluates Agent Reports with LangSmith 관련 대표 이미지

🖼️ 인포그래픽

How Similarweb Evaluates Agent Reports with LangSmith 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

How Similarweb Evaluates Agent Reports with LangSmith 내용을 설명하는 본문 이미지

💡 한 줄 요약

시밀러웹은 랭스미스에서 단답형 질의에는 정답 예시와 도구 검사를, 장문 연구 보고서에는 다차원 평가표·근거 충실성 검사·기준 실행 비교를 적용하고, 모든 점수를 설명과 실행 추적에 연결해 에이전트 변경을 검증한다.

📌 핵심 요약

  • 에이전트는 같은 입력에도 서로 다른 도구와 경로를 선택해 여러 형태의 유효한 답을 만들 수 있으므로, 개별 결과만 보고 변경의 품질을 판단하기 어렵다.
  • 시밀러웹은 필수·금지 도구 호출과 구조화 출력은 결정론적으로 검사하고, 의미와 품질은 질문·출력·평가기준을 받은 언어 모델 심사자가 점수와 설명으로 평가하도록 구성했다.
  • 답의 범위가 좁은 일반 대화는 고정 질문, 정답 예시, 예상 도구 검사로 평가하며, 표현이 달라도 의미가 같은지는 정답 예시에 기반한 의미 평가자가 판정한다.
  • 복수의 좋은 답이 가능한 장문 연구 보고서는 단일 정답 대신 품질 차원별 평가표를 사용하고, 근거 충실성 검사와 저장된 이전 실행과의 직접 비교를 병행한다.
  • 초기 평가표는 출처의 수와 명확한 귀속을 충돌하는 기준으로 다뤄 좋은 변경을 퇴행처럼 보이게 했으며, 시밀러웹은 출처 개수보다 이름과 검증 가능성에 무게를 두도록 기준을 다시 보정했다.

🧩 주요 포인트

  1. 출력의 개방성에 맞춘 평가 방식 선택 → 단답형의 정답 비교를 장문 보고서에 그대로 적용하면 품질보다 유사성을 보상하게 된다.
  2. 점수·평가 설명·실행 추적의 연결 → 평균값이 변한 이유를 사례와 기준, 실제 도구 사용 과정까지 거슬러 확인할 수 있다.
  3. 평가표의 가중치와 유인 점검 → 서로 충돌하거나 제품 목적과 어긋난 기준은 개선된 결과를 퇴행으로 오판하게 만든다.

🧠 상세 정리

1. 에이전트 변경 평가가 어려운 이유

전통적 소프트웨어는 정해진 테스트의 통과 여부와 반복 가능한 동작을 중심으로 변경을 검증할 수 있지만, 에이전트 시스템은 같은 입력에도 다른 경로와 도구를 선택하고 서로 다르면서도 유효한 답을 만들 수 있다. 한 결과가 더 좋아 보여도 다른 사례에서는 출처 표시가 사라지거나 중요한 제한 조건이 누락되고, 특정 데이터 출처에 지나치게 의존하는 문제가 생길 수 있다. 따라서 프롬프트·모델·도구를 갱신하는 일은 전체 시스템이 실제로 개선됐는지, 아니면 실패가 다른 위치로 이동했는지를 확인해야 하는 작업이다. 이 글은 이러한 불확실성을 줄이기 위해 평가를 부가적인 점검이 아니라 에이전트 제품 구조의 일부로 편입해야 한다는 문제의식에서 출발한다.

2. 시밀러웹 데이터 스튜디오의 평가 대상

시밀러웹은 웹사이트와 앱의 트래픽 규모, 유입 경로, 경쟁사 성과, 이용자 관심의 이동을 추정하며, 데이터 스튜디오는 그 데이터 위에서 작동하는 에이전트 계층이다. 사용자가 자연어로 질문하면 에이전트가 작업 순서를 계획하고 적절한 데이터 도구를 호출해 수치를 가져온 뒤 답을 작성한다. 요청은 특정 사이트의 유입 비중을 묻는 간단한 조회부터 경쟁사 비교와 여러 단계를 거치는 연구 보고서까지 다양하며, 에이전트는 고정된 절차가 아니라 요청별로 실행 방법을 결정한다. 이 때문에 퇴행은 최종 문장뿐 아니라 도구 선택, 데이터 검색, 근거 종합의 어느 단계에도 숨어 있을 수 있어, 어떤 사례와 품질 차원이 변했고 실행 추적에서 무엇이 일어났는지를 함께 보여주는 평가 체계가 필요했다.

3. 결정론적 검사와 언어 모델 심사자

시밀러웹은 에이전트 출력을 두 종류의 검사로 평가한다. 결정론적 검사는 필수 도구를 호출했는지, 사용하지 말아야 할 도구를 피했는지, 유효한 구조화 출력을 반환했는지처럼 기계적으로 통과와 실패를 판정할 수 있는 항목을 담당한다. 의미나 전반적인 품질처럼 규칙만으로 판단하기 어려운 항목은 언어 모델 심사자가 사용자 질문, 에이전트 출력, 비교 기준을 받아 점수와 그 이유를 반환한다. 비교 기준은 예상 답과 의미가 같은지를 보는 정답 예시일 수도 있고, 각 품질 수준을 구체적으로 정의한 평가표일 수도 있다. 두 검사 결과는 같은 평가 반복 과정에서 랭스미스의 피드백으로 나란히 기록되며, 심사자는 최종 권위가 아니라 검토 가능한 신호를 대규모로 생산하는 평가자 역할을 맡는다.

4. 일반 대화는 정답 예시로 평가

범위가 좁고 예상되는 답의 형태가 있는 일반 대화는 에이전트 시스템에서 비교적 평가하기 쉬운 사례다. 각 평가 사례에는 고정 질문, 정답 예시, 예상 도구 검사, 실제 에이전트 출력이 포함되며, 도구 호출은 결정론적으로 확인하고 답의 의미는 정답 예시에 기반한 언어 모델 심사자가 비교한다. 정확한 답도 여러 문장으로 표현될 수 있으므로 단순 문자열 일치 대신 의미가 같은지를 판단하며, 예시에서는 주요 유입 경로와 직접 유입 비율은 맞췄지만 추천 유입을 빠뜨린 답에 가깝지만 불완전하다는 설명과 함께 0.7점이 부여됐다. 랭스미스는 각 평가자의 키·점수·설명을 실험 열로 만들고 점수에서 해당 실행 추적으로 이동할 수 있게 하므로, 일반 대화에서는 정답 예시 기반 의미 평가와 도구 검사가 핵심 품질을 대부분 포괄한다.

5. 장문 연구에는 단일 정답이 맞지 않는다

장문 연구 출력은 출처, 해석, 권고, 제한 조건, 서사 구조를 포함하며 같은 질문에도 여러 종류의 우수한 보고서가 나올 수 있다. 한 보고서는 트래픽 획득에 집중하고 다른 보고서는 경쟁 구도나 수익화 위험에 초점을 둘 수 있지만, 주장에 근거가 있고 추론이 타당하다면 모두 유효할 수 있다. 이런 상황에서 하나의 정답 보고서를 기준으로 비교하면 실제 품질이 아니라 특정 참고문서와의 유사성을 보상하게 된다. 시밀러웹은 이를 피하기 위해 단일 종합 판정 대신 품질 차원별 평가표를 만들고, 각 기준에 명시적인 점수 구간을 부여해 보고서가 어느 수준을 충족했는지와 부족한 이유를 따로 반환하도록 했다.

6. 출처 통합·근거 충실성·기준 실행 비교

출처 통합 기준은 플랫폼의 원시 데이터 외에 외부 출처를 얼마나 다양하고 충실하게 활용했는지를 평가한다. 단일 데이터 인터페이스에만 의존하면 0점, 업계 보고서처럼 출처를 막연히 언급하면 0.3점, 이름·날짜·수치·맥락이 있는 여러 출처를 인용하면 0.8점, 풍부하게 귀속된 출처를 서사에 긴밀히 통합하면 1점이라는 식으로 수준을 구분한다. 각 기준은 점수뿐 아니라 부족한 부분과 점수의 근거를 함께 반환하므로, 낮은 수치가 나오면 외부 맥락이 장식적으로 사용됐는지처럼 구체적인 원인을 확인할 수 있다. 여기에 각 주장이 검색된 데이터에서 실제로 도출되는지를 점검하는 근거 충실성 검사를 더해, 자신감 있게 표현됐지만 자료가 뒷받침하지 않는 진술을 찾아낸다. 새 버전의 개선 여부는 저장되고 승인된 이전 실행을 절대적 정답이 아닌 기준점으로 삼아 두 보고서를 직접 비교하는 방식으로도 확인한다.

7. 랭스미스가 만든 추적 가능한 평가 흐름

평가 프롬프트를 작성하는 것만으로는 변경이 실제 개선인지 반복해서 판정하기 어렵기 때문에, 시밀러웹은 데이터 세트·피드백·실행 추적·기준 비교를 하나의 흐름으로 연결했다. 랭스미스의 평가 실행은 고정 데이터 세트에 대해 반복 횟수와 동시 실행 수를 지정해 검사를 수행하고, 평가자별 점수를 열로 저장하며 각 점수에 설명을 붙인다. 개발자는 평균점수의 상승과 하락만 보는 대신 어떤 사례가 움직였는지, 어떤 품질 기준이 변했는지, 평가자가 무엇이라고 설명했는지, 실제 실행 과정에서 에이전트가 어떤 행동을 했는지를 차례로 조사할 수 있다. 원문이 강조하는 차별점은 숫자 자체가 아니라 숫자와 평가자의 추론, 그 판단을 낳은 에이전트 행동이 서로 연결돼 있다는 점이며, 이를 통해 평가는 단순 순위표가 아니라 변경 원인을 찾는 엔지니어링 작업 흐름이 된다.

8. 잘못 보정된 평가표가 만든 일주일의 혼선

초기 장문 연구 평가에서는 작은 프롬프트 변경 뒤 종합점수가 떨어지자 이를 퇴행으로 간주해 되돌리고 수정한 뒤 다시 실행하는 과정이 반복됐으며, 사람이 읽은 보고서는 계속 양호했지만 팀은 수치를 더 신뢰했다. 기준별 설명을 열어본 뒤에야 새 보고서가 더 많은 출처를 사용해 출처 범위 점수는 올랐지만, 출처의 이름과 귀속이 모호해 다른 기준 점수는 낮아졌고 두 기준의 충돌이 종합점수에 가려졌다는 사실을 확인했다. 평가표를 고치기 전에는 이름 없는 외부 언급이 아홉 개 있다는 이유로 0.7점을 받은 보고서에조차 설명은 귀속이 빈약하다고 적혀 있어, 점수와 평가자의 실제 판단이 어긋나 있었다. 시밀러웹은 출처의 단순 개수보다 이름이 명확하고 검증 가능하며 특정 주장과 연결돼 있는지를 보상하도록 기준점을 다시 작성했고, 같은 보고서의 점수는 0.3점으로 조정돼 설명과 일치했다. 원문은 또한 완전성보다 간결성을 더 뚜렷하게 보상하면 전략적 연구를 요청한 경우에도 보고서가 짧아지는 잘못된 유인이 생긴다고 지적하며, 평가표를 신뢰하기 전에 기준 간 충돌과 제품 목적에 맞는 가중치를 반드시 보정해야 한다고 설명한다.

🧾 핵심 주장 / 시사점

  • 평가 방식은 답의 길이가 아니라 정답의 유일성과 품질 판단의 성격에 맞춰야 하며, 열린 연구 과제에서는 유사도보다 근거·출처·추론을 나누어 보는 편이 적합하다.
  • 종합점수는 서로 반대 방향으로 움직이는 기준을 숨길 수 있으므로, 점수 변화는 반드시 기준별 설명과 실제 실행 추적을 함께 읽어야 해석할 수 있다.
  • 평가표는 단순 측정 도구가 아니라 에이전트가 최적화할 행동을 정하는 장치이므로, 제품이 원하는 품질과 다른 유인을 주지 않는지 먼저 보정해야 한다.

✅ 액션 아이템

  • 시밀러웹처럼 단답형에는 정답 예시·도구 검사를, 장문 연구 보고서에는 다차원 평가표와 근거 충실성 검사를 구분해 적용한다.
  • 랭스미스에서 점수·평가 설명·실행 추적을 연결해 에이전트 변경이 평균값을 움직인 이유를 사례 단위로 검증한다.
  • 평가표 가중치가 출처 개수와 명확한 귀속처럼 충돌하지 않는지 점검하고 검증 가능성 중심으로 기준을 보정한다.

❓ 열린 질문

  • 장문 연구 보고서에 단답형의 정답 비교를 적용하면 품질보다 유사성을 보상하는 경계는 어디인가?
  • 언어 모델 심사자의 점수와 설명이 근거 충실성 검사·기준 실행 비교와 어긋날 때 어떤 기준이 우선인가?
  • 필수·금지 도구 호출의 결정론적 검사와 의미 평가자를 함께 쓸 때 에이전트 경로 다양성은 어떻게 판단할 것인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.