Articlelangchain.com·2026년 8월 25일·0

LangSmith Engine Improves Agent Issue Detection by 2x

Quick Summary

LangSmith Engine은 내부 벤치마크에서 이슈 탐지 성능을 2배 이상, 공개 벤치마크에서 수정 성능을 25% 개선하고 업무 도구 연동·자체 호스팅·비용 조절 기능을 확대했다.

LangSmith Engine Improves Agent Issue Detection by 2x 관련 대표 이미지

🖼️ 인포그래픽

LangSmith Engine Improves Agent Issue Detection by 2x 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

LangSmith Engine Improves Agent Issue Detection by 2x의 핵심 내용을 4단계로 요약한 인포그래픽
LangSmith Engine Improves Agent Issue Detection by 2x 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

LangSmith Engine은 내부 벤치마크에서 이슈 탐지 성능을 2배 이상, 공개 벤치마크에서 수정 성능을 25% 개선하고 업무 도구 연동·자체 호스팅·비용 조절 기능을 확대했다.

📌 핵심 요약

  • LangSmith Engine은 운영 트레이스를 분석해 관련 이슈를 묶고, 근거와 원인 진단·수정 제안·검토용 PR·검증용 데이터 예제·회귀 모니터링을 제공한다.
  • 5월 출시 이후 6천만 건 이상의 트레이스에서 2만 건 이상의 이슈를 발견했으며, 이슈 식별·그룹화를 평가하는 내부 IssueBench 성능은 2배 이상, Terminal-Bench 같은 공개 벤치마크의 수정 성능은 25% 개선됐다.
  • Slack 이슈 알림과 Linear 이슈 자동 생성을 지원하며, 오래된 이슈 자동 종료와 트레이스 내 발생 위치 연결로 조사와 대응을 돕는다.
  • 자체 호스팅에서는 고객 VPC 안에서 오케스트레이션을 실행하고 데이터 무보관 관리형 서비스인 LangSmith Intelligence에 추론을 요청한다. Reduced Analysis는 분석할 트레이스 수를 줄여 비용을 낮추는 기능이다.
  • Engine은 LangSmith Plus와 Enterprise 요금제의 SaaS 및 자체 호스팅 배포에서 제공된다. 향후에는 제안한 수정의 자동 검증과 평가 데이터셋 자동 생성을 지원할 예정이다.

🧩 주요 포인트

  1. 이슈 탐지와 수정 성능의 개선 → IssueBench와 공개 벤치마크가 서로 다른 단계를 평가하므로, 탐지 성과와 수정 효과를 구분해 해석할 필요가 있다.
  2. Slack·Linear 연동과 이슈 자동 정리 → 발견한 문제를 기존 업무 흐름에 연결하고, 현재 발생하는 이슈에 대응 역량을 집중하도록 돕는다.
  3. 검증용 데이터 예제 제공에서 자동 검증으로 확장 예정 → 현재의 수정 제안과 오프라인 검증 지원에 더해, 배포 판단에 필요한 검증 결과까지 제공하려는 방향이다.

🧠 상세 정리

1. 대규모 운영 트레이스에서 진단과 수정으로 연결

운영 에이전트는 수백만 건의 트레이스를 생성할 수 있어, 사람이 각각의 오류를 찾고 원인을 분석한 뒤 수정안을 작성하는 방식은 규모가 커질수록 감당하기 어렵다. LangSmith Engine은 이 과정을 자동화하기 위해 플랫폼 안에서 동작하는 딥 에이전트로 설계됐다. 관련 문제가 발생한 실행들을 하나의 이슈로 묶고, 문제가 드러난 실행 기록과 재발을 포함한 발생 시간표, 근본 원인을 제시한다. 이어 프롬프트 또는 코드 변경과 검토용 PR을 제공하며, 실패한 실행을 데이터셋 예제로 구성해 배포 전 오프라인 검증을 돕는다. 수정 이후에도 이슈별 모니터링을 이어가며 같은 문제가 다시 발생하는지 확인한다.

2. 탐지와 수정 성능을 구분한 개선 성과

원문에 따르면 Engine은 5월 출시 이후 고객 에이전트의 트레이스 6천만 건 이상을 분석하고 2만 건 이상의 이슈를 발견했으며, 수만 시간의 엔지니어링 작업을 절감했다. 개발팀은 Engine의 작업 단계별 성능을 여러 내부 벤치마크로 측정한다. 그중 IssueBench는 트레이스에서 이슈를 식별하고 관련 발생 사례를 묶는 능력을 평가하며, 출시 이후 점수가 2배 이상 높아졌다. 제안한 수정의 성능은 Terminal-Bench 같은 공개 벤치마크에서 25% 개선됐다고 설명한다. 원문은 이러한 개선을 더 중요한 문제의 발견, 더 많은 실행에서의 이슈 탐지, 더 효과적인 수정 제안으로 연결하지만, 개별 고객 환경의 성과 수치는 제시하지 않는다.

3. 기존 업무 도구와 조사 흐름의 연결

이번 업데이트는 Engine이 찾은 문제를 팀이 이미 사용하는 업무 도구로 전달하고, 조사와 우선순위 판단을 쉽게 만드는 기능을 포함한다. Slack 연동은 새로 탐지한 이슈를 엔지니어에게 알려 빠른 조사를 돕고, Linear 연동은 이슈를 자동 생성해 다른 개발 작업과 함께 대응을 추적하도록 한다. Engine은 트레이스에서 더 이상 나타나지 않는 오래된 이슈를 자동으로 종료해 현재 발생하는 중요한 문제에 집중하도록 돕는다. 또한 LangSmith 트레이스에서 해당 문제가 발생한 구체적인 위치를 연결하므로 사용자는 수정에 착수하기 전에 탐지 근거를 확인할 수 있다. 이러한 기능은 이슈의 발견부터 조사, 작업 등록과 정리까지 이어지는 흐름을 지원한다.

4. 자체 호스팅 지원과 분석 비용 조절

Engine은 자체 호스팅 LangSmith 고객에게도 제공되며, 원문은 이를 기업의 보안 및 규정 준수 요구에 대응하는 배포 선택지로 소개한다. 이 구성에서 Engine의 오케스트레이션은 고객 VPC 내부에서 실행된다. 추론은 목적에 맞게 훈련된 모델을 사용하는 관리형 서비스 LangSmith Intelligence에 요청하며, 이 서비스는 데이터를 보관하지 않는다고 설명한다. 따라서 자체 호스팅의 작동 방식을 이해할 때는 고객 VPC에서 실행되는 오케스트레이션과 관리형 추론 요청을 함께 살펴봐야 한다. 별도로 Reduced Analysis 모드는 Engine이 스캔하는 트레이스 수를 줄여 비용에 민감한 사용자가 분석 비용을 조절하도록 하지만, 구체적인 절감률은 제시되지 않는다.

5. 운영 고객 사례에서 드러난 조사 시간 단축

원문은 고객들이 Engine을 운영 에이전트 모니터링, 반복되는 실패의 발견, 탐지 이후의 조사와 분류에 사용하고 있다고 설명한다. 사례로 등장한 Campfire의 AI 엔지니어 Nancy Jin은 관측과 이슈 분류를 한곳에서 수행할 수 있다는 점을 강조했다. 그는 근본 원인 진단과 초안 형태의 수정 제안 품질을 높게 평가하며, 문제 탐지와 초기 조사에 걸리는 시간이 크게 줄었다고 말했다. 또한 트레이스를 뒤지는 시간이 감소하고 잘못된 동작에서 수정 배포까지 이어지는 과정이 짧아졌다고 설명했다. 이 사례는 실제 사용 경험에 대한 정성적 증언이며, 벤치마크 개선 수치와 별도로 구체적인 시간 절감률이나 비교 조건은 제공하지 않는다.

6. 다음 단계인 자동 검증과 현재 이용 조건

Engine은 대규모 환경에서 수동으로 수행하기 어려운 이슈 발견과 진단을 먼저 해결했으며, 다음 개발 초점으로 검증을 제시한다. 예정된 자동 검증 기능은 제안한 수정을 사용자의 데이터셋에 실행하고 해당 이슈와 함께 결과를 보여줘, 배포 전에 변경의 효과를 판단하도록 돕는다. 평가 데이터셋 자동 생성 기능도 예정돼 있으며, 에이전트의 트레이스와 프롬프트를 활용하고 기존 트레이스가 없는 에이전트의 데이터셋 생성도 지원할 계획이다. 이 기능들은 현재 제공되는 검증용 데이터 예제와 구분되는 향후 계획이다. 현재 Engine은 LangSmith Plus와 Enterprise 요금제에서 SaaS 및 자체 호스팅 방식으로 이용할 수 있다. Plus 사용자는 LangSmith에서 활성화할 수 있고, Enterprise 사용자는 담당 계정 팀을 통해 시작하도록 안내한다.

🧾 핵심 주장 / 시사점

  • 성능 개선은 탐지와 수정이라는 서로 다른 작업에서 측정됐으므로, 2배 이상과 25%를 하나의 통합 성능 지표로 해석해서는 안 된다.
  • 자체 호스팅 구성에서도 추론은 LangSmith Intelligence에 요청하므로, 배포 구조는 오케스트레이션의 실행 위치와 추론 서비스의 역할을 함께 봐야 한다.
  • 자동 검증과 데이터셋 생성은 향후 계획이며, 현재 제공되는 수정 제안과 검증용 예제를 통한 지원 범위와 구분해야 한다.

✅ 액션 아이템

  • IssueBench의 2배 이상 개선과 공개 벤치마크의 25% 개선을 각각 이슈 탐지와 수정 성능으로 구분해 검토.
  • Slack·Linear 연동과 이슈 자동 정리가 현재의 문제 조사 및 대응 흐름에 적용될 지점 검토.
  • 자체 호스팅의 고객 VPC·LangSmith Intelligence 구성과 Reduced Analysis의 분석 트레이스 수 축소 방식을 도입 판단에 반영.

❓ 열린 질문

  • IssueBench의 2배 이상 개선과 공개 벤치마크의 25% 개선은 실제 운영 에이전트에서 각각 어느 정도의 효과로 이어지는가?
  • Reduced Analysis로 분석할 트레이스 수를 줄이면 비용과 이슈 탐지 결과는 각각 어떻게 달라지는가?
  • 향후 자동 검증과 평가 데이터셋 자동 생성은 언제 제공되며, 현재의 오프라인 검증 지원 범위를 어떻게 확장하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.