The Reliability Layer for Healthcare AI: Common LangSmith Use Cases
Quick Summary
Abridge와 Included Health는 LangSmith로 임상 전문가의 판단을 재사용 가능한 평가 자산으로 전환해 의료 AI의 출시 속도와 신뢰성을 높이고 있다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Abridge와 Included Health는 LangSmith로 임상 전문가의 판단을 재사용 가능한 평가 자산으로 전환해 의료 AI의 출시 속도와 신뢰성을 높이고 있다.
📌 핵심 요약
- 의료 AI 평가는 임상 전문가의 시간이 병목이 되므로, 두 조직은 임상 검토를 일회성 비용이 아닌 라벨 데이터셋·보정된 평가기·자동화된 출시 관문을 만드는 기반으로 활용한다.
- Abridge는 임상 기록의 정확성·규정 준수·문체·완전성 등 실패 유형별 평가기를 구축하고, 원천 대화에 직접 대조하는 참조 없는 평가와 선별된 예시에 대조하는 참조 기반 평가를 결합한다.
- Abridge는 오프라인 평가, 과거 진료 대화에 대한 검증, 제한적 A/B 테스트, 전체 출시, 운영 모니터링을 거치며, LangSmith를 활용한 평가가 출시 주기를 1~2개월에서 며칠로 단축하는 데 기여했다.
- Included Health는 Dot의 진료 경로 안내와 안전성을 임상 검토로 평가한다. 출시 후 채팅 참여도는 75% 증가했으며, 평가된 대화에서 임상의와 진료 권고가 일치하는 비율은 목표인 95%를 웃돌고, 임상 감사에서 고위험 상황의 99% 이상을 식별했다고 보고했다.
- 재사용 평가 자산에도 지속적인 검토와 재보정이 필요하며, 보호대상 건강정보(PHI) 처리는 평가 설계의 일부다. Abridge는 자체 호스팅·접근 통제·감사 가능성을 요구하고, 학습에 쓰기 전에 대화 데이터에서 식별 정보를 제거한다.
🧩 주요 포인트
- 임상 판단의 자산화 → 단일 정답으로 포괄하기 어려운 유효한 변형, 행동하지 않아야 할 상황, 검토자의 전문성을 평가 기준에 반영해야 재사용의 신뢰성을 확보할 수 있다.
- 실패 유형별 평가와 단계적 출시의 결합 → 기존 임상 근거를 반복 활용하면서도 제한적 A/B 테스트의 실제 임상의 반응으로 출시 확대 여부를 판단한다.
- Dot의 참여도·진료 경로 안내·안전성 지표와 PHI 제약 → 이용 증가만으로 신뢰성을 판단하지 않고, 임상 성과와 평가 데이터의 취급 조건을 함께 살펴야 한다.
🧠 상세 정리
1. 임상 전문가의 시간을 재사용 가능한 평가 기반으로 전환
의료 AI가 제대로 작동하는지는 그 시스템이 시간을 절약해 주려는 당사자인 임상 전문가가 가장 잘 판단하지만, 수천 건의 진료를 계속 직접 검토하는 방식은 확장에 한계가 있다. Included Health의 Dot은 LangGraph와 Deep Agents를 기반으로 모호한 회원 요구를 해석하고, 보장 범위와 청구 질문에 답하며, 적절한 진료로 연결하고 응급 상황을 감지한다. Abridge는 환자 동의하에 녹음한 진료 대화를 장기 건강기록과 청구를 뒷받침하는 임상 기록으로 바꾸므로, 환자의 관찰을 의사의 결론으로 잘못 귀속하거나 처방되지 않은 약물과 용량을 추가하면 문제가 된다. 두 제품의 실패 양상은 다르지만, 정확성 판단에 필요한 사람이 엔지니어링 조직 밖에 있고 그 사람의 시간이 희소하다는 제약은 같다. 원문은 LangSmith로 전문가의 판단을 라벨 데이터셋, 보정된 평가기, 자동화된 출시 관문에 담아 그 가치를 다음 검증과 출시에도 이어가는 접근을 설명한다.
2. 자동화 전에 정의해야 할 임상 판단의 조건
임상 검토를 자동화하려면 먼저 전문가가 무엇을 판단하는지 명확히 해야 하며, 원문은 이를 어렵게 만드는 세 가지 특성을 제시한다. 첫째, 임상 기록에는 유일한 정답 형식이 없고 전문과, 진료 상황, 임상의에 따라 필요한 내용이 달라지므로, 단일 참조 기록만 정답으로 삼으면 타당한 변형을 벌점 처리하면서 중요한 오류는 놓칠 수 있다. 둘째, 올바르게 행동하는 것뿐 아니라 행동하지 않아야 할 때를 인식하는지도 중요해, Included Health는 응급 안전장치가 필요한 상황에서 작동하고 무해한 상황에서는 작동하지 않는지 확인한다. Abridge 역시 에이전트가 정해진 경계를 지키고 임상의가 기대하는 도구를 선택하는지 평가한다. 셋째, Abridge는 평가에 전문의 자격을 갖춘 의사나 특정 분야 전문가가 필요한지 미리 정하는데, 평가기의 품질이 이를 보정한 판단의 품질에 달려 있기 때문이다.
3. 실패 유형별 평가기와 두 가지 참조 방식
Abridge는 임상의와 사용자 피드백에서 이미 알려진 실패 유형을 수집하고, 발생 빈도와 심각도에 따라 우선순위를 정한 뒤 정확성, 규정 준수, 문체, 완전성 등의 범주로 묶는다. 각 범주에는 별도 평가기를 두어 하나의 포괄적 품질 점수보다 기록이 구체적으로 어떻게 실패하는지를 검사한다. 과거에는 임상의가 작성한 주석 지침과 라벨에 점수가 맞도록 사람이 평가기 프롬프트를 조정했지만, 이제는 같은 지침과 예시를 자동 프롬프트 최적화 프레임워크에 넣어 평가기를 생성한다. 참조 없는 평가기는 생성 기록을 원천 대화에 직접 대조하므로 별도 모범 기록 없이 다양한 진료에 적용할 수 있고 개발과 운영 중 모두 활용할 수 있다. 참조 기반 평가기는 선별된 예시와 출력을 비교하며 특정 전문과에 맞출 수 있어, 두 접근을 결합하면 넓은 적용 범위와 전문 분야의 세밀한 맥락을 함께 다룰 수 있다.
4. 평가기와 임상의 판단의 일치 여부 검증
자동 최적화로 만든 평가기라도 임상의가 부여한 주석과 비교해 검증해야 하며, 생성 과정 자체가 임상적 타당성을 보장하는 것은 아니다. LangSmith의 Align Evaluator는 평가기 판단과 임상의 주석을 비교하고 불일치 사례를 살펴볼 수 있는 인터페이스를 제공한다. Abridge는 별도로 주석 작성자에게 출력이 올바른 경우에도 판단 이유를 설명하도록 요청해, 일관되지 않은 판단을 해소하고 라벨이 충분한 검토를 반영했는지 확인한다. 이런 절차를 통해 개별 전문가의 판단은 검사와 재보정이 가능하고 다음 평가에도 재사용할 수 있는 자산이 된다. 원문이 강조하는 시간 절약은 전문가 판단을 없애는 데서 생기는 것이 아니라 판단 이후의 작업을 자동화하는 데서 생기며, 새로운 운영 사례와 피드백은 평가 기준을 계속 갱신하는 근거가 된다.
5. 운영 중 임상 검토가 만드는 피드백 순환
보정된 평가기가 이미 확보한 판단을 적용한다면, 운영 중 검토는 실제 대화에서 드러나는 행동을 관찰하고 다음 개선에 필요한 새로운 근거를 공급한다. Included Health에서는 대화를 LangSmith 주석 대기열에 넣고, 임상 검토자가 Dot이 회원을 적절한 진료 환경으로 안내했는지, 응급 안전장치가 적절히 작동했는지, 후속 조치가 필요한지를 평가한다. 이 결정은 구조화된 라벨로 바뀌어 회사의 데이터 웨어하우스로 내보내지며, 데이터 과학팀은 이를 운영 대시보드 구축에 활용한다. 같은 검토 결과는 Dot의 회원 안내 방식을 규정하는 스킬 정의에도 반영되므로, 한 번의 검토가 해당 사례의 판단을 넘어 여러 용도로 재사용된다. 임상 판단이 데이터가 되고 데이터가 제품 변경을 이끌며 그 변경을 다음 출시 전에 같은 기준으로 검증하는 흐름이 형성된다는 것이 원문의 핵심이다.
6. 축적된 평가 근거를 출시 관문으로 활용
Abridge의 모델 변경은 오프라인 평가, 과거 진료 대화에 대한 검증, 제한적 A/B 테스트, 전체 출시, 지속적인 운영 모니터링을 거치며 단계마다 서로 다른 근거를 더한다. 일부 파트너는 고객의 첫 10~15%에 포함되는 조용한 배포에 참여하는 데 동의하고, Abridge는 이 과정에서 임상의의 기록 수정, 평점, 정성적 피드백처럼 자동 평가기만으로 얻기 어려운 신호를 관찰한다. 오프라인 평가는 제한적 노출을 시작할 준비가 됐는지 판단하고 실제 운영 행동은 배포 확대 여부를 결정하며, 원문은 이 과정이 출시 주기를 1~2개월에서 며칠로 줄였다고 설명한다. Included Health에서도 Dot의 슈퍼그래프를 Deep Agents로 이전하는 변경이 네 제품팀에 영향을 주었지만, 기존 다중 턴 시뮬레이션 평가로 성능 유지를 확인했다. 그 결과 중대한 성능 저하 없이 2주 미만에 이전을 마쳤으며, 두 사례는 변경마다 신뢰를 처음부터 확인하기보다 기존 근거 위에 새로운 근거를 축적하는 방식을 보여준다.
7. 참여도와 임상 성과를 함께 보는 운영 신뢰성
빠른 출시가 의미 있으려면 실제 사용자에게 제공된 시스템이 안정적으로 작동해야 하므로, Included Health는 제품 이용, 진료 경로 안내 품질, 안전성이라는 세 차원을 함께 측정한다. 이는 각각 회원이 제품을 사용하는지, 적절한 진료로 연결되는지, 긴급한 주의가 필요한 상황을 알아보는지라는 서로 다른 질문에 답한다. 회사는 Dot 출시 후 채팅 참여도가 75% 증가했으며, 평가된 대화에서 Dot의 진료 권고에 대한 임상의 동의율은 목표인 95%를 계속 웃돈다고 보고한다. 또한 임상 감사에서는 고위험 상황의 99% 이상을 식별한 것으로 나타났으므로, 이 수치는 평가된 대화와 감사라는 각각의 측정 맥락을 유지해 이해해야 한다. Abridge와 Included Health 모두 임상 라벨을 미래의 판단에도 활용하지만, 원문은 이러한 자산에도 검토와 재보정이 계속 필요하다는 점을 함께 명시한다.
8. PHI 취급 조건을 평가 설계에 포함
임상 판단을 재사용하게 해 주는 진료 추적 기록, 대화 이력, 임상의 주석에는 보호대상 건강정보인 PHI가 포함될 수 있으므로, 이를 저장하고 반복 활용하는 순간 보안과 배포 구조도 평가 설계의 일부가 된다. Abridge는 평가 기반의 요구사항으로 자체 호스팅, 접근 통제, 감사 가능성을 두고 있으며, 대화 데이터를 학습에 사용하기 전에 식별 정보를 제거한다. 원문은 이런 통제가 평가 파이프라인을 만든 뒤 덧붙이는 요소가 아니라, 어떤 데이터를 처음부터 파이프라인에 넣을 수 있는지를 결정하는 조건이라고 설명한다. 따라서 임상 판단의 재사용 범위는 평가기의 성능뿐 아니라 그 판단을 뒷받침하는 데이터의 취급 조건과 함께 정해진다. 제공된 본문은 LangSmith의 관리형 클라우드와 고객 자체 클라우드 활용 방식을 언급하다 중간에 끊기므로, 나머지 배포 선택지나 PHI 처리에 관한 추가 설명은 확인할 수 없다.
🧾 핵심 주장 / 시사점
- 임상 전문성의 확장 효과는 전문가를 검토에서 제거하는 데서가 아니라, 한 번 내린 판단을 여러 평가와 출시에 반복 적용하는 데서 나온다.
- 자동 평가와 실제 임상의 반응은 서로 다른 근거를 제공하므로, 평가 점수만으로 출시를 결정하기보다 단계별로 근거를 누적하는 방식이 중요하다.
- 평가 자산의 재사용은 데이터 보관과 활용을 수반하므로, PHI 취급 조건은 신뢰성 확보 과정의 설계 요건이 된다.
✅ 액션 아이템
- 임상 판단의 자산화에 앞서 유효한 변형, 행동하지 않아야 할 상황, 검토자의 전문성을 평가 기준에 반영할 범위 검토.
- Abridge의 실패 유형별 평가와 제한적 A/B 테스트를 연결해 출시 확대 여부를 판단하는 방식의 적용 가능성 검토.
- Dot의 참여도·진료 경로 안내·안전성 지표를 함께 해석하고, 평가 데이터 재사용에 필요한 PHI 취급 조건 확인.
❓ 열린 질문
- 임상 판단의 자산화에서 유효한 변형과 임상적으로 중요한 오류를 구분하는 평가 기준은 어떻게 정할 수 있을까?
- Abridge의 실패 유형별 평가 결과와 제한적 A/B 테스트의 임상의 반응이 다를 때 출시 확대 여부를 어떻게 판단할까?
- Dot의 채팅 참여도 75% 증가, 임상의 동의율 95% 초과, 고위험 상황 99% 이상 식별이라는 성과는 지속적인 검토와 재보정 과정에서 유지될까?