Scaling Agents in Healthcare & Life Sciences: Lessons from Madrigal Pharmaceuticals, Abridge, and Vizient
Quick Summary
의료·생명과학 에이전트의 확장에는 추적·평가·비용 통제와 공통 플랫폼이 필요하며, Madrigal Pharmaceuticals와 Abridge 사례는 재사용 가능한 기반과 임상적 신뢰의 중요성을 보여준다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
의료·생명과학 에이전트의 확장에는 추적·평가·비용 통제와 공통 플랫폼이 필요하며, Madrigal Pharmaceuticals와 Abridge 사례는 재사용 가능한 기반과 임상적 신뢰의 중요성을 보여준다.
📌 핵심 요약
- 글에서 접촉한 의료·생명과학 조직의 76%는 에이전트 자율성 확대의 전제로 추적·평가·지출 가시성을 꼽았으며, 건강보험·의료 제공 조직과 관련해서는 43%가 PHI 처리·비식별화·HIPAA 요건에 집중한다고 설명한다.
- 접촉 조직의 49%는 전사 에이전트 플랫폼을 주요 용도로 추진하고, 33%는 규제 문서·백오피스 업무를 대상으로 삼는다. 외부 사용자 대상 에이전트와 중앙 통제 아래 비개발자가 에이전트를 만드는 프로그램은 각각 26%로 제시된다.
- Madrigal Pharmaceuticals는 데이터 접근을 표준화하고 Deep Agents 기반 오케스트레이터와 모듈형 스킬을 결합해 신규 사용 사례 개발을 수주에서 수시간으로 줄였다. LangSmith로 실행을 추적하고 실제 운영 오류를 평가 데이터에 반영했으며, 회사 설명에 따르면 기업 내 활용까지 걸린 기간은 예상했던 수개월 대신 수주였다.
- Abridge는 환자 동의를 받아 임상의와 환자의 대화를 임상 문서로 전환하며, 250개가 넘는 의료 시스템 파트너, 50개가 넘는 전문 분야, 28개 언어에 걸쳐 연간 1억 건이 넘는 대화를 기록한다. 임상 안전성과 HIPAA·PHI 요건이 제품을 제약하고, 확장 과정에서 에이전트 평가가 주요 병목이 됐다.
- Vizient는 분산된 병원 데이터를 질의해 외래 진료 투자 성과와 비용 효율적인 진료 제공을 분석하는 GenAI 플랫폼으로 소개된다. 제공된 본문은 Abridge의 출시 소요 기간을 설명하던 문장 중간에서 끊겨, 이후 평가 개선 내용과 Vizient의 상세 사례는 확인할 수 없다.
🧩 주요 포인트
- 추적·평가·지출 가시성을 요구하는 비율이 76%라는 관찰 → 자율성 확대에는 답변 품질뿐 아니라 감사에 제시할 실행·검토·품질 측정 기록이 필요하다.
- Madrigal Pharmaceuticals의 데이터 표준화와 모듈형 스킬 → 공통 기반을 재사용하면 신규 사용 사례 개발을 단축하고, 운영 오류를 평가에 반영해 개선을 이어갈 수 있다.
- Abridge의 임상 안전성 제약과 평가 병목 → 사용 범위가 커질수록 신뢰를 검증할 평가 역량이 중요하지만, 본문 중단으로 구체적인 해결 방식과 성과는 판단할 수 없다.
🧠 상세 정리
1. 의료 에이전트 확장의 전제는 검증 가능한 신뢰
의료·생명과학 분야의 에이전트는 수시간의 수작업 검토를 수분으로 줄이고, 여러 시스템에 흩어진 데이터를 함께 질의하며, 임상의의 문서 작성 부담을 덜 잠재력이 있다. 그러나 잘못된 답변의 비용이 특히 높기 때문에, 신뢰는 제품 품질을 넘어 감사·규정 준수 의무이자 일부 상황에서는 환자 안전 요건이 된다. 글에서 접촉한 조직의 76%는 자율성을 확대하기 전에 추적·평가·지출 가시성을 확보해야 한다고 답했으며, 이는 업계 전체의 확정적 비율이 아니라 해당 접촉 조직들에 대한 관찰이다. 필요한 기반에는 에이전트가 무엇을 했고 누가 검토했으며 품질을 어떻게 측정했는지 지속적으로 남기는 기록이 포함된다. 건강보험·의료 제공 조직과 관련해서는 43%가 PHI 처리·비식별화·HIPAA 요건에 집중한다고 설명하며, 일부 팀은 사용자와 모델 전반의 지출을 통합적으로 파악하기 위해 LLM gateway를 도입하고 있다.
2. 분산된 실험을 전사 공통 플랫폼으로 통합
글에서 접촉한 조직의 49%는 전사 에이전트 플랫폼, 통제 계층 또는 에이전트 팩토리를 주요 사용 사례로 추진하며, 개별 사업 부문의 에이전트를 그 위에서 운영하려 한다. 여러 팀이 각자 에이전트를 만들면서 같은 기반 기능을 반복 구축하다가, 결국 하나의 팀이 공통 계층을 담당하게 되는 흐름이 제약사·보험자·의료 시스템에서 관찰된다. 이 계층은 재사용 가능한 템플릿 라이브러리, 내부 에이전트 카탈로그, 또는 시제품부터 운영 배포까지 이어지는 통제된 경로의 형태를 취할 수 있다. 사례로 상위 5대 제약사 중 한 곳은 수백 개 애플리케이션을 단일 상호운용 플랫폼으로 통합하고 있으며, 한 보험자는 운영 중인 에이전트 하나에서 공통 기반 위에 약 100개를 추가하는 범위 검토로 나아갔다. 많은 조직의 출발점이 명확한 운영 전환 경로가 없는 수백 개의 개념검증이라는 설명은, 에이전트 수의 증가와 실제 운영 역량의 확보가 별개의 과제임을 보여준다.
3. 성과가 명확한 문서 업무와 외부 대화형 서비스
접촉 조직의 33%는 기존 문서 기록과 건당 비용이 있는 업무에 에이전트를 적용하고 있어, 규제 문서와 백오피스가 가장 분명한 투자수익을 보여주는 영역으로 제시된다. 임상시험 보고서·규제 제출 자료, FDA 서신 추출, 의학·법률 검토, GxP 문서 생성, 프로토콜 OCR, 사전 승인, 보험금 청구 재처리와 급여 조정, 구매주문·송장 처리가 여기에 포함된다. 이 업무들은 도입 전후를 비교할 지표가 있고 일부는 이미 운영 중이며, 의료 문서 작성자나 처리팀이 수시간 쓰던 작업을 수분 단위로 측정하거나 제출 일정을 성과 지표로 삼을 수 있다. 별도로 26%는 가입자 안내, SMS·WhatsApp을 통한 환자 접수와 분류, 소비자 기기 도우미, 상담센터 문의 분산 등 외부 사용자 대상 에이전트를 운영하거나 구축하고 있다. 음성 상호작용에서는 감정, 이상사례 언급, PII 노출을 추적·평가하며, 정신건강 제공 기관은 배포 확대 전에 대화 이탈과 자살 사고 감지를 명시적으로 시험하고 있다.
4. 분산 개발과 연구·진료 지원의 서로 다른 제약
중앙 엔지니어링 조직이 병목이 되면 현업이 중앙 통제 범위 안에서 에이전트를 만들도록 하는 시도가 나타나며, 글은 이러한 조직의 비율을 26%로 제시한다. 현업 팀은 SharePoint, EHR 요약, Snowflake 같은 내부 자료를 기반으로 에이전트를 설정하고 검증하며, 중앙 팀은 가치가 입증된 결과를 운영 가능한 수준으로 발전시킨다. 임상의와 약사가 개발 단계에서 프롬프트와 평가 데이터셋을 직접 관리하고 평가를 실행하며, 엔지니어링이 통과한 버전을 승격하는 방식도 등장하고 있다. 과학 연구에서는 표적 발굴, 구조 기반 설계, 오믹스·단일세포 교란 분석, 문헌·지식 그래프 검색, 실험 장비 제어처럼 오래 실행되고 결정성이 낮은 작업이 많아 최종 답변뿐 아니라 전체 실행 경로의 평가가 중요하다. 진료 전 준비, 진료 안내 조율, 차트 준비, 의뢰 관리 등 임상의·케어팀 지원에서는 사람의 검토가 대체로 전제되며, 더 큰 장애물은 EHR 통합과 감사 의무로 설명된다.
5. Madrigal의 데이터 추상화와 모듈형 스킬
Madrigal Pharmaceuticals는 심각한 지방간 질환인 대사이상 관련 지방간염인 MASH에 집중하는 바이오제약사로, 구조화 시스템·비정형 문서·외부 자료·실시간 API에 흩어진 정보를 통합하고 검색·종합하려고 전사 에이전트 플랫폼을 만들었다. 첫 제약은 데이터 출처마다 형식과 접근 방식, 기대 동작이 달랐다는 점이며, 회사는 이를 동일한 보안 데이터 웨어하우스로 정규화하고 일관된 도구 인터페이스로 노출했다. 에이전트가 모든 정보를 같은 추상화 계층을 통해 다루게 되면서, 새 영역을 추가할 때마다 오케스트레이션 로직을 다시 작성할 필요가 줄었다. LangChain의 Deep Agents 실행 기반으로 만든 오케스트레이터는 작업에 필요한 역량과 실행할 에이전트, 병렬 수행할 부분을 결정한 뒤 결과를 조정하며, 모든 분야의 세부 내용을 직접 내장하기보다 전문 역량에 문제를 배분한다. 새로운 사용 사례는 문제 접근 방식과 좋은 출력의 기준을 정의하는 모듈형 스킬로 추가되며, 원문은 이 방식으로 개발 기간이 수주에서 수시간으로 줄었다고 설명한다.
6. 병렬 연구를 조율하고 실제 오류를 평가로 연결
Madrigal은 복잡한 연구 질문을 여러 하위 에이전트에 나누고, 각 하위 에이전트가 다시 자신의 작업을 병렬화하도록 구성해 연구 처리의 효율을 높였다. Deep Agents에 내장된 공유 가상 파일시스템은 결과·출처·중간 단계를 기록하고 재사용하게 하는 메모리 역할을 맡아, 규모가 커질수록 필요한 협업과 조정을 지원한다. LangSmith는 모든 도구 호출, 검색된 문서 조각, 에이전트 결정을 포함하는 전체 파이프라인 가시성을 제공하며, Madrigal의 AI·데이터 과학 총괄 Parth Patel은 도입 전후의 차이를 기초 심리학에서 신경영상으로 이동한 것에 비유했다. 팀은 전체 실행에 대한 추적 단위 평가로 시작하고, 실제 최종 사용자 피드백을 모사하도록 설계한 LLM-as-judge 채점기로 정확히 같은 경로를 따랐는지보다 결과를 평가했다. 특히 운영에서 발생한 의미 있는 오류를 LangSmith 데이터셋의 새 시험 사례로 추가함으로써, 합성 사례에만 의존하지 않고 실제 실패를 통해 평가 범위를 확장하는 개선 순환을 만들었다.
7. 관리형 배포로 기업 내 활용까지 연결
Madrigal의 작은 팀에는 에이전트 로직뿐 아니라 배포에 필요한 모든 인프라를 직접 구축하기 어렵다는 제약이 있었고, 원문은 이를 플랫폼 확장의 또 다른 과제로 다룬다. 팀은 LangSmith Deployment를 사용해 그래프를 관리형 서비스로 배포하면서 상태 영속성, 동시 세션, 사용자 인터페이스로의 실시간 스트리밍을 제공받고, 스킬 업데이트를 자동으로 배포하는 CI/CD 파이프라인을 사용했다. CIO Ron Filippo에 따르면 시제품에서 기업 내 활용으로 넘어가는 데 걸린 시간은 팀이 예상한 수개월이 아니라 수주였으며, 이는 해당 회사가 제시한 경험이다. 사례의 핵심은 데이터 계층 추상화로 새 영역마다 조정 로직을 재구축하지 않고, 모듈형 스킬로 새로운 요구를 같은 플랫폼 안에 수용했다는 데 있다. 여기에 운영 추적과 평가 데이터의 연결, 관리형 배포가 결합되어 개발 속도뿐 아니라 실제 사용 중 개선을 이어갈 기반도 마련됐다고 설명한다.
8. Abridge의 임상적 신뢰와 제공된 본문의 한계
Abridge는 환자 동의를 받아 임상의가 진료 대화를 녹음하면 EHR에 제출할 수 있는 임상 문서로 전환하며, 미국에서 해마다 20억 건이 넘는 임상의·환자 대화가 발생하는 가운데 퇴근 후 문서 작성에 쓰이는 시간을 돌려주는 것을 목표로 한다. 회사는 250개가 넘는 의료 시스템 파트너와 협력하고, 50개가 넘는 전문 분야와 28개 언어에 걸쳐 연간 1억 건이 넘는 대화를 기록한다고 소개된다. 진단을 잘못 귀속하거나 존재하지 않는 약물을 생성하거나 용량을 틀리면 환자 안전에 영향을 줄 수 있어 출시 기준이 매우 높고, HIPAA와 PHI 처리 및 기업 고객의 신뢰 요구가 처음부터 아키텍처를 형성한다. 전문 분야와 진료 환경이 늘면서 에이전트 평가가 주요 병목이 됐다는 설명 뒤에 본문이 출시 소요 기간을 서술하던 중 끊기므로, 그 기간이나 이후 해결책은 확인할 수 없다. Vizient 역시 도입부에서 분산된 병원 데이터로 외래 진료 투자 성과와 더 비용 효율적인 진료 제공 장소를 질의하는 GenAI 플랫폼으로만 소개되어, 제공된 자료만으로 상세 구현이나 운영 성과를 덧붙일 수 없다.
🧾 핵심 주장 / 시사점
- 의료·생명과학에서 관측 가능성은 개발 편의 기능을 넘어, 실행과 검토 및 품질 측정의 근거를 남겨 자율성 확대를 뒷받침하는 기반으로 작동한다.
- Madrigal 사례는 공통 데이터 인터페이스와 모듈형 스킬을 통해 사용 사례 추가 비용을 줄이고, 운영 실패를 평가 사례로 전환해 재사용 기반을 계속 개선하는 방식을 보여준다.
- 규제 문서 업무의 명확한 전후 지표, 과학 연구의 전체 경로 평가, Abridge의 임상 안전성 제약은 업무별 성공 기준과 평가 방식이 달라야 함을 시사한다.
✅ 액션 아이템
- 에이전트 자율성 확대에 앞서 추적·평가·지출 가시성과 실행·검토·품질 측정 기록의 확보 수준을 점검한다.
- Madrigal Pharmaceuticals의 데이터 표준화·모듈형 스킬·운영 오류의 평가 반영 방식을 신규 사용 사례 개발에 적용할 가능성을 검토한다.
- Abridge의 평가 병목 해결 방식과 Vizient의 상세 성과에 대한 판단은 본문 중단으로 확인되지 않는 내용을 확보한 뒤 진행한다.
❓ 열린 질문
- 추적·평가·지출 가시성과 실행·검토·품질 측정 기록은 어느 수준에 도달해야 에이전트 자율성 확대를 뒷받침할 수 있는가?
- Madrigal Pharmaceuticals의 데이터 표준화와 모듈형 스킬은 신규 사용 사례 개발을 수주에서 수시간으로 단축하는 데 각각 어떻게 기여했는가?
- Abridge는 임상 안전성과 HIPAA·PHI 요건을 충족하면서 에이전트 평가 병목을 어떻게 해소했는가?