Building an Agent Harness for Life Sciences: Introducing Deep Life Sci
Quick Summary
LangChain은 제약 R&D 비용 증가를 완화할 가능성을 제시하며, 과학 데이터 접근·분석과 기업별 맞춤화, LangSmith 기반 추적·평가를 지원하는 오픈 소스 에이전트 어시스턴트 Deep Life Sci를 공개했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
LangChain은 제약 R&D 비용 증가를 완화할 가능성을 제시하며, 과학 데이터 접근·분석과 기업별 맞춤화, LangSmith 기반 추적·평가를 지원하는 오픈 소스 에이전트 어시스턴트 Deep Life Sci를 공개했다.
📌 핵심 요약
- 원문은 신약 하나의 개발 비용이 9년마다 두 배가 되는 Eroom’s law를 제시하며, 전임상 단계의 방대한 논문·생물학 데이터 분석과 임상 단계의 FDA 규제 대응 문서 작업을 비용 증가의 배경으로 설명한다.
- 저자들은 Claude와 ChatGPT 같은 범용 AI의 생명과학 도메인 지식·데이터 연동 부족, 전문 제품의 높은 가격, 독점 에이전트 하네스의 맞춤화 제약을 지적한다. GxP 검증에는 시스템의 행동을 설명할 문서와 감사 로그가 필요하다고 강조한다.
- Deep Life Sci는 Deep Agents 하네스 기반의 오픈 소스 도구로, ClinicalTrials.gov의 60만 건 이상 등록 연구, PubMed의 논문 초록 2,900만 건, PubMed Central의 전문 논문 1,200만 건에 접근한다. 하위 에이전트에 문서 검토를 분담하고 LangSmith 샌드박스에서 코드를 실행해 데이터를 분석한다.
- 활용 사례로 RNA-seq·단백질체 분석 결과와 문헌 근거를 연결한 유전자 우선순위 도출, 임상시험 결과의 공통 형식 추출과 비교, 임상 문서 검토·수정 지원을 제시한다. 문서 작업 시간 단축은 기대 효과이며 정량적인 실증 결과는 제시하지 않는다.
- 기업은 내부 데이터·문서 연결, 모델 선택, 가드레일·승인 단계 추가로 Deep Life Sci를 맞춤화할 수 있다. LangSmith의 실행 추적과 수정 가능한 기본 평가 세트는 구축·테스트·배포·모니터링을 반복하는 ADLC와 변경 전후 성능 비교를 지원한다.
🧩 주요 포인트
- 독점 하네스의 맞춤화 제약과 GxP 설명 요구 → 생명과학 조직에서는 시스템 통제권과 감사 가능성이 도입의 핵심 쟁점이 된다.
- 과학 데이터 접근·하위 에이전트 분담·샌드박스 분석의 결합 → 문헌 탐색부터 실험 결과 해석과 임상 문서 지원까지 연결하는 활용 방식이 제시된다.
- 기업 내부 맥락 통합과 LangSmith 기반 ADLC → 업무 적합성을 높이고 변경의 개선·퇴행 여부를 확인할 수 있지만, 제약 R&D 비용 절감은 아직 원문이 제시하는 가능성이다.
🧠 상세 정리
1. 제약 R&D 비용 증가와 기존 AI의 한계
원문은 지난 70년간 컴퓨팅 성능의 가격이 지수적으로 하락한 흐름과 달리, 신약 하나의 개발 비용은 9년마다 두 배가 된다는 Eroom’s law에서 출발한다. 전임상 연구에서는 유망한 표적을 찾기 위해 수백만 편의 논문과 방대한 생물학 데이터를 검토해야 하며, 임상시험에서는 늘어나는 FDA 규정에 대응하기 위해 수만 페이지의 문서 작업이 필요하다. 저자들은 Claude와 ChatGPT 같은 범용 도구에 필요한 도메인 지식과 과학 데이터 연동이 부족하고, 전문 바이오테크 AI 제품은 높은 가격을 부과하는 경우가 많다고 주장한다. 또한 양쪽의 독점 에이전트 하네스가 맞춤화를 막고 비싼 폐쇄형 모델에 사용자를 묶어 둔다고 지적한다. 특히 GxP 검증에 시스템 행동을 설명할 문서와 감사 로그가 필요하다는 점을 들어, 임상 의사결정을 지원하는 시스템에 대한 조직의 통제권을 강조한다.
2. Deep Life Sci의 구성과 과학 데이터 접근
LangChain은 조직이 자체 지능을 소유하는 것이 경쟁 우위가 된다는 관점에서 임상·실험 과학자를 위한 Deep Life Sci를 개발했다. 이 도구는 Deep Agents 하네스 위에 구축한 오픈 소스 어시스턴트이며, 기업이 자신의 용도에 맞게 채택하고 수정할 수 있는 템플릿으로 제시된다. ClinicalTrials.gov의 60만 건 이상 등록 연구, PubMed의 논문 초록 2,900만 건, PubMed Central의 전문 논문 1,200만 건에 접근하고, 하위 에이전트에 작업을 나눠 수백 개 문서를 한 번에 검토한다. 각 에이전트에는 LangSmith 샌드박스가 제공되어 코드를 안전하게 실행하고 다양한 데이터 분석을 수행할 수 있다. 사용자는 PDF, 이미지, 표 형식 데이터, RIS 서지 파일과 SMILES·FASTA 등의 파일을 업로드해 분석에 포함할 수 있다.
3. 실험 결과 해석과 임상 근거 비교
실험실 활용 예시에서는 과학자가 RNA-seq 또는 단백질체 스크리닝 결과 표를 업로드하는 것으로 작업이 시작된다. 원문은 에이전트가 샌드박스에서 풍부도 분석을 수행해 차등 발현 유전자를 식별하고, 각 후보와 표현형의 연관성을 뒷받침하는 기존 문헌을 찾는 흐름을 설명한다. 이어 잘 알려진 유전자와 새로운 유전자를 구분하고 근거 논문을 포함한 순위 표를 반환한다. 임상 개발 또는 HEOR 팀의 사례에서는 특정 적응증의 표준 치료에 관한 출판된 임상시험을 찾고, 평가변수 값, 표본 수 N, 모집단 특성, 추적 관찰 기간을 일관되게 추출한다. 에이전트는 검색과 기준에 따른 선별을 거쳐 각 시험을 공통 스키마로 정리하고 표와 포리스트 플롯 형식의 비교를 생성한다.
4. 임상시험 문서 검토와 수정 지원
임상시험 단계에는 동의서, 임상시험 계획서와 변경 문서, 증례기록서 등 여러 유형의 문서가 수천 페이지에 걸쳐 생성된다. 이 문서들은 최종 확정 전에 여러 차례 철저한 감사와 검토, 수정을 거쳐야 하므로 반복적인 작업 부담이 발생한다. 원문은 Deep Life Sci에 참고용 계획서를 업로드하고 추가 통계 정보를 조사·수집하는 활용 방식을 제시한다. 사용자는 이를 바탕으로 필요한 피드백과 수정 사항을 신속하게 정리할 수 있으며, 저자들은 이러한 지원이 임상 문서 작성 시간을 상당히 줄일 가능성이 있다고 본다. 다만 이 사례에서 실제 시간 절감률이나 검증 결과는 제공하지 않으므로, 효과의 크기는 확인된 성과가 아니라 기대 수준으로 읽어야 한다.
5. 기업 내부 맥락을 반영하는 맞춤화
저자들은 Deep Life Sci의 가치가 기업의 업무 환경에 통합되고 최적화될 때 더 커진다고 설명한다. 도구가 일차 평가변수의 개념을 알더라도 내부 분석 결과, 규제기관이 이의를 제기했던 평가변수, 실제 환자 등록 실적이 있는 시험기관 같은 기업별 맥락은 기본적으로 알지 못한다. 이런 정보를 하네스에 반영하는 것이 원문이 말하는 자체 지능 소유의 구체적인 모습이다. 코드가 오픈 소스이므로 조직은 내부 데이터와 문서를 연결하거나, 다양한 프런티어 모델과 오픈 소스 모델을 활용하고, 가드레일과 승인 단계를 추가할 수 있다. 이러한 수정은 구축·테스트·배포·모니터링 후 학습한 내용을 다음 버전에 반영하는 에이전트 개발 수명주기인 ADLC로 이어진다.
6. 추적과 평가를 통한 개선 및 기대 효과
Deep Life Sci의 모든 실행은 사용자의 LangSmith 계정에 처음부터 끝까지 기록되며, 문헌 검색, 샌드박스 실행 코드, 하위 에이전트가 읽은 문서와 답변에 이르는 과정이 포함된다. 이 기록은 디버깅과 개선에 쓰이고 감사 기록의 역할도 한다. 기본 평가 세트는 새로운 데이터 연결이나 활용 사례에 맞춰 수정·확장할 수 있으며, 모델 교체나 프롬프트 변경 전후에 실행해 성능 개선 또는 퇴행을 확인하도록 제안된다. 저자들은 이러한 추적과 평가가 ADLC의 반복 개선을 뒷받침한다고 설명한다. 결론에서는 Deep Life Sci 같은 오픈 소스 도구와 LangSmith를 결합하면 신약 개발 전반의 비용을 줄이고 반복 속도를 높여 Eroom’s law를 역전시킬 수 있다고 주장하지만, 이를 입증하는 정량적 결과는 제시하지 않는다.
🧾 핵심 주장 / 시사점
- 오픈 소스 하네스의 가치는 맞춤화뿐 아니라, GxP 검증에 필요한 행동 설명과 감사 기록을 조직이 통제할 수 있다는 논리와 연결된다.
- 공개 과학 데이터에 접근하는 능력과 기업 내부 맥락을 이해하는 능력은 구분되며, 원문은 내부 맥락 통합을 업무 적합성을 높이는 핵심으로 제시한다.
- 실행 추적은 에이전트가 무엇을 했는지 보여주고 평가는 변경이 성능에 미친 영향을 확인하지만, 이것만으로 제약 R&D 비용 절감이 입증되는 것은 아니다.
✅ 액션 아이템
- Deep Life Sci의 문헌 탐색·실험 결과 해석·임상 문서 지원 기능이 도입 대상 업무에 적합한지 검토한다.
- 내부 데이터·문서 연결과 가드레일·승인 단계에 필요한 맞춤화 범위를 GxP 설명 요구와 함께 검토한다.
- 모델 선택이나 프롬프트 변경 전후에 LangSmith 실행 추적과 기본 평가 세트를 활용해 성능 개선·퇴행 여부를 확인한다.
❓ 열린 질문
- Deep Life Sci의 임상 문서 검토·수정 지원은 실제 작업 시간을 얼마나 줄일 수 있는가?
- GxP 검증에 필요한 행동 설명과 감사 가능성을 확보하려면 Deep Life Sci에 어떤 맞춤화가 필요한가?
- 내부 데이터·문서 연결과 모델 선택이 성능에 미치는 영향을 LangSmith 기본 평가 세트로 충분히 확인할 수 있는가?