Articleaws.amazon.com·2026년 9월 16일·0

Improving HCLS AI reasoning with open-source agent skills

Quick Summary

AWS는 HCLS 11개 분야의 의사결정 절차를 담은 오픈소스 스킬 38개를 소개하며, 스킬을 적용한 에이전트가 미적용 에이전트와의 비교에서 실행 환경 구성에 따라 70~86%의 승률을 보였다고 보고한다.

Improving HCLS AI reasoning with open-source agent skills 관련 대표 이미지

🖼️ 인포그래픽

Improving HCLS AI reasoning with open-source agent skills 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Improving HCLS AI reasoning with open-source agent skills의 핵심 내용을 4단계로 요약한 인포그래픽
Improving HCLS AI reasoning with open-source agent skills 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

AWS는 HCLS 11개 분야의 의사결정 절차를 담은 오픈소스 스킬 38개를 소개하며, 스킬을 적용한 에이전트가 미적용 에이전트와의 비교에서 실행 환경 구성에 따라 70~86%의 승률을 보였다고 보고한다.

📌 핵심 요약

  • 기반 모델 기반 에이전트는 ACMG/AMP 같은 지침을 알고 있어도 근거 범주, 인구집단 빈도 임계값, 계산 예측 점수를 잘못 적용할 수 있으며, 이러한 방법론적 오류는 규제와 환자 안전에 영향을 줄 수 있다.
  • HCLS Agent Skills는 11개 분야의 스킬 38개를 MIT-0 라이선스로 제공한다. SKILL.md에 판단 절차를 담는 추론 스킬과 도구 명령·검증된 매개변수·코드 템플릿을 담는 파이프라인 스킬로 구분된다.
  • 글이 보고한 스킬 적용 에이전트의 일대일 비교 승률은 실행 환경 구성에 따라 70~86%이며, 가장 큰 효과가 나타난 비판적 사고의 승률은 78~85%, 효과 크기 d는 0.65~1.03이다. 제공된 본문에는 상세 평가 설계가 제시되지 않는다.
  • Quick Desktop은 질문에 맞는 스킬을 자동 활성화한다. Kiro CLI는 전체 스킬 적재 시 약 80K 토큰이 필요한 문제를 스킬 없는 조정자와 8개 분야별 전문 에이전트로 나누며, 전문 에이전트별 적재량은 약 15K 토큰이다. AWS Strands Agents SDK와 Amazon Bedrock AgentCore를 통한 구현·배포도 소개한다.
  • 약물 재창출 사례에서는 IPF의 치료 표적으로 TGFBR1을 검토하며 drug-repurposing과 translational-research 스킬로 데이터베이스 질의, 근거 수준별 후보 순위화, 질병 기전과의 연관성 평가를 구조화한다. 제공된 본문은 이 사례의 설명 도중 끊겨 최종 후보와 임상 전환 가능성에 대한 결론은 확인할 수 없다.

🧩 주요 포인트

  1. 지침 지식과 절차 적용의 간극 → 추론 스킬과 파이프라인 스킬을 결합해 판단 기준과 실행 정확성을 함께 보완한다.
  2. 전체 적재 약 80K 토큰과 전문 에이전트별 약 15K 토큰 → Kiro CLI의 분야별 라우팅으로 스킬 선택 부담과 무관한 문맥의 경쟁을 줄인다.
  3. ~86%의 비교 승률과 중간에 끊긴 IPF 사례 → 개선 주장은 제시되지만, 평가의 재현성과 임상 전환 결론을 판단할 근거는 제공된 본문만으로 제한된다.

🧠 상세 정리

1. 지침을 아는 것과 올바르게 적용하는 것의 간극

글은 기반 모델을 사용하는 의료·생명과학(HCLS) 에이전트가 학습 과정과 시스템 프롬프트에서 지침을 접했더라도 실제 판단에서는 이를 잘못 적용할 수 있다는 문제에서 출발한다. TP53 미스센스 변이를 ACMG/AMP 기준으로 분류하도록 요청하면 올바른 프레임워크를 인용하면서도 근거 범주를 혼동하거나 인구집단 빈도 임계값을 생략하고 계산 예측 점수를 지어낼 수 있다는 예시다. 저자는 이를 사실 지식의 부족보다 전문가가 오랜 훈련으로 익히는 구조화된 추론 절차의 부족으로 설명한다. 이런 오류는 변이 해석뿐 아니라 청구 심사, 임상시험 설계, 영상 분석에서도 나타날 수 있으며, 출력이 그럴듯해도 잘못된 기준을 적용해 규제와 환자 안전에 영향을 줄 수 있다고 지적한다.

2. 38개 스킬의 구성과 보고된 개선 효과

제안된 해법은 유전체학, 신약 개발, 청구 업무, 의료 영상 등을 포함하는 HCLS 11개 분야의 오픈소스 에이전트 스킬 38개다. 각 스킬은 Agent Skills 공개 표준을 따르는 SKILL.md 문서로, YAML 머리말에 활성화 조건·의존성·메타데이터를 선언하고 본문에는 의사결정 프레임워크, 매개변수 표, 코드 패턴, 검증 기준을 담는다. 에이전트는 추론 시점에 필요한 내용을 점진적으로 제공받으며, 전체 컬렉션은 MIT-0 라이선스로 공개된다. 글은 같은 에이전트의 스킬 적용 여부를 비교했을 때 실행 환경 구성에 따라 적용 쪽의 승률이 70~86%였고, 비판적 사고에서는 78~85%의 승률과 d = 0.65~1.03의 효과 크기를 보였다고 보고하지만, 제공된 본문에는 상세 평가 설계와 결과 분석이 포함되어 있지 않다.

3. 추론 스킬과 파이프라인 스킬의 역할

저장소는 스킬을 판단 방법을 안내하는 추론 스킬과 실행 가능한 결과물을 만드는 파이프라인 스킬로 구분한다. 추론 스킬인 genomic-variant-interpretation은 ACMG/AMP 분류의 근거 범주, 인구집단 빈도 임계값, 계산 예측 도구의 기준값을 담아 판단 절차를 구체화한다. 파이프라인 스킬인 variant-calling은 GATK4 HaplotypeCaller 명령, 올바른 주석 그룹, VQSR 구간별 민감도 목표, Mutect2 종양·정상 구성처럼 도구 실행에 필요한 내용을 제공한다. 글은 제한된 문서 구절을 검색하는 RAG와 달리 스킬이 의사결정 절차와 오류 조건 자체를 담으며, 파인튜닝이 아니라 질문의 활성화 패턴에 따라 적용되는 구조화된 프롬프트라고 설명한다. 또한 판단 기준을 사람이 읽고 감사할 수 있고, 20개가 넘는 서비스에서 사용할 수 있으며, 의료 정책이나 실험 기준이 바뀌면 모델 재학습 없이 텍스트를 수정할 수 있다는 점을 장점으로 든다.

4. 설치 요건과 서비스별 연결 방식

예제를 실행하려면 Kiro 또는 Kiro CLI, Amazon Bedrock 모델 접근 권한을 갖춘 AWS Strands Agents SDK, 기존 에이전트 구현을 사용하는 AgentCore harness, Quick Desktop 등의 환경이 필요하며, Claude Code나 OpenAI Codex 같은 코딩 에이전트 실행 환경도 사용할 수 있다. 공통 준비 사항으로 Python 3.10 이상, uv, 저장소 복제를 위한 Git을 제시한다. 저장소를 복제한 뒤 스킬만 설치할 때는 npx skills add awslabs/hcls-agent-skills를 사용하고, Kiro에서는 install.sh로 스킬과 사전 구성된 에이전트를 함께 설치해 자동 라우팅을 이용한다. Kiro의 다중 에이전트 모드도 별도 설치 옵션으로 제공되며, Strands에서는 Python 코드의 AgentSkills로 스킬 디렉터리를 연결한다. Quick Desktop은 설치 스크립트가 안내하는 그래픽 인터페이스 절차를 따르고, AgentCore는 해당 문서의 스킬 추가 절차를 사용하도록 안내한다.

5. Quick Desktop의 선택적 스킬 활성화

Quick Desktop 사례는 스킬 설치 후 추가 구성 없이 질문에 맞는 HCLS 추론 절차를 적용하는 단일 에이전트 사용 방식을 보여준다. 에이전트는 질문에 포함된 활성화 패턴을 바탕으로 관련 스킬을 자동으로 선택하므로, 사용자가 먼저 스킬 이름을 알아야 할 필요가 줄어든다. 예를 들어 E11.42 대신 E11.9로 코딩할 때 RAF에 어떤 영향이 있는지 물으면 risk-adjustment 스킬이 활성화된다. 글은 이때 에이전트가 단순히 문서를 검토하라고 제안하는 대신 구체적인 HCC 매핑, 계층 관계 처리, 정량화된 RAF 차이를 제시한다고 설명한다. 다만 제공된 본문에 실제 RAF 차이의 수치는 없으며, 이 사례의 강조점은 관련 스킬만 선택적으로 활성화해 응답의 초점과 정확성을 유지하도록 돕는다는 데 있다.

6. Kiro CLI의 다중 에이전트와 문맥 관리

스킬 38개를 모두 하나의 에이전트 문맥에 적재하면 약 80K 토큰을 소비하며, 글은 큰 문맥을 지원하는 모델에서는 가능하지만 스킬 선택과 주의 배분의 문제가 남는다고 설명한다. 에이전트가 매 질문마다 적절한 스킬 집합을 골라야 하고, 무관한 스킬 내용도 문맥에서 주의를 놓고 경쟁하기 때문이다. 사용자가 /risk-adjustment처럼 스킬을 직접 지정하는 대안도 있지만, 이는 질문 전에 어떤 전문 절차가 필요한지 알아야 한다는 부담을 되살린다. Kiro CLI 구성은 스킬을 적재하지 않은 가벼운 조정자가 의도를 분류하고 8개 분야별 전문 에이전트로 질의를 전달하며, 각 전문 에이전트는 관련 스킬 약 15K 토큰만 적재하도록 나눈다. 라우팅과 스킬 연결은 JSON 에이전트 파일로 정의되며, 본문은 코드베이스에서 복잡한 약물 재창출 질문을 처리하는 시연을 소개한다.

7. Strands 구현과 AgentCore 운영 배포

AWS Strands Agents SDK 통합 예시는 AgentSkills를 통해 유전체학과 영상 분야 에이전트에 각각 다른 스킬 디렉터리를 연결하는 방식이다. MultiAgentOrchestrator는 이들 전문 에이전트를 묶어 질의를 전달하며, 코드에서는 TP53의 NM_000546.6:c.743G>A 변이를 ACMG 기준으로 분류해 달라는 요청을 사용한다. 로컬에서 스킬을 갖춘 에이전트가 동작하면 Amazon Bedrock AgentCore로 운영 환경에 배포하는 흐름이 이어진다. 글은 Strands 에이전트 코드에 스킬을 포함하는 방법 외에도 AgentCore 실행 환경 수준에서 스킬을 구성해 해당 환경의 에이전트가 사용할 수 있게 하는 경로를 제시한다. AgentCore harness가 관리형 호스팅, 자동 확장, 보안 경계, 관측 기능을 제공한다는 설명이며, 이 부분은 별도의 추론 성능 결과보다 구현과 운영 배포 방식을 다룬다.

8. IPF 약물 재창출 사례와 확인 가능한 범위

첫 활용 사례는 특발성 폐섬유증(IPF)을 연구하는 바이오기업이 수용체 키나아제 TGFBR1(ALK5)을 통한 TGF-β1 신호를 조절하는 승인 약물의 재창출 가능성을 검토하는 상황이다. 스킬 적용 전 에이전트는 알려진 TGFBR1 억제제를 문헌 검토 형태로 나열하지만, 후보 순위 기준이나 근거 위계, 임상 전환 가능성 평가 체계는 구조화하지 못한다고 설명한다. 적용 후에는 drug-repurposing과 translational-research 스킬을 활성화하고 DGIdb 질의에서 억제제, 조절제, 결합제 순으로 상호작용 유형을 우선하며, 신뢰도가 낮은 출처보다 ChEMBL과 DrugBank를 우선한다. 후보 평가에서는 직접적인 표적 작용 근거를 경로 수준 근거보다, 경로 수준 근거를 표현형 연관성보다 높게 두고 기존 적응증의 관련성을 보정 요소로 반영한다. 이어 TGFBR1 억제를 섬유아세포의 근섬유아세포 전환과 상피·간엽 전환 등 IPF 병리 과정에 연결하지만, 제공된 본문은 세포외 기질에 관한 설명 도중 끊겨 최종 추천 약물이나 임상 전환 가능성의 결론까지는 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • 이 접근의 핵심은 HCLS 지식을 더 많이 제시하는 것보다, 이미 아는 지침을 어떤 순서와 기준으로 적용할지 명시해 그럴듯한 오판을 줄이는 데 있다.
  • 선택적 스킬 활성화와 분야별 에이전트 라우팅은 전문 절차를 제공하면서도 사용자의 스킬 선택 부담과 문맥 적재 부담을 관리하는 상호 보완적 방식이다.
  • 보고된 비교 승률은 방법론 보완의 가능성을 보여주지만, 제공된 평가 정보와 미완결 IPF 사례만으로 개별 판단의 임상적 타당성이나 최종 후보의 적합성까지 확정할 수는 없다.

✅ 액션 아이템

  • ACMG/AMP 적용에서 근거 범주, 인구집단 빈도 임계값, 계산 예측 점수의 처리 정확성을 검토한다.
  • 전체 적재 약 80K 토큰과 전문 에이전트별 약 15K 토큰을 기준으로 Kiro CLI의 분야별 라우팅 적용을 검토한다.
  • 70~86%의 비교 승률에 대한 상세 평가 설계와 IPF 사례의 최종 후보·임상 전환 결론을 추가 확인한다.

❓ 열린 질문

  • 70~86%의 비교 승률은 구체적으로 어떤 평가 설계와 실행 환경 구성에서 도출되었는가?
  • Kiro CLI의 8개 분야별 전문 에이전트는 여러 분야에 걸친 질문에서 스킬 선택과 추론을 얼마나 정확하게 수행하는가?
  • IPF의 TGFBR1 약물 재창출 사례에서 최종 후보와 임상 전환 가능성은 어떻게 평가되었는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.