Scaling medical content review at Flo Health with Amazon Bedrock – Part 2
Quick Summary
Flo Health는 의료 전문가의 최종 통제를 유지하면서 전문화된 AI 평가, 신뢰할 수 있는 자료 검색, 자동 재검증을 결합해 의료 콘텐츠 검토 시간을 60% 줄이고 팀 증원 없이 처리량을 3배로 높였다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 요약
Flo Health는 의료 전문가의 최종 통제를 유지하면서 전문화된 AI 평가, 신뢰할 수 있는 자료 검색, 자동 재검증을 결합해 의료 콘텐츠 검토 시간을 60% 줄이고 팀 증원 없이 처리량을 3배로 높였다.
📌 핵심 요약
- Flo Health의 의료 전문가는 기사 한 편을 검토하는 데 평균 7영업일을 사용했으며, 신뢰할 수 있는 출처 확인과 10개 항목의 의료 정확성 점검이 콘텐츠 생산의 핵심 병목이었다.
- 운영 시스템은 내부 의료 지침 검사, 외부 의료 출처를 통한 검증, 의료 전문가의 최종 검토로 이어지는 3단계 검증 구조를 채택했다.
- 의료 정확성, 법적 준수, 브랜드 문체 등 검토 차원별로 독립된 AI 평가자를 구성하고, 위험도·품질 기준·지연 시간·운영 비용에 따라 각 평가자에 적합한 모델을 선택했다.
- 콘텐츠 생성 과정에는 다단계 프롬프트와 검색 증강 생성이 적용됐으며, 관련 지침·의학 지식·템플릿·시각 자료를 검색하고 사용된 출처를 생성 콘텐츠와 함께 보존했다.
- 검토 결과와 수정 제안은 기존 Contentful 환경에 표시되고 최종 선택권은 사람에게 남겨졌으며, 전체 도입 결과 검토 시간은 60% 감소하고 콘텐츠 처리량은 의료팀 증원 없이 3배로 증가했다.
🧩 주요 포인트
- 기존에 분할돼 있던 콘텐츠 구조를 세부 요소별 평가와 연결함으로써, 하나의 거대한 요청보다 구체적인 문제 지적과 수정 제안을 제공할 수 있게 됐다.
- 고위험 의료 검사는 정확성과 신뢰성을 우선하고 단순 검사는 기준을 충족하는 경량 모델에 맡겨, 안전 요구를 유지하면서 지연 시간과 비용을 함께 관리했다.
- 근거 출처, 적용 규칙, 중간 결과와 변경 내용을 사용자 화면에 드러내고 최종 결정을 전문가에게 맡겨, 자동화가 의료 검토를 대체하지 않고 전문 판단을 증폭하도록 설계했다.
🧠 상세 정리
1. 의료 콘텐츠 생산의 병목
Flo Health는 앱 안의 이야기와 기사부터 온보딩 흐름, 마케팅 자료까지 다양한 건강 콘텐츠를 제작하며, 문자와 시각 콘텐츠 모두 내부 의료 정확성 지침을 충족해야 한다. 의료 전문가는 기사 한 편당 평균 7영업일을 들여 사실을 확인하고, 신뢰할 수 있는 자료와 참고문헌을 대조하며, 10개 항목으로 구성된 정확성 점검을 수행했다. 이 과정은 사용자 신뢰와 안전을 지키는 데 필수적이지만 콘텐츠 생산량을 확대하고 사용자 요구에 빠르게 대응하는 데 병목으로 작용했다. 콘텐츠 전문성을 갖춘 의료 인력은 희소하고 채용에 많은 시간과 비용이 필요하기 때문에, 단순히 검토자를 늘리는 방식도 지속 가능하거나 경제적인 해법이 아니었다. 이에 Flo Health는 기존 의료진의 판단을 대체하기보다 반복 작업과 확인 부담을 줄여 같은 인력의 전문성을 더 효율적으로 활용하는 방향을 선택했다.
2. 개념 검증에서 3단계 운영 검증으로
Flo Health는 AWS 생성형 AI 혁신 센터의 개념 검증 결과를 출발점으로 삼되, 의료 전문가의 역량을 단계적으로 확장하고 지속적인 검증을 통해 신뢰를 쌓는 도입 전략을 택했다. 운영 시스템의 첫 단계는 콘텐츠를 내부 의료 지침과 대조해 잠재적인 문제를 표시하고 기존 규칙에 근거한 수정안을 제안하는 것이다. 두 번째 단계에서는 임상 의사결정 자료, 동료 심사 학술지, 규제기관 자료 등 신뢰할 수 있는 외부 의료 출처를 이용해 내용을 검증한다. 마지막 단계에서는 의료 전문가가 적용된 규칙과 관련 출처로 연결되는 링크가 표시된 주석 콘텐츠를 검토해 사실 확인과 최종 판단을 수행한다. 이 체계의 주요 성공 지표는 검토에 필요한 시간을 줄이는 것과 전문가가 직접 수정해야 하는 항목 수를 최소화하는 것으로 설정됐다.
3. 전문화된 AI 평가자와 위험 기반 모델 선택
Flo Health는 모든 요구사항을 하나의 거대한 프롬프트로 처리하지 않고, 의료 정확성·법적 준수·브랜드 문체 등 각 검토 차원에 집중하는 여러 AI 평가자를 만들었다. 각 평가자는 고유한 프롬프트와 학습·시험용 예시 집합을 가지며, 콘텐츠의 각 요소에 대해 해당 차원의 구체적인 의견을 반환한다. 팀은 평가자마다 여러 모델을 시험한 뒤 필요한 품질 기준, 위험 수준, 응답 지연 시간과 운영 비용을 함께 고려해 가장 적합한 모델을 선택한다. 의료 안전처럼 위험이 높은 검사는 정확성과 신뢰성을 우선하고, 비교적 단순하거나 위험이 낮은 검사는 성능 기준을 충족하는 범위에서 더 가벼운 모델을 사용할 수 있다. 평가자가 서로 분리돼 있으므로 특정 평가자의 예시와 프롬프트를 보강해 정확도를 높이면서 다른 평가자를 변경하지 않을 수 있고, 그 과정에서 발생할 수 있는 회귀 문제도 줄일 수 있다.
4. Contentful에 통합된 검토와 사람의 최종 통제
검토 파이프라인은 텍스트를 관리 가능한 단위로 나누는 MACROS 방식을 Flo Health의 Contentful 콘텐츠 모델에 맞게 조정했다. 설문과 채팅의 각 단계는 이미 별도 콘텐츠 항목으로 저장돼 있으며, 평가 전에는 이를 다시 버튼 문구, 제목, 설명 같은 더 작은 요소로 분할한다. 각 요소는 전문화된 AI 평가자들을 차례로 거치고, 평가 결과는 문제를 해소하기 위한 새 문구 제안을 생성하는 후속 입력으로 사용된다. 제안된 문구와 변경 부분은 편집자와 의료 전문가가 익숙한 Contentful 앱 화면에 직접 표시되며, 사용자는 제안 중 하나를 선택하거나 수정하거나 원문을 유지할 수 있다. 각 줄에 대한 결정이 끝난 뒤에만 최종 콘텐츠가 Contentful 항목에 반영되므로, AI는 전문가 보조 역할을 수행하고 최종 통제권은 사람에게 남는다.
5. 콘텐츠 생성 파이프라인과 모델 역할 분담
검토 체계를 운영에 도입한 뒤 Flo Health는 같은 기반을 콘텐츠 생성에도 활용해, 처음부터 콘텐츠 흐름을 수작업으로 구성하는 반복 업무와 인지 부담을 줄이고자 했다. 생성 과정은 여러 단계로 나뉜 프롬프트 방식을 사용하며, 각 단계의 작업 성격에 따라 서로 다른 Claude 모델을 배치한다. 사용자가 원하는 생성 단계 수를 판별하는 것과 같은 가벼운 분류와 일상적인 분석에는 속도가 빠르고 비용이 낮은 Claude Haiku를 사용한다. 섬세한 의료 설명을 작성하거나 특정한 공감 표현으로 문단을 다시 쓰는 등 높은 품질과 복잡한 추론이 필요한 작업에는 더 강력한 Claude Sonnet 모델을 호출한다. 이러한 역할 분담은 모든 단계에 동일한 모델을 적용하지 않고, 개별 작업의 난도와 요구 품질에 맞춰 생성 자원을 사용하려는 운영 방식이다.
6. 검색 증강 생성과 의료 근거 관리
여성 건강 분야의 생성 도구에는 모델 자체에 포함되지 않은 많은 맥락이 필요했기 때문에, Flo Health는 검색 증강 생성을 이용해 지식 기반에서 요청과 관련된 정보만 찾아 모델의 입력 맥락에 제공했다. 콘텐츠를 작성할 때 시스템은 해당 주제에 맞는 지침, 규칙, 의학 지식, 기존 템플릿과 시각 자료 참조를 검색한다. 이 지식 자료는 제품·편집·의료 검토 담당자가 반복적으로 개발하고 유지하며, 안전 범위에 대한 책임은 의료팀이 맡는다. 내부 자료뿐 아니라 근거 기반 임상 의사결정 도구, 동료 심사 학술지, 규제기관 간행물 같은 신뢰할 수 있는 외부 의료 출처도 통합됐다. 시스템은 생성된 각 콘텐츠와 함께 실제로 사용한 출처 목록을 저장하므로, 의료 검토자는 자료를 다시 수동으로 검색하지 않고도 근거를 직접 열어 확인할 수 있다.
7. 사용자 경험과 운영 아키텍처
사용자가 불일치를 조기에 발견할 수 있도록 생성의 각 단계를 명확히 설명하고 시각화했으며, 단계가 완료될 때마다 중간 결과를 순차적으로 표시해 전체 파이프라인이 끝나기 전에도 검토를 시작할 수 있게 했다. 화면과 콘텐츠 요소 사이의 연결 및 디자인 요소도 함께 보여 줘, 사용자가 결과를 반복적으로 내보내 휴대전화에서 시험해야 하는 부담을 줄였다. Contentful에서 시작된 요청은 Amazon API Gateway를 통해 전달되고, 지식 기반 검색과 콘텐츠 구조화, 검증으로 이어지는 흐름은 AWS Lambda와 AWS Step Functions가 조정한다. 의료 참고문서, 지침, 템플릿과 시각 자료는 Amazon S3에 저장되며, Amazon DynamoDB는 파이프라인의 상태와 메타데이터를 관리한다. 마지막 검증에서 의료 정확성이나 브랜드 지침 문제가 발견되면 자동으로 재처리가 시작되고, 모듈형 구조를 통해 새로운 콘텐츠 유형이나 검증 요구사항도 추가할 수 있도록 설계됐다.
8. 성과와 프롬프트 운영에서 얻은 교훈
운영 체계는 더 높은 품질의 콘텐츠가 사람의 검토 단계에 도달하게 하고, 콘텐츠 제작자와 의료 검토자 사이의 피드백 반복 횟수를 줄이는 데 초점을 맞췄다. 기사에서 제시된 결과에 따르면 의료팀을 확대하지 않고도 검토 시간이 60% 줄었고 콘텐츠 처리량은 3배로 늘었다. 프롬프트 출력 형식에 관한 실무 경험에서는 JSON보다 YAML이 더 견고한 것으로 평가됐는데, 들여쓰기 기반 구조가 형식 오류에 더 관대해 유효하지 않은 출력이 적고 문제를 추적하기도 쉬웠기 때문이다. 이후 Amazon Bedrock에 스키마에 맞는 JSON 응답을 API 수준에서 강제하는 구조화 출력 기능이 도입돼, 출력 형식의 일관성 문제를 겪는 팀이 고려할 수 있는 대안으로 언급됐다. 원문은 이어서 예시와 규칙에 관한 교훈을 다루기 시작하지만 제공된 본문이 해당 대목에서 중단되므로, 그 이후의 결론이나 세부 내용은 확인할 수 없다.
🧾 핵심 주장 / 시사점
- 이 사례의 확장 전략은 전문 의료 인력을 단순히 늘리는 것이 아니라, 출처 검색·규칙 점검·초안 수정을 자동화해 기존 전문가가 최종 판단과 고위험 검토에 집중하도록 만드는 데 있다.
- 검토 차원과 생성 단계를 모듈로 분리하면 위험 수준에 맞는 모델을 배치하고 특정 평가자만 개선할 수 있어, 품질·비용·지연 시간을 조정하면서 다른 검사의 회귀 가능성을 줄일 수 있다.
- 의료 분야에서 생성 결과만 제공하는 것보다 적용 규칙, 사용 출처, 중간 결과와 변경 내역을 함께 노출하는 것이 검증 가능성과 사람의 통제권을 유지하는 핵심 운영 요소로 나타난다.
✅ 액션 아이템
- 의료 정확성·법적 준수·브랜드 문체별로 독립 평가자를 나누고, 위험도·품질·지연·비용 기준으로 모델 배정 규칙을 정의한다.
- 콘텐츠 세부 요소 단위로 문제 지적과 수정 제안을 연결하고, 근거 출처·적용 규칙·중간 결과를 검토 화면에 함께 노출한다.
- 내부 지침 검사·외부 출처 검증·전문가 최종 검토의 3단계 흐름을 유지한 채, 검토 시간 60% 단축과 처리량 3배 목표 대비 병목을 점검한다.
❓ 열린 질문
- 고위험 의료 검사와 단순 검사를 가르는 위험도·품질 기준은 무엇으로 설정할 것인가?
- 검색 증강 생성에서 보존할 출처·지침·중간 결과의 최소 범위는 어디까지로 둘 것인가?
- 전문가 최종 통제를 유지하면서도 7영업일 병목을 줄이려면 어느 검증 단계를 우선 자동화할 것인가?