Articleaws.amazon.com·2026년 9월 16일·0

Build a serverless PII redaction pipeline with Amazon Bedrock Data Automation

Quick Summary

Amazon Bedrock Data Automation(BDA)의 맞춤형 블루프린트와 단어 매칭을 결합한 서버리스 PII 가림 처리 사례에서, 12개 문서·47페이지 평가의 재현율이 89.3%에서 95.2%로 높아졌고 정밀도는 97.0%에서 96.5%로 소폭 낮아졌다.

Build a serverless PII redaction pipeline with Amazon Bedrock Data Automation 관련 대표 이미지

🖼️ 인포그래픽

Build a serverless PII redaction pipeline with Amazon Bedrock Data Automation 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Build a serverless PII redaction pipeline with Amazon Bedrock Data Automation의 핵심 내용을 4단계로 요약한 인포그래픽
Build a serverless PII redaction pipeline with Amazon Bedrock Data Automation 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Amazon Bedrock Data Automation(BDA)의 맞춤형 블루프린트와 단어 매칭을 결합한 서버리스 PII 가림 처리 사례에서, 12개 문서·47페이지 평가의 재현율이 89.3%에서 95.2%로 높아졌고 정밀도는 97.0%에서 96.5%로 소폭 낮아졌다.

📌 핵심 요약

  • 수동 PII 가림 처리는 처리량, 인적 오류, 규정 준수 측면의 부담이 있으며, 기존 OCR·패턴 매칭·맞춤형 ML 방식은 손상된 텍스트와 필드별 업무 규칙을 다루는 데 한계가 있다.
  • 주치의 진술서 사례에서는 환자 이름·생년월일·집 주소·연락처를 가리고 의사 이름·진료 날짜·병원 주소·증상·의료 기록은 유지하도록 BDA 블루프린트를 설계했으며, 전체 스키마는 9개 필드 그룹과 37개 필드로 구성됐다.
  • 파이프라인은 BDA, AWS Step Functions, AWS Lambda를 사용하는 서버리스 배치 구조로 소개되며, 블루프린트 ARN을 입력받아 용도별로 재사용하고 BDA API 호출마다 문서 한 페이지를 처리한다.
  • 한 번의 BDA API 호출에서 얻은 맞춤형 출력과 단어별 좌표를 포함한 표준 출력을 토큰 매칭으로 결합했다. 100 DPI 스캔을 포함한 6개 품질 수준의 12개 문서·47페이지 평가에서 재현율은 89.3%에서 95.2%로 상승했고 정밀도는 97.0%에서 96.5%로 낮아졌다.
  • 블루프린트 성능과 BDA 신뢰도 점수를 함께 평가해 예외 사례를 사람이 검토하도록 분기할 수 있다. 원문은 야간 약 25,000페이지의 운영 처리량을 언급하지만 파이프라인 아키텍처 설명 도중 잘려 있어 구체적인 운영 구현은 확인할 수 없다.

🧩 주요 포인트

  1. 환자 정보와 의사 정보를 구분하는 자연어 필드 지시 → PII 탐지 범위를 업무 목적에 맞추고 보존할 정보의 불필요한 가림을 줄이는 설계.
  2. 맞춤형 출력으로 찾은 PII를 표준 출력에서 토큰 매칭 → 반복 출현한 정보의 누락을 줄이지만 일부 과잉 가림에 따른 정밀도 저하가 수반됨.
  3. 블루프린트 ARN과 공통 서버리스 배치 구조의 분리 → 용도별 재사용을 지원하되, 12개 문서·47페이지의 평가 결과와 야간 약 25,000페이지의 운영 규모는 구분해 해석해야 함.

🧠 상세 정리

1. PII 가림 처리는 탐지와 정밀한 범위 설정의 문제

의료 양식, 보험 청구서, 금융 기록처럼 매일 수천 건의 스캔 문서를 처리하는 조직은 문서를 제3자에게 공유하거나 후속 처리에 넘기기 전에 개인 식별 정보인 PII를 가려야 하는 규정 준수 요구에 직면한다. 수동 처리는 직원의 시간을 소모하고 인적 오류를 일으킬 수 있어 대규모 처리에 한계가 있으며, 정보 누락은 규정 준수 위험으로 이어진다. 한 페이지에 이름과 날짜, 주소가 여러 개 있어도 해당 업무에서 민감한 항목은 일부일 수 있으므로, 단순한 탐지를 넘어 정확한 가림 대상을 결정해야 한다. 기존 OCR과 패턴 매칭 또는 맞춤형 ML 모델의 조합은 텍스트가 손상되면 제약이 생기고 필드별 업무 규칙을 쉽게 표현하기 어렵다. 문서 형식이 바뀔 때 맞춤형 모델을 구축하고 재학습하려면 ML 전문성도 필요하다는 것이 원문이 제시하는 출발점이다.

2. 문서 맥락을 이해하는 BDA와 맞춤형 블루프린트

원문은 생성형 AI의 문서 이해 능력을 활용해 페이지의 배치, 필드 라벨, 주변 맥락을 함께 해석하고 특정 정보가 누구에게 속하는지 구분하는 접근을 제시한다. Amazon Bedrock Data Automation은 문서, 이미지, 오디오, 비디오 같은 비정형 자료에서 구조화된 정보를 추출하는 Amazon Bedrock의 서비스다. 맞춤형 블루프린트에서는 자연어 지시로 이름이 지정된 문서 필드와 추출 범위를 선언하고, 결과로 해당 내용과 신뢰도 점수, 각 출현 위치의 경계 상자 좌표를 받아 후처리에 활용할 수 있다. 이 기능을 가림 처리의 업무 요건에 맞게 구성하면 BDA를 특정 용도에 맞춘 PII 탐지 엔진으로 사용할 수 있다는 설명이다. 전체 해법은 무엇을 가릴지 정의하는 블루프린트와 이를 배치 규모로 적용하는 서버리스 파이프라인이라는 두 부분으로 나뉜다.

3. 주치의 진술서에서 가릴 정보와 유지할 정보 구분

블루프린트를 설계할 때는 무엇이 민감 정보인지, 무엇이 민감 정보가 아닌지, 페이지 어디에 있는지, 어떻게 제거할지를 먼저 정한다. 사례로 제시된 주치의 진술서는 후속 보험 청구 처리 전에 환자 이름, 생년월일, 집 주소, 연락처를 가리는 것이 목표다. 반면 의사 이름, 진료 날짜, 병원 주소와 연락처, 증상 및 의료 기록은 이 사례의 가림 대상에서 제외되며, 이는 해당 업무 맥락에서 설정한 구분이다. 대상 정보는 구조화된 양식 필드뿐 아니라 비정형 손글씨와 문서 여러 위치에 반복해서 나타날 수 있어 한 영역만 탐지해서는 충분하지 않다. 제거 방식은 대상 필드의 경계 상자 좌표를 식별한 뒤 PDF를 PNG로 변환하고, 후처리에서 해당 위치에 검은 상자를 적용하는 방식으로 설명된다.

4. 자연어 지시와 37개 필드로 탐지 범위 구체화

블루프린트는 AWS Management Console, AWS CLI 또는 개발자 SDK로 만들 수 있으며, 콘솔은 샘플 문서에서 스키마를 생성하는 안내 절차도 제공한다. 최종 스키마에는 가림 대상 필드, 데이터 유형, 간단한 자연어 설명, 그리고 inferred 추론 유형을 사용할 경우 날짜 형식 같은 적용 변환을 정의한다. 사례의 전체 스키마는 관련 결과를 묶는 9개 필드 그룹과 37개 필드로 구성되며, 제시된 PatientIdentity 예시는 환자 이름, 성, 생년월일, 의료 기록 번호를 포함한다. 각 예시 필드는 변환 없이 추출하는 explicit 추론 유형을 사용하고, 자연어 지시로 환자의 생년월일을 예약 날짜나 서명 날짜와 구분하거나 서명 영역까지 환자 성을 찾도록 범위를 정한다. 같은 설계 원칙으로 주치의의 인쇄된 이름과 서명을 가림 대상에서 제외하며, 원문은 용도별 블루프린트를 반복 실험으로 조정하고 추가적인 자동 실험은 향후 과제로 남긴다.

5. 페이지 단위 처리와 품질별 평가 설계

배포 시에는 원하는 블루프린트의 Amazon Resource Name인 ARN을 입력 매개변수로 사용해, 같은 배치 파이프라인 기반에서 여러 가림 처리 용도를 지원한다. 파이프라인은 BDA API 호출마다 문서 한 페이지를 보내 생성형 AI가 해석할 맥락을 페이지 단위로 한정하며, BDA는 문자 단위 OCR에 의존하지 않고 페이지 전체의 배치와 라벨, 맥락을 해석한다고 설명된다. 원문은 이를 통해 OCR이 판독하기 어려운 손글씨 환자 이름을 찾고 품질이 낮은 입력의 예외 사례를 더 효과적으로 다룰 수 있다고 주장한다. 성능 평가는 사람이 가림 처리한 정답 문서와 비교해 PII 출현 사례에 대한 정밀도와 재현율을 계산하는 방식이다. 평가 자료는 깨끗한 인쇄 양식, 인쇄 후 팩스 전송, 인쇄 품질이 낮은 팩스, 손글씨 양식, 손글씨를 인쇄하고 재스캔한 문서, 저해상도 100 DPI 스캔의 6개 품질 수준을 포함했다.

6. 표준 출력의 토큰 매칭으로 반복 정보 누락 보완

초기 시험에서 블루프린트는 12개 문서·47페이지 표본의 PII를 적어도 한 번씩 식별했지만, 서술형 본문과 손글씨 의사 기록에서 같은 정보가 반복되는 위치는 간혹 놓쳤다. 이를 보완하기 위해 원문은 맞춤형 추출 결과와 BDA 표준 출력을 결합하는 두 번째 탐지 단계를 도입했으며, 두 출력은 단 한 번의 API 호출에서 함께 반환된다. 맞춤형 출력에는 블루프린트가 탐지한 PII 필드와 경계 상자가 포함되고, 표준 출력에는 전체 추출 내용과 각 단어의 경계 상자가 포함된다. 후처리는 탐지한 PII 값을 정규화된 단어 토큰으로 나눈 뒤 페이지의 표준 출력에서 같은 형태의 단어를 찾아, 기존 영역과 겹치지 않는 새 일치 위치를 최종 가림 좌표에 추가한다. 따라서 양식 필드에서 찾은 이름이 자유 서술 문단이나 손글씨에 다시 나타나는 경우를 보완하면서도, 두 번째 BDA 호출에 따른 지연은 추가하지 않는다.

7. 재현율 개선과 소폭의 정밀도 저하

사람이 가림 처리한 정답과 비교한 12개 문서·47페이지 평가에서 블루프린트 추출만 사용한 방식의 정밀도는 97.0%, 재현율은 89.3%였다. 이 방식은 명시적으로 선언된 필드에서는 높은 정밀도를 보였지만 자유 서술 영역의 PII를 놓쳤으며, 표준 출력과 매칭 로직을 결합하자 정밀도는 96.5%, 재현율은 95.2%로 바뀌었다. 결과적으로 반복 정보의 탐지 범위는 넓어졌지만 일부 과잉 가림으로 정밀도가 소폭 낮아지는 절충이 나타났다. 원문의 예시에서는 블루프린트가 라벨이 있는 양식 필드의 환자 이름을 가리고, 표준 출력의 토큰 매칭이 페이지 아래 서술 문단에 다시 등장한 같은 이름을 추가로 찾아낸다. 원문은 블루프린트 성능을 BDA 신뢰도 점수와 함께 평가하면 용도에 맞게 예외 사례를 사람의 검토로 넘길 수 있다고 설명하며, 수치는 제시된 표본과 업무 사례에 대한 평가 결과로 읽어야 한다.

8. 서버리스 배치 적용 방향과 제공 자료의 한계

원문은 검증된 PII 가림 처리 블루프린트를 배치 문서 처리에 적용하기 위해 BDA, AWS Step Functions, AWS Lambda를 사용하는 서버리스 파이프라인을 소개한다. 블루프린트가 가림 대상의 의미와 범위를 정의하고 공통 파이프라인이 이를 적용하는 구조이므로, 용도에 맞는 블루프린트 ARN을 입력해 같은 기반을 재사용하는 방향이다. 아키텍처 절에서는 주치의 진술서의 실제 운영 가림 처리량이 야간 약 25,000페이지에 이를 수 있다고 언급하며, 이는 앞서 성능을 평가한 47페이지 표본과 구분되는 규모다. 다만 제공된 본문은 가림 작업의 동시성을 극대화하는 논의를 시작한 문장 중간에서 끊겨 있어, 이후의 구체적인 처리 흐름이나 동시성 관리 방식은 확인할 수 없다. 따라서 이 자료에서 정리할 수 있는 내용은 블루프린트 설계, 페이지별 추출과 토큰 매칭, 표본 평가 결과, 서버리스 배치 적용 방향까지이며 완성된 운영 아키텍처의 세부 사항은 제시되지 않았다.

🧾 핵심 주장 / 시사점

  • 가림 처리의 정확성은 PII를 많이 찾는 것뿐 아니라, 환자 정보와 의사 정보처럼 업무상 제거할 대상과 보존할 대상을 명시적으로 구분하는 데 달려 있다.
  • 토큰 매칭은 블루프린트가 이미 찾은 PII의 반복 출현을 보완하는 구조이므로, 최초 탐지 성능과 반복 위치 탐지 성능을 함께 살펴볼 필요가 있다.
  • 재현율 95.2%와 정밀도 96.5%는 개선 효과와 남은 오류 가능성을 함께 보여주며, 12개 문서·47페이지 평가만으로 야간 약 25,000페이지 운영 성능까지 입증된 것은 아니다.

✅ 액션 아이템

  • 환자 정보와 의사 정보의 구분을 기준으로 BDA 블루프린트의 가림 대상과 보존 대상 적합성 검토.
  • 토큰 매칭 적용에 따른 재현율 89.3%→95.2% 개선과 정밀도 97.0%→96.5% 저하를 함께 평가.
  • BDA 신뢰도 점수를 활용한 사람 검토 분기와 야간 약 25,000페이지 처리를 위한 구체적인 운영 구현 확인.

❓ 열린 질문

  • 환자 정보와 의사 정보를 구분하는 BDA 블루프린트의 가림 범위는 다른 문서 처리 용도에서 어떻게 달라져야 하는가?
  • 토큰 매칭으로 재현율이 95.2%로 높아지고 정밀도가 96.5%로 낮아지는 절충은 해당 업무에서 수용 가능한가?
  • 12개 문서·47페이지 평가에서 야간 약 25,000페이지 운영으로 확대할 때 처리 성능과 사람 검토 분기의 적정성을 어떻게 확인할 것인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.