Enhancing industrial safety AI with synthetic data on Amazon SageMaker AI
Quick Summary
Amazon SageMaker AI와 Amazon Rekognition을 활용해 실제 산업 장면에 위험 위치의 사람을 합성하고 자동 라벨링한 결과, YOLO11 nano의 사람 탐지 mAP50이 0.051에서 0.106으로 개선됐다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Amazon SageMaker AI와 Amazon Rekognition을 활용해 실제 산업 장면에 위험 위치의 사람을 합성하고 자동 라벨링한 결과, YOLO11-nano의 사람 탐지 mAP50이 0.051에서 0.106으로 개선됐다.
📌 핵심 요약
- 산업 안전 AI는 위험 상황 이미지의 희소성, 촬영의 안전·윤리 문제, 이미지당 약 3~5달러의 수동 수집·주석 비용, 경량 모델이 필요한 엣지 배포 제약으로 학습 데이터 확보에 어려움을 겪는다.
- 파이프라인은 Amazon SageMaker AI의 Qwen-Image-Edit-2509로 실제 장비 이미지에 사람을 삽입하고, Amazon Rekognition DetectLabels API로 자동 주석을 생성해 기존 장비 주석과 결합한다.
- 실험은 열차가 포함된 OpenImages 실제 학습 이미지 약 3,200장에 합성 이미지 최대 1,000장을 추가하고, 실제 이미지만으로 구성한 테스트 세트에서 YOLO11의 사람·열차 2개 클래스 탐지를 평가했다.
- YOLO11-nano에 합성 이미지 1,000장을 추가했을 때 위험 위치 배치는 사람 mAP50을 0.051에서 0.106으로 높였지만, 배경 배치는 0.046으로 낮췄다. 원문 도입부는 최대 160% 개선을 보고하지만, 제공된 본문은 합성 이미지 250~1,000장 비교 설명 도중 끊겨 해당 최대치의 세부 결과는 확인할 수 없다.
- ml.g5.12xlarge에서 이미지 생성에 약 166초가 걸렸으며, 충분한 VRAM을 갖춘 단일 GPU 또는 가중치 양자화를 통한 이미지당 추론 비용 약 10배 절감 전망은 아직 검증되지 않았다.
🧩 주요 포인트
- 실제 장면 편집과 자동 주석 결합 → 배경·기존 장비 주석을 보존하면서 위험한 촬영과 수동 주석 없이 희소한 사람 탐지 사례를 보강하는 접근이다.
- 위험 위치 배치와 배경 배치의 성능 차이 → 합성 데이터의 효과는 단순한 이미지 수나 장면 변화보다 탐지 과제와 맞는 사람의 위치에 크게 좌우된다.
- 합성 이미지 250~1,000장 비교 결과의 누락과 비용 절감 전망의 미검증 → 최적 합성량, 최대 160% 개선의 조건, 실제 추론 비용 효과는 제공된 자료만으로 확정할 수 없다.
🧠 상세 정리
1. 산업 안전 AI의 데이터 부족과 수집 제약
산업 안전 AI는 컴퓨터 비전과 예측 분석 등을 이용해 작업장의 위험을 발견하고 예방하는 기술이며, 농업·건설·광업·제조업처럼 자율 장비를 사용하는 산업에는 신뢰할 수 있는 사람 탐지 모델이 필요하다. 그러나 작업자가 사각지대에 있거나 어린이가 움직이는 작업 장치 근처에 있는 고위험 상황은 실제 데이터에서 드물고, 이를 촬영하기 위해 의도적으로 재현하는 일도 위험하고 비윤리적이다. 원문은 필요한 학습 이미지가 수천~수백만 장에 이를 수 있지만, 수동 수집과 주석 비용은 이미지당 약 3~5달러이고 주석 작업량도 일반적으로 하루 약 2,000장 수준이라고 설명한다. 트랙터·지게차·철도 차량 등에 장착된 엣지 장치에서는 모델 크기가 제한되므로 경량 구조를 사용해야 하며, 개별 학습 사례의 중요성도 커진다. 이러한 제약이 겹치면서 탐지 실패의 결과가 가장 심각한 상황에서 오히려 학습 신호가 부족해지는 문제가 발생한다.
2. 실제 장면 편집과 자동 라벨링을 결합한 구조
제안된 파이프라인은 사실적인 합성 이미지 생성과 자동 라벨링이라는 두 단계로 구성되며, 수동 주석 없이 학습용 이미지와 라벨을 함께 만드는 것을 목표로 한다. 첫 단계에서는 Amazon SageMaker AI에 배포한 확산 모델 Qwen-Image-Edit-2509가 실제 장비 이미지에 사람을 삽입하면서 원래 배경과 조명, 크기 관계를 유지한다. 두 번째 단계에서는 Amazon Rekognition DetectLabels API가 사람의 경계 상자를 생성하고, 이를 기존 장비 주석과 결합한다. 원문은 장면 전체를 새로 생성하는 대신 실제 이미지를 편집하면 배경의 충실도와 기존 주석의 유효성을 보존하고, 합성 장면과 실제 장면의 분포 차이에서 오는 도메인 격차를 피할 수 있다고 설명한다. 이미지 필터링·크기 조정·프롬프트 조립·라벨 처리까지 자동화 흐름에 포함하며, 완성된 합성 이미지와 주석은 실제 학습 데이터에 추가된다.
3. 생성 모델 배포와 추론 비용의 한계
Qwen-Image-Edit-2509는 NVIDIA A10G GPU 4개와 총 96GB VRAM을 제공하는 ml.g5.12xlarge 인스턴스에 배포됐다. 양자화하지 않은 모델 가중치는 약 60GB이며, 60개 트랜스포머 계층을 GPU 4개에 나누어 배치하기 위한 사용자 지정 장치 매핑이 필요했다. 생성 설정은 추론 단계 25회, CFG scale 4.0, 최소 이미지 치수 512픽셀이며 이미지 한 장을 만드는 데 약 166초가 걸렸다. 원문은 효율적인 추론을 위해 장치 간 통신을 피할 것을 권고하며, 충분한 VRAM을 갖춘 단일 GPU의 예로 ml.p5.4xlarge에서 제공하는 NVIDIA H100을 들거나 가중치 양자화를 대안으로 제시한다. 이러한 하드웨어 사용으로 이미지당 추론 비용이 약 10배 줄어들 것으로 전망하지만, 해당 비용 절감 수치는 아직 측정으로 검증되지 않았다고 명시한다.
4. 위험 위치에 사람을 삽입하는 프롬프트 설계
합성 작업의 바탕으로는 기관차가 있으면서 사람이 없는 실제 학습 이미지를 선택하고, 구조화된 프롬프트로 사실적인 사람 한 명을 추가하도록 지시한다. 성별은 다양성을 위해 무작위화하며, 사람의 위치는 선로 위·열차 위·장비 가장자리에 매달린 곳 등 해당 산업에서 위험성이 있는 상황으로 지정한다. 예시 프롬프트는 열차 차량 높이가 15~20피트라는 크기 기준을 제시하고, 사람의 비율과 원근·조명이 자연스럽게 맞아야 하며 기존 숫자·문자·로고·기호를 바꾸지 않도록 요구한다. 시간대와 주변 환경 조건에 맞는 빛과 분위기를 지정할 수 있지만, 기계 표면의 먼지·때·바랜 도장처럼 자연스러운 질감을 유지하고 과도한 광택이나 채도는 피하도록 한다. 또한 인물과 배경 전체의 선명도, 온전한 신체 형태, 일관된 기하 구조를 요구하는데, 실험에서는 이러한 여러 조건 가운데 과제에 맞는 위험 위치 배치가 후속 탐지 성능에 가장 중요한 요인으로 나타났다.
5. Amazon Rekognition을 통한 자동 주석 처리
생성된 각 이미지는 Amazon Rekognition DetectLabels API로 처리하며, 사람 관련 탐지에는 person, human, man, woman, boy, girl, child, adult, people이라는 단어를 사용한다. 최소 신뢰도 기준은 80%로 설정하고, 탐지된 경계 상자의 중복은 IoU 임계값 > 0.5를 적용한 비최대 억제인 NMS로 제거한다. 처리된 경계 상자는 YOLO 형식으로 변환한 뒤 원본 이미지에 이미 있던 장비 주석과 병합한다. 이렇게 만들어지는 의사 라벨은 사람이 직접 작성한 주석을 대신하는 기계 생성 주석이며, 원문은 엣지 탐지 모델의 학습에 충분한 품질을 유지하면서 수동 작업을 줄인다고 설명한다. 최종적으로 사람 합성 이미지와 자동 주석을 실제 데이터와 함께 사용하므로, 이미지 생성뿐 아니라 학습 데이터 구성까지 연결되는 자동화 방식이다.
6. 공개 데이터 구성과 YOLO11 평가 조건
실험에서는 고객의 산업 장비 데이터를 공개 가능한 형태로 대체하기 위해 OpenImages의 열차 이미지 부분집합을 사용하고, 열차를 중장비의 대리 대상으로 삼았다. 실제 학습 이미지는 약 3,200장이며, 여기에 사람을 삽입한 합성 이미지를 최대 1,000장 추가했다. 테스트 세트는 합성 이미지 없이 실제 OpenImages 이미지로만 구성하고, 적어도 하나의 기관차가 포함되도록 필터링했다. 평가 과제는 사람과 열차의 2개 클래스 탐지이며 클래스 불균형이 심한 조건이고, 엣지 배포가 가능한 탐지 모델 계열의 대표로 YOLO11을 선택했다. 학습은 Amazon SageMaker AI에서 PyTorch 2.1.0을 사용해 이미지 크기 640, 조기 종료 patience 50, 최대 500에포크로 수행했으며, 합성 데이터의 배치 전략·양·모델 용량이라는 세 차원을 평가 대상으로 제시했다.
7. 위험 위치 배치의 효과와 장면 변화의 반례
YOLO11-nano의 배치 전략 비교에서는 각 합성 조건에 이미지 1,000장을 사용했으며, 실제 데이터만 쓴 기준선의 사람 mAP50은 0.051, 재현율은 0.170, 정밀도는 0.338, 사람·열차 통합 mAP50은 0.517이었다. 위험 위치 배치는 사람 mAP50을 0.106으로 약 두 배 높였고, 재현율 0.234, 정밀도 0.409, 통합 mAP50 0.558을 기록했다. 위험 위치에 장면 변화까지 더하면 사람 mAP50은 0.088, 재현율은 0.128, 정밀도는 0.492, 통합 mAP50은 0.547로 나타나 추가 변형이 모든 지표를 함께 개선하지는 않았다. 배경 배치는 사람 mAP50 0.046, 재현율 0.219, 정밀도 0.217, 통합 mAP50 0.527로 사람 mAP50이 기준선보다 낮았고, 배경 배치에 장면 변화를 더한 조건은 각각 0.051, 0.085, 0.421, 0.532였다. 원문은 이 결과를 바탕으로 주변 환경이나 시간대 변화보다 해당 탐지 과제와 관련된 위치에 사람을 배치하는 일이 훨씬 중요하다고 해석하며, 합성 이미지 추가 자체가 성능 향상을 보장하지 않음을 보여준다.
8. 최대 개선 주장과 제공된 결과의 확인 범위
원문 도입부는 수동 주석이나 위험한 촬영 없이 사람 탐지 mAP50이 최대 160% 개선됐다고 보고하며, mAP50은 IoU 기준 0.5에서 측정하는 평균 정밀도 지표라고 설명한다. 다만 제공된 본문에서 상세 수치로 확인되는 주요 결과는 YOLO11-nano의 위험 위치 배치가 사람 mAP50을 0.051에서 0.106으로 높였다는 비교이다. 이어지는 두 번째 핵심 발견의 제목은 최적 합성 데이터 양을 하이퍼파라미터로 다루며, 합성 이미지 수를 250~1,000장으로 바꾸어 성능을 살폈다는 설명을 시작한다. 그러나 해당 문장이 끝나기 전에 자료가 끊겨 합성량별 결과와 최적 수량은 제시되지 않았고, 앞서 평가 대상으로 언급한 모델 용량별 상세 결과도 확인할 수 없다. 따라서 최대 160% 개선은 원문이 보고한 주장으로 보존하되, 그 수치를 낸 구체적 조건이나 최적 합성량을 현재 제공된 표에서 추정해 확정해서는 안 된다.
🧾 핵심 주장 / 시사점
- 위험 위치 배치는 성능을 높이고 배경 배치는 낮췄으므로, 합성 데이터의 가치는 이미지 수뿐 아니라 실제 탐지 대상 상황과의 관련성에 달려 있다.
- 위험 위치에 장면 변화를 추가했을 때 정밀도는 높아졌지만 재현율과 mAP50은 낮아져, 시각적 다양성 확대가 탐지 지표 전반의 개선으로 이어지지는 않았다.
- 실제 이미지로만 테스트한 결과는 합성 증강의 효과를 살펴볼 근거를 제공하지만, 열차 대리 데이터에서 얻은 결과와 누락된 후속 실험만으로 다른 산업의 성능이나 최적 합성량까지 확정할 수는 없다.
✅ 액션 아이템
- 위험 위치 배치를 우선 적용 후보로 삼고, 배경 배치와의 사람 탐지 성능 차이를 검토한다.
- 합성 이미지 250~1,000장 비교의 누락된 결과를 확인해 최적 합성량과 최대 160% 개선의 조건을 검토한다.
- 충분한 VRAM을 갖춘 단일 GPU 또는 가중치 양자화의 이미지당 추론 비용을 측정해 약 10배 절감 전망을 검증한다.
❓ 열린 질문
- 위험 위치 배치에서 확인된 YOLO11-nano의 사람 mAP50 개선은 다른 산업 장면에서도 유지되는가?
- 합성 이미지 250~1,000장 비교에서 최적 합성량은 얼마이며, 최대 160% 개선은 어떤 조건에서 나타났는가?
- 충분한 VRAM을 갖춘 단일 GPU 또는 가중치 양자화를 적용하면 이미지당 추론 비용 약 10배 절감 전망이 실제로 성립하는가?