Articleaws.amazon.com·2026년 8월 20일·0

Build a no-code ML workflow with Snowflake, Amazon SageMaker Canvas and Amazon Quick – Part 1: Setting up your Snowflake environment

Quick Summary

Snowflake에 사기 탐지용 샘플 데이터와 연결 정보를 준비해 Amazon SageMaker Canvas의 모델 구축과 Amazon Quick의 예측 시각화로 이어지는 노코드 머신러닝 흐름의 기반을 마련한다.

Build a no-code ML workflow with Snowflake, Amazon SageMaker Canvas and Amazon Quick – Part 1: Setting up your Snowflake environment 관련 대표 이미지

🖼️ 인포그래픽

Build a no-code ML workflow with Snowflake, Amazon SageMaker Canvas and Amazon Quick – Part 1: Setting up your Snowflake environment 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Build a no-code ML workflow with Snowflake, Amazon SageMaker Canvas and Amazon Quick – Part 1: Setting up your Snowflake environment의 핵심 내용을 4단계로 요약한 인포그래픽
Build a no-code ML workflow with Snowflake, Amazon SageMaker Canvas and Amazon Quick – Part 1: Setting up your Snowflake environment 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Snowflake에 사기 탐지용 샘플 데이터와 연결 정보를 준비해 Amazon SageMaker Canvas의 모델 구축과 Amazon Quick의 예측 시각화로 이어지는 노코드 머신러닝 흐름의 기반을 마련한다.

📌 핵심 요약

  • 이 글은 3부작 중 1부로, AWS 계정과 Snowflake 계정을 전제로 Snowflake 환경을 구성하며, 2부는 Amazon SageMaker Canvas의 데이터 준비와 사기 탐지 모델 구축, 3부는 Amazon Quick의 예측 시각화를 다룬다.
  • 사례의 의료 기관은 Snowflake에 운영 데이터를 축적했지만 데이터 과학 인력 부족과 전문 인력 의존으로 수요 예측, 소비 패턴 분석, 예측 결과 공유에 어려움을 겪었다.
  • 제안된 흐름은 Snowflake 데이터를 Amazon SageMaker Canvas에서 준비하고 학습한 뒤, 배치 예측 결과를 Amazon S3로 출력해 Amazon Quick의 대화형 대시보드에서 시각화한다.
  • 실습에서는 X-SMALL 크기의 HOL_WH 웨어하우스와 FRAUD 데이터베이스, FRAUD.PUBLIC.FRAUD_TABLE 테이블을 만들고 거래 범주·금액·시간대에 따른 사기 판정 규칙을 적용한 샘플 데이터 139538건을 생성한다.
  • 설정 후 전체 행 수, 상위 10개 행, is_fraud별 건수를 확인하고 Snowflake 조직 이름과 계정 이름을 하이픈으로 연결한 조직 계정 이름을 조회해 후속 연결에 사용한다.

🧩 주요 포인트

  1. 전문 인력 의존으로 지연된 예측 분석 → Amazon SageMaker Canvas의 시각적 데이터 준비와 모델 구축으로 업무 사용자의 직접 실험을 지원한다.
  2. Snowflake에서 Amazon S3를 거쳐 Amazon Quick으로 이어지는 예측 활용 → 기존 데이터 저장 기반을 모델 구축과 이해관계자 대상 결과 공유까지 확장한다.
  3. 건의 규칙 기반 샘플 데이터 생성과 is_fraud별 건수 확인 → 후속 사기 탐지 모델 구축에 사용할 데이터와 기본 검증 절차를 마련한다.

🧠 상세 정리

1. 운영 데이터와 예측 활용 사이의 간극

의료, 소매, 생명과학 조직은 Snowflake 같은 클라우드 데이터 웨어하우스에 방대한 운영 데이터를 축적하지만, 이를 의미 있는 예측으로 전환하는 데 어려움을 겪는다. 원문은 전통적인 머신러닝 접근에 전문 팀, 긴 개발 주기, 상당한 엔지니어링 지원이 필요해 데이터를 잘 아는 업무 사용자의 실험이 제한된다고 설명한다. 사례의 의료 기관도 수년간 판매 거래, 제품 이동, 환자 상호작용, 지역별 성과 지표를 확보했으나 이를 예측에 활용할 데이터 과학 역량이 충분하지 않았다. 이 때문에 새로운 예측이나 분석 요청마다 엔지니어링 또는 머신러닝 전문가의 지원이 필요했고, 견고한 데이터 기반이 있어도 업무 팀이 직접 모델을 만들고 반복 개선하기는 어려웠다.

2. 업무 요구와 노코드 접근의 목적

사례의 업무 팀은 여러 제품 범주의 수요를 예측하고 계절별·지역별 소비 패턴을 이해하며, 머신러닝에서 얻은 정보를 비즈니스 인텔리전스 대시보드에서 활용하기를 원했다. 예측을 생성한 이후에도 이해관계자가 결과를 살펴보고 공유할 수 있도록 대화형 시각화가 필요하다는 점이 별도의 요구로 제시된다. 해결 방식은 기존 Snowflake 데이터와 연동하고 익숙한 시각화 도구를 활용하면서, 보안과 거버넌스를 유지하고 전문 인력에 대한 의존을 줄여야 했다. Amazon SageMaker Canvas는 데이터 탐색, 특성 준비, 예측 모델 구축을 시각적으로 수행하게 해 비즈니스 분석가, 제품 책임자, 운영 팀이 이러한 작업에 직접 참여하도록 지원하는 도구로 소개된다.

3. 전체 구성과 3부작의 범위

전체 해법은 기존 데이터 인프라를 활용하면서 Snowflake의 데이터를 Amazon SageMaker Canvas의 머신러닝 기능과 Amazon Quick의 시각화 기능으로 연결하는 방식이다. 1부인 이 글은 AWS 계정과 Snowflake 계정을 사전 조건으로 제시하고, 실제 실습에서는 Snowflake 데이터베이스 구성과 사기 탐지용 샘플 데이터 준비에 집중한다. 이어지는 2부에서는 Amazon SageMaker Canvas를 Snowflake에 연결해 데이터를 준비하고 변환한 다음 사기 탐지 모델을 구축하며, 3부에서는 예측 결과를 대화형 대시보드로 시각화하고 공유한다. 따라서 의료 기관의 수요 예측 요구는 문제의 배경이고, 이 글에서 구체적으로 생성하는 데이터와 후속 모델 구축의 실습 주제는 사기 탐지다.

4. 모델 학습부터 예측 시각화까지의 흐름

Amazon SageMaker Canvas는 Snowflake에 직접 연결하는 시각적 인터페이스를 제공하며, 사용자는 이를 통해 데이터를 준비하고 머신러닝 모델을 구축하며 예측을 생성할 수 있다. 원문은 모델 학습 후 Canvas의 모델 상세 페이지에서 별도 인프라 구성 없이 Amazon SageMaker Endpoint로 배포하고, 엔드포인트가 서비스 중 상태가 되면 Snowflake 거래 데이터에 대한 예측을 생성하는 흐름을 설명한다. Amazon Quick에서 결과를 시각화할 때는 Canvas의 배치 예측을 사용해 예측값이 포함된 데이터셋을 Amazon S3로 출력하는 경로를 제시한다. 이렇게 출력한 결과는 대화형 대시보드로 전달되어 조직의 이해관계자가 살펴볼 수 있으며, 이 전체 흐름은 1부에서 완료하는 작업이 아니라 시리즈가 지향하는 구성이다.

5. 시각적 데이터 준비와 지원하는 분석 유형

원문은 이 구성의 주요 이점으로 코딩 전문성이 없는 사용자의 셀프서비스 모델 구축과 기업 거버넌스를 유지하는 시각적 데이터 준비를 제시한다. 데이터 준비에는 Data Wrangler가 제공하는 300개 이상의 시각적 변환을 활용할 수 있고, 모델 학습은 Amazon SageMaker의 관리형 인프라에서 수행한다고 설명한다. 또한 회귀, 분류, 시계열 예측을 지원하므로 하나의 해법으로 여러 유형의 업무 질문을 다룰 수 있으며, 예측 결과는 대화형 대시보드로 공유할 수 있다. 모델 개발 시간을 수개월에서 수시간으로 줄이는 효과도 장점으로 언급하지만, 본문에는 이 시간 단축을 입증하는 별도의 측정 결과나 사례별 성능 비교가 제시되지는 않는다.

6. Snowflake 웨어하우스와 테이블 구성

실습은 Snowflake 콘솔의 왼쪽 패널에서 더하기 기호를 선택하고 SQL 워크시트를 연 뒤, 제공된 SQL을 붙여 넣어 각 하위 구간을 순서대로 실행하는 방식으로 진행한다. SQL은 accountadmin 역할을 사용해 X-SMALL 크기의 HOL_WH 웨어하우스와 FRAUD 데이터베이스를 생성하고, 해당 데이터베이스 안에 FRAUD.PUBLIC.FRAUD_TABLE 테이블을 구성한다. 테이블에는 거래 식별자와 시각, 카드 번호, 가맹점, 거래 범주와 금액뿐 아니라 이름, 주소, 위치, 직업, 생년월일 등의 필드가 포함된다. 거래 시각에는 시간대가 없는 타임스탬프를, 금액에는 소수점 둘째 자리까지의 숫자 형식을 지정하는 등 열별 자료형을 정의하며, 마지막 is_fraud 열에는 사기 여부를 나타내는 숫자를 저장한다.

7. 샘플 거래 생성과 사기 라벨 규칙

데이터 삽입 SQL은 생성 함수를 사용해 139538개의 샘플 거래를 만들고, 거래 시각과 금액, 가맹점, 거래 범주, 고객 및 위치 관련 값을 무작위 방식으로 채운다. 사기 여부는 거래 범주·금액·시간대와 무작위 조건을 결합해 부여하며, 온라인 쇼핑 또는 온라인 기타 거래의 금액이 700을 초과하거나 여행 거래의 금액이 800을 초과하는 경우 등이 규칙에 포함된다. 금액이 900을 초과하고 거래 시간이 0시부터 4시 사이인 경우, 특정 범주의 중간 금액 거래인 경우, 심야 거래인 경우에도 각각 다른 조건을 적용한다. 최종적으로 조건을 충족하면 is_fraud를 1로, 그렇지 않으면 0으로 기록하므로, 이 실습 데이터는 실제 의료 기관의 거래를 가져온 것이 아니라 SQL로 생성하고 규칙에 따라 라벨을 부여한 샘플이다.

8. 데이터 검증과 후속 연결 정보 확보

쿼리 실행이 끝나면 전체 행 수를 조회하고 상위 10개 행을 살펴보며, is_fraud별 건수를 집계하는 세 가지 검증 쿼리로 데이터 적재 결과를 확인한다. 이 과정은 생성된 데이터의 규모와 행 내용을 확인하고 사기 여부에 따른 건수 분포를 살펴보는 단계이며, 본문에는 모델 학습 결과나 예측 정확도 평가가 포함되어 있지 않다. 이후 Amazon SageMaker Canvas 연결에 필요한 조직 계정 이름을 얻기 위해 현재 Snowflake 조직 이름과 계정 이름을 조회하고, 두 값을 하이픈으로 이어 붙이는 SQL을 실행한다. 1부의 결과물은 Snowflake 데이터베이스, 사기 탐지용 샘플 데이터, 후속 연결 정보이며, 다음 글에서 이 기반을 사용해 시각적 데이터 준비와 사기 탐지 모델 구축을 진행한다.

🧾 핵심 주장 / 시사점

  • 업무 배경은 의료 기관의 수요 예측이지만 구현 예제는 사기 탐지이므로, 비즈니스 요구와 실습 모델의 목적을 구분해서 읽어야 한다.
  • 노코드 모델 구축이 중심이지만 1부의 Snowflake 환경 구성과 샘플 데이터 생성에는 제공된 SQL을 실행하는 과정이 포함된다.
  • 1부는 데이터와 연결 기반을 준비하는 단계로, 모델 성능이나 실제 업무 효과를 검증한 결과까지 제공하지는 않는다.

✅ 액션 아이템

  • Snowflake에 HOL_WH, FRAUD, FRAUD.PUBLIC.FRAUD_TABLE을 구성하고 샘플 데이터 139538건 생성.
  • 전체 행 수, 상위 10개 행, is_fraud별 건수를 확인해 샘플 데이터의 기본 검증 수행.
  • Snowflake 조직 이름과 계정 이름을 하이픈으로 연결한 조직 계정 이름을 확보해 Amazon SageMaker Canvas의 후속 연결 준비.

❓ 열린 질문

  • FRAUD.PUBLIC.FRAUD_TABLE의 전체 행 수는 139538건이며 is_fraud별 건수는 각각 얼마인가?
  • Amazon SageMaker Canvas 연결에 사용할 Snowflake 조직 계정 이름은 무엇인가?
  • Amazon Quick의 대화형 대시보드는 의료 기관의 수요 예측과 소비 패턴 분석에 필요한 결과 공유를 어떻게 지원하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.