Articleaws.amazon.com·2026년 9월 21일·0

Run Positron on Amazon SageMaker AI for data science workflows

Quick Summary

Positron은 Amazon SageMaker AI의 단일 Space에서 권한 기반 데이터 접근부터 R·Python 분석, 모델 배포, Shiny 애플리케이션과 Quarto 보고서까지 연결하며, 합성 대출 데이터 실습으로 이 흐름을 시연했다.

Run Positron on Amazon SageMaker AI for data science workflows 관련 대표 이미지

🖼️ 인포그래픽

Run Positron on Amazon SageMaker AI for data science workflows 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Run Positron on Amazon SageMaker AI for data science workflows의 핵심 내용을 4단계로 요약한 인포그래픽
Run Positron on Amazon SageMaker AI for data science workflows 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Positron은 Amazon SageMaker AI의 단일 Space에서 권한 기반 데이터 접근부터 R·Python 분석, 모델 배포, Shiny 애플리케이션과 Quarto 보고서까지 연결하며, 합성 대출 데이터 실습으로 이 흐름을 시연했다.

📌 핵심 요약

  • Positron은 Amazon SageMaker Studio의 사용자 지정 이미지로 실행되며, Space 실행 역할의 권한으로 Amazon Athena, AWS Glue Data Catalog, Amazon S3에 접근한다. Posit Assistant는 선택적으로 Amazon Bedrock을 사용해 사용자의 AWS 계정과 AWS 리전에서 AI 코딩 지원을 제공한다.
  • 합성 대출 50,000건을 분석한 결과 소득 누락 1,500건과 채무불이행 1,015건이 확인됐으며, 전체 채무불이행률은 2.03%였다. R에서 파생 변수를 검증하고 불완전한 기록을 제외해 모델링·점수 산출 대상 48,500건을 남겼다.
  • Python의 XGBoost 분류기는 40,000행과 특성 3개로 학습했으며, 홀드아웃 평가 AUC는 0.834, 최고 위험 10분위의 관측 채무불이행률은 12.3%였다. 48,500건의 점수 결과를 Athena에 등록하고 실시간 엔드포인트의 InService 상태와 호출 성공을 확인했다.
  • Shiny for Python은 학습에 사용한 특성 정의를 적용해 엔드포인트를 호출했고, Quarto는 같은 프로젝트에서 데이터 출처부터 분석·배포 결과까지 재현 가능한 보고서로 연결했다. Posit Assistant의 기록된 세션 비용 추정치는 $6.319였으며, AWS 청구서나 일반적인 비용 기준이 아니다.
  • 실습은 합성 데이터와 단일 홀드아웃 분할에 기반해 공정성, 보정, 대출 적합성, 운영 지연시간·부하·모니터링·규제 준수를 입증하지 않았다. 운영 도입에는 Posit 미리보기 약관·라이선스·이미지 버전, 지원 AWS 리전·모델, 네트워크·최소 권한·운영 책임 검증이 필요하며, 실습 후에는 엔드포인트, 엔드포인트 구성, 모델 순으로 삭제해 지속 과금을 방지해야 한다.

🧩 주요 포인트

  1. Space 실행 역할과 사용자 지정 이미지에 기반한 통합 → 데이터 과학자는 한 환경에서 작업하고, 관리자는 이미지·권한·라이선스·운영 구성을 책임지는 역할 분리가 필요하다.
  2. R의 특성 검증을 Python 학습, Shiny for Python 추론, Quarto 기록으로 연결 → 분석부터 활용·보고까지 같은 프로젝트에서 근거와 결과를 이어갈 수 있다.
  3. AUC 0.834와 $6.319는 한 번의 기록된 실행에서 나온 결과 → 모델 성능과 비용의 일반화에는 한계가 있으며, 운영 적합성과 비용은 별도 검증 대상으로 남는다.

🧠 상세 정리

1. 단일 Space로 연결하는 데이터 과학 작업

데이터 과학 팀은 통제된 데이터 접근, R 분석, Python 모델 개발, 배포, 애플리케이션 개발과 보고를 위해 여러 도구를 오가는 경우가 많으며, 이 글은 Posit의 데이터 과학 IDE인 Positron을 Amazon SageMaker AI에서 실행해 해당 흐름을 연결한다. Positron은 Space 실행 역할 아래에서 동작하므로 역할에 허용된 Amazon Athena, AWS Glue Data Catalog, Amazon S3에 별도 키를 저장하거나 교체하지 않고 접근할 수 있다. 사용자는 필요한 인스턴스 크기로 Space를 시작할 수 있고, 팀은 SageMaker AI 학습 계획으로 예정된 학습을 위한 용량을 예약할 수 있다. 독립 프로젝트를 위해 여러 Space를 동시에 실행하거나 공유 Space의 동일한 Positron 애플리케이션에서 협업할 수도 있다. 실습 환경에서는 프로젝트 탐색기, 편집기, R·Python 세션, 변수 창, 그래프, 터미널과 애플리케이션 미리보기가 하나의 브라우저 환경에 제공됐다.

2. 실행 전제와 관리자·사용자 역할

Posit은 Amazon SageMaker Distribution 이미지를 기반으로 하는 Positron 컨테이너 이미지 정의를 제공하며, 관리자는 이를 빌드해 Studio 도메인과 같은 AWS 리전의 비공개 Amazon ECR 저장소에 올린다. 이어 SageMaker AI 이미지와 버전을 등록하고 JupyterLab 앱 이미지 구성을 만든 뒤, 라이선스와 실행 역할 권한을 확인해 이미지를 도메인에 연결한다. 실습에는 Posit 라이선스 부여와 이미지 정의 접근권, Amazon ECR 및 Studio 사용자 지정 이미지 관리 권한, Athena·Glue 접근 역할, Amazon S3 원본 위치와 Athena 쿼리 결과 위치가 필요하다. 제시된 환경은 ml.t3.xlarge 이상을 요구하며, Posit Assistant에 Amazon Bedrock을 사용할 때는 Studio 도메인과 같은 리전의 모델 접근권도 필요하다. 데이터 과학자는 준비된 Space에서 Positron을 열어 R, Python, Quarto, Posit Database Drivers와 선택적인 Posit Assistant를 사용한다. Posit은 소프트웨어 이미지와 제품 지원을, 고객은 신원·권한·라이선스·네트워크·로깅·이미지 업데이트와 승인된 AWS 서비스를, AWS는 관리형 클라우드 서비스를 담당한다.

3. Posit Assistant의 데이터 탐색과 비용 기록

Posit Assistant는 같은 Space에서 AWS Glue Data Catalog의 credit_risk_blog.loan_tape_source를 찾아 읽기 전용 Amazon Athena 쿼리를 준비했다. 이 쿼리는 6개 필드의 표본 5행을 반환했으며, 2.18 MiB를 스캔하고 1초 미만에 완료됐다. Amazon Bedrock을 모델 제공자로 선택하면 환경의 AWS 자격 증명과 설정된 리전을 사용할 수 있어, 해당 인증이 정상적으로 해결되는 경우 별도의 모델 제공자 API 키가 필요하지 않다. 원문에 따르면 고객 콘텐츠는 암호화되고 기반 모델 개선에 사용되거나 모델 제공자와 공유되지 않으며, AWS PrivateLink로 비공개 연결을 구성할 수 있다. 기록된 세션 정보에는 총 6,657,942토큰, 캐시 읽기 6,118,411토큰, 캐시 쓰기 462,905토큰, 비용 추정치 $6.319와 캐시 효율 92.5%가 표시됐다. 이 수치는 해당 세션과 Assistant의 추정에 한정되며 AWS 청구서나 일반 비용 벤치마크가 아니고, 캐시 동작과 가격은 선택한 모델 및 제공자에 따라 달라진다.

4. Athena 프로파일링과 R 특성 검증

실습은 Amazon S3에 저장하고 AWS Glue Data Catalog에 등록한 합성 대출 포트폴리오 50,000건을 대상으로 하며, 실제 운영 대출 시스템을 나타내지 않는다. 모델 개발에 앞서 Athena 집계 쿼리로 행 수, 식별자 유일성, 결측값, 수치 범위와 목표 변수의 유효성을 살폈으며, 자료에는 Assistant의 프로파일링 명령 실행 전 승인 단계도 제시된다. 분석 결과 대출 50,000건 중 소득이 누락된 기록은 1,500건, 채무불이행은 1,015건으로 전체 채무불이행률은 2.03%였다. 이어 전체 테이블을 활성 R 세션으로 불러와 Data Explorer에서 확인하고, 부채 대비 소득 비율과 로그 소득 특성을 생성했다. R의 Plots 창에서는 부채 대비 소득 비율 분포를 확인했으며, 불완전한 기록 1,500건을 제외한 48,500건을 모델링과 점수 산출 대상으로 남겼다.

5. Python 학습과 관리형 실시간 배포

R에서 검증한 특성 정의를 Python으로 옮긴 뒤, 40,000행과 모델 특성 3개로 구성된 행렬을 사용해 XGBoost 분류기를 학습했다. 홀드아웃 평가에서는 AUC 0.834가 나왔고, 최고 위험 10분위의 관측 채무불이행률은 12.3%로 나타났으며, 원문은 위험 분위별 관측 결과를 함께 제시한다. 워크플로는 대출 48,500건에 대한 예측 확률과 위험 10분위 값을 Parquet로 저장하고, Athena의 credit_risk_blog.scored_loans 테이블로 등록했다. 이어 SageMaker AI 모델, 엔드포인트 구성과 실시간 엔드포인트를 생성해 분석 결과를 관리형 추론 서비스로 연결했다. 엔드포인트는 InService 상태에 도달했고 합성 신청자 입력을 사용한 호출에도 성공했지만, 이 기록은 한 번의 실습에서 학습·점수 저장·배포가 연결됐음을 보여주는 범위에 해당한다.

6. Shiny 추론과 Quarto 재현 보고

Shiny for Python 애플리케이션은 합성 신청자 정보를 입력받아 학습 시 사용한 특성 정의를 적용하고, 배포된 SageMaker AI 엔드포인트에서 반환한 채무불이행 확률을 표시했다. 소스 코드와 실행 중인 애플리케이션은 같은 Positron 프로젝트에 유지됐으며, 애플리케이션은 Amazon SageMaker Studio 애플리케이션 프록시 뒤에서 실행돼 해당 Space에 인증된 사용자만 접근할 수 있었다. 엔드포인트 호출에는 저장된 키 대신 Space 실행 역할을 사용했고, 호출 권한은 해당 엔드포인트 ARN에 대한 sagemaker:InvokeEndpoint로 제한됐다. 마지막으로 Quarto 보고서는 Athena 원본, 데이터 품질 발견 사항, R 검증, Python 모델, 점수 결과, SageMaker AI 엔드포인트와 Shiny 애플리케이션을 연결했다. 보고서를 프로젝트에서 직접 생성함으로써 실습의 근거와 결과를 하나의 재현 가능한 문서에 보존했다.

7. 기록된 실행이 입증한 범위와 한계

기록된 실행은 단일 Positron Space에서 권한에 따른 데이터 탐색·표본 조회·프로파일링, R과 Python을 오가는 분석, 모델 평가, 관리형 배포와 연결된 결과물 생성이 가능함을 보여줬다. 그러나 데이터와 신청자 입력이 모두 합성이므로 모델 공정성, 확률 보정, 대출 업무 적합성, 운영 지연시간, 부하 동작, 모니터링 또는 규제 준수를 입증한 것은 아니다. AUC 0.834와 위험 분위별 결과는 한 번의 홀드아웃 분할에서 나왔으며, 낮은 위험 분위들의 관측 채무불이행률은 엄격하게 단조적인 패턴을 보이지 않았다. 따라서 제시된 스크린샷과 측정치는 해당 실행의 증거로 해석해야 하며 일반적인 성능이나 비용 벤치마크로 제시해서는 안 된다. 운영 도입 전에는 Posit 미리보기 약관, 라이선스 부여, 이미지 버전, 지원 AWS 리전과 모델 가용성을 검증하고, 네트워크 설계, 최소 권한, 비밀정보 처리, 로깅, 이미지 패치와 운영 책임도 확인해야 한다.

8. 실습 자원 정리와 삭제 순서

원문은 실습에서 만든 자원으로 지속적인 요금이 발생하지 않도록 사용 후 삭제할 것을 안내하며, 실시간 엔드포인트가 엔드포인트 구성과 모델에 의존한다는 점을 삭제 순서의 근거로 제시한다. 먼저 SageMaker AI 콘솔의 추론 엔드포인트 목록에서 실시간 엔드포인트를 삭제하고, 다음으로 엔드포인트 구성을, 마지막으로 모델을 삭제하는 순서다. 각 단계는 콘솔 외에도 aws sagemaker delete-endpoint, delete-endpoint-config, delete-model 명령으로 수행할 수 있도록 예시가 제공된다. 이어 Amazon S3의 쿼리 출력 위치에서 객체를 삭제하고 Athena 쿼리 편집기에서 DROP TABLE IF EXISTS로 해당 테이블을 제거하도록 안내한다. 제공된 본문은 이 정리 안내 이후 일부 문구가 잘린 상태이므로, 확인 가능한 삭제 대상과 순서는 엔드포인트·구성·모델 및 쿼리 출력 객체·Athena 테이블까지다.

🧾 핵심 주장 / 시사점

  • 이 사례의 핵심은 개별 도구의 성능보다 권한 기반 데이터 접근, 언어 간 분석, 배포와 보고가 하나의 Positron 프로젝트에서 이어진다는 점이다.
  • Space 실행 역할과 Amazon Bedrock의 환경 자격 증명 활용은 별도 키 관리 필요를 줄이지만, 권한·네트워크·이미지 관리 등 고객의 운영 책임은 계속 남는다.
  • 합성 데이터에서 확인한 모델 지표와 세션 비용은 실행 가능성을 설명하는 근거이며, 실제 대출 업무의 적합성이나 일반적인 운영 비용을 입증하는 근거로 확대할 수 없다.

✅ 액션 아이템

  • Positron 운영 도입 전 Posit 미리보기 약관·라이선스·이미지 버전과 지원 AWS 리전·모델, 네트워크·최소 권한·운영 책임을 검증한다.
  • AUC 0.834와 $6.319를 단일 실행 결과로 한정해 해석하고, 공정성·보정·대출 적합성과 운영 성능·비용을 별도 검증한다.
  • 실습 종료 후 엔드포인트, 엔드포인트 구성, 모델 순으로 삭제해 지속 과금을 방지한다.

❓ 열린 질문

  • Positron 도입 환경은 Posit 미리보기 약관·라이선스·이미지 버전과 지원 AWS 리전·모델 조건을 충족하는가?
  • 합성 데이터와 단일 홀드아웃 분할에서 얻은 AUC 0.834 외에 공정성·보정·대출 적합성과 운영 성능을 어떻게 검증할 것인가?
  • Posit Assistant의 $6.319 추정치가 일반적인 비용 기준이 아니라면, 실제 운영 환경의 비용은 어떻게 검증할 것인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.