Articleaws.amazon.com·2026년 10월 1일·0

Uplifting conversion across the acquisition funnel with personalization using contextual bandits on AWS

Quick Summary

Amazon Payments는 Amazon SageMaker AI 기반 다목적 LinUCB로 고객 획득 퍼널을 개인화했으며, 7주 온라인 A/B 테스트에서 한 고객 집단의 최종 전환율은 높은 한 자릿수 비율로 상대 상승했지만 다른 집단은 개선되지 않아 콘텐츠의 중요성이 드러났다.

Uplifting conversion across the acquisition funnel with personalization using contextual bandits on AWS 관련 대표 이미지

🖼️ 인포그래픽

Uplifting conversion across the acquisition funnel with personalization using contextual bandits on AWS 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Uplifting conversion across the acquisition funnel with personalization using contextual bandits on AWS의 핵심 내용을 4단계로 요약한 인포그래픽
Uplifting conversion across the acquisition funnel with personalization using contextual bandits on AWS 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Amazon Payments는 Amazon SageMaker AI 기반 다목적 LinUCB로 고객 획득 퍼널을 개인화했으며, 7주 온라인 A/B 테스트에서 한 고객 집단의 최종 전환율은 높은 한 자릿수 비율로 상대 상승했지만 다른 집단은 개선되지 않아 콘텐츠의 중요성이 드러났다.

📌 핵심 요약

  • 생성형 AI와 Amazon Bedrock으로 개인화 콘텐츠를 대량 제작할 수 있게 되면서, Amazon Payments는 고객별로 어떤 콘텐츠를 보여줄지 선택하는 문제에 다목적 컨텍스트 멀티암드 밴딧을 적용했다. 7주 온라인 A/B 테스트에서 현재 한 고객 집단은 최종 퍼널 전환율의 높은 한 자릿수 상대 상승을 보였지만, 다른 집단은 기존 경험보다 개선되지 않았으며 저자들은 원인을 모델이 아닌 콘텐츠로 설명한다.
  • Amazon Payments가 선택한 LinUCB는 결제 행동과 거래 구성 등의 맥락 벡터를 이용해 콘텐츠별 예상 보상과 불확실성 보너스를 계산한다. 결정론적 선택으로 판단을 감사하고 재현할 수 있으며, entity_id는 추천을 고객에게 연결하는 용도로만 사용하고 모델 입력에는 포함하지 않는다.
  • 신청 시작·제출·승인에 각각 LinUCB 모델을 두고 점수를 가중합해 전체 퍼널을 동시에 최적화했다. 실제 적용에서는 대략 동일한 가중치를 사용했으며, 시작만 최적화하면 승인에 불리할 수 있고 승인만 최적화하면 드물고 지연되는 결과 때문에 학습 신호가 부족해진다.
  • 탐색 강도를 조절하는 α는 1.0이 합리적인 기본값이며 일반적인 범위는 0.1~2.0이다. 신청 시작과 제출은 즉시 모델에 반영하고, 며칠 늦게 도착하는 승인 결과는 귀속 기간을 적용해 후속 배치 주기까지 보류함으로써 처리 중인 신청이 성과를 낮게 평가하게 되는 편향을 피하며 주간 처리 주기와 맞춘다.
  • 콘텐츠 후보는 사전 검토한 업종별 이미지와 혜택 중심 태그라인의 조합으로 구성하고, 디자인 시스템으로 브랜드 일관성을 유지한다. Amazon SageMaker AI는 학습·배치 처리·버전 관리·모니터링을 지원하며, 공개 저장소는 합성 데이터 실험용 Jupyter 노트북·명령줄 데모·단위 테스트를 제공하지만 제공된 원문은 배치 아키텍처 설명 도중에 끊겨 있다.

🧩 주요 포인트

  1. 고객 맥락과 LinUCB의 불확실성 보너스를 결합 → 수동 세그먼트별로 트래픽을 따로 확보하지 않고 유사한 방문에 학습을 일반화하면서 탐색과 활용을 조절한다.
  2. 신청 시작·제출·승인의 점수를 함께 반영하고 승인 지연을 처리 → 단계 간 상충과 희소한 최종 성과 신호를 고려하는 퍼널 전체 최적화가 가능하다.
  3. 주 실험에서 고객 집단별 성과가 갈리고 저자들이 콘텐츠를 원인으로 지목 → 개인화 성과는 LinUCB뿐 아니라 검토된 이미지·태그라인 후보의 적합성에도 좌우된다.

🧠 상세 정리

1. 콘텐츠 대량 생성 이후의 선택 문제와 실험 결과

생성형 AI는 개인화 콘텐츠를 빠르고 낮은 비용으로 대량 제작할 수 있게 했으며, 이전 글에서는 Amazon Bedrock으로 브랜드 지침과 가드레일을 지키면서 이를 구현하는 방법을 설명했다. 이번 글의 문제의식은 이렇게 늘어난 후보 중 어떤 콘텐츠를 각 고객에게 보여주고, 적절한 선택을 얼마나 빨리 학습할 수 있는가에 있다. Amazon Payments는 제품 획득 퍼널에 Amazon SageMaker AI 기반 다목적 컨텍스트 멀티암드 밴딧을 적용했다. 7주 온라인 A/B 테스트에서 현재 한 고객 집단의 최종 퍼널 전환율은 높은 한 자릿수 비율로 상대 상승했지만, 다른 집단은 기존 경험보다 개선되지 않았다. 저자들은 개선이 없었던 집단의 문제를 모델이 아닌 콘텐츠로 설명하며, 결과가 모든 고객 집단에서 동일하게 나타난다고 주장하지 않는다.

2. 멀티암드 밴딧과 UCB의 탐색·활용 균형

멀티암드 밴딧은 선택지가 많고 트래픽이 제한된 환경에서 고객에게 서비스를 제공하는 동시에 어떤 선택지가 성과를 내는지 학습하는 강화학습 방법이다. 각 콘텐츠 변형을 하나의 선택지인 arm으로 취급하고 실제 트래픽으로 시험하면서, 성과가 좋은 후보에 노출을 늘리되 다른 후보를 계속 탐색할 일부 트래픽을 남긴다. 이 방식은 현재 가장 좋은 후보를 활용하는 것과 아직 확실하지 않은 후보를 탐색하는 것 사이의 균형을 유지하며, 새로운 변형이 추가되어도 실험 종료를 기다리지 않고 학습을 이어간다. 원문은 A/B/n 테스트의 역할도 인정하면서, 생성형 AI로 후보 수가 늘어날수록 밴딧의 역할이 커질 것으로 예상한다. Amazon Payments는 예상 보상에 불확실성 보너스를 더하는 UCB를 선택했으며, 결정론적 선택 규칙 덕분에 각 노출의 판단을 설명하고 재현할 수 있다는 점을 강조한다.

3. 고정 세그먼트에서 고객 맥락 벡터로의 전환

일반적인 밴딧이 전체 고객에게 가장 좋은 후보 하나를 학습한다면, 컨텍스트 밴딧은 방문자의 맥락에 따라 후보 선택을 달리한다. 사람이 정의한 집단마다 별도 밴딧을 운영하는 세그먼트 방식은 집단 구분이 임의적이고 각 집단에 학습용 트래픽이 따로 필요하다는 한계가 있다. 컨텍스트 밴딧은 속성을 수치로 표현한 특징 벡터를 직접 사용하므로, 한 맥락에서 학습한 패턴을 유사한 다른 방문에도 적용할 수 있다. 운영 시스템에서는 고정 세그먼트 대신 결제 행동과 거래 구성 등 행동 신호를 고객의 맥락 벡터로 표현한다. entity_id 같은 불투명한 식별 키는 학습된 추천을 해당 방문자에게 연결하는 데만 사용하며, 모델의 입력으로는 사용하지 않는다고 명시한다.

4. LinUCB의 선형 보상 추정과 맥락별 불확실성

Amazon Payments는 Li et al. (2010)이 제안한 LinUCB를 선택했으며, 더 새로운 알고리즘이 존재함에도 계산 효율성, 결정론적 선택의 감사 가능성, 제한된 초기 데이터로 큰 후보 공간을 다루는 특성을 이유로 든다. 핵심 가정은 각 후보의 기대 보상이 맥락 벡터의 선형 함수라는 것으로, 이를 통해 이전에 보지 못한 방문자에게도 추정을 일반화한다. 각 후보는 보상과 맥락을 누적하는 벡터 b와 관찰한 맥락의 외적을 누적하는 행렬 A를 유지하며, A는 단위행렬에서 시작한다. A의 역행렬과 b로 계산한 θ를 보상 추정에 사용하고, 여기에 α와 맥락별 불확실성을 반영한 보너스를 더해 후보 점수를 구한다. 불확실성 보너스는 해당 후보가 거의 만나지 못한 유형의 방문자에게 크고 자주 관찰한 유형에는 작아지므로, 탐색 강도가 방문자의 맥락에 따라 달라진다.

5. 신청 시작·제출·승인을 함께 최적화하는 방법

고객 여정은 신청 시작, 제출, 승인이라는 세 단계로 구성되며, 각 단계의 성과는 항상 같은 방향으로 움직이지 않는다. 시작을 늘리는 콘텐츠는 폭넓은 고객을 끌어들일 수 있지만 승인은 제안이 신청자에게 실제로 적합한지에 영향을 받으므로, 한 단계만 최적화하면 다른 단계가 악화되는 시소 문제가 생길 수 있다. 반대로 승인만 목표로 삼으면 결과가 드물고 늦게 도착하기 때문에 모델이 활용할 학습 신호가 부족해진다. 이를 해결하기 위해 단계별로 LinUCB 모델 하나씩을 운영하고, 세 모델의 UCB 점수를 선형 가중합한 값이 가장 큰 후보를 선택한다. 실제 적용에서는 대략 동일한 가중치를 사용했으며, 원문은 사업 우선순위나 별도 보정으로 가중치를 정하고 학습이 쌓인 뒤 승인 비중을 높이거나 상충이 큰 경우 파레토 프런티어를 활용할 가능성도 제시한다.

6. 탐색 강도 조정, 지연 보상 처리와 실험 코드

α는 탐색과 활용의 균형을 조절하는 단일 값으로, 높이면 충분히 시험하지 않은 후보를 더 탐색하고 낮추면 현재 유망한 후보의 활용을 늘린다. 원문은 1.0을 합리적인 기본값으로, 0.1~2.0을 일반적인 범위로 제시하며 후보가 많고 이력이 적을 때 높게 시작해 증거가 축적되면 낮추는 접근을 설명한다. 값이 지나치게 높으면 약한 후보에 트래픽을 낭비하고 너무 낮으면 최적이 아닌 후보에 고착될 위험이 있으며, 단일 값이므로 그리드 탐색으로 조정하기 쉽다. 승인 결과는 며칠 뒤에 도착하므로 귀속 기간을 적용하고, 시작과 제출은 즉시 반영하되 승인은 후속 배치 주기까지 보류해 처리 중인 신청으로 인한 하향 편향을 피한다. 이 처리는 주간 처리 주기와 맞물리며, 공개 저장소에는 Amazon SageMaker AI에서 합성 데이터로 방법을 시험할 Jupyter 노트북과 명령줄 데모, 단위 테스트가 포함된다.

7. 검토한 구성 요소의 조합과 브랜드 일관성

밴딧의 성과는 선택할 수 있는 콘텐츠 후보 풀의 품질에 달려 있으므로, 원문은 후보를 늘리는 과정에서도 콘텐츠 검토를 유지하는 방법을 다룬다. 콘텐츠는 업종별 이미지와 혜택 중심 태그라인이라는 두 종류의 구성 요소로 만들어지며, 각 이미지와 태그라인의 짝이 하나의 후보가 되는 데카르트 곱 구조를 사용한다. 적은 수의 구성 요소만으로 많은 페이지 변형을 만들 수 있지만, 조합 수가 늘어날 때 모든 조합을 개별 검토하는 방식은 비현실적이라고 설명한다. 대신 일부 요소는 이해관계자의 요구에 따라 고정하고, 각 구성 요소를 먼저 검토함으로써 전체 조합 공간에 대한 통제를 확보하는 접근을 제시한다. 승인된 색상, 레이아웃, 컴포넌트, 패턴을 포함한 디자인 시스템에 콘텐츠를 맞추면 변형의 시각적 일관성과 브랜드 적합성을 구조적으로 유지할 수 있다는 주장이다.

8. 생성형 AI를 통한 후보 확장과 AWS 배포 범위

초기 배포에서는 생성형 AI 도구가 제작을 지원한 경우에도 구성 요소를 세밀한 사람의 검토 아래 선별했다. 저자들은 앞으로 텍스트, 이미지, 레이아웃의 구성 요소 풀을 크게 늘려 밴딧이 선택할 수 있는 공간을 확장할 가능성이 있다고 본다. 생성형 AI가 후보 집합을 넓히고 밴딧이 방문자별로 성과가 좋은 조합을 찾아내는 과정이 서로를 강화한다는 것이 원문의 전망이다. AWS 배포 설명에서는 Amazon SageMaker AI를 전체 파이프라인의 핵심 서비스로 소개하며, 모델 학습, 배치 처리, 버전 관리, 모니터링을 통합적으로 지원한다고 설명한다. 배치 아키텍처를 채택했고 그 이유가 두 가지라고 밝히지만, 제공된 원문은 첫 번째 이유를 설명하는 도중에 끊겨 있어 구체적인 이유 전체와 이후 배포 구조는 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • 생성형 AI로 콘텐츠 제작 비용이 낮아질수록 개인화의 중요한 과제는 후보 생성에서 고객별 선택과 학습 속도로 이동한다.
  • 퍼널 단계별 목표의 상충과 승인 지연은 서로 다른 문제이며, 다목적 점수 결합과 지연 보상 처리를 함께 적용해야 두 제약을 모두 다룰 수 있다.
  • 한 고객 집단의 상대 전환율 상승을 전체 집단의 성공으로 일반화할 수 없으며, 저자들이 콘텐츠를 원인으로 지목한 결과는 후보 풀의 적합성도 모델과 함께 평가해야 함을 보여준다.

✅ 액션 아이템

  • 7주 온라인 A/B 테스트의 고객 집단별 결과를 구분해 해석하고, 개선되지 않은 집단은 이미지·태그라인 후보의 적합성을 검토한다.
  • 신청 시작·제출·승인의 단계 간 상충과 승인 지연을 함께 고려해 다목적 LinUCB의 가중치와 보상 반영 시점을 검토한다.
  • LinUCB의 α=1.0과 0.1~2.0 범위를 출발점으로, 후보 수와 학습 이력에 따른 탐색 강도 조정을 검토한다.

❓ 열린 질문

  • 7주 온라인 A/B 테스트에서 개선되지 않은 고객 집단의 콘텐츠는 어떤 점에서 적합성이 부족했는가?
  • 신청 시작·제출·승인에 대략 동일한 가중치를 적용한 방식은 가중치를 달리했을 때와 비교해 최종 전환율에 어떤 차이를 만드는가?
  • LinUCB의 α를 0.1~2.0 범위에서 조정할 때 후보 수와 학습 이력에 따른 탐색·활용 균형은 어떻게 달라지는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.