Why Spotify Is Not Using Bayesian A/B Testing

Quick Summary

Spotify는 베이지안 A/B 테스트의 보장이 사전분포와 중단 규칙에 따라 달라지고 기존 빈도주의 도구보다 일괄적으로 우월하지 않다는 이유로, 현재 베이지안 추론을 추가할 필요가 없다고 본다.

Why Spotify Is Not Using Bayesian A/B Testing 관련 대표 이미지

🖼️ 인포그래픽

Why Spotify Is Not Using Bayesian A/B Testing 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Why Spotify Is Not Using Bayesian A/B Testing의 핵심 내용을 4단계로 요약한 인포그래픽
Why Spotify Is Not Using Bayesian A/B Testing 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Spotify는 베이지안 A/B 테스트의 보장이 사전분포와 중단 규칙에 따라 달라지고 기존 빈도주의 도구보다 일괄적으로 우월하지 않다는 이유로, 현재 베이지안 추론을 추가할 필요가 없다고 본다.

📌 핵심 요약

  • 여러 상용 실험 플랫폼이 베이지안 모드를 제공하지만, Spotify는 베이지안 A/B 테스트가 더 유연하고 해석하기 쉬우며 순차 검정과 다중 검정 문제를 자연스럽게 해결한다는 주장이 지나치게 단순화되어 있다고 지적한다.
  • 베이지안 A/B 테스트는 중단 규칙·사전분포·우도에 따라 서로 다른 보장을 제공하는 구성들의 집합이다. 실험 프로그램은 효과 없는 기능의 출시 제한, 효과 추정의 정밀도, 비용 함수 최소화 등 목표와 제약을 먼저 정해야 한다.
  • 평탄 사전분포와 사후확률 임계값에 따른 중단은 빈도주의의 반복적인 중간 확인과 같은 거짓 양성률 문제를 재현한다. 우도 원리는 중단 시점과 무관한 사후분포의 유효성을 보장하지만, 거짓 양성률 통제에는 베이즈 요인 기반 중단 같은 별도 구성이 필요하다.
  • 여러 지표에 걸친 거짓 발견률 통제에는 베이즈 요인 기반 중단과 잘 보정된 경험적 베이즈 사전분포가 필요하다. 과거 실험의 무효과 비율을 나타내는 점질량 성분이 다중성 보정을 흡수하며, 이 보장은 과거 자료의 품질과 보정 상태에 의존한다.
  • 정보성 사전분포는 효과 추정치를 축소해 승자의 저주를 완화하지만 평탄 사전분포는 그렇지 않다. 시뮬레이션에서 잘 보정된 과거 사전분포는 가장 낮은 추정 오차를 보였으나, 잘못 추정된 사전분포는 집단 순차 검정(GST)보다 추정 정확도와 탐지 성능을 악화시켰고, 이상적인 사전분포도 GST 대비 검정력 우위를 보이지 않았다.

🧩 주요 포인트

  1. 동일한 베이지안 방식 안에서도 보장이 달라짐 → 추론 체계의 이름보다 실험 프로그램의 목표와 통계 구성의 적합성이 선택 기준이 됨.
  2. 사후분포의 유효성과 거짓 양성률·거짓 발견률 통제는 별개임 → 중간 확인과 여러 지표 사용에 대한 보장은 중단 규칙과 사전분포를 구체적으로 따져야 함.
  3. 경험적 베이즈의 추정 이점은 과거 자료의 보정 품질에 의존함 → 승리한 실험만 포함하거나 서로 다른 프로그램을 섞으면 이점이 손실로 바뀔 수 있음.

🧠 상세 정리

1. 베이지안 A/B 테스트 확산과 Spotify의 문제의식

GrowthBook, LaunchDarkly, PostHog, Amplitude Experiment, Optimizely, VWO, Statsig, Eppo 등 여러 상용 실험 플랫폼은 베이지안 A/B 테스트에 대한 관심이 커지면서 베이지안 모드를 추가했다. 이를 지지하는 논의는 베이지안 방식이 현대적이고 유연하며 빈도주의 통계보다 해석하기 쉽고, 다중 검정과 순차 검정의 복잡성도 자연스럽게 해결한다고 주장한다. Spotify는 이런 설명이 구체적인 조건을 생략하면서 빈도주의에서 결과를 반복 확인하는 것과 다를 바 없는 잘못된 추론 관행을 낳을 수 있다고 반박한다. 글의 바탕이 된 연구는 베이지안과 빈도주의 체계가 대중적인 논쟁에서 묘사되는 것보다 훨씬 가깝다고 설명한다. Spotify가 현재 기존 빈도주의 도구에 베이지안 추론을 추가할 필요가 없다고 보는 이유도 이러한 구성별 복잡성과 두 체계의 중첩에 있다.

2. 추론 방식보다 실험 프로그램의 목표가 먼저

기업이 베이지안 A/B 테스트 도입을 고민하는 상황은 보통 시간에 걸쳐 여러 실험을 수행하는 실험 프로그램을 시작하거나 개선할 때다. 그러나 베이지안 A/B 테스트는 하나의 고정된 방법이 아니라 중단 규칙, 사전분포, 우도로 정의되는 여러 구성의 집합이므로, 이름만으로 적합성을 판단할 수 없다. 원문은 효과 없는 기능의 출시 수를 제한할 것인지, 효과를 일정한 정밀도로 추정할 것인지, 장기적으로 특정 비용 함수를 최소화할 것인지부터 정해야 한다고 제안한다. 적절한 통계 구성은 이렇게 정한 목표와 실험 프로그램의 제약에 따라 달라지며, 특정 목표와 특정 구성의 조합에서 성립하는 주장을 베이지안 전체의 속성으로 일반화하면 혼란이 생긴다. 실제로 베이지안 체계에는 최신 순차 방법부터 잘못된 빈도주의 관행과 수치적으로 같은 결과를 내는 절차까지 함께 포함된다.

3. 오류율과 사후분포의 유효성은 서로 다른 보장

원문은 거짓 양성과 거짓 음성 같은 오류가 빈도주의자에게만 의미 있는 개념이 아니라고 강조한다. 어떤 추론 철학을 사용하더라도 실험 프로그램은 시간이 지나면서 이런 오류를 만들어내므로, 중요한 것은 오류율 통제가 프로그램의 목표인지와 선택한 구성이 이를 통제하는 매개변수를 갖추었는지다. 베이지안 방식에서 중간 확인에 따른 거짓 양성률을 신경 쓰지 않아도 된다는 주장은 흔히 우도 원리를 근거로 제시된다. 우도 원리는 데이터를 언제, 왜 수집 중단했는지와 관계없이 사후분포가 유효한 믿음의 갱신이라는 점을 보장하지만, 그 보장의 범위는 제한적이다. 오류율 통제, 추정 정밀도, 의사결정 이론상의 성능은 여전히 사전분포와 중단 규칙에 의존하며, 일관된 사후분포 자체만으로 이 목표들이 충족되지는 않는다.

4. 중간 확인 문제를 해결하는 구성과 해결하지 못하는 구성

베이지안 A/B 테스트에는 중간 확인에 대한 보정이 필요 없다는 말은 거짓 양성률 통제를 목표로 삼지 않는다는 뜻일 수도 있고, 그 비율을 통제하는 특정 구성을 사용한다는 뜻일 수도 있다. 두 주장은 구별되어야 하며, 대부분의 플랫폼에서 기본값으로 제공하는 평탄 사전분포와 사후확률 임계값 기반 중단은 빈도주의의 반복적인 중간 확인에서 나타나는 거짓 양성률 문제를 재현한다. 반면 베이즈 요인 기반 중단은 처리 효과의 증거를 귀무가설과 비교하며, 귀무가설 아래에서의 마팅게일 성질을 통해 중간 확인에도 거짓 양성률을 통제한다. 이 구성에서는 우도 원리와 오류율 제한을 동시에 얻을 수 있고, 원문은 여러 일반적인 비용 함수에서도 최적 중단 규칙이 베이즈 요인 기반 중단으로 도출된다고 설명한다. 다만 저자들은 이 중단 방식을 제공하는 플랫폼을 알고 있지 않다고 밝히므로, 베이지안 모드의 존재만으로 해당 보장을 기대할 수는 없다.

5. 여러 지표의 자동 처리가 의미하는 보장의 범위

베이지안 검정이 여러 지표를 자동으로 처리한다는 주장은 어떤 오류율을 어떤 구성으로 통제하는지 생략한다. 원문이 설명하는 보장은 많은 독자가 예상할 거짓 양성률이 아니라 거짓 발견률이며, 이를 얻으려면 베이즈 요인 기반 중단과 실험 프로그램의 과거 결과에서 추정한 잘 보정된 경험적 베이즈 사전분포가 필요하다. 이 사전분포에는 과거 지표 관측 중 효과가 없는 비율을 나타내는 점질량 성분이 포함되어야 하고, 이 비율이 다중성 보정을 흡수한다. 따라서 명시적인 지표 수 보정이 보이지 않는다고 해서 보정 자체가 없는 것이 아니라, 더 정교하고 복잡한 형태로 구성 안에 들어가 있는 것이다. 사전분포가 잘 보정되면 여러 지표에 걸친 거짓 발견률을 통제할 수 있지만, 보정이 부실하면 거짓 양성률이 제한되지 않는다고 원문은 경고한다.

6. 경험적 베이즈 사전분포를 뒷받침하는 자료의 조건

경험적 베이즈 사전분포의 보장은 과거 실험 결과를 보관하고 있다는 사실만으로 확보되지 않는다. 원문은 과거 결과 자료를 유지하면서 서로 이질적인 프로그램이나 지표를 부적절하게 합치지 않고, 감지하지 못한 분포 변화와 승리한 결과에 치우친 자료를 피해야 한다고 설명한다. 이는 과거 자료에서 얻은 사전분포가 현재 실험과 여러 지표에 적절히 적용될 수 있어야 한다는 요구이며, 조건이 무너지면 처음 요구했던 통계적 보장도 얻을 수 없다. 시뮬레이션에서는 이미 승리한 실험만 포함한 자료와 서로 다른 프로그램을 합친 자료라는 두 가지 흔한 사전분포 추정 실패 사례를 시험했고, 둘 다 추정 정확도를 떨어뜨렸다. 따라서 경험적 베이즈의 활용 가능성은 추론 방식의 명칭보다 과거 자료의 대표성, 적절한 결합 범위, 보정 상태를 얼마나 유지할 수 있는지에 달려 있다.

7. 승자의 저주를 줄이는 핵심은 정보성 사전분포

베이지안 방식이 승자의 저주를 해결한다는 주장은 원문에서 상대적으로 문제가 적은 주장으로 평가되지만, 정보성 사전분포를 사용한다는 조건이 붙는다. 정보성 사전분포는 효과 추정치를 사전평균 쪽으로 축소하므로, 합리적인 사전분포를 사용하면 출시된 기능의 효과 추정치가 평탄 사전분포나 빈도주의 점추정치보다 덜 부풀려진다. 반면 플랫폼의 기본값인 평탄 사전분포는 축소를 제공하지 않고 사후평균이 최대우도추정치와 같기 때문에, 승자의 저주가 빈도주의 경우만큼 심하게 남는다. 잘 보정된 경험적 베이즈 사전분포는 실험 프로그램의 효과 크기 분포에 맞춰 축소의 목표와 정도를 조정한다는 추가 이점이 있다. 그러나 교정의 정도는 사전분포의 품질에 전적으로 의존하므로, 베이지안 방식을 사용한다는 사실만으로 효과 추정의 과장을 해결했다고 판단할 수 없다.

8. 시뮬레이션의 이점과 한계, 제공된 원문의 범위

원문의 시뮬레이션에서는 잘 보정된 과거 사전분포가 시험한 모든 구성 중 가장 낮은 추정 오차를 보였으며, 이는 정보성 사전분포의 추정 정확도 이점을 뒷받침한다. 그러나 잘못 지정된 사전분포는 단순히 사전분포가 없는 수준에 그치지 않고, 기준으로 삼은 집단 순차 검정(GST)보다 추정 정밀도와 탐지 성능을 악화시켰다. 실험 프로그램에 가장 적합한 이상적인 과거 사전분포를 사용한 경우에도 GST보다 높은 검정력을 보이지 않았으므로, 추정 정확도의 개선과 검정력의 개선은 구분해야 한다. 이러한 결과는 베이지안과 빈도주의 중 하나를 일괄적으로 우월하다고 고르기보다, 원하는 보장과 실제 구성의 성능을 비교해야 한다는 원문의 문제의식을 지지한다. 다만 제공된 본문은 승자의 저주에 관한 정리 문장 도중에 끊기므로, 앞부분에서 예고한 의사결정 이론과 두 체계의 등가성에 대한 후속 상세 논증까지 확인할 수는 없다.

🧾 핵심 주장 / 시사점

  • 베이지안 모드의 도입 여부보다 중단 규칙·사전분포·우도가 실험 프로그램의 목표에 어떤 보장을 제공하는지가 더 직접적인 선택 기준이다.
  • 여러 지표의 처리가 자동으로 보이더라도, 그 보장을 가능하게 하는 다중성 보정과 과거 자료 관리의 복잡성은 구성 내부에 남아 있다.
  • 잘 보정된 사전분포의 추정 정확도 이점은 검정력 우위와 동일하지 않으며, 잘못된 사전분포는 기존 GST보다 성능을 떨어뜨릴 수 있다.

✅ 액션 아이템

  • 실험 프로그램의 목표와 제약을 먼저 정하고, 효과 없는 기능의 출시 제한·효과 추정의 정밀도·비용 함수 최소화 중 필요한 보장을 기준으로 통계 구성 검토.
  • 중간 확인과 여러 지표를 사용하는 경우, 베이즈 요인 기반 중단 및 경험적 베이즈 사전분포가 거짓 양성률·거짓 발견률 통제 조건을 충족하는지 확인.
  • 승자의 저주 완화를 위한 사전분포의 보정 품질과 과거 자료의 편향을 살피고, 추정 정확도와 검정력을 GST와 비교.

❓ 열린 질문

  • 실험 프로그램의 목표와 제약 중 효과 없는 기능의 출시 제한, 효과 추정의 정밀도, 비용 함수 최소화에서 무엇이 우선인가?
  • 현재의 중단 규칙과 사전분포는 중간 확인의 거짓 양성률과 여러 지표의 거짓 발견률에 어떤 보장을 제공하는가?
  • 경험적 베이즈 사전분포의 과거 자료에 승리한 실험만 포함하거나 서로 다른 프로그램을 섞은 편향이 있으며, GST 대비 추정 정확도와 검정력은 어떠한가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.