İçeriğe geç

A/B testinde örneklem büyüklüğü ve beş sık yanılgı

Güç, anlamlılık düzeyi ve en küçük anlamlı fark üzerinden grup başına gereken örneklem, %5'ten %6'ya örneği, yarıda durdurma ve çoklu karşılaştırma gibi yanılgılar; anketlerde örneklem için kısa not.

2 dk okumaA/B testi · Örneklem · İstatistik · Anket

A/B testi, iki sürümü rastgele bölünmüş kullanıcılarla karşılaştırır. Test çoğu zaman yanlış nedenle başarısız olur: gerekenden çok kısa sürdürülür ya da küçük bir farkı görmek için yetersiz örneklemle başlanır. Örneklem büyüklüğünü başta hesaplamak bu iki sorunu da büyük ölçüde önler.

Örneklem neye bağlıdır?

Dört büyüklük birbirini belirler:

  • **Mevcut oran** (örneğin dönüşüm oranı %5).
  • **Yakalamak istediğiniz en küçük fark** (örneğin %5'ten %6'ya).
  • **Anlamlılık düzeyi** (genellikle %5, iki yönlü): fark yokken yanlış "fark var" deme riski.
  • **Güç** (genellikle %80): fark gerçekten varken onu yakalama olasılığı.

Bunlardan biri sıkılaştırıldığında örneklem büyür. İki oranlı z-testi yaklaşımıyla örnekler:

  • %5 → %6 (göreli %20 artış): grup başına yaklaşık 8.158 kullanıcı, iki grupla toplam yaklaşık 16.300
  • %5 → %7: grup başına yaklaşık 2.213
  • %5 → %5,5 (göreli %10 artış): grup başına yaklaşık 31.234

Fark yarıya indiğinde örneklem yaklaşık dört katına çıkar: örneklem, farkın karesiyle ters orantılıdır. Küçük gelişmeleri ölçmek bu yüzden pahalıdır.

Beş sık yanılgı

  • **Anlamlı çıkınca testi durdurmak.** Sonuca sürekli bakıp ilk anlamlı p değerinde durmak yanlış pozitif oranını yükseltir. Örneklem büyüklüğünü ve süreyi önceden yazın, ona ulaşmadan karar vermeyin (ya da sıralı test yöntemleri kullanın).
  • **Birçok metriği ya da dilimi denemek.** Yirmi metrikten birinin tesadüfen anlamlı çıkması beklenir. Ana metriği önceden belirleyin, diğerlerini keşif sayın.
  • **Tam hafta döngüsünü atlamak.** Hafta içi ile hafta sonu davranışı farklıdır. Testi en az bir, tercihen iki tam hafta çalıştırın.
  • **Anlamlılığı etki büyüklüğüyle karıştırmak.** Çok büyük bir örneklemde önemsiz bir fark da anlamlı çıkar; güven aralığına ve iş değerine bakın.
  • **Dağılımın bozulduğunu fark etmemek.** Gruplar arası kullanıcı oranı planlanandan sapıyorsa (örneğin %50-50 yerine %52-48) atama hatası olabilir; sonuç bu kontrol yapılmadan yorumlanmamalıdır.

Anket örneklemi: kısa not

Anketlerde de aynı mantık, farklı büyüklüklerle çalışır: hata payı, güven düzeyi ve evren. %95 güven ve ±%5 hata payı için en kötü durumda (oran %50) sonsuz evrende gerekli örneklem 384,15, yukarı yuvarlanınca 385'tir. Evren 2.000 kişiyse sonlu evren düzeltmesiyle 323'e düşer. Yanıt oranı %30 ise 323 / 0,30 ≈ 1.077 kişiyi davet etmek gerekir. Yanıt verenlerin tüm evreni temsil etmesi (yanıt yanlılığı) ise ayrı bir sorundur; örneklem büyüklüğü bunu çözmez.

Araçlarla deneyin

Gereken örneklemi ve sonucun anlamlılığını A/B testi örneklem ve anlamlılık aracında hesaplayabilirsiniz: iki oranlı z-testi, p değeri, güven aralığı ve göreli artış tarayıcıda çıkar. Anketler için anket örneklem büyüklüğü, ortalama farkları için t-testi hesaplayıcı var. Deney tasarımınızı birlikte gözden geçirmek için bize yazın.

Bu konuyu kendi tesisiniz için konuşalım