A/B testinde örneklem büyüklüğü ve beş sık yanılgı
Güç, anlamlılık düzeyi ve en küçük anlamlı fark üzerinden grup başına gereken örneklem, %5'ten %6'ya örneği, yarıda durdurma ve çoklu karşılaştırma gibi yanılgılar; anketlerde örneklem için kısa not.
A/B testi, iki sürümü rastgele bölünmüş kullanıcılarla karşılaştırır. Test çoğu zaman yanlış nedenle başarısız olur: gerekenden çok kısa sürdürülür ya da küçük bir farkı görmek için yetersiz örneklemle başlanır. Örneklem büyüklüğünü başta hesaplamak bu iki sorunu da büyük ölçüde önler.
Örneklem neye bağlıdır?
Dört büyüklük birbirini belirler:
- **Mevcut oran** (örneğin dönüşüm oranı %5).
- **Yakalamak istediğiniz en küçük fark** (örneğin %5'ten %6'ya).
- **Anlamlılık düzeyi** (genellikle %5, iki yönlü): fark yokken yanlış "fark var" deme riski.
- **Güç** (genellikle %80): fark gerçekten varken onu yakalama olasılığı.
Bunlardan biri sıkılaştırıldığında örneklem büyür. İki oranlı z-testi yaklaşımıyla örnekler:
- %5 → %6 (göreli %20 artış): grup başına yaklaşık 8.158 kullanıcı, iki grupla toplam yaklaşık 16.300
- %5 → %7: grup başına yaklaşık 2.213
- %5 → %5,5 (göreli %10 artış): grup başına yaklaşık 31.234
Fark yarıya indiğinde örneklem yaklaşık dört katına çıkar: örneklem, farkın karesiyle ters orantılıdır. Küçük gelişmeleri ölçmek bu yüzden pahalıdır.
Beş sık yanılgı
- **Anlamlı çıkınca testi durdurmak.** Sonuca sürekli bakıp ilk anlamlı p değerinde durmak yanlış pozitif oranını yükseltir. Örneklem büyüklüğünü ve süreyi önceden yazın, ona ulaşmadan karar vermeyin (ya da sıralı test yöntemleri kullanın).
- **Birçok metriği ya da dilimi denemek.** Yirmi metrikten birinin tesadüfen anlamlı çıkması beklenir. Ana metriği önceden belirleyin, diğerlerini keşif sayın.
- **Tam hafta döngüsünü atlamak.** Hafta içi ile hafta sonu davranışı farklıdır. Testi en az bir, tercihen iki tam hafta çalıştırın.
- **Anlamlılığı etki büyüklüğüyle karıştırmak.** Çok büyük bir örneklemde önemsiz bir fark da anlamlı çıkar; güven aralığına ve iş değerine bakın.
- **Dağılımın bozulduğunu fark etmemek.** Gruplar arası kullanıcı oranı planlanandan sapıyorsa (örneğin %50-50 yerine %52-48) atama hatası olabilir; sonuç bu kontrol yapılmadan yorumlanmamalıdır.
Anket örneklemi: kısa not
Anketlerde de aynı mantık, farklı büyüklüklerle çalışır: hata payı, güven düzeyi ve evren. %95 güven ve ±%5 hata payı için en kötü durumda (oran %50) sonsuz evrende gerekli örneklem 384,15, yukarı yuvarlanınca 385'tir. Evren 2.000 kişiyse sonlu evren düzeltmesiyle 323'e düşer. Yanıt oranı %30 ise 323 / 0,30 ≈ 1.077 kişiyi davet etmek gerekir. Yanıt verenlerin tüm evreni temsil etmesi (yanıt yanlılığı) ise ayrı bir sorundur; örneklem büyüklüğü bunu çözmez.
Araçlarla deneyin
Gereken örneklemi ve sonucun anlamlılığını A/B testi örneklem ve anlamlılık aracında hesaplayabilirsiniz: iki oranlı z-testi, p değeri, güven aralığı ve göreli artış tarayıcıda çıkar. Anketler için anket örneklem büyüklüğü, ortalama farkları için t-testi hesaplayıcı var. Deney tasarımınızı birlikte gözden geçirmek için bize yazın.
Bu konuyu kendi tesisiniz için konuşalım
Diğer notlar
Tüm notlar →- 2 dk okumaTıbbi cihaz UDI etiketinde sık yapılan altı hataAmbalaj seviyeleri, yeni UDI-DI gerektiren değişiklikler, Basic UDI-DI karışıklığı, eksik üretim tanımlayıcısı, etiket ile barkodun uyuşmaması ve baskı kalitesi: tıbbi cihaz UDI'sinde en sık karşılaşılan hatalar.
- 2 dk okumaAgregasyonda koli–palet ilişkisini bozan altı durumReddedilen kutu, kısmi koli, numune alma, elle müdahale, çift atama ve palet bozma: agregasyon kaydının fiziksel içerikten ayrıştığı en sık durumlar ve hatta nasıl önleneceği.
- 2 dk okumaSCADA verisinde eksik ve bozuk kayıtlar: modelden önce yapılması gerekenlerZaman damgası, boşluklar, donmuş sensörler, fiziksel sınır dışı değerler, kısıtlama ve bakım dönemleri, sensör değişimi: kestirimci bakım ya da üretim tahmini modelinden önce SCADA verisinde neye bakılmalı?