A/B test örneklem büyüklüğü ve anlamlılık hesaplayıcı
Testi başlatmadan önce kaç ziyaretçi gerektiğini, bittiğinde de farkın şansa bağlı olup olmadığını görün. İki mod var: gereken örneklem ve sonuç anlamlılığı. Formüller ve sık yapılan hatalar aşağıda.
Hesap tarayıcınızda yapılır; girdiğiniz değerler hiçbir yere gönderilmez.
- Grup başına gereken örneklem
- 31.234
- Toplam (iki grup)
- 62.468
- B grubundan beklenen oran
- %5,5
- Mutlak fark
- +0,5 puan
- Göreli fark
- +%10
- Tahmini süre
- 32 gün
- z (anlamlılık)
- 1,96
- z (güç)
- 0,842
Asgari fark değişirse
| Fark | B oranı | Grup başına |
|---|---|---|
| +%5 | %5,25 | 122.124 |
| +%7,5 | %5,38 | 54.903 |
| +%10 | %5,5 | 31.234 |
| +%15 | %5,75 | 14.193 |
| +%20 | %6 | 8.158 |
Fark yarıya indiğinde gereken örneklem yaklaşık dört katına çıkar.
n = ( z₁₋α/₂·√(2·p̄·q̄) + z₁₋β·√(p₁q₁ + p₂q₂) )² / (p₁ − p₂)², p̄ = (p₁ + p₂)/2 (grup başına)
Sonuçlar iki oranın normal yaklaşımına dayanır ve testin önceden belirlenen örneklemle tamamlandığını varsayar. Sonuçlar karar için tek başına yeterli değildir; deney tasarımı, çoklu karşılaştırma ve iş etkisi ayrıca değerlendirilmelidir.
Deney tasarımınızı, ölçüm planınızı ve sonuçların karar sürecine bağlanmasını birlikte gözden geçirelim mi?
Görüşme talep edin01
Nasıl kullanılır
A
Testten önce "Gereken örneklem" modunu seçin: taban oranı, görmek istediğiniz en küçük farkı, α ve gücü girin; grup başına ziyaretçi sayısını ve tahmini süreyi görün.
B
Testi, belirlediğiniz örnekleme ulaşana kadar sürdürün; ara sonuçlara bakıp erken durdurmayın.
C
Bittiğinde "Sonuç anlamlılığı" moduna geçip iki grubun ziyaretçi ve dönüşen sayılarını girin; p değerini, farkın ve göreli artışın güven aralığını okuyun.
02
Örneklem büyüklüğü neye bağlı?
Gereken örneklemi dört şey belirler: taban oran, saptamak istediğiniz en küçük fark (asgari saptanabilir fark), anlamlılık düzeyi α ve istatistiksel güç. Fark küçüldükçe örneklem çok hızlı büyür: farkı yarıya indirmek gereken ziyaretçiyi yaklaşık dört katına çıkarır, çünkü gerekli örneklem farkın karesiyle ters orantılıdır. Taban oran ne kadar düşükse (aynı göreli fark için) örneklem de o kadar büyür.
Araç, grup başına örneklemi iki oranlı testin yaygın normal yaklaşımıyla hesaplar: n = (z₁₋α/₂·√(2·p̄·q̄) + z₁₋β·√(p₁q₁ + p₂q₂))² / (p₁ − p₂)². Burada p₁ taban oran, p₂ beklenen yeni oran, p̄ ikisinin ortalaması, q = 1 − p'dir. Gruplar eşit büyüklükte varsayılır; sonuç yukarı yuvarlanır. Bu, R'deki power.prop.test işlevinin kullandığı formüldür.
Asgari fark göreli ya da mutlak girilebilir. %5 tabanda %10'luk göreli fark, %5,5'e çıkmak demektir (0,5 yüzde puan); mutlak girseydiniz doğrudan yüzde puan yazardınız. İki girişi karıştırmak örneklemi katlarca değiştirir; hesaplayıcı beklenen B oranını her zaman ayrıca gösterir.
03
p değeri ve güven aralığı ne söyler?
p değeri şunu cevaplar: iki sürüm gerçekte aynı olsaydı, bu kadar ya da daha büyük bir fark görme olasılığı nedir? p < α ise fark istatistiksel olarak anlamlı sayılır. p değeri farkın büyük ya da iş açısından önemli olduğunu söylemez; çok büyük örneklemde önemsiz bir fark da anlamlı çıkabilir. Anlamlı olmaması da "fark yok" demek değildir; veri farkı göstermeye yetmemiş olabilir.
Güven aralığı daha çok bilgi verir: farkın makul değerler aralığını gösterir. Aralık sıfırı içeriyorsa fark %95 güvenle sıfırdan ayırt edilemez. Fark için aralık, havuzlanmamış standart hatayla hesaplanır; göreli artış için Katz log-oran yöntemi kullanılır. Güven düzeyi 1 − α'dır; "%95 olasılıkla gerçek fark bu aralıkta" demek tam doğru bir yorum değildir, doğrusu aynı yöntemle çok sayıda test yapılsa aralıkların yaklaşık %95'inin gerçek farkı içereceğidir.
Test z-testidir: iki grubun oranları havuzlanıp standart hata bulunur. Beklenen dönüşen ya da dönüşmeyen sayısı gruplardan birinde 5'in altındaysa normal yaklaşım zayıflar ve araç bunu uyarı olarak gösterir.
04
A/B testlerinde sık yapılan hatalar
Erken bakıp durdurmak: örneklem dolmadan p değerine bakıp ilk anlamlı görünümde testi bitirmek yanlış pozitif oranını belirgin biçimde artırır. Örneklemi önceden belirleyin ya da sıralı test yöntemleri kullanın. Çok sayıda sürümü ya da ölçütü aynı anda denemek de aynı sorunu doğurur; her karşılaştırma ek bir şans tanır, düzeltme (ör. Bonferroni) gerekir.
Örneklemin bileşimi: trafiği bölen mekanizma bozuksa (örnek oran uyuşmazlığı) iki grup karşılaştırılamaz. Grup büyüklüklerinin tasarlanan orana uyup uymadığını kontrol edin. Ayrıca deneyi en az bir tam iş döngüsü (haftalık desen) boyunca sürdürün; yenilik etkisi ilk günlerde sonuçları şişirebilir.
Anlamlılık ile önem karıştırılır: güven aralığının alt ucu iş açısından anlamlı bir iyileşmeyi hâlâ gösteriyor mu, ona bakın. Küçük örneklemde aralık geniştir; karar vermeden önce asgari fark ve maliyetle birlikte okuyun.
Sık sorulanlar
- Girdiğim sayılar bir yere gönderiliyor mu?
- Hayır. Hesaplar tamamen tarayıcınızda çalışan kodla yapılır; hiçbir değer sunucuya iletilmez ve kaydedilmez.
- Asgari saptanabilir fark neyi seçmeli?
- İş açısından değer yaratacak en küçük iyileşmeyi seçin, örneğin dönüşümde %5'lik göreli artış. Daha küçük bir farkı yakalamak için gereken ziyaretçiyi toplamak maliyetliyse testi daha büyük bir fark için tasarlayın ya da daha fazla süre ayırın.
- Güç ve α'yı neden %80 ve %5 alıyorlar?
- Bunlar yerleşik varsayılanlardır, doğa yasası değil. Yanlış pozitifin maliyeti yüksekse α'yı küçültün (ör. %1); fark kaçırmanın maliyeti yüksekse gücü artırın (ör. %90). İkisi de gereken örneklemi büyütür.
- Tek yönlü test ne zaman uygun?
- Yalnızca "B, A'dan iyi mi?" sorusuyla ilgileniyorsanız ve B'nin daha kötü olması da aynı kararı doğuracaksa (örneğin sürümü yayınlamamak). Karar öncesinde belirleyin; sonuca bakıp tek yönlüye geçmek p değerini haksız yere küçültür. Emin değilseniz iki yönlü kullanın.
- Test süresini nasıl bulursunuz?
- Toplam örneklemi iki gruptaki günlük toplam ziyaretçiye bölüp yukarı yuvarlıyoruz. Gerçek süre trafik dalgalanmasına, haftalık desene ve yalnızca teste uygun kullanıcıların oranına göre değişir; en az bir tam hafta ya da iş döngüsü planlayın.
- Sonuç anlamlı çıktı, hemen uygulamalı mıyım?
- p değeri tek başına yeterli değildir. Güven aralığının alt ucuna, ölçüm planınıza (birden çok ölçüt ya da sürüm denediniz mi), örnek oran uyuşmazlığına ve iş etkisine de bakın.
Deneylerinizin sonuçlarına güvenelim
Deney tasarımı, ölçüm planı ve sonuçların karar sürecine bağlanması için verinizi birlikte ele alıyoruz. Ücretsiz keşif görüşmesinde ihtiyacınızı konuşalım.