Zum Inhalt springen

A/B-Test-Rechner für Stichprobengröße und Signifikanz

Sehen Sie vor dem Start, wie viele Besucher Sie brauchen, und nach dem Ende, ob der Unterschied mehr als Zufall ist. Es gibt zwei Modi: nötige Stichprobe und Signifikanz des Ergebnisses. Formeln und typische Fehler stehen unten.

Kostenloses Werkzeug · Datenanalyse
Was berechnen?
Art des Effekts
Testrichtung

Die Berechnung läuft in Ihrem Browser; Ihre Eingaben werden nirgendwohin gesendet.

Nötige Stichprobe je Gruppe
31.234
Gesamt (beide Gruppen)
62.468
Erwartete Rate in Gruppe B
5,5 %
Absoluter Unterschied
+0,5 Punkte
Relativer Unterschied
+10 %
Geschätzte Dauer
32 Tage
z (Signifikanz)
1,96
z (Teststärke)
0,842

Wenn sich der Mindesteffekt ändert

Wenn sich der Mindesteffekt ändert
EffektB-RateJe Gruppe
+5 %5,25 %122.124
+7,5 %5,38 %54.903
+10 %5,5 %31.234
+15 %5,75 %14.193
+20 %6 %8.158

Halbiert sich der Effekt, vervierfacht sich die nötige Stichprobe ungefähr.

n = ( z₁₋α/₂·√(2·p̄·q̄) + z₁₋β·√(p₁q₁ + p₂q₂) )² / (p₁ − p₂)², p̄ = (p₁ + p₂)/2 (je Gruppe)

Die Ergebnisse beruhen auf der Normalverteilungsnäherung für zwei Anteile und setzen voraus, dass der Test mit der vorab festgelegten Stichprobe abgeschlossen wird. Allein reichen sie für eine Entscheidung nicht aus; Versuchsaufbau, multiple Vergleiche und geschäftliche Wirkung sind gesondert zu bewerten.

Sollen wir Ihr Versuchsdesign, Ihren Messplan und die Anbindung der Ergebnisse an Entscheidungen gemeinsam durchgehen?

Gespräch anfragen

01

So funktioniert es

  1. A

    Wählen Sie vor dem Test den Modus „Nötige Stichprobe“: Geben Sie Basisrate, kleinsten gewünschten Effekt, α und Teststärke ein; lesen Sie die Besucher je Gruppe und die geschätzte Dauer ab.

  2. B

    Lassen Sie den Test laufen, bis diese Stichprobe erreicht ist; schauen Sie nicht auf Zwischenergebnisse und brechen Sie nicht vorzeitig ab.

  3. C

    Wechseln Sie am Ende zu „Signifikanz des Ergebnisses“ und geben Sie Besucher und Konversionen beider Gruppen ein; lesen Sie p-Wert sowie Konfidenzintervalle von Unterschied und relativem Zuwachs.

02

Wovon hängt die Stichprobengröße ab?

Vier Größen bestimmen die nötige Stichprobe: die Basisrate, der kleinste nachzuweisende Effekt (minimal nachweisbarer Effekt), das Signifikanzniveau α und die Teststärke. Schrumpft der Effekt, wächst die Stichprobe sehr schnell: Halbiert man den Effekt, vervierfacht sich ungefähr die Besucherzahl, weil die nötige Stichprobe umgekehrt proportional zum Quadrat des Effekts ist. Bei gleichem relativem Effekt gilt: Je niedriger die Basisrate, desto größer die Stichprobe.

Das Werkzeug berechnet die Stichprobe je Gruppe mit der üblichen Normalverteilungsnäherung für einen Test auf zwei Anteile: n = (z₁₋α/₂·√(2·p̄·q̄) + z₁₋β·√(p₁q₁ + p₂q₂))² / (p₁ − p₂)². Dabei ist p₁ die Basisrate, p₂ die erwartete neue Rate, p̄ ihr Mittelwert und q = 1 − p. Die Gruppen werden als gleich groß angenommen, das Ergebnis wird aufgerundet. Es ist die Formel der R-Funktion power.prop.test.

Der Mindesteffekt lässt sich relativ oder absolut eingeben. Ein relativer Effekt von 10 % bei 5 % Basisrate bedeutet 5,5 % (0,5 Prozentpunkte); im absoluten Modus gäben Sie direkt Prozentpunkte an. Werden beide verwechselt, ändert sich die Stichprobe um ein Vielfaches; der Rechner zeigt deshalb stets die erwartete B-Rate gesondert an.

03

Was sagen p-Wert und Konfidenzintervall aus?

Der p-Wert beantwortet: Wie wahrscheinlich ist ein so großer oder größerer Unterschied, wenn beide Versionen tatsächlich identisch wären? Bei p < α gilt der Unterschied als statistisch signifikant. Der p-Wert sagt nicht, dass der Unterschied groß oder für das Geschäft wichtig ist; bei sehr großer Stichprobe kann auch ein belangloser Unterschied signifikant sein. Ein nicht signifikantes Ergebnis bedeutet ebenfalls nicht „kein Unterschied“; die Daten können zu dünn sein, um ihn zu zeigen.

Das Konfidenzintervall sagt mehr: Es zeigt den Bereich plausibler Unterschiede. Enthält es null, lässt sich der Unterschied bei diesem Konfidenzniveau nicht von null unterscheiden. Das Intervall für den Unterschied nutzt den nicht zusammengefassten Standardfehler; für den relativen Zuwachs wird die Log-Verhältnis-Methode nach Katz verwendet. Das Konfidenzniveau ist 1 − α; „mit 95 % Wahrscheinlichkeit liegt der wahre Unterschied in diesem Intervall“ ist nicht ganz die richtige Lesart, richtig ist: Würde dasselbe Verfahren oft wiederholt, enthielten etwa 95 % der Intervalle den wahren Unterschied.

Der Test ist ein z-Test: Die Raten beider Gruppen werden zusammengefasst, um den Standardfehler zu bestimmen. Liegt die erwartete Zahl der Konvertierer oder Nichtkonvertierer in einer Gruppe unter 5, wird die Normalverteilungsnäherung schwächer, und das Werkzeug zeigt einen Hinweis.

04

Häufige Fehler bei A/B-Tests

Vorzeitiges Hinschauen und Abbrechen: Wer den p-Wert vor Erreichen der Stichprobe ansieht und den Test beim ersten signifikanten Wert beendet, erhöht die Rate falsch positiver Ergebnisse deutlich. Legen Sie die Stichprobe vorab fest oder nutzen Sie sequenzielle Testverfahren. Auch viele Varianten oder Kennzahlen gleichzeitig zu testen führt zum selben Problem; jeder Vergleich bietet eine zusätzliche Chance, sodass eine Korrektur (zum Beispiel Bonferroni) nötig ist.

Zusammensetzung der Stichprobe: Ist der Mechanismus, der den Verkehr aufteilt, fehlerhaft (Sample Ratio Mismatch), lassen sich die beiden Gruppen nicht vergleichen. Prüfen Sie, ob die Gruppengrößen dem geplanten Verhältnis entsprechen. Lassen Sie das Experiment außerdem mindestens einen vollen Geschäftszyklus (Wochenmuster) laufen; ein Neuheitseffekt kann die Ergebnisse in den ersten Tagen aufblähen.

Signifikanz mit Bedeutung verwechseln: Prüfen Sie, ob die Untergrenze des Konfidenzintervalls noch eine für das Geschäft relevante Verbesserung zeigt. Bei kleiner Stichprobe ist das Intervall breit; lesen Sie es vor der Entscheidung zusammen mit Mindesteffekt und Kosten.

Häufige Fragen

Werden die eingegebenen Zahlen irgendwohin gesendet?
Nein. Alle Berechnungen laufen in Code, der in Ihrem Browser ausgeführt wird; kein Wert wird an einen Server übertragen oder gespeichert.
Was soll ich als minimal nachweisbaren Effekt wählen?
Wählen Sie die kleinste Verbesserung, die für das Unternehmen Wert schafft, zum Beispiel 5 % relativen Anstieg der Konversion. Ist es teuer, die für einen kleineren Effekt nötigen Besucher zu sammeln, planen Sie den Test für einen größeren Effekt oder geben Sie ihm mehr Zeit.
Warum werden Teststärke und α auf 80 % und 5 % gesetzt?
Das sind etablierte Standardwerte, kein Naturgesetz. Ist ein falsch positives Ergebnis teuer, senken Sie α (zum Beispiel 1 %); ist es teuer, einen Effekt zu verpassen, erhöhen Sie die Teststärke (zum Beispiel 90 %). Beides vergrößert die nötige Stichprobe.
Wann ist ein einseitiger Test angebracht?
Nur wenn Sie ausschließlich wissen wollen, ob B besser als A ist, und ein schlechteres B zur selben Entscheidung führen würde (zum Beispiel nicht auszuliefern). Legen Sie das vor dem Test fest; ein Wechsel zu einseitig nach Ansicht des Ergebnisses macht den p-Wert unzulässig klein. Im Zweifel zweiseitig testen.
Wie wird die Testdauer berechnet?
Wir teilen die Gesamtstichprobe durch die täglichen Besucher beider Gruppen zusammen und runden auf. Die tatsächliche Dauer hängt von Verkehrsschwankungen, dem Wochenmuster und dem Anteil der für den Test geeigneten Nutzer ab; planen Sie mindestens eine volle Woche oder einen Geschäftszyklus ein.
Das Ergebnis ist signifikant; soll ich sofort ausrollen?
Der p-Wert allein genügt nicht. Beachten Sie auch die Untergrenze des Konfidenzintervalls, Ihren Messplan (wurden mehrere Kennzahlen oder Varianten getestet), ein mögliches Sample Ratio Mismatch und die geschäftliche Wirkung.

Machen wir Ihre Experimentergebnisse belastbar

Wir gehen Ihre Daten mit Ihnen durch: Versuchsdesign, Messplan und die Anbindung der Ergebnisse an Entscheidungen. Sprechen wir in einem kostenlosen Erstgespräch über Ihren Bedarf.