Stichprobengröße beim A/B-Test und fünf häufige Irrtümer
Die je Gruppe nötige Stichprobe aus Teststärke, Signifikanzniveau und kleinster nachweisbarer Differenz, das Beispiel 5 % auf 6 %, Irrtümer wie vorzeitiges Abbrechen und multiple Vergleiche; eine kurze Notiz zu Umfragestichproben.
Ein A/B-Test vergleicht zwei Versionen mit zufällig aufgeteilten Nutzern. Tests scheitern oft aus dem falschen Grund: Sie laufen viel kürzer als nötig oder starten mit einer zu kleinen Stichprobe, um einen kleinen Unterschied zu sehen. Die Stichprobengröße am Anfang zu berechnen, verhindert beides weitgehend.
Wovon hängt die Stichprobengröße ab?
Vier Größen bestimmen einander:
- **Die aktuelle Rate** (zum Beispiel 5 % Konversionsrate).
- **Der kleinste Unterschied, den Sie erfassen wollen** (zum Beispiel von 5 % auf 6 %).
- **Das Signifikanzniveau** (meist 5 %, zweiseitig): das Risiko, fälschlich „es gibt einen Unterschied“ zu sagen, obwohl keiner besteht.
- **Die Teststärke** (meist 80 %): die Wahrscheinlichkeit, einen Unterschied zu erfassen, wenn er wirklich besteht.
Wird eine davon verschärft, wächst die Stichprobe. Mit dem Ansatz des Zwei-Anteile-z-Tests ergeben sich Beispiele:
- 5 % → 6 % (20 % relative Steigerung): etwa 8.158 Nutzer je Gruppe, bei zwei Gruppen insgesamt etwa 16.300
- 5 % → 7 %: etwa 2.213 je Gruppe
- 5 % → 5,5 % (10 % relative Steigerung): etwa 31.234 je Gruppe
Halbiert sich der Unterschied, wächst die Stichprobe auf etwa das Vierfache: Sie ist umgekehrt proportional zum Quadrat des Unterschieds. Deshalb ist es teuer, kleine Verbesserungen zu messen.
Fünf häufige Irrtümer
- **Den Test abbrechen, sobald er signifikant wird.** Wer das Ergebnis laufend ansieht und beim ersten signifikanten p-Wert stoppt, erhöht die Rate falsch positiver Ergebnisse. Stichprobengröße und Dauer vorab festhalten und vor deren Erreichen nicht entscheiden (oder sequenzielle Testverfahren nutzen).
- **Viele Kennzahlen oder Segmente ausprobieren.** Von zwanzig Kennzahlen wird eine zufällig signifikant erwartet. Die Hauptkennzahl vorab festlegen, die übrigen als Exploration behandeln.
- **Den vollen Wochenzyklus auslassen.** Wochentags- und Wochenendverhalten unterscheiden sich. Den Test mindestens eine, besser zwei volle Wochen laufen lassen.
- **Signifikanz mit Effektgröße verwechseln.** Bei sehr großer Stichprobe wird auch ein belangloser Unterschied signifikant; auf das Konfidenzintervall und den Geschäftswert achten.
- **Eine gestörte Aufteilung nicht bemerken.** Weicht der Nutzeranteil zwischen den Gruppen vom Plan ab (zum Beispiel 52-48 statt 50-50), kann ein Zuweisungsfehler vorliegen; ohne diese Prüfung sollte das Ergebnis nicht gedeutet werden.
Umfragestichproben: eine kurze Notiz
Bei Umfragen gilt dieselbe Logik mit anderen Größen: Fehlerspanne, Konfidenzniveau und Grundgesamtheit. Für 95 % Konfidenz und ±5 % Fehlerspanne beträgt die nötige Stichprobe im ungünstigsten Fall (Anteil 50 %) bei unendlicher Grundgesamtheit 384,15, aufgerundet 385. Umfasst die Grundgesamtheit 2.000 Personen, sinkt sie mit der Endlichkeitskorrektur auf 323. Bei 30 % Rücklaufquote müssen 323 / 0,30 ≈ 1.077 Personen eingeladen werden. Ob die Antwortenden die gesamte Grundgesamtheit repräsentieren (Antwortverzerrung), ist ein eigenes Problem; die Stichprobengröße löst es nicht.
Mit den Werkzeugen ausprobieren
Die nötige Stichprobe und die Signifikanz eines Ergebnisses berechnen Sie im Werkzeug A/B-Test: Stichprobe und Signifikanz: Zwei-Anteile-z-Test, p-Wert, Konfidenzintervall und relative Steigerung erscheinen im Browser. Für Umfragen gibt es das Werkzeug Stichprobengröße für Umfragen, für Mittelwertunterschiede den t-Test-Rechner. Für die gemeinsame Durchsicht Ihres Versuchsdesigns schreiben Sie uns.
Lassen Sie uns das für Ihr Werk besprechen
Weitere Notizen
Alle Notizen →- 3 Min. LesezeitSechs häufige Fehler auf UDI-Etiketten von MedizinproduktenVerpackungsebenen, Änderungen mit neuer UDI-DI, Verwechslung von Basic UDI-DI und UDI-DI, fehlende Herstellungskennung, Etikett und Barcode passen nicht zusammen, ungeprüfte Druckqualität: die häufigsten UDI-Fehler bei Medizinprodukten.
- 2 Min. LesezeitSechs Situationen, in denen die Karton-Paletten-Beziehung bei der Aggregation brichtAusgeschleuste Packungen, Teilkartons, Probenahme, manuelle Eingriffe, Doppelzuordnung und Palettenauflösung: die häufigsten Situationen, in denen Aggregationsdaten vom physischen Inhalt abweichen, und wie man sie an der Linie verhindert.
- 2 Min. LesezeitLücken und fehlerhafte Werte in SCADA-Daten: was vor der Modellierung zu tun istZeitstempel, Lücken, eingefrorene Sensoren, physikalisch unmögliche Werte, Abregelung und Wartungszeiten, Sensortausch: was in SCADA-Daten vor einem Modell für vorausschauende Wartung oder Leistungsprognose zu prüfen ist.