t-Test-Rechner
Fügen Sie Rohdaten ein oder geben Sie n, Mittelwert und Standardabweichung ein. Sie sehen t, die Freiheitsgrade, den p-Wert, das Konfidenzintervall der Mittelwertdifferenz und Cohens d für einen Einstichproben-, unabhängigen Zweistichproben- (Welch oder gepoolt) oder gepaarten t-Test, mit Diagramm der Verteilung und des kritischen Bereichs.
Trennen Sie Werte durch Zeilenumbrüche, Leerzeichen, Tabulatoren oder Semikolons (eine aus Excel kopierte Spalte funktioniert). Als Dezimalzeichen sind Komma oder Punkt möglich; geben Sie keine Tausendertrennzeichen ein. Teile, die keine Zahlen sind, werden übersprungen.
Die Berechnung läuft in Ihrem Browser; die eingefügten Daten werden nirgendwohin gesendet.
Meist 0 (kein Unterschied).
Fügen Sie Daten ein oder laden Sie das Beispiel.
Möchten Sie sicherstellen, dass Ihre Experimente und A/B-Vergleiche mit der richtigen Stichprobe und dem richtigen Test angelegt sind? Schauen wir gemeinsam darauf.
Gespräch anfragen01
So geht's
A
Wählen Sie die Testart (eine Stichprobe, zwei unabhängige Gruppen oder gepaart) und fügen Sie Rohdaten ein oder geben Sie n, Mittelwert und Standardabweichung ein.
B
Wählen Sie die Alternativhypothese (zwei- oder einseitig), das Niveau α und bei zwei Gruppen die Welch- oder gepoolte Varianz.
C
Lesen Sie t, die Freiheitsgrade, den p-Wert, das Konfidenzintervall der Mittelwertdifferenz und Cohens d ab; im Diagramm sehen Sie, wo das beobachtete t relativ zum kritischen Bereich liegt; kopieren Sie das Ergebnis.
02
Welchen t-Test wählen?
Ein Einstichproben-t-Test vergleicht den Mittelwert einer Gruppe mit einem bekannten oder angestrebten Wert: Entspricht die durchschnittliche Füllmenge einer Abfüllmaschine 500 g? Ein unabhängiger Zweistichproben-t-Test vergleicht die Mittelwerte zweier voneinander unabhängiger Gruppen: Unterscheidet sich die Zykluszeit von Linie A von der von Linie B?
Der gepaarte t-Test ist für zwei Messungen derselben Einheiten gedacht (Energieverbrauch vor und nach der Wartung, die Zeit derselben Nutzer auf zwei Oberflächen). Hier wird die Differenz jedes Paares gebildet und gefragt, ob der Mittelwert dieser Differenzen von null abweicht. Wer auf gepaarte Daten einen Test für unabhängige Stichproben anwendet, verschenkt die Trennschärfe, die aus der Paarung kommt; ein gepaarter Test auf unabhängige Daten liefert ein falsches Ergebnis.
03
Welch- und gepoolter t-Test
Der gepoolte (Student-)Test setzt gleiche Varianzen in beiden Gruppen voraus und schätzt eine gemeinsame Varianz; seine Freiheitsgrade betragen n₁ + n₂ − 2. Der Welch-Test macht diese Annahme nicht: Die Varianz jeder Gruppe wird durch ihren eigenen Stichprobenumfang geteilt, und die Freiheitsgrade ergeben sich nach der Welch-Satterthwaite-Formel als Bruchzahl.
Bei gleichen Varianzen liefert Welch fast dasselbe Ergebnis; bei ungleichen (besonders bei zusätzlich verschiedenen Gruppengrößen) kann der gepoolte Test die Fehlerrate erster Art verzerren. Deshalb ist Welch voreingestellt. Die gepoolte Option dient dazu, Lehrbuchbeispiele nachzurechnen oder mit einem älteren Bericht zu vergleichen.
04
p-Wert, Konfidenzintervall und Effektstärke
Der p-Wert ist die Wahrscheinlichkeit, ein t zu beobachten, das so extrem oder extremer ist als das beobachtete, wenn die Nullhypothese gälte. Ein kleines p besagt, dass die Daten mit H₀ unvereinbar sind; es sagt nicht, dass der Unterschied groß oder wichtig ist. Das Konfidenzintervall der Mittelwertdifferenz erlaubt den direkten Blick auf Größe und Unsicherheit des Unterschieds: Enthält das Intervall null nicht, verwirft der zweiseitige Test H₀ bei gleichem α.
Cohens d drückt den Unterschied in Einheiten der Standardabweichung aus; es ist einheitenfrei und zwischen Studien vergleichbar. Gängige grobe Schwellen: 0,2 klein, 0,5 mittel, 0,8 groß; sie hängen vom Fachgebiet ab. In kleinen Stichproben ist d leicht überhöht, Hedges' g korrigiert das.
Häufige Fragen
- Soll ich den Welch- oder den gepoolten t-Test verwenden?
- Verwenden Sie standardmäßig Welch. Bei gleichen Varianzen liefert er ein Ergebnis sehr nahe am gepoolten Test, und bei ungleichen bleibt er dort korrekt, wo der gepoolte Test versagt. Wählen Sie den gepoolten Test nur, wenn Sie einen Grund haben, die gleichen Varianzen vorab zu kennen, oder eine Quelle nachrechnen wollen.
- Soll ich einseitig oder zweiseitig testen?
- Testen Sie nur dann einseitig, wenn allein ein Unterschied in eine Richtung für Sie zählt und Sie das vor dem Blick auf die Daten entschieden haben. Die Richtung nach dem Ergebnis zu wählen, macht den p-Wert künstlich klein. Im Zweifel testen Sie zweiseitig; der einseitige p-Wert ist halb so groß wie der zweiseitige, wenn das Ergebnis in der genannten Richtung liegt.
- Was, wenn die Stichprobe klein oder die Daten nicht normalverteilt sind?
- Bei kleiner Stichprobe stützt sich der t-Test darauf, dass die Daten annähernd normalverteilt sind; Schiefe und Ausreißer verfälschen p-Wert und Intervall. Mit wachsender Stichprobe (grob ab 30 pro Gruppe, bei starker Schiefe mehr) nähert sich die Verteilung des Mittelwerts der Normalverteilung, und der Test wird robuster. Bei sehr kleinen Stichproben ist das Ergebnis vorsichtig zu bewerten; sehen Sie sich Diagramm und Daten an und nutzen Sie gegebenenfalls eine Transformation oder einen rangbasierten Test.
- Darf ich bei p ≥ 0,05 sagen, es gebe keinen Unterschied?
- Nein. Nicht verwerfen zu können, zeigt nicht, dass es keinen Unterschied gibt; die Stichprobe kann zu klein sein, um ihn zu erkennen. Sehen Sie auf das Konfidenzintervall: Enthält es sowohl null als auch praktisch bedeutsame Unterschiede, sind die Daten nicht aussagekräftig. Für den Nachweis von Äquivalenz braucht es ein eigenes Verfahren (TOST).
- Wie groß muss Cohens d sein, damit ein Unterschied als groß gilt?
- Eine grobe Orientierung: 0,2 klein, 0,5 mittel, 0,8 groß. Diese Schwellen stammen von Cohen und hängen vom Fachgebiet ab; in der Produktion kann selbst ein sehr kleines d in Geld gerechnet groß sein. Beurteilen Sie den Effekt auch in Ihrer eigenen Einheit (dem Intervall).
- Kann ich statt Rohdaten auch Kennwerte eingeben?
- Ja. Geben Sie im Modus „Kennwerte“ für jede Gruppe n, Mittelwert und Stichproben-Standardabweichung (mit n−1) ein; beim gepaarten Test Mittelwert und Standardabweichung der Differenzen. Bei Kennwerteingabe ist die Prüfung der Schiefe nicht möglich.
Testen wir Ihre Vergleiche richtig
Lassen Sie uns gemeinsam entwerfen, wie Sie zeigen, ob sich zwei Zustände in Ihren Produktions-, Vertriebs- oder Felddaten wirklich unterscheiden, mit welcher Stichprobe und welchem Test.