Korrelations- und einfacher Regressionsrechner
Fügen Sie zwei Spalten (x und y) ein. Sie sehen die Pearson-Korrelation, die Ausgleichsgerade, den Standardfehler der Steigung, 95-%-Konfidenzintervalle und den p-Wert und erhalten für jedes x eine Prognose von y.
Pro Zeile ein (x, y)-Paar. Trennzeichen kann Tabulator, ; , | oder Leerzeichen sein (aus Excel kopierte Spalten funktionieren); Dezimalkomma und -punkt werden automatisch erkannt. Eine Kopfzeile wird übersprungen; es werden die ersten zwei Spalten verwendet.
Die Berechnung läuft in Ihrem Browser; die eingefügten Daten werden nirgendwohin gesendet.
Lassen Sie uns gemeinsam prüfen, ob die Zusammenhänge in Ihren Daten tatsächlich nützen und wie sie zu einer Entscheidungsunterstützung werden.
Gespräch anfragen01
So geht's
A
Fügen Sie die Spalten x und y ein (aus Excel kopierbar) oder laden Sie die Beispieldaten.
B
Lesen Sie Korrelation, R², Steigung und Achsenabschnitt, Standardfehler, 95-%-Intervalle und den p-Wert ab; prüfen Sie im Diagramm, wie gut die Punkte zur Geraden passen.
C
Geben Sie einen x-Wert ein, um das prognostizierte y und seine Intervalle zu erhalten; kopieren Sie das Ergebnis.
02
Was sagen Pearson r und R² aus?
Der Pearson-Korrelationskoeffizient r zeigt Richtung und Stärke des linearen Zusammenhangs zweier Variablen von −1 bis +1. Ein Wert nahe null bedeutet, dass kein linearer Zusammenhang besteht; es kann aber ein anderer Zusammenhang (etwa U-förmig) vorliegen. Eine grobe Orientierung zur sprachlichen Einordnung der Stärke: |r| < 0,1 vernachlässigbar, < 0,3 schwach, < 0,5 mittel, < 0,8 stark, darüber sehr stark; diese Schwellen hängen vom Fachgebiet ab.
R² = r² ist der Anteil der Streuung von y, den das lineare Modell erklärt. R² = 0,60 bedeutet, dass 60 % der Streuung durch x erklärt werden und 40 % nicht. Ein hohes R² heißt nicht, dass das Modell richtig oder der Zusammenhang kausal ist.
03
Steigung, Standardfehler, Konfidenzintervall und p-Wert
Die Ausgleichsgerade minimiert die Summe der quadrierten vertikalen Abweichungen. Die Steigung b gibt an, um wie viele Einheiten sich y im Mittel ändert, wenn x um eine Einheit steigt. Der Standardfehler zeigt, wie stark die Steigung in einer anderen Stichprobe schwanken könnte; das 95-%-Konfidenzintervall ist b ± t·SE, wobei t aus der Student-t-Verteilung mit n − 2 Freiheitsgraden stammt.
Der p-Wert ist die Wahrscheinlichkeit, eine so extreme oder extremere Steigung zu beobachten, wenn die wahre Steigung null wäre. Ein kleines p besagt, dass sich der Zusammenhang schwer allein durch Zufall erklären lässt; über Größe oder praktische Bedeutung sagt es nichts. Bei sehr großen Stichproben wird selbst eine winzige Steigung „signifikant“.
Für die Prognose werden zwei Intervalle angegeben: das Konfidenzintervall der mittleren Antwort (wie unsicher die Gerade selbst ist) und das Prognoseintervall für eine einzelne neue Beobachtung (die Streuung einer Einzelmessung kommt hinzu). Das Prognoseintervall ist immer breiter.
04
Korrelation ist keine Kausalität
Dass zwei Größen gemeinsam variieren, beweist nicht, dass die eine die andere verursacht. Ein gemeinsamer dritter Faktor (die Lufttemperatur erhöht Eisverkauf und Stromverbrauch), umgekehrte Kausalität oder reiner Zufall können dasselbe Ergebnis erzeugen. Zwei Reihen, die beide mit der Zeit wachsen, zeigen fast immer eine hohe Korrelation.
Für eine Kausalaussage braucht es ein Experiment, einen gut kontrollierten Vergleich oder zusätzliches Wissen (einen physikalischen Mechanismus). Achten Sie auch auf Ausreißer: Ein einzelner Extremwert kann r stark verändern; vertrauen Sie der Zahl nicht, ohne das Diagramm anzusehen.
Häufige Fragen
- Wie groß muss ein Korrelationskoeffizient sein, damit er als stark gilt?
- Eine feste Schwelle gibt es nicht. Eine grobe Orientierung: |r| < 0,3 schwach, 0,3–0,5 mittel, 0,5–0,8 stark, darüber sehr stark. In Physik und Technik erwartet man 0,9, bei Daten zum menschlichen Verhalten kann schon 0,3 bedeutsam sein. Schauen Sie immer auch auf das Diagramm.
- Worin unterscheiden sich R² und r?
- R² ist das Quadrat von r und gibt den Anteil der Streuung von y an, den das lineare Modell erklärt. r trägt auch die Richtung (plus oder minus), R² nicht. r = −0,8 und r = +0,8 ergeben dasselbe R² (0,64).
- Ist der Zusammenhang stark, wenn der p-Wert unter 0,05 liegt?
- Nein. Der p-Wert betrifft die Wahrscheinlichkeit, dass der Zusammenhang Zufall ist, nicht seine Stärke. Bei großen Stichproben ergibt auch ein sehr schwacher Zusammenhang p < 0,05; für die Größe des Zusammenhangs sehen Sie auf r, R² und das Intervall der Steigung.
- Wie viele Datenpunkte brauche ich?
- Das Werkzeug rechnet mit 3 Paaren, das ist aber sehr wenig. Für eine solide Beurteilung werden mindestens 20–30 Paare empfohlen; bei wenigen Paaren kann ein einzelner Ausreißer das Ergebnis völlig verändern.
- Kann ich mit der Regressionsgeraden außerhalb des Datenbereichs prognostizieren?
- Technisch ja, aber unzuverlässig. Man weiß nicht, ob der lineare Zusammenhang in einem nicht gemessenen Bereich weiterbesteht. Für ein x außerhalb des Datenbereichs zeigt das Werkzeug einen Hinweis.
- In welchem Format soll ich die Daten einfügen?
- Zwei Spalten: x und y in jeder Zeile. Trennzeichen kann ein Tabulator (aus Excel kopiert), ;, | oder ein Leerzeichen sein. Dezimalkomma oder -punkt wird automatisch erkannt; eine Kopfzeile wird übersprungen, bei mehr als zwei Spalten werden die ersten zwei verwendet.
Zusammenhänge in Ihren Daten in Entscheidungen verwandeln
Lassen Sie uns gemeinsam prüfen, welche Variablen in Ihren Produktions-, Vertriebs- oder Felddaten sich tatsächlich beeinflussen und wie Sie daraus eine Entscheidungsunterstützung machen.