Nachdem wir eine lineare Regressionsgerade angepasst haben, stellt sich die nächste Frage: Wie viel von der beobachteten Streuung erfasst dieses Modell?
Das passende Maß heißt und wird meist mit bezeichnet. Für die einfache lineare Regression mit einem Prädiktor und einem Achsenabschnitt, die wir hier betrachten, gilt . Wir können den Wert also berechnen, indem wir .
Determinationskoeffizient
R2
R2=r2
den Pearson-Korrelationskoeffizienten quadrieren
Der Wert r2 gibt den Anteil oder Prozentsatz der beobachteten Streuung der abhängigen Variablen Y an, den das angepasste lineare Modell mithilfe von X erfasst.
Der Wert von r2 lässt sich im Streudiagramm daran erkennen, wie dicht die Datenpunkte an der Regressionsgeraden liegen:
Die gestrichelten Strecken zeigen die vertikalen Residuen, also die Differenzen zwischen beobachteten und vorhergesagten Werten an derselben horizontalen Position. Vergleiche ihre Längen mit der gesamten Streuung der Zielwerte. Der Determinationskoeffizient fasst diesen Vergleich der Streuung in einer Zahl zusammen.
Datenpunkte liegen sehr nahe an der Regressionslinie.
Für diese Punkte ergibt die Rechnung R2≈0,997, also 99,7%. Die dichte Lage an der Regressionsgeraden passt zu diesem Wert: Das Modell erfasst fast die gesamte beobachtete Streuung von Y.
Datenpunkte sind weit von der Regressionslinie entfernt.
Für den zweiten Datensatz gilt R2≈0,078, also 7,8%. Die längeren Residuen passen zu diesem niedrigen Wert: Das lineare Modell erfasst nur einen kleinen Teil der beobachteten Streuung von Y.
Im einfachen linearen Modell erhalten wir r2, indem wir den bereits bekannten Korrelationskoeffizienten quadrieren.
r2=(r)2
Wenn r schon bekannt ist, quadrieren wir den Wert, um r2 zu erhalten.
Für einen definierten Korrelationskoeffizienten gilt −1≤r≤1. Sein Quadrat liegt daher zwischen null und eins:
0≤r2≤1
Berechnung mit Abweichungssummen:
Wir können r2 auch direkt aus denselben Abweichungssummen berechnen, die in der Formel für r vorkommen:
r2=SSxxSSyy(SSxy)2
Die SS-Terme fassen Abweichungen von den Mittelwerten zusammen. Berechne die Abweichungen jedes Datenpaares, bevor du ihre Quadrate oder Produkte addierst:
Beim zweiten dargestellten Datensatz gilt xˉ=4,5 und yˉ=5. Das erste Paar (1,2) trägt beispielsweise (1−4,5)2=12,25 zu SSxx, (2−5)2=9 zu SSyy und (1−4,5)(2−5)=10,5 zu SSxy bei. Über alle acht Paare ergeben sich:
SSxx=42,SSyy=60,SSxy=14
R2=42⋅60142=2520196=907≈0,07778
Dieses Verhältnis setzt Streuung in beiden Variablen voraus, also SSxx>0 und SSyy>0. Sind alle y-Werte identisch, ist die Gesamtstreuung null und das übliche Verhältnis für den Determinationskoeffizienten nicht definiert.
Multipliziere r2 mit 100, um den vom Modell erfassten Anteil der Streuung von Y als Prozentsatz anzugeben.
Bei r2=0,81 erfasst das lineare Regressionsmodell 81% der beobachteten Streuung von Y mithilfe von X.
Die übrige Streuung, hier 1−r2 beziehungsweise 19%, wird von diesem linearen Modell nicht erfasst. Dahinter können nicht berücksichtigte Variablen, ein nichtlinearer Zusammenhang, Messfehler oder zufällige Schwankungen stehen. Aus r2 allein lässt sich die Ursache nicht ablesen.
Ein höheres r2 bedeutet, dass dieses Modell mehr von der beobachteten Streuung in Y erfasst. Es beweist weder einen Ursache-Wirkungs-Zusammenhang noch automatisch zuverlässige Vorhersagen. Dafür müssen wir zusätzlich die Residuen, den Datenbereich und die Angemessenheit eines linearen Modells prüfen.