Der vom Modell erfasste Anteil der Streuung
Nachdem wir eine lineare Regressionsgerade angepasst haben, stellt sich die nächste Frage: Wie viel von der beobachteten Streuung erfasst dieses Modell?
Das passende Maß heißt Determinationskoeffizient und wird meist mit bezeichnet. Für die einfache lineare Regression mit einem Prädiktor und einem Achsenabschnitt, die wir hier betrachten, gilt . Wir können den Wert also berechnen, indem wir den Pearson-Korrelationskoeffizienten quadrieren.
Der Wert gibt den Anteil oder Prozentsatz der beobachteten Streuung der abhängigen Variablen an, den das angepasste lineare Modell mithilfe von erfasst.
Bestimmtheitskoeffizient aus einem Streudiagramm
Der Wert von lässt sich im Streudiagramm daran erkennen, wie dicht die Datenpunkte an der Regressionsgeraden liegen:
Die gestrichelten Strecken zeigen die vertikalen Residuen, also die Differenzen zwischen beobachteten und vorhergesagten Werten an derselben horizontalen Position. Vergleiche ihre Längen mit der gesamten Streuung der Zielwerte. Der Determinationskoeffizient fasst diesen Vergleich der Streuung in einer Zahl zusammen.
Ein Modell erfasst fast die gesamte Streuung
Für diese Punkte ergibt die Rechnung , also . Die dichte Lage an der Regressionsgeraden passt zu diesem Wert: Das Modell erfasst fast die gesamte beobachtete Streuung von .
Ein Modell erfasst wenig Streuung
Für den zweiten Datensatz gilt , also . Die längeren Residuen passen zu diesem niedrigen Wert: Das lineare Modell erfasst nur einen kleinen Teil der beobachteten Streuung von .
Den Determinationskoeffizienten berechnen
Im einfachen linearen Modell erhalten wir , indem wir den bereits bekannten Korrelationskoeffizienten quadrieren.
Wenn schon bekannt ist, quadrieren wir den Wert, um zu erhalten.
Für einen definierten Korrelationskoeffizienten gilt . Sein Quadrat liegt daher zwischen null und eins:
Berechnung mit Abweichungssummen:
Wir können auch direkt aus denselben Abweichungssummen berechnen, die in der Formel für vorkommen:
Die -Terme fassen Abweichungen von den Mittelwerten zusammen. Berechne die Abweichungen jedes Datenpaares, bevor du ihre Quadrate oder Produkte addierst:
Beim zweiten dargestellten Datensatz gilt und . Das erste Paar trägt beispielsweise zu , zu und zu bei. Über alle acht Paare ergeben sich:
Dieses Verhältnis setzt Streuung in beiden Variablen voraus, also und . Sind alle -Werte identisch, ist die Gesamtstreuung null und das übliche Verhältnis für den Determinationskoeffizienten nicht definiert.
Interpretation als Prozentsatz
Multipliziere mit , um den vom Modell erfassten Anteil der Streuung von als Prozentsatz anzugeben.
- Bei erfasst das lineare Regressionsmodell der beobachteten Streuung von mithilfe von .
- Die übrige Streuung, hier beziehungsweise , wird von diesem linearen Modell nicht erfasst. Dahinter können nicht berücksichtigte Variablen, ein nichtlinearer Zusammenhang, Messfehler oder zufällige Schwankungen stehen. Aus allein lässt sich die Ursache nicht ablesen.
Ein höheres bedeutet, dass dieses Modell mehr von der beobachteten Streuung in erfasst. Es beweist weder einen Ursache-Wirkungs-Zusammenhang noch automatisch zuverlässige Vorhersagen. Dafür müssen wir zusätzlich die Residuen, den Datenbereich und die Angemessenheit eines linearen Modells prüfen.