# Grundidee der linearen Regression

> For AI agents: use [llms.txt](https://nakafa.com/llms.txt) for the site index. Markdown versions are available by appending `.md` to content URLs or sending `Accept: text/markdown`.

URL: https://nakafa.com/de/faecher/mathematik/regression-und-korrelation/grundidee-der-linearen-regression
Source: https://raw.githubusercontent.com/nakafaai/aksara/16d6b8e869d1a277313c65bbfc4b4a83efe77a46/packages/corpus/material/lesson/mathematics/statistics-regression/linear-regression-concept/de.mdx

Verstehe, wie eine Regressionsgerade einen linearen Datentrend zusammenfasst, Vorhersagen ermöglicht und mit der Methode der kleinsten Quadrate bestimmt wird.

---

## Was ist lineare Regression?

Ein [Streudiagramm](/de/faecher/mathematik/regression-und-korrelation/streudiagramm) zeigt, ob die Werte zweier Variablen $$X$$ und $$Y$$ ein gemeinsames Muster bilden.

Visible text: Ein [Streudiagramm](/de/faecher/mathematik/regression-und-korrelation/streudiagramm) zeigt, ob die Werte zweier Variablen und ein gemeinsames Muster bilden.

Wenn die Punktwolke ungefähr einem ansteigenden oder fallenden geradlinigen Trend folgt, können wir diesen Trend durch eine passende Gerade zusammenfassen. Sie heißt **lineare Regressionsgerade**. Das Verfahren zu ihrer Bestimmung heißt **lineare Regression**.

## Die „Best-Fit“-Linie

Die Regressionsgerade wird auch als _Best-Fit_-Gerade bezeichnet. Das bedeutet nicht, dass sie durch jeden Datenpunkt verläuft. Nach dem Kriterium der kleinsten Quadrate ist es die Gerade mit der kleinsten möglichen Summe quadrierter vertikaler Residuen. So fasst sie den linearen Trend der Daten zusammen.

## Beispiel einer Regressionslinie

Betrachten wir erneut Lernzeiten und Prüfungsergebnisse. Die Punktwolke zeigt einen positiven linearen Trend.

Component: ScatterDiagram
Props:
- title: Regressionslinie für den Zusammenhang zwischen Lernzeit und Prüfungsergebnissen
- description: Die Linie zeigt den linearen Trend (Regressionslinie) der Daten.
- xAxisLabel: Lernzeit (Stunden)
- yAxisLabel: Prüfungsergebnis
- datasets: [
{
name: "Schüler",
color: "var(--chart-1)",
points: [
{ x: 1, y: 60 },
{ x: 1.5, y: 68 },
{ x: 2, y: 65 },
{ x: 2.5, y: 75 },
{ x: 3, y: 72 },
{ x: 3.5, y: 80 },
{ x: 4, y: 85 },
{ x: 4, y: 82 },
{ x: 4.5, y: 90 },
{ x: 5, y: 88 },
{ x: 5.5, y: 95 },
{ x: 6, y: 92 },
],
},
]
- calculateRegressionLine: true
- regressionLineStyle: {
color: "var(--chart-3)",
}

Die eingezeichnete Regressionsgerade zeigt den **allgemeinen Trend**: Mit längerer Lernzeit steigt das vorhergesagte Prüfungsergebnis tendenziell an. Einzelne Ergebnisse können trotzdem oberhalb oder unterhalb der Geraden liegen.

## Wozu dient diese Regressionslinie?

Eine wichtige Anwendung ist die **Vorhersage**. Wir könnten mit der Geraden zum Beispiel das Ergebnis eines Schülers schätzen, der $$7 \text{Stunden}$$ lernt. Die beobachteten Lernzeiten reichen jedoch nur von $$1$$ bis $$6$$ Stunden. Eine Vorhersage für $$7 \text{Stunden}$$ ist daher eine **Extrapolation** und weniger verlässlich als eine Schätzung innerhalb des beobachteten Bereichs.

Visible text: Eine wichtige Anwendung ist die **Vorhersage**. Wir könnten mit der Geraden zum Beispiel das Ergebnis eines Schülers schätzen, der lernt. Die beobachteten Lernzeiten reichen jedoch nur von bis Stunden. Eine Vorhersage für ist daher eine **Extrapolation** und weniger verlässlich als eine Schätzung innerhalb des beobachteten Bereichs.

## Mathematisches Konzept

Die lineare Regressionsgerade, also die _Best-Fit_-Gerade, wird mit der **Methode der kleinsten Quadrate** bestimmt. Gesucht ist die Gerade, welche die **Summe der quadrierten vertikalen Residuen** zwischen beobachteten und vorhergesagten Werten minimiert.

Mathematisch hat sie die Form:

```math
\hat{y} = a + bx
```

Dabei gilt:

- $$\hat{y}$$ (gesprochen: $$y$$-Dach) ist der von der Regressionsgeraden **vorhergesagte $$y$$-Wert**.
- $$x$$ ist der Wert der unabhängigen Variablen.
- $$b$$ ist die **Steigung**. Sie gibt an, um wie viel sich $$\hat{y}$$ bei einer Erhöhung von $$x$$ um eine Einheit verändert.
- $$a$$ ist der **$$y$$-Achsenabschnitt**, also der vorhergesagte $$y$$-Wert bei $$x = 0$$. Diese Deutung ist nur sinnvoll, wenn $$x = 0$$ im Sachzusammenhang eine Bedeutung hat.

Visible text: - (gesprochen: -Dach) ist der von der Regressionsgeraden **vorhergesagte -Wert**.
- ist der Wert der unabhängigen Variablen.
- ist die **Steigung**. Sie gibt an, um wie viel sich bei einer Erhöhung von um eine Einheit verändert.
- ist der **-Achsenabschnitt**, also der vorhergesagte -Wert bei . Diese Deutung ist nur sinnvoll, wenn im Sachzusammenhang eine Bedeutung hat.

Die Werte von $$b$$ und $$a$$ werden aus den beobachteten $$(x, y)$$-Paaren berechnet:

Visible text: Die Werte von und werden aus den beobachteten -Paaren berechnet:

Component: MathContainer
Children:

```math
b = \frac{n(\sum xy) - (\sum x)(\sum y)}{n(\sum x^2) - (\sum x)^2}
```

```math
a = \bar{y} - b\bar{x}
```

Dabei bedeutet:

- $$n$$ ist die Anzahl der Datenpaare.
- $$\sum x$$ ist die Summe aller $$x$$-Werte.
- $$\sum y$$ ist die Summe aller $$y$$-Werte.
- $$\sum xy$$ ist die Summe der Produkte der zusammengehörigen $$x$$- und $$y$$-Werte.
- $$\sum x^2$$ ist die Summe der quadrierten $$x$$-Werte.
- $$\bar{x}$$ ist der Mittelwert der $$x$$-Werte ($$\frac{\sum x}{n}$$
  ).
- $$\bar{y}$$ ist der Mittelwert der $$y$$-Werte ($$\frac{\sum y}{n}$$
  ).

Visible text: - ist die Anzahl der Datenpaare.
- ist die Summe aller -Werte.
- ist die Summe aller -Werte.
- ist die Summe der Produkte der zusammengehörigen - und -Werte.
- ist die Summe der quadrierten -Werte.
- ist der Mittelwert der -Werte (
 ).
- ist der Mittelwert der -Werte (
 ).

Diese Formeln bestimmen eine eindeutige Kleinste-Quadrate-Gerade, solange die beobachteten $$x$$-Werte nicht alle gleich sind. Sind alle $$x$$-Werte identisch, ist der Nenner der Steigungsformel null und die Daten bestimmen keine eindeutige Regressionssteigung.

Visible text: Diese Formeln bestimmen eine eindeutige Kleinste-Quadrate-Gerade, solange die beobachteten -Werte nicht alle gleich sind. Sind alle -Werte identisch, ist der Nenner der Steigungsformel null und die Daten bestimmen keine eindeutige Regressionssteigung.