# Tikhonov-Regularisierung

> For AI agents: use [llms.txt](https://nakafa.com/llms.txt) for the site index. Markdown versions are available by appending `.md` to content URLs or sending `Accept: text/markdown`.

URL: https://nakafa.com/de/faecher/ki-und-data-science/lineare-methoden-der-ki/regularisierung
Source: https://raw.githubusercontent.com/nakafaai/aksara/16d6b8e869d1a277313c65bbfc4b4a83efe77a46/packages/corpus/material/lesson/ai-ds/linear-methods/regularization/de.mdx

Schlecht konditionierte Ausgleichsprobleme mit Tikhonov-Regularisierung, Spektralfiltern, begründeter Parameterwahl und stabilen numerischen Verfahren lösen.

---

## Warum Ausgleichsprobleme instabil sein können

Für $$A\in\mathbb{R}^{m\times n}$$ und $$b\in\mathbb{R}^m$$ löst die gewöhnliche Methode der kleinsten Quadrate

Visible text: Für und löst die gewöhnliche Methode der kleinsten Quadrate

```math
\min_x\|Ax-b\|_2^2
```

Ein Minimierer existiert immer, auch wenn die Gleichungen $$Ax=b$$ nicht konsistent sind. Das eigentliche Problem ist ein anderes: Bei einer rangdefizienten Matrix $$A$$ muss der Minimierer nicht eindeutig sein. Ist $$A$$ nahezu rangdefizient, können kleine Störungen in $$b$$ große Änderungen der angepassten Parameter verursachen.

Visible text: Ein Minimierer existiert immer, auch wenn die Gleichungen nicht konsistent sind. Das eigentliche Problem ist ein anderes: Bei einer rangdefizienten Matrix muss der Minimierer nicht eindeutig sein. Ist nahezu rangdefizient, können kleine Störungen in große Änderungen der angepassten Parameter verursachen.

Die Singulärwertzerlegung erklärt diese Verstärkung. Für $$A=U\Sigma V^T$$ enthält die Ausgleichslösung Faktoren $$1/\sigma_i$$. Eine Datenkomponente in Richtung eines sehr kleinen Singulärwerts $$\sigma_i$$ wird daher stark vergrößert.

Visible text: Die Singulärwertzerlegung erklärt diese Verstärkung. Für enthält die Ausgleichslösung Faktoren . Eine Datenkomponente in Richtung eines sehr kleinen Singulärwerts wird daher stark vergrößert.

## Tikhonov-Problem

Die Tikhonov-Regularisierung wägt Datentreue gegen eine gewählte Vorstellung plausibler Parameter ab:

```math
\min_x\left(\|Ax-b\|_2^2+\alpha^2\|L(x-x_0)\|_2^2\right),\qquad \alpha>0
```

Dabei ist $$x_0$$ ein Referenzwert, $$L$$ legt fest, welche Größe klein oder glatt bleiben soll, und $$\alpha$$ steuert die Abwägung.

Visible text: Dabei ist ein Referenzwert, legt fest, welche Größe klein oder glatt bleiben soll, und steuert die Abwägung.

- $$L=I$$ bestraft den Abstand zu $$x_0$$.
- Eine Matrix erster Differenzen bestraft schnelle Änderungen benachbarter Parameter.
- Eine Matrix zweiter Differenzen bestraft Krümmung und begünstigt glattere Profile.

Visible text: - bestraft den Abstand zu .
- Eine Matrix erster Differenzen bestraft schnelle Änderungen benachbarter Parameter.
- Eine Matrix zweiter Differenzen bestraft Krümmung und begünstigt glattere Profile.

Die Strafe erzeugt keine neuen Informationen in den Beobachtungen. Sie macht die gewählte Vorstruktur ausdrücklich sichtbar und führt zu einem stabilen Optimierungsproblem.

## Erweitertes Ausgleichsproblem

Die Zielfunktion ist exakt das Ausgleichsproblem

```math
\min_x\left\|\begin{pmatrix}A\\\alpha L\end{pmatrix}x-\begin{pmatrix}b\\\alpha Lx_0\end{pmatrix}\right\|_2^2
```

Die Ableitung liefert die Normalgleichung

```math
(A^TA+\alpha^2L^TL)x=A^Tb+\alpha^2L^TLx_0
```

Die Lösung ist genau dann eindeutig, wenn

```math
\operatorname{null}(A)\cap\operatorname{null}(L)=\{0\}
```

Für die gewöhnliche Ridge-Regularisierung mit $$L=I$$ gilt diese Bedingung für jedes $$\alpha>0$$, denn $$A^TA+\alpha^2I$$ ist positiv definit.

Visible text: Für die gewöhnliche Ridge-Regularisierung mit gilt diese Bedingung für jedes , denn ist positiv definit.

## Spektrale Filterung

Für $$L=I$$ und $$x_0=0$$ sei $$A=U\Sigma V^T$$. Dann gilt

Visible text: Für und sei . Dann gilt

Component: MathContainer
Children:

```math
x_\alpha=\sum_i\frac{\sigma_i}{\sigma_i^2+\alpha^2}(u_i^Tb)v_i
```

```math
\phi_i(\alpha)=\frac{\sigma_i^2}{\sigma_i^2+\alpha^2}
```

Der Faktor $$\phi_i$$ liegt nahe bei $$1$$, wenn $$\sigma_i\gg\alpha$$, und nahe bei $$0$$, wenn $$\sigma_i\ll\alpha$$. Die Regularisierung erhält somit gut bestimmte Richtungen und dämpft Richtungen, die Rauschen verstärken würden.

Visible text: Der Faktor liegt nahe bei , wenn , und nahe bei , wenn . Die Regularisierung erhält somit gut bestimmte Richtungen und dämpft Richtungen, die Rauschen verstärken würden.

## Gerechnetes Sensitivitätsbeispiel

Wir betrachten

Component: MathContainer
Children:

```math
A=\begin{pmatrix}1&0\\0&0{,}1\end{pmatrix},\qquad b=\begin{pmatrix}1\\0{,}2\end{pmatrix}
```

```math
x_{\mathrm{LS}}=A^{-1}b=\begin{pmatrix}1\\2\end{pmatrix}
```

Der zweite Singulärwert beträgt nur $$0{,}1$$. Eine Änderung der zweiten Beobachtung um $$0{,}01$$ ändert den zweiten unregularisierten Parameter um $$0{,}1$$.

Visible text: Der zweite Singulärwert beträgt nur . Eine Änderung der zweiten Beobachtung um ändert den zweiten unregularisierten Parameter um .

Mit $$L=I$$, $$x_0=0$$ und $$\alpha=0{,}2$$ folgt

Visible text: Mit , und folgt

Component: MathContainer
Children:

```math
(A^TA+0{,}2^2I)x=A^Tb
```

```math
x_{0{,}2}=\begin{pmatrix}1/1{,}04\\0{,}02/0{,}05\end{pmatrix}=\begin{pmatrix}25/26\\0{,}4\end{pmatrix}
```

Dieselbe Störung um $$0{,}01$$ verändert den zweiten Parameter nun nur um $$0{,}02$$. Diese Stabilität kostet Verzerrung: Der Schätzwert $$0{,}4$$ liegt weiter vom unregularisierten Wert $$2$$ entfernt.

Visible text: Dieselbe Störung um verändert den zweiten Parameter nun nur um . Diese Stabilität kostet Verzerrung: Der Schätzwert liegt weiter vom unregularisierten Wert entfernt.

## Wahl des Regularisierungsparameters

Es gibt keinen universell besten Wert für $$\alpha$$. Er hängt vom Rauschniveau, von der Parameterskalierung, von der Strafe und vom Zweck des Modells ab.

Visible text: Es gibt keinen universell besten Wert für . Er hängt vom Rauschniveau, von der Parameterskalierung, von der Strafe und vom Zweck des Modells ab.

| Methode | Geeignete Evidenz | Entscheidung |
| --- | --- | --- |
| Validierung oder Kreuzvalidierung | Vorhersagemodell mit zurückgehaltenen Beobachtungen | Den Wert mit der besten Leistung außerhalb der Trainingsdaten wählen |
| Diskrepanzprinzip | Belastbare Schätzung der Norm des Beobachtungsrauschens | Residualnorm an das erwartete Rauschniveau anpassen |
| Verallgemeinerte Kreuzvalidierung | Lineares inverses Problem ohne eigenen Validierungssatz | Einen aus dem angepassten System berechneten Vorhersagewert minimieren |
| L-Kurve | Explorative Analyse inverser Probleme | Die Ecke der Kurve aus Residualnorm und Strafnorm untersuchen |

Ein kleines $$\alpha$$ betont die Datentreue und kann Rauschverstärkung bestehen lassen. Ein großes $$\alpha$$ betont die Strafe und kann die Lösung zu stark glätten oder schrumpfen. Auch Parameterspalten und Strafzeilen müssen sinnvoll skaliert sein. Andernfalls lässt sich der Zahlenwert von $$\alpha$$ kaum interpretieren.

Visible text: Ein kleines betont die Datentreue und kann Rauschverstärkung bestehen lassen. Ein großes betont die Strafe und kann die Lösung zu stark glätten oder schrumpfen. Auch Parameterspalten und Strafzeilen müssen sinnvoll skaliert sein. Andernfalls lässt sich der Zahlenwert von kaum interpretieren.

## Allgemeine Gewichte und Nebenbedingungen

Eine Diagonalmatrix $$L=\operatorname{diag}(\omega_1,\ldots,\omega_n)$$ erzeugt parameterspezifische Strafen:

Visible text: Eine Diagonalmatrix erzeugt parameterspezifische Strafen:

```math
\|L(x-x_0)\|_2^2=\sum_{i=1}^n\omega_i^2(x_i-x_{0i})^2
```

Ein größeres $$\omega_i$$ bedeutet eine stärkere Schrumpfung in Richtung $$x_{0i}$$. Die Gewichte sollten jedoch Einheiten und eine begründbare Vorstruktur widerspiegeln, nicht bloß kennzeichnen, welche Koeffizienten schwer zu schätzen sind.

Visible text: Ein größeres bedeutet eine stärkere Schrumpfung in Richtung . Die Gewichte sollten jedoch Einheiten und eine begründbare Vorstruktur widerspiegeln, nicht bloß kennzeichnen, welche Koeffizienten schwer zu schätzen sind.

Eine Gleichung wie $$x_i=c$$ sollte als ausdrückliche Gleichungsnebenbedingung modelliert werden, wenn sie exakt gelten muss. Schranken wie $$l_i\le x_i\le u_i$$ erfordern ein beschränktes Ausgleichsproblem. Eine extrem große Strafe kann eine Gleichung annähern, ersetzt aber keine exakte Nebenbedingung und kann die numerische Skalierung verschlechtern.

Visible text: Eine Gleichung wie sollte als ausdrückliche Gleichungsnebenbedingung modelliert werden, wenn sie exakt gelten muss. Schranken wie erfordern ein beschränktes Ausgleichsproblem. Eine extrem große Strafe kann eine Gleichung annähern, ersetzt aber keine exakte Nebenbedingung und kann die numerische Skalierung verschlechtern.

## Zuverlässige numerische Lösung

Die Normalgleichung ist für die Analyse nützlich, doch das ausdrückliche Bilden von $$A^TA$$ quadriert die Konditionszahl. In numerischem Code sollte das erweiterte Ausgleichssystem mit QR oder SVD gelöst werden, wenn Stabilität wichtig ist. Dokumentiert werden sollten $$\alpha$$, $$L$$, die Parameterskalierung, die Residualnorm und die Strafnorm. So bleibt die Abwägung nachvollziehbar, statt den regularisierten Schätzwert als reine Aussage der Daten zu behandeln.

Visible text: Die Normalgleichung ist für die Analyse nützlich, doch das ausdrückliche Bilden von quadriert die Konditionszahl. In numerischem Code sollte das erweiterte Ausgleichssystem mit QR oder SVD gelöst werden, wenn Stabilität wichtig ist. Dokumentiert werden sollten , , die Parameterskalierung, die Residualnorm und die Strafnorm. So bleibt die Abwägung nachvollziehbar, statt den regularisierten Schätzwert als reine Aussage der Daten zu behandeln.