Quartilpositionen innerhalb von Klassenintervallen schätzen
Bei ungruppierten Daten können wir jeden Wert sortieren und seine genaue Position bestimmen. Eine gruppierte Häufigkeitstabelle enthält dagegen nur Intervalle, zum Beispiel und , sowie die Anzahl der Werte in jedem Intervall. Die einzelnen Messwerte sind nicht enthalten.
Wie beim Median gruppierter Daten bestimmen wir , und deshalb durch Interpolation. Wir schätzen, an welcher Stelle innerhalb des betreffenden Klassenintervalls das Quartil liegt.
Wir bestimmen die Position des Quartils mit dieser Formel:
- liegt an der Position .
- liegt an der Position , also .
- liegt an der Position .
Dabei bezeichnet die Gesamtzahl aller Werte.
Vorgehen bei gruppierten Daten
Als Beispiel betrachten wir die nach Schuhgrößen gruppierten Verkaufszahlen eines Geschäfts. Die Häufigkeitstabelle unten nennt jede Klasse und die Zahl der verkauften Paare darin, und die Quartile werden durch Interpolation in der Klasse geschätzt, die die gesuchte Position enthält. Arbeite die Schritte mit der Tabelle daneben durch, denn jeder eingesetzte Wert stammt aus ihr.
Kumulative Häufigkeitstabelle aufstellen
Zuerst ergänzen wir die kumulierte Häufigkeit . Sie addiert alle Häufigkeiten von der ersten Klasse bis einschließlich der betrachteten Klasse. Daran erkennen wir, in welchem Intervall eine gesuchte Position liegt.
Die vollständige Tabelle sieht so aus:
| Schuhgröße | Häufigkeit () | Kumulierte Häufigkeit () | Untere Grenze () | Obergrenze () | Klassenbreite () |
|---|---|---|---|---|---|
| Gesamt |
Die untere Klassenschwelle ist die untere Klassengrenze minus .
Die obere Klassenschwelle ist die obere Klassengrenze plus .
Die Klassenbreite ist die obere Klassenschwelle minus die untere Klassenschwelle.
Quartilklasse bestimmen
Nun bestimmen wir zunächst die Position jedes Quartils.
Insgesamt liegen = Werte vor.
-
Position von : .
In der Spalte endet die erste Klasse an Position und die zweite an Position . Die Positionen bis gehören zur zweiten Klasse, sodass Position in der Klasse liegt.
-
Position von (Median): .
In der Spalte liegt die Position in der Klasse : Der vorherige Wert von ist , der Wert von in dieser Klasse ist .
-
Position von : .
In der Spalte liegt auch die Position in der Klasse : Der vorherige Wert von ist , der Wert von in dieser Klasse ist .
Quartilwert interpolieren
Sobald die Quartilklasse feststeht, schätzen wir den Wert innerhalb des Intervalls mit folgender Formel:
Die Größen in dieser Formel bedeuten:
- = Wert des gesuchten Quartils
- = untere Grenze der Quartilklasse
- = Gesamtzahl der Werte
- = kumulierte Häufigkeit vor der -ten Quartilklasse
- = Häufigkeit der Quartilklasse
- = Klassenbreite
Diese Interpolation setzt voraus, dass die Beobachtungen innerhalb der gewählten Klasse gleichmäßig verteilt sind. Sie liefert eine modellbasierte Schätzung und kann die bei der Gruppierung weggelassenen Einzelwerte nicht rekonstruieren.
Unteres Quartil der Schuhverkäufe
Berechnen wir aus der obigen Tabelle.
Position von : . Klasse von : . Einzusetzende Werte
| Größe | Wert |
|---|---|
| Werte einsetzen: |
Damit ergibt sich für der Wert . Nach dem gruppierten Modell entfallen also etwa der Verkäufe auf Schuhgröße oder kleiner.
Übung
Berechne anhand der Schuhverkaufsdaten aus der Tabelle.
Vergleiche anschließend die Interpolation bei gruppierten Daten mit der Quartilbestimmung für ungruppierte Daten. Warum liefert die gruppierte Tabelle nur einen Schätzwert?
Lösung
Position von : . Klasse von : . Einzusetzende Werte
| Größe | Wert |
|---|---|
| Werte einsetzen: |
Damit ergibt sich für der Wert . Im gruppierten Modell haben etwa der verkauften Schuhe die Größe oder eine kleinere Größe. Die übrigen haben eine Schuhgröße über .
Vergleich mit Einzeldaten:
Bei gruppierten Daten enthält die Tabelle Intervalle und Häufigkeiten ohne die einzelnen Werte. Deshalb liefert die Interpolation einen geschätzten Quartilwert.
Bei ungruppierten Daten sind die sortierten Einzelwerte bekannt. Die gewählte Quartilkonvention kann deshalb einen Wert auswählen oder direkt zwischen zwei bekannten Werten interpolieren. Die Interpolation gruppierter Daten ist ungenauer, weil die Beobachtungen innerhalb jeder Klasse nicht mehr vorliegen.