Etwas Neues beginnt. Auf den Blättern 1 bis 4 war das Modell bekannt, etwa „der Würfel
ist fair“ oder „die Füllmenge ist N(500,12)-verteilt“. Daraus wurden Wahrscheinlichkeiten
berechnet. Ab jetzt ist es umgekehrt: Es liegen Daten vor, also beobachtete Werte. Aus
ihnen will man etwas über die unbekannte Verteilung dahinter lernen. Das Skript fasst das so
zusammen: bisher „Modell → Daten“, ab jetzt „Daten → Modell“.
Die Daten hier: Acht Studierende haben gesagt, wie viel Geld sie im Monat ausgeben, in
Euro. Sieben Werte liegen zwischen 290 und 340 Euro. Ein Wert fällt auf: 1.200 Euro.
Gesucht ist:
-
(i) von Hand zwei Zahlen, die einen „typischen Wert“ der Ausgaben angeben: den
Stichprobenmittelwert xˉ8 und den Median x˙8. Beide werden in
den Schritten 2 und 3 genau erklärt. Danach der Vergleich: Warum liegen sie so weit
auseinander?
- (ii) dieselben zwei Zahlen mit der Statistik-Software R, als Kontrolle.
-
(iii) eine Prüfung mit einer festen Regel, der IQR-Regel: Ist die 1.200 ein
Ausreißer, also ein Wert, der deutlich von den übrigen abweicht? IQR steht für
Interquartilsabstand, den Abstand zwischen den beiden Grenzen, die das untere und das
obere Viertel der Werte abtrennen (Schritt 11).
Die Tabelle mit den R-Befehlen und der Hinweis zur Ausreißer-Regel stehen auf dem
Aufgabenblatt. Sie gehören zur Aufgabe und werden im Lauf des Wegs erklärt.
Der Weg in drei Etappen und eine Ergänzung:
-
(i) Werte sortieren, Mittelwert und Median von Hand, vergleichen. Dann erklären, warum ein
einziger Wert den Mittelwert so stark verschiebt (Robustheit, Bruchpunkt).
-
(ii) Beides mit
mean und median in R
nachrechnen.
-
(iii) Die Quantile x0,25 und x0,75 bestimmen, daraus den Interquartilsabstand
und zwei Schranken. Jeder Wert außerhalb der Schranken ist ein Ausreißer. Zum Schluss
dasselbe in R.
- Ergänzung: Mittelwert und Median noch einmal ohne die 1.200.
Merke: Der Mittelwert hängt von der Größe jedes einzelnen Werts ab. Ein extremer Wert
zieht ihn mit. Der Median hängt nur von der Reihenfolge ab. Ein extremer Wert verschiebt ihn
kaum.
Zur Musterlösung: Im Text zu (iii) steht die obere Schranke
xupper=352.
Der R-Code der Musterlösung direkt darüber gibt
357,625 aus, und das ist richtig (Schritt
12). Das Ergebnis bleibt gleich: 1.200 liegt über beiden Zahlen. Für die Quantile nennen
Skript und Musterlösung keine Rechenregel. Hier gilt die Regel von R (Schritt 8).
n=8:
290≤298≤305≤310≤315≤320≤340≤1.200
Die acht beobachteten Werte heißen zusammen Stichprobe. Man schreibt sie als x1,x2,…,x8. Dabei ist xi der Wert der i-ten befragten Person, in der
Reihenfolge, in der die Daten erhoben wurden. Also x1=320, x2=290 und so weiter
bis x8=1.200, alles in Euro.
Die Anzahl der Werte heißt Stichprobenumfang n. Hier ist n=8. Deshalb tragen
die gesuchten Größen die 8 im Namen: xˉ8 und x˙8.
Für den Median und die Quantile braucht man die Werte der Größe nach. Die
sortierte Stichprobe schreibt man mit Klammern um den Index: x(1) ist der
kleinste Wert, x(2) der zweitkleinste, …, x(8) der größte. Die Klammer
unterscheidet „der i-te nach Größe“ (x(i)) von „der i-te in der Liste“ (xi).
Sortiert: 290, 298, 305, 310, 315, 320, 340, 1.200. Zum Beispiel ist x(4)=310, aber x4=305.
Im Bild stehen die Werte als Punkte auf einem Zahlenstrahl. Die kleine Zahl über jedem
Punkt ist seine Stelle in der sortierten Stichprobe, also das i in x(i). Über 310
steht deshalb 4, denn x(4)=310.
Die 1.200 liegt so weit rechts, dass die Achse zwischen 430 und 1.190 Euro unterbrochen
ist. Maßstabsgetreu wäre das Bild rund fünfmal so breit. Oder, in dieser Breite: Die
sieben anderen Punkte lägen fast aufeinander.
Aus Aufgabe 1 („Histogramm: Wartezeiten an der Bushaltestelle“): Eine Stichprobe
x1,…,xn sind
n beobachtete Werte,
n ist der Stichprobenumfang. Die sortierte
Stichprobe
x(1)≤⋯≤x(n) ordnet sie vom kleinsten zum größten Wert.
xˉ8=83.378=422,25 €
Der Stichprobenmittelwert xˉn (gelesen „x quer n“) ist das, was man im
Alltag „Durchschnitt“ nennt: alle Werte addieren und durch ihre Anzahl teilen.
In der Formel steht das Summenzeichen ∑i=1nxi. Es ist eine Kurzschrift
für x1+x2+⋯+xn: Man setzt für i nacheinander 1,2,…,n ein und
addiert alles.
Hier sind es acht Werte. Die Tabelle addiert sie Schritt für Schritt in der Reihenfolge
der Aufgabe. Die Summe ist 3.378 Euro. Geteilt durch n=8:
xˉ8=83.378=422,25
Die Division geht glatt auf: 8⋅422=3.376, Rest 2, und 2:8=0,25. Es muss
also nicht gerundet werden.
Was der Mittelwert bedeutet: Würden alle acht gleich viel ausgeben und zusammen
genauso viel wie jetzt (3.378 €), dann gäbe jede Person 422,25 € aus. Das Skript erklärt
das mit einem Aufzug: Man ersetzt die Gruppe durch gleich schwere „Klone“, die den Aufzug
genauso belasten.
Schätzer: Die acht Studierenden sind nur ein kleiner Teil aller Studierenden. Der
Mittelwert der acht ist deshalb eine Schätzung für die unbekannten mittleren
Ausgaben aller Studierenden, also für den Erwartungswert μ. Eine Zahl, die man aus
einer Stichprobe berechnet, um eine unbekannte Größe der Verteilung zu schätzen, heißt
Schätzer.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“): Der
Erwartungswert
μ=E(X) ist der Wert, um den eine Zufallsvariable
X im Mittel
schwankt — sozusagen der Durchschnitt über unendlich viele Wiederholungen.
x˙8=2x(4)+x(5)=2310+315=312,5 €
Der Median x˙n (gelesen „x Punkt n“) ist der mittlere Wert der
sortierten Stichprobe. Er teilt sie in eine untere und eine obere Hälfte. Das
Skript nennt ihn auch Stichprobenmedian.
Die Formel hat zwei Fälle, weil es nicht immer genau einen mittleren Wert gibt:
-
n ungerade, etwa 7 Werte: Es gibt genau einen Wert in der Mitte, an Stelle
2n+1=4. Er ist der Median.
-
n gerade, etwa 8 Werte: Es gibt zwei mittlere Werte, an den Stellen
2n und 2n+1. Der Median liegt genau in der Mitte zwischen ihnen,
ist also ihr Durchschnitt.
Hier ist n=8 gerade. Die mittleren Stellen sind 28=4 und 5. Aus der
sortierten Stichprobe (Schritt 1): x(4)=310 und x(5)=315. Also
x˙8=2310+315=2625=312,5
Probe: Vier Werte liegen darunter (290, 298, 305, 310), vier darüber (315, 320,
340, 1.200). Genau das soll der Median leisten.
Der Median ist das 50-%-Quantil x0,5: Die Hälfte der Werte liegt darunter.
Mehr zu Quantilen in Schritt 8.
Merke: Vor dem Median immer sortieren. In der unsortierten Liste stehen an Stelle 4
und 5 die Werte 305 und 340 — das ergäbe fälschlich 322,5.
422,25−312,5=109,75 €
Beide Zahlen sollen einen „typischen Wert“ beschreiben. Trotzdem liegt der Mittelwert um
422,25−312,5=109,75 Euro über dem Median.
Was fällt auf?
-
Sieben der acht Werte liegen unter dem Mittelwert, nur die 1.200 darüber
(Tabelle). Niemand gibt auch nur ungefähr 422 € aus: Der größte der sieben Werte ist 340
€.
- Der Median liegt dagegen mitten in der dichten Gruppe der sieben Werte.
Das deutet darauf hin, dass ein einziger Wert, die 1.200, den Mittelwert stark nach oben
zieht. Einen Wert, der so deutlich von den übrigen abweicht, nennt man Ausreißer.
Ob die 1.200 nach einer festen Regel wirklich als Ausreißer zählt, prüft Teil (iii).
Für diese Daten beschreibt der Median die Ausgaben einer typischen Person also besser.
Warum das so ist, zeigen die nächsten beiden Schritte.
Merke: Liegen Mittelwert und Median weit auseinander, ist das ein Warnzeichen. Oft
steckt ein einzelner extremer Wert oder eine schiefe Verteilung dahinter. Das Skript sagt
dazu: Liegen viele Werte links und wenige weit rechts („rechtsschief“), wird der
Mittelwert nach oben gezogen.
1.200 statt 340: Mittelwert
+8860=+107,5 €, Median
±0
Ein Schätzer heißt robust, wenn er stabil gegenüber Ausreißern ist: Ein einzelner
auffälliger Wert verschiebt ihn kaum.
Ein Gedankenspiel zeigt den Unterschied. Angenommen, die achte Person gäbe nicht
1.200 €, sondern nur 340 € aus — so viel wie der zweitgrößte Wert x(7). Die 1.200
liegt 1.200−340=860 Euro darüber.
Mittelwert: Die Summe wäre um 860 kleiner, 3.378−860=2.518. Der Mittelwert
wäre 82.518=314,75. Er fiele also um 422,25−314,75=107,5 Euro.
Das ist genau 8860: Jeder Euro eines einzelnen Werts geht mit 81 in
den Mittelwert ein. Allein der Überschuss der 1.200 macht also über 100 Euro des
Mittelwerts aus.
Median: Er hängt nur von x(4) und x(5) ab. Die bleiben 310 und 315, egal
ob der größte Wert 340, 1.200 oder eine Million ist. Der Median bliebe 312,5 €.
Im Bild zeigt der Pfeil, wohin der Mittelwert rutschen würde: fast auf den Median.
Merke: Der Median ist robust, der Mittelwert nicht. Ändert sich ein einzelner Wert
um einen Betrag, ändert sich der Mittelwert um diesen Betrag geteilt durch
n.
εxˉ∗=n1=81,
εx˙∗=21
Wie robust ein Schätzer ist, misst der Bruchpunkt ε∗ („epsilon
Stern“). Das ist der Anteil an Ausreißern in der Stichprobe, ab dem der Schätzer
unbrauchbar wird. „Unbrauchbar“ heißt: Man kann ihn durch diese Ausreißer beliebig weit
wegziehen.
Mittelwert, ε∗=n1: Schon ein Wert von n reicht.
Macht man die 1.200 immer größer, wächst der Mittelwert immer weiter mit (Schritt 5). Hier
ist das 1 von 8 Werten, also 81=12,5%. Je größer n, desto weniger
zieht ein einzelner Wert. Beliebig weit ziehen kann ihn aber auch dann ein einziger
extremer Wert.
Median, ε∗=21: Erst wenn die Hälfte der Werte Ausreißer
sind, kippt er. Die Tabelle zeigt das für n=8. Der Median ist 21(x(4)+x(5)). Werden die drei größten Werte riesig, stehen an Stelle 4 und 5 immer noch
310 und 315. Erst wenn vier Werte riesig werden, ist auch x(5) riesig — und der
Median wächst mit. Vier von acht ist die Hälfte. Bei jedem n braucht man ungefähr die
Hälfte, bei ungeradem n einen Wert mehr als die Hälfte (bei n=7 vier Werte). Deshalb
sagt man kurz: Bruchpunkt 21.
Das Skript nennt dazu noch eine Stärke des Mittelwerts: Bei symmetrischen Daten ohne
Ausreißer schätzt er genauer als der Median („effizienter“). Der Median eignet sich
besonders für kleine oder verrauschte Datensätze — wie diesen.
Merke: Bruchpunkt des Mittelwerts
n1: ein einziger Ausreißer genügt.
Bruchpunkt des Medians
21: erst die Hälfte der Werte.
mean(x) → 422.25, median(x) →
312.5
R ist eine kostenlose Statistik-Software, mit der die Musterlösung rechnet. Der
Code im Lösungsweg macht Zeile für Zeile Folgendes:
-
x <- c(320, 290, …, 1200) legt die acht Werte unter dem
Namen x ab. Der Pfeil <- heißt
„speichere unter“, c(…) fasst die Zahlen zu einer Liste
zusammen. R schreibt Dezimalzahlen mit Punkt statt Komma. Tausenderpunkte kennt R nicht:
Aus 1.200 wird in R 1200, aus 422,25 wird
422.25.
-
sort(x) zeigt die sortierte Stichprobe — wie in Schritt 1.
-
mean(x) berechnet den Stichprobenmittelwert (mean ist
englisch für Mittelwert): 422,25.
median(x) berechnet den Median: 312,5.
Die Zeilen mit #[1] sind die Antworten von R. Das
[1] heißt nur: Die Ausgabe beginnt mit dem ersten Eintrag.
Beide Werte stimmen mit (i) überein.
Aus Aufgabe 1 („Histogramm: Wartezeiten an der Bushaltestelle“): Mit
x <- c(…) gibt man eine Stichprobe in R ein. Danach rechnen
alle Befehle mit x.
Stelle
h=1+(n−1)⋅p,
xp=x(k)+f⋅(x(k+1)−x(k))
(iii) vermutet: Ein Wert verzerrt die Schätzer. Er zieht sie also weg von dem, was
für die meisten Werte typisch ist. Zur Prüfung dient die IQR-Regel vom Aufgabenblatt. Sie
braucht zwei Quantile, x0,25 und x0,75.
Was ist ein Quantil? Das Quantil xp ist eine Grenze, unter der ungefähr der
Anteil p der Werte liegt. p ist eine Zahl zwischen 0 und 1:
- x0,25: Etwa ein Viertel der Werte liegt darunter.
- x0,5: Etwa die Hälfte liegt darunter — das ist der Median.
- x0,75: Etwa drei Viertel liegen darunter.
Warum „ungefähr“ — und warum eine Regel? Bei 8 Werten liegen unter einer Grenze
immer 0, 1, 2, … oder 8 Werte, also 0 %, 12,5 %, 25 % und so weiter. Unter
jeder Zahl von knapp über 298 bis 305 liegen genau zwei Werte (290 und 298), also
25 %. Welche dieser Zahlen soll x0,25 sein? Das legt eine Rechenregel fest. Das
Skript nennt keine. Hier gilt die Regel, nach der R mit
quantile(x, p) rechnet:
-
Die Stelle h=1+(n−1)⋅p in der sortierten Stichprobe ausrechnen. Für
p=0 ist h=1 (der kleinste Wert), für p=1 ist h=n (der größte).
Dazwischen wandert die Stelle gleichmäßig.
-
Ist h eine ganze Zahl, ist xp=x(h). Sonst liegt h zwischen zwei Stellen.
Dann ist k die Zahl vor dem Komma und f der Rest nach dem Komma, also h=k+f.
Man geht von x(k) den Anteil f des Wegs bis x(k+1). Das heißt
lineares Dazwischenrechnen.
Probe mit dem Median (p=0,5, n=8): h=1+7⋅0,5=4,5, also
k=4 und f=0,5. Halber Weg von x(4)=310 nach x(5)=315: 310+0,5⋅5=312,5. Das ist genau der Median aus Schritt 3. Die Regel passt also zur
Median-Formel.
Andere Bücher und Programme benutzen teils etwas andere Regeln. Dann weichen die Quantile
etwas ab, hier um bis zu 10 Euro (zum Beispiel 335 statt 325 für x0,75). Am
Ergebnis ändert das nichts: Die 1.200 liegt bei jeder Regel weit außerhalb. In dieser
Übung gilt die Regel von R.
Aus Blatt 4, Aufgabe 5 („Quantile: die Füllmenge einer Kaffeepackung“): Dort war
das Quantil einer
Verteilung die Grenze
qα, links von der die Fläche
α unter der Dichte liegt, berechnet mit
qnorm. Das
Quantil
xp hier ist dasselbe für
Daten: Statt einer Fläche zählt der Anteil der
Werte.
h=2,75:
x0,25=298+0,75⋅7=303,25 €
Jetzt die Regel aus Schritt 8 für p=0,25, mit n=8:
h=1+(8−1)⋅0,25=1+7⋅0,25=1+1,75=2,75
Die Stelle 2,75 liegt zwischen Stelle 2 und Stelle 3. Also k=2 und f=0,75.
Die beiden Nachbarn in der sortierten Stichprobe: x(2)=298 und x(3)=305. Der
Weg von 298 bis 305 ist 305−298=7 Euro lang. Davon geht man drei Viertel (f=0,75):
0,75⋅7=5,25, x0,25=298+5,25=303,25
Probe: Unter 303,25 € liegen 290 und 298, also 2 von 8 Werten. Das sind
82=25% — wie gewünscht.
Im Bild liegt die Linie x0,25 zwischen dem 2. und dem 3. Punkt, näher am 3. Punkt.
x0,25 heißt auch unteres Quartil („Quartil“ von lateinisch quartus,
der Vierte: Es trennt das untere Viertel ab).
h=6,25:
x0,75=320+0,25⋅20=325 €
Dieselbe Regel für p=0,75:
h=1+7⋅0,75=1+5,25=6,25
Die Stelle 6,25 liegt zwischen Stelle 6 und Stelle 7. Also k=6 und f=0,25.
Die Nachbarn: x(6)=320 und x(7)=340. Der Weg ist 340−320=20 Euro lang.
Davon ein Viertel:
0,25⋅20=5, x0,75=320+5=325
Probe: Unter 325 € liegen sechs Werte (290 bis 320), also 86=75%.
Darüber liegen 340 und 1.200, das restliche Viertel.
x0,75 heißt auch oberes Quartil: Es trennt das obere Viertel ab.
Beachte: Für x0,75 braucht man nur x(6) und x(7). Die 1.200 an
Stelle 8 spielt keine Rolle. Wäre sie 12.000, bliebe x0,75=325. Auch die Quartile
sind also robust.
IQR=325−303,25=21,75 €
Der Interquartilsabstand ist der Abstand zwischen den beiden Quartilen. Abgekürzt
wird er IQR, vom englischen interquartile range. Das Aufgabenblatt und R
benutzen diese Abkürzung.
IQR=x0,75−x0,25=325−303,25=21,75 Euro
Was er bedeutet: Zwischen x0,25 und x0,75 liegt die mittlere Hälfte
der Werte. Hier sind das 305, 310, 315 und 320, also vier von acht. Im Bild ist dieser
Bereich die blaue Box zwischen den Linien x0,25 und x0,75. Der IQR ist ihre
Breite.
Der IQR ist ein Maß für die Streuung: Wie weit liegen die typischen Werte
auseinander? Hier nur 21,75 Euro — die mittlere Hälfte der Studierenden gibt ziemlich
ähnlich viel aus.
Wie die Quartile hängt der IQR nicht von den äußersten Werten ab. Er ist deshalb ein
robustes Streuungsmaß. Die 1.200 kann ihn nicht aufblähen. Genau deshalb eignet er
sich, um Ausreißer zu erkennen.
xlower=270,625 €,
xupper=357,625 €
Aus Box und IQR baut man zwei Schranken (Grenzen). Man geht von jedem Ende der Box
das 1,5-Fache des IQR nach außen:
-
untere Schranke xlower=x0,25−1,5⋅IQR (englisch
lower, „unten“),
-
obere Schranke xupper=x0,75+1,5⋅IQR (englisch
upper, „oben“).
Zuerst der Abstand: 1,5⋅21,75=32,625 Euro.
xlower=303,25−32,625=270,625
xupper=325+32,625=357,625
Die Zahlen gehen ohne Rundung auf, deshalb stehen sie mit drei Nachkommastellen da.
Warum gerade 1,5? Das ist eine feste Vereinbarung. Das Skript zeigt, was sie bei
normalverteilten Daten bedeutet: Die Schranken liegen dann etwa 2,7 Standardabweichungen
σ von der Mitte entfernt. Außerhalb liegen nur rund 0,7 % der Werte. Ein Wert dort
draußen ist also ungewöhnlich.
Aus Blatt 4, Aufgabe 1 („Normalverteilung: die σ-Regeln“): Bei normalverteilten
Daten ist
σ die Standardabweichung: Sie misst, wie weit die Werte typischerweise
vom Erwartungswert
μ abweichen. Im Bereich
μ±σ liegen etwa 68,2 % der
Werte, im Bereich
μ±2σ etwa 95,4 %.
Zur Musterlösung: Im Text steht xupper=352. Der R-Code der
Musterlösung gibt 357,625 aus, und die Rechnung oben bestätigt das: 325+32,625=357,625. Für das Ergebnis ist es gleich, denn 1.200 liegt über beiden Zahlen.
nur
1.200>357,625 ⇒ 1.200 ist ein Ausreißer
Die IQR-Regel sagt: Ein Wert x ist ein Ausreißer, wenn er unter der
unteren Schranke oder über der oberen Schranke liegt. Das ist der Hinweis vom
Aufgabenblatt: Kein Ausreißer ist, wer im Intervall [270,625; 357,625] liegt.
Die Tabelle prüft jeden der acht Werte:
-
Der kleinste Wert 290 liegt über 270,625. Also liegt kein Wert unter der unteren
Schranke.
- Die Werte 290 bis 340 liegen alle unter 357,625. Sie sind keine Ausreißer.
-
Nur 1.200>357,625. Die 1.200 liegt sogar 842,375 Euro über der oberen Schranke.
Ergebnis: Genau ein Ausreißer, die 1.200. Die Vermutung aus (iii) stimmt: Dieser
eine Wert ist es, der den Mittelwert so weit nach oben zieht.
Im Bild ist der grüne Bereich alles zwischen den Schranken. Sieben Punkte liegen darin,
nur die 1.200 (rot eingekreist) liegt weit rechts außerhalb.
Merke: Die IQR-Regel markiert einen Wert nur als auffällig. Ob er ein Fehler ist
oder echt, sagt sie nicht. Das muss man an den Daten selbst klären.
x[x < lower | x > upper] →
1200
Die Aufgabe verlangt die Prüfung mit R. Der Code im Lösungsweg ist der der Musterlösung,
dazu die Ausgaben von R.
Erster Block: quantile(x, 0.25) und
quantile(x, 0.75) geben die Quartile, 303,25 und 325 — wie in
den Schritten 9 und 10. Über der Zahl druckt R einen Namen,
25% bzw. 75%. Er sagt nur, welches
Quantil das ist. IQR(x) gibt 21,75.
Zweiter Block: Die Ergebnisse werden unter kurzen Namen gespeichert (q1, q3, iqr) und daraus die Schranken
berechnet. Der Stern * heißt „mal“. R gibt 270,625 und 357,625
aus. Über den Zahlen steht wieder 25% bzw.
75%: R übernimmt den Namen von q1 und
q3. Er hat hier keine Bedeutung.
Dritter Block: x < lower | x > upper fragt für
jeden Wert: Liegt er unter lower oder über
upper? Der senkrechte Strich | heißt
„oder“. R antwortet für jeden der acht Werte in der Reihenfolge der Eingabe mit
TRUE (wahr) oder FALSE (falsch). Nur
der achte Wert, die 1.200, ergibt TRUE.
x[…] mit eckigen Klammern wählt aus
x genau die Werte aus, bei denen
TRUE steht. Ergebnis: 1.200. Das bestätigt die Tabelle aus
Schritt 13.
ohne 1.200:
xˉ7≈311,14 €,
x˙7=310 €
Diese Ergänzung geht über die Aufgabe hinaus. Die IQR-Regel hat die 1.200 als
Ausreißer markiert. Was wäre ohne sie? Die Rechnung zeigt an den echten Daten, wie
verschieden stark sich Mittelwert und Median bewegen.
Ohne die 1.200 bleiben sieben Werte, also n=7. Ihre Summe steht schon in der Tabelle
von Schritt 2 (vorletzte Zeile): 2.178=3.378−1.200.
xˉ7=72.178=311,142857…≈311,14
Die Division geht nicht auf, deshalb wird auf zwei Nachkommastellen, also auf Cent,
gerundet.
n=7 ist ungerade. Der Median ist der Wert an Stelle 27+1=4 der sortierten
sieben Werte 290,298,305,310,315,320,340: x˙7=310.
Vergleich:
- Der Mittelwert fällt um 422,25−311,14=111,11 Euro.
- Der Median fällt nur um 312,5−310=2,5 Euro.
Die Balken unten im Panel zeigen in diesem Schritt die Werte ohne die 1.200, das Minus
daneben den Unterschied. Ohne die 1.200 liegen Mittelwert und Median fast gleich — so wie
das Skript es für symmetrische Daten beschreibt. Das bestätigt von der anderen Seite, was
Schritt 5 im Gedankenspiel gezeigt hat.
Aber: Einen Wert einfach wegzulassen, ist nur mit gutem Grund erlaubt, etwa bei
einem Tippfehler. Die 1.200 kann echt sein, zum Beispiel bei hoher Miete. Dann gehört sie
zu den Daten.
| Größe |
Rechnung |
Wert |
| Mittelwert xˉ8 |
3.378:8 |
422,25 € |
| Median x˙8 |
(310+315):2 |
312,5 € |
| x0,25 |
298+0,75⋅7 |
303,25 € |
| x0,75 |
320+0,25⋅20 |
325 € |
| IQR |
325−303,25 |
21,75 € |
| Schranken |
303,25−32,625 / 325+32,625 |
270,625 / 357,625 € |
In Worten: Im Durchschnitt geben die acht Studierenden 422,25 € im Monat aus. Die
Hälfte gibt aber höchstens 312,5 € aus, und sieben von acht liegen unter dem Durchschnitt.
Der Grund ist eine einzige Person mit 1.200 €. Nach der IQR-Regel ist sie ein Ausreißer. Für
eine typische Person beschreibt der Median die Ausgaben besser als der Mittelwert.
Der Weg in Kürze:
-
Sortieren, dann Mittelwert (Summe durch n) und Median (Mitte der sortierten Werte).
-
Vergleichen: Der Mittelwert ist nicht robust, Bruchpunkt n1. Der Median ist
robust, Bruchpunkt 21.
-
Quartile mit der Regel von R: Stelle 1+(n−1)⋅p, dann linear dazwischenrechnen.
-
IQR, Schranken im Abstand 1,5⋅IQR von der Box, jeden Wert mit den
Schranken vergleichen.
Die Balken im Panel zeigen wieder die Werte mit allen acht Studierenden. Das Plus daneben
ist der Unterschied zur Ergänzung ohne die 1.200 (Schritt 15).
Rückblick: Liegen Mittelwert und Median weit auseinander, lohnt ein Blick auf die
Daten. Die IQR-Regel findet dann die verdächtigen Werte — mit Größen (Quartile, IQR), die
selbst robust sind und von den Ausreißern nicht verzerrt werden.