20 Personen haben eine Klausur geschrieben. Von jeder Person kennt man die erreichte Punktzahl. In der Aufgabe stehen die Punktzahlen in der Reihenfolge, in der sie aufgeschrieben wurden. So eine ungeordnete Liste heißt Urliste.
Jede Punktzahl kommt nur einmal vor. Würde man jede einzeln zählen, hätte man 20 Mal die Häufigkeit 1. Daraus lernt man nichts. Deshalb gibt die Aufgabe vier Klassen vor: Bereiche von je 20 Punkten. Man zählt, wie viele Teilnehmer in jedem Bereich liegen.
Gesucht ist:
- a) für jede Klasse: wie viele Teilnehmer darin liegen, welcher Anteil das ist, und wie viele bis zu dieser Klasse zusammengekommen sind (aufaddiert);
- b) ein Bild dieser Anteile;
- c) ein Bild der aufaddierten Anteile, die empirische Verteilungsfunktion.
Der Weg:
- Daten ordnen, Klassen genau abgrenzen, je Klasse zählen (Schritte 1 bis 3).
- Anteile ausrechnen und aufaddieren (Schritte 4 und 5).
- Säulendiagramm zeichnen und lesen (Schritte 6 und 7).
- Verteilungsfunktion: Punkte eintragen und verbinden (Schritte 8 und 9).
Merke: Bei Klassen zählt nur noch, in welcher Klasse ein Wert liegt, nicht mehr der genaue Wert. Alles Weitere wird mit diesen Klassen-Anzahlen gerechnet.
Annahme für c): Innerhalb einer Klasse weiß man nicht mehr, wo die Werte liegen. Man nimmt an, dass sie gleichmäßig verteilt sind, und verbindet die Punkte der Verteilungsfunktion mit geraden Linien. Mehr dazu in den Schritten 8 und 9.
n=20, kleinster Wert 25, größter Wert 87
Zuerst drei Wörter, die in der Statistik immer wieder vorkommen:
- Merkmalsträger: die Person oder Sache, an der man etwas beobachtet. Hier ein Klausurteilnehmer.
- Merkmal: was man an ihm beobachtet. Hier die Punktzahl.
- Ausprägung (auch Merkmalswert): der Wert, den ein Merkmalsträger hat. Hier zum Beispiel 74 Punkte.
n ist die Anzahl der Merkmalsträger, hier n=20.
Die Punktzahl ist ein Zahlenwert, mit dem man rechnen kann. Ein solches Merkmal heißt quantitativ. Punktzahlen sind ganze Zahlen, aber es gibt sehr viele mögliche Werte. Ein solches Merkmal heißt quasi-stetig: Man behandelt es wie einen Messwert und fasst die Werte in Klassen zusammen.
Aus Aufgabe 2 („Merkmalsarten: qualitativ oder quantitativ?“): Ein quantitatives Merkmal ist diskret, wenn es nur einzelne, abzählbare Werte annimmt (Kinderzahl), und stetig, wenn jeder Wert in einem Bereich möglich ist (Körpergröße). Quasi-stetig heißt: eigentlich diskret, aber mit so vielen Werten, dass man es wie ein stetiges Merkmal behandelt.
Zum Zählen ordnet man die Urliste zuerst der Größe nach. Das ergibt die geordnete Liste. Darin stehen benachbarte Werte nebeneinander, und beim Zählen geht keiner verloren. Tipp für die Klausur: Jeden Wert in der Urliste abhaken, sobald er in der geordneten Liste steht. Am Ende müssen 20 Werte dastehen.
K3=[60; 80): 60 gehört dazu, 80 nicht
Eine Klasse ist ein Bereich von Werten. Alle Werte darin werden zusammen gezählt. Man nummeriert die Klassen mit j und schreibt sie K1,K2,K3,K4. Das Zusammenfassen in Klassen heißt Klassierung, die Daten danach heißen klassierte Daten.
Jede Klasse hat eine untere Grenze xju und eine obere Grenze xjo. Das hochgestellte u steht für „unten“, das o für „oben“; es ist kein Exponent. Bei K3 ist x3u=60 und x3o=80. Die Klassenbreite ist obere minus untere Grenze, hier immer 80−60=20 Punkte.
„60 bis unter 80“ heißt: 60 gehört dazu, 80 nicht mehr. Man schreibt das als [60; 80). Die eckige Klammer heißt „Grenze gehört dazu“, die runde heißt „Grenze gehört nicht dazu“. Als Ungleichung: 60≤x<80.
Das ist hier wichtig: Ein Teilnehmer hat genau 60 Punkte. Er gehört in K3, nicht in K2. Denn K2 reicht nur „bis unter 60“.
Merke: Bei „bis unter“ gehört ein Wert genau auf der Grenze immer in die obere Klasse. So liegt jeder Wert in genau einer Klasse, keiner doppelt und keiner gar nicht.
n1=2, n2=5, n3=11, n4=2 Jetzt geht man die geordnete Liste von links nach rechts durch und zählt, wie viele Werte in jeder Klasse liegen. Diese Anzahl heißt absolute Häufigkeit nj der Klasse Kj.
- K1=[20; 40): 25 und 36, also n1=2.
- K2=[40; 60): 43, 49, 50, 52, 56, also n2=5. Die 60 ist nicht dabei.
- K3=[60; 80): 60, 64, 67, 69, 71, 72, 74, 75, 76, 77, 78, also n3=11.
- K4=[80; 100): 83 und 87, also n4=2.
Probe: Jeder Teilnehmer liegt in genau einer Klasse. Die Anzahlen müssen zusammen also n=20 ergeben:
2+5+11+2=20 ✓
Das Summenzeichen ∑ ist die Kurzschrift für „alle zusammenzählen“: ∑j=14nj heißt n1+n2+n3+n4.
fj=0,10; 0,25; 0,55; 0,10 Die Anzahl allein sagt wenig: 11 von 20 ist viel, 11 von 1000 wenig. Deshalb teilt man durch die Gesamtzahl n. Das ergibt den Anteil der Klasse, die relative Häufigkeit fj:
fj=nnj
Mit den Anzahlen aus Schritt 3 und n=20:
- f1=202=0,10, also 10 %,
- f2=205=0,25, also 25 %,
- f3=2011=0,55, also 55 %,
- f4=202=0,10, also 10 %.
Probe: Alle Anteile zusammen sind das Ganze, also 1 (100 %): 0,10+0,25+0,55+0,10=1 ✓
Die Tabelle mit nj und fj je Klasse ist die gesuchte Häufigkeitsverteilung: Sie sagt, wie sich die 20 Teilnehmer auf die Klassen verteilen.
Aus Aufgabe 3 („Prüfungsnoten: Häufigkeiten und Summenhäufigkeiten“): Dort wurde für jede einzelne Note gezählt und durch
n geteilt. Hier ist es dieselbe Rechnung, nur steht an der Stelle einer Note jetzt eine Klasse.
Fj=0,10; 0,35; 0,90; 1,00 Oft will man wissen: Wie viele liegen unter einer Grenze? Zum Beispiel: Wie viele haben weniger als 80 Punkte? Dafür addiert man die Häufigkeiten von der ersten Klasse bis zur gesuchten Klasse auf. Das heißt kumulieren.
- Absolute Summenhäufigkeit Nj: die Anzahlen aufaddiert, Nj=n1+⋯+nj.
- Relative Summenhäufigkeit Fj: die Anteile aufaddiert, Fj=f1+⋯+fj=nNj.
Jede Zeile ist die vorige plus die neue Klasse:
- N1=2, F1=0,10
- N2=2+5=7, F2=0,10+0,25=0,35
- N3=7+11=18, F3=0,35+0,55=0,90
- N4=18+2=20, F4=0,90+0,10=1,00
So liest man es: F3=0,90 heißt: 90 % der Teilnehmer haben weniger als 80 Punkte (die obere Grenze von K3). Wegen „bis unter“ zählt die Grenze 80 selbst nicht mit.
Probe: Die letzte Zeile muss N4=n=20 und F4=1 sein, denn bis zur letzten Klasse sind alle gezählt. ✓
Die Tabelle mit Nj und Fj je Klasse ist die gesuchte Summenhäufigkeitsverteilung. Im Lösungsweg steht sie mit dem Summenzeichen: ∑m=1jnm heißt „alle nm von m=1 bis m=j addieren“. Der Buchstabe m zählt dabei die Klassen durch, j ist die Klasse, bis zu der addiert wird.
gleich breite Klassen ⇒ Säulenhöhe
fjKlassierte Daten zeichnet man als Säulen über den Klassen. Die Säulen stehen ohne Lücke nebeneinander, weil die Klassen lückenlos aneinander grenzen: Wo K2 endet, beginnt K3.
Für die Höhe der Säulen gilt diese Regel:
- Alle Klassen gleich breit: Säulendiagramm ohne Zwischenraum. Die Höhe ist direkt die Häufigkeit, hier fj.
- Klassen verschieden breit: Histogramm mit der Häufigkeitsdichte dj=xjo−xjufj als Höhe. Dann zeigt die Fläche der Säule den Anteil.
Hier sind alle Klassen 20 Punkte breit. Also ist die Höhe fj: 0,10; 0,25; 0,55; 0,10. Im Sprachgebrauch heißt auch dieses Bild oft Histogramm. In der Klausur „Säulendiagramm ohne Zwischenraum“ schreiben.
Zur Kontrolle, falls jemand die Dichte zeichnet: dj=fj:20 ergibt 0,005; 0,0125; 0,0275; 0,005. Jede Höhe ist durch dieselbe Zahl 20 geteilt. Das Bild sieht also genauso aus, nur die Zahlen an der Hochachse ändern sich. Beides ist richtig, solange die Achse sagt, was abgetragen ist.
höchste Säule: 60 bis unter 80, 55 %
So zeichnet man es in der Klausur:
- Waagerechte Achse: Punktzahl, mit den Grenzen 20, 40, 60, 80, 100 in gleichen Abständen (zum Beispiel 2 cm je 20 Punkte).
- Senkrechte Achse: relative Häufigkeit fj, von 0 bis 0,6 (zum Beispiel 1 cm je 0,1).
- Über jeder Klasse ein Rechteck von der unteren bis zur oberen Grenze, so hoch wie fj. Keine Lücken.
- Beide Achsen beschriften: was abgetragen ist.
Was man abliest: Die höchste Säule steht über [60; 80). Mehr als die Hälfte der Teilnehmer, 55 %, hat dort abgeschnitten. Nach unten (unter 40) und nach oben (ab 80) liegen je nur 10 %.
F(40)≈0,10,
F(60)≈0,35,
F(80)≈0,90,
F(100)=1 Die empirische Verteilungsfunktion F(x) gibt für jede Zahl x an, welcher Anteil der Werte höchstens bis x reicht. „Empirisch“ heißt: aus beobachteten Daten berechnet. Sie ist die Summenhäufigkeit, als Funktion gezeichnet.
Aus Aufgabe 3 („Prüfungsnoten: Häufigkeiten und Summenhäufigkeiten“): Bei den Noten gab es nur die Werte 1 bis 6. Dort springt
F an jeder Note um deren Anteil nach oben und bleibt dazwischen waagerecht: eine Treppenfunktion.
Bei klassierten Daten ist das anders. Man weiß nur, wie viele Werte in einer Klasse liegen, nicht wo genau. Aus der Tabelle kennt man F deshalb nur an den Klassengrenzen, und zwar näherungsweise:
- An der unteren Grenze der ersten Klasse ist noch niemand gezählt: F(20)=0.
- Fj aus Schritt 5 ist der Anteil unter der oberen Grenze xjo. Also gilt F(xjo)≈Fj.
Das ergibt fünf Punkte: (20; 0), (40; 0,10), (60; 0,35), (80; 0,90), (100; 1).
Warum nur ≈? F(x) zählt „höchstens x“, die Tabelle zählt „unter xjo“. Bei klassierten Daten nimmt man an, dass die Werte gleichmäßig über die Klasse verteilt sind. Dann hat ein einzelner Punktwert den Anteil 0, und „unter 60“ und „höchstens 60“ sind gleich: F(60)≈0,35. Aus der Urliste wäre es genau F(60)=208=0,40, denn ein Teilnehmer hat genau 60 Punkte. Diese Information geht beim Klassieren verloren. Gefragt ist hier die Funktion der Klassen.
Linienzug durch die fünf Punkte, links 0, rechts 1
Zwischen den Grenzen nimmt man an: Die Werte einer Klasse sind gleichmäßig über die Klasse verteilt. Dann wächst F innerhalb der Klasse gleichmäßig. Man verbindet die Punkte also mit geraden Linien. Das heißt lineare Interpolation. Für x in der Klasse Kj gilt
F(x)≈Fj−1+xjo−xjufj(x−xju)
Fj−1 ist die Summenhäufigkeit der Klasse davor, also der Startwert der Linie an der unteren Grenze. Für die erste Klasse ist F0=0.
Der Bruch xjo−xjufj ist die Steigung der Linie in der Klasse. Bei K3: 200,55=0,0275 je Punkt. Das ist die höchste Steigung, passend zur höchsten Säule aus Teil b).
Außerhalb der Klassen:
- Links von 20 liegt kein Wert: F(x)=0.
- Ab 100 sind alle Werte gezählt: F(x)=1.
In der Klausur: Achse Punktzahl wie in Teil b), Hochachse von 0 bis 1. Die fünf Punkte eintragen, mit dem Lineal verbinden, links bei 0 und rechts bei 1 eine waagerechte Linie anhängen. Die Linie steigt nie ab: Ein Anteil „bis x“ kann mit größerem x nicht kleiner werden.
Ergänzung: Dieselbe Gerade benutzt die Formelsammlung später, um den Median (den Wert, unter dem die Hälfte liegt) aus Klassen zu berechnen.
Merke: Klassierte Daten:
F ist ein Linienzug durch
(xjo; Fj), beginnend bei
(x1u; 0). Einzelwerte wie die Noten in Aufgabe 3:
F ist eine Treppenfunktion.
a) In den Klassen liegen 2, 5, 11 und 2 Teilnehmer, das sind 10 %, 25 %, 55 % und 10 %. Aufaddiert: 10 % haben unter 40 Punkte, 35 % unter 60, 90 % unter 80, alle 100 % unter 100.
b) Säulendiagramm ohne Lücken, Höhe fj. Die meisten Teilnehmer (55 %) liegen bei 60 bis unter 80 Punkten.
c) Linienzug durch (20; 0), (40; 0,10), (60; 0,35), (80; 0,90), (100; 1); links davon 0, rechts davon 1.
Rückblick: Klassen genau abgrenzen, zählen, durch
n teilen, aufaddieren. Jede spätere Zeichnung nimmt nur noch diese Tabelle.