studyklar
Statistik · Übungsblatt 1 · Aufgabe 4

Klausurpunkte in Klassen: Häufigkeiten und Verteilungsfunktion

20 Klausurpunktzahlen sind gegeben. Hier werden sie in vier Klassen sortiert und gezählt. Daraus entstehen eine Häufigkeitstabelle, ein Säulendiagramm und die empirische Verteilungsfunktion. Rechts steht der ganze Lösungsweg, links die Erklärung zum aktuellen Schritt. Mit Weiter geht es Schritt für Schritt voran. Ein Klick auf einen Schritt springt direkt dorthin.

Die Aufgabe

Aufgabe 4. 20 Teilnehmer einer Klausur haben folgende Punktzahlen erzielt: 25, 74, 87, 43, 60, 72, 56, 36, 75, 49, 83, 52, 71, 67, 78, 50, 76, 64, 77, 69.

  1. Bestimmen Sie für die erzielten Punktzahlen die Häufigkeitsverteilung und die Summenhäufigkeitsverteilung mit den Klassen 20 bis unter 40, 40 bis unter 60, 60 bis unter 80, 80 bis unter 100.
  2. Stellen Sie die Häufigkeitsverteilung graphisch dar.
  3. Stellen Sie die empirische Verteilungsfunktion graphisch dar.

a) Häufigkeitsverteilung und Summenhäufigkeitsverteilung

ordnen, Klassen abgrenzen, zählen, aufaddieren

Die Daten: Merkmal Punktzahl, 20 Werte geordnet

Die geordnete Liste: alle 20 Punktzahlen der Größe nach
Platz12345678910
Punkte25364349505256606467
Platz11121314151617181920
Punkte69717274757677788387

Die Klassen: was „bis unter“ heißt

Die vier Klassen der Aufgabe: linke Grenze gehört dazu, rechte nicht
Klassein Wortenals Intervallxjux_j^uxjox_j^o
K1K_120 bis unter 40[20; 40)2040
K2K_240 bis unter 60[40; 60)4060
K3K_360 bis unter 80[60; 80)6080
K4K_480 bis unter 100[80; 100)80100

Je Klasse zählen: absolute Häufigkeiten

Zählen in der geordneten Liste, Klasse für Klasse
KlasseWerte darinnjn_j
[20; 40)[20;\ 40)25, 362
[40; 60)[40;\ 60)43, 49, 50, 52, 565
[60; 80)[60;\ 80)60, 64, 67, 69, 71, 72, 74, 75, 76, 77, 7811
[80; 100)[80;\ 100)83, 872
Probe: die Anzahlen ergeben zusammen alle Teilnehmer
∑j=14nj=2+5+11+2=20=n\sum_{j=1}^{4} n_j = 2 + 5 + 11 + 2 = 20 = n

Anteile: relative Häufigkeiten

Relative Häufigkeit: Anzahl in der Klasse geteilt durch alle nn
fj=njnf_j = \frac{n_j}{n}
Eingesetzt mit n = 20
f1=220=0,10,f2=520=0,25,f3=1120=0,55,f4=220=0,10f_1 = \frac{2}{20} = 0{,}10, \quad f_2 = \frac{5}{20} = 0{,}25, \quad f_3 = \frac{11}{20} = 0{,}55, \quad f_4 = \frac{2}{20} = 0{,}10
Probe: alle Anteile zusammen ergeben 1
∑j=14fj=0,10+0,25+0,55+0,10=1\sum_{j=1}^{4} f_j = 0{,}10 + 0{,}25 + 0{,}55 + 0{,}10 = 1

Aufaddieren: Summenhäufigkeiten

Summenhäufigkeiten: von Klasse 1 bis Klasse j aufaddiert
Nj=∑m=1jnm,Fj=∑m=1jfm=NjnN_j = \sum_{m=1}^{j} n_m, \qquad F_j = \sum_{m=1}^{j} f_m = \frac{N_j}{n}
Ergebnis a): Häufigkeitsverteilung (nⱼ, fⱼ) und Summenhäufigkeitsverteilung (Nⱼ, Fⱼ)
Klassenjn_jfjf_jNjN_jFjF_j
20 bis unter 4020,1020,10
40 bis unter 6050,2570,35
60 bis unter 80110,55180,90
80 bis unter 10020,10201,00
Summe201,00––

b) Die Häufigkeitsverteilung als Bild

Säulen ohne Lücke über den Klassen

Welches Diagramm, welche Höhe

Klassenbreite: bei allen vier Klassen gleich
xjo−xju=40−20=60−40=80−60=100−80=20x_j^o - x_j^u = 40 - 20 = 60 - 40 = 80 - 60 = 100 - 80 = 20
Gleiche Breiten: Säulenhöhe = relative Häufigkeit
Ho¨hej=fj:0,10;  0,25;  0,55;  0,10\text{Höhe}_j = f_j: \quad 0{,}10;\ \ 0{,}25;\ \ 0{,}55;\ \ 0{,}10
Nur zum Vergleich: Häufigkeitsdichte, gleiche Form, andere Achsenzahlen
dj=fj20:0,005;  0,0125;  0,0275;  0,005d_j = \frac{f_j}{20}: \quad 0{,}005;\ \ 0{,}0125;\ \ 0{,}0275;\ \ 0{,}005

Zeichnen und ablesen

Säulendiagramm ohne Zwischenraum (siehe Grafik oben): über [20; 40)[20;\ 40), [40; 60)[40;\ 60), [60; 80)[60;\ 80) und [80; 100)[80;\ 100) je ein Rechteck der Höhe 0,100{,}10, 0,250{,}25, 0,550{,}55 und 0,100{,}10. Die meisten Teilnehmer (55 %) haben 60 bis unter 80 Punkte.

c) Die empirische Verteilungsfunktion

Summenhäufigkeiten als Linie

Was F(x) angibt, und wo man es kennt

Punkte der Verteilungsfunktion aus der Tabelle (näherungsweise): obere Klassengrenze und Fⱼ aus Schritt 5
x20406080100
F(x) ≈00,100,350,901,00

Die Punkte gerade verbinden

Innerhalb einer Klasse: gerade Linie von (xⱼᵘ; Fⱼ₋₁) nach (xⱼᵒ; Fⱼ), mit F₀ = 0
F(x)≈Fj−1+fjxjo−xju (x−xju)fu¨r xju≤x<xjoF(x) \approx F_{j-1} + \frac{f_j}{x_j^o - x_j^u}\,(x - x_j^u) \quad \text{für } x_j^u \le x < x_j^o
Ergebnis c): die empirische Verteilungsfunktion der klassierten Punktzahlen
F(x)≈{0x<200+0,1020 (x−20)20≤x<400,10+0,2520 (x−40)40≤x<600,35+0,5520 (x−60)60≤x<800,90+0,1020 (x−80)80≤x<1001x≥100F(x) \approx \begin{cases} 0 & x < 20 \\ 0 + \frac{0{,}10}{20}\,(x - 20) & 20 \le x < 40 \\ 0{,}10 + \frac{0{,}25}{20}\,(x - 40) & 40 \le x < 60 \\ 0{,}35 + \frac{0{,}55}{20}\,(x - 60) & 60 \le x < 80 \\ 0{,}90 + \frac{0{,}10}{20}\,(x - 80) & 80 \le x < 100 \\ 1 & x \ge 100 \end{cases}

Ergebnis

a) nj=2; 5; 11; 2n_j = 2;\ 5;\ 11;\ 2, fj=0,10; 0,25; 0,55; 0,10f_j = 0{,}10;\ 0{,}25;\ 0{,}55;\ 0{,}10, Nj=2; 7; 18; 20N_j = 2;\ 7;\ 18;\ 20, Fj=0,10; 0,35; 0,90; 1,00F_j = 0{,}10;\ 0{,}35;\ 0{,}90;\ 1{,}00
b) Säulendiagramm ohne Zwischenraum über den vier Klassen, Höhe fjf_j (gleiche Klassenbreite 20)
c) Linienzug durch (20; 0)(20;\ 0), (40; 0,10)(40;\ 0{,}10), (60; 0,35)(60;\ 0{,}35), (80; 0,90)(80;\ 0{,}90), (100; 1)(100;\ 1), davor 0, danach 1
Probe: ∑nj=20=n\sum n_j = 20 = n, ∑fj=1\sum f_j = 1, F4=1F_4 = 1, und FF steigt nie ab

In Worten: Mehr als die Hälfte der Teilnehmer hat 60 bis unter 80 Punkte. Nur 10 % blieben unter 40, und nur 10 % erreichten 80 oder mehr.

Plausibel? Die geordnete Liste hat 7 Werte unter 60 (bis zur 56) und 18 Werte unter 80 (bis zur 78). Das passt zu N2=7N_2 = 7 und N3=18N_3 = 18.

Der Weg in Kürze: ordnen → Klassen mit „bis unter“ abgrenzen → njn_j zählen → fj=nj/nf_j = n_j / n → aufaddieren zu NjN_j, FjF_j → Säulen der Höhe fjf_j → Punkte (xjo; Fj)(x_j^o;\ F_j) gerade verbinden.

Typische Fehler:

  • Die 60 in die Klasse 40 bis unter 60 zählen. Sie gehört nach oben.
  • Die Probe auslassen: Ergeben die Anzahlen nicht 20, fehlt ein Wert oder ist doppelt.
  • Säulen mit Lücken zeichnen, als wären es einzelne Werte.
  • FF als Treppe mit Sprüngen an den Klassengrenzen zeichnen. Mit den Klassen als Grundlage ist FF ein Linienzug. Eine Treppe mit 20 Stufen wäre die exakte Funktion der Urliste; gefragt ist hier aber die Funktion der klassierten Daten.
  • Die Punkte über die Mitte der Klassen setzen. Das ist der Polygonzug des Histogramms (Mitten der Säulenoberkanten), nicht die Verteilungsfunktion. FjF_j gehört über die obere Grenze.
  • Die Linie schon ab 0 Punkten ansteigen lassen statt erst ab 20, oder über 1 hinaus zeichnen.