Das Unternehmen hat gezählt, wie oft seine Kunden eine Beratung genutzt haben. In der Tabelle stehen aber keine Anzahlen von Kunden, sondern nur Anteile : 0,15 heißt 15 % der Kunden. Wie viele Kunden es insgesamt sind, steht nirgends.
Die Aufgabe hat keine eigene Fragezeile. Die Frage steckt im ersten Satz: „wie häufig … durchschnittlich“. Gesucht ist also die durchschnittliche Zahl der Beratungen je Kunde. Der Durchschnitt heißt in der Statistik arithmetisches Mittel oder kurz Mittelwert . Er gehört zu den Lagemaßen : Zahlen, die sagen, um welchen Wert sich die Daten gruppieren.
In der Klausur gehört zur Zahl ein Satz, was sie bedeutet, mit der Einheit „Beratungen je Kunde“. Der Satz bringt eigene Punkte.
Der Weg:
Die Tabelle lesen und prüfen, ob die Anteile vollständig sind (Schritte 1 und 2). Verstehen, warum jeder Wert mit seinem Anteil gewichtet wird, dann rechnen und deuten (Schritte 3 bis 5). Ergänzung, nicht gefragt: wie stark die Werte um den Mittelwert streuen (Schritte 6 und 7). Merke: Sind nur Anteile gegeben, zählt jeder Wert so stark wie sein Anteil. Die vier Werte 0, 1, 2, 3 ohne Anteile zu mitteln, ist falsch.
x i = 0 , 1 , 2 , 3 f i = 0,15 , 0,30 , 0,35 , 0,20 x_i = 0,\ 1,\ 2,\ 3 \quad f_i = 0{,}15,\ 0{,}30,\ 0{,}35,\ 0{,}20 x i = 0 , 1 , 2 , 3 f i = 0 , 15 , 0 , 30 , 0 , 35 , 0 , 20 Zuerst die Begriffe, mit denen die Statistik eine solche Tabelle beschreibt:
Der Merkmalsträger ist das, woran etwas beobachtet wird: ein Kunde. Das Merkmal ist die Eigenschaft, die interessiert: wie oft der Kunde eine Beratung in Anspruch genommen hat. Die Ausprägungen x i x_i x i sind die möglichen Werte: x 1 = 0 x_1 = 0 x 1 = 0 , x 2 = 1 x_2 = 1 x 2 = 1 , x 3 = 2 x_3 = 2 x 3 = 2 , x 4 = 3 x_4 = 3 x 4 = 3 Beratungen. Der Index i i i ist die Nummer der Spalte, von 1 bis k = 4 k = 4 k = 4 . Aus Blatt 1, Aufgabe 3 („Prüfungsnoten: Häufigkeiten und Summenhäufigkeiten“): Die
relative Häufigkeit f i f_i f i ist der Anteil der Merkmalsträger mit der Ausprägung
x i x_i x i : absolute Häufigkeit geteilt durch die Gesamtzahl,
f i = n i n f_i = \tfrac{n_i}{n} f i = n n i .
Die Zeile „Anteil der Kunden“ enthält genau diese relativen Häufigkeiten. f 3 = 0,35 f_3 = 0{,}35 f 3 = 0 , 35 heißt: 35 % der Kunden haben genau 2 Beratungen genutzt. Die absoluten Häufigkeiten n i n_i n i und die Gesamtzahl n n n der Kunden fehlen. Gerechnet wird darum nur mit den Anteilen.
Aus Blatt 1, Aufgabe 1 („Skalenniveaus: Urlaubsort bis Flugangst“): Ein kardinales (metrisches) Merkmal hat echte Zahlen als Werte: Man kann sie ordnen, Abstände bilden und addieren.
Die Zahl der Beratungen ist kardinal: 0 heißt keine Beratung, 2 sind doppelt so viele wie 1. Sie ist außerdem diskret : Sie hat nur einzelne, abzählbare Werte, hier ganze Zahlen. Weil man die Werte addieren darf, ist ein Durchschnitt hier sinnvoll.
Über welchen Zeitraum gezählt wurde, sagt die Aufgabe nicht. Das Ergebnis gilt darum „je Kunde“ im erhobenen Zeitraum.
∑ i = 1 4 f i = 1 \sum_{i=1}^{4} f_i = 1 ∑ i = 1 4 f i = 1 Bevor gerechnet wird, lohnt eine Probe: Jeder Kunde hat genau eine der vier Ausprägungen. Die vier Anteile zusammen müssen also alle Kunden ergeben, das sind 1 oder 100 %.
Das Zeichen ∑ \sum ∑ (Summenzeichen, ein großes griechisches S) heißt: alle Werte dahinter addieren. ∑ i = 1 4 f i \sum_{i=1}^{4} f_i ∑ i = 1 4 f i liest man „Summe der f i f_i f i für i i i von 1 bis 4“, also f 1 + f 2 + f 3 + f 4 f_1 + f_2 + f_3 + f_4 f 1 + f 2 + f 3 + f 4 .
Die Summe ist genau 1. Die Tabelle ist also vollständig: Kein Kunde fehlt, und keine Gruppe ist doppelt gezählt. Wäre die Summe etwa 0,95, hätte man sich verlesen oder es fehlte eine Ausprägung, zum Beispiel 4 Beratungen.
Dass die Anteile zusammen 1 ergeben, wird gleich beim Durchschnitt noch einmal wichtig.
x ˉ = ∑ i = 1 k x i ⋅ f i \bar{x} = \sum_{i=1}^{k} x_i \cdot f_i x ˉ = ∑ i = 1 k x i ⋅ f i Der naheliegende Fehler: die vier Werte 0, 1, 2, 3 addieren und durch 4 teilen. Das ergibt 1,5. Diese Rechnung tut so, als hätte jede Ausprägung gleich viele Kunden. Tatsächlich haben 35 % der Kunden 2 Beratungen, aber nur 15 % keine. Die Anteile müssen also in die Rechnung.
Ein Gedankenbeispiel: Angenommen, das Unternehmen hätte 100 Kunden. Dann hätten 15 Kunden keine Beratung, 30 Kunden eine, 35 Kunden zwei und 20 Kunden drei. Für den Durchschnitt zählt man alle Beratungen zusammen und teilt durch die 100 Kunden. Die 2 kommt dabei 35-mal vor, nicht einmal.
Aus Blatt 1, Aufgabe 6 („Tore von Arminia Bielefeld: Modus, Median, Mittelwert“): Aus einer Häufigkeitstabelle rechnet man den Mittelwert so: jeden Wert
x i x_i x i mit seiner Häufigkeit
n i n_i n i malnehmen, alles addieren und durch
n n n teilen:
x ˉ = 1 n ∑ x i ⋅ n i \bar{x} = \tfrac{1}{n}\sum x_i \cdot n_i x ˉ = n 1 ∑ x i ⋅ n i .
Hier ist n n n unbekannt. Das macht nichts: Zieht man 1 n \tfrac{1}{n} n 1 in die Summe, steht bei jedem Wert n i n \tfrac{n_i}{n} n n i , und das ist der Anteil f i f_i f i . Die Formel braucht also nur die Anteile. Mit 100 oder mit 10.000 Kunden käme dasselbe heraus.
Das Zeichen für den Mittelwert ist x ˉ \bar{x} x ˉ (gesprochen „x quer“). Diese Form heißt gewogenes (oder gewichtetes) arithmetisches Mittel . Die Anteile f i f_i f i sind die Gewichte : Sie sagen, wie stark jeder Wert zählt. Damit das ein Durchschnitt ist, müssen die Gewichte zusammen 1 ergeben. Das hat Schritt 2 geprüft.
x ˉ = 0 + 0,30 + 0,70 + 0,60 = 1,6 \bar{x} = 0 + 0{,}30 + 0{,}70 + 0{,}60 = 1{,}6 x ˉ = 0 + 0 , 30 + 0 , 70 + 0 , 60 = 1 , 6 Jetzt wird die Formel aus Schritt 3 angewendet. Für jede Spalte rechnet man x i ⋅ f i x_i \cdot f_i x i ⋅ f i : Beratungen mal Anteil. Dieses Produkt ist der Beitrag der Gruppe zum Durchschnitt.
Die Gruppe mit 0 Beratungen trägt nichts bei, denn 0 ⋅ 0,15 = 0 0 \cdot 0{,}15 = 0 0 ⋅ 0 , 15 = 0 . Sie zählt trotzdem: Ihr Anteil 0,15 fehlt den anderen Gruppen und zieht den Durchschnitt so nach unten.
Die vier Beiträge addiert ergeben 1,6. Das ist exakt, gerundet wird nichts.
Probe mit den gedachten 100 Kunden: Sie nehmen zusammen 15 ⋅ 0 + 30 ⋅ 1 + 35 ⋅ 2 + 20 ⋅ 3 = 160 15 \cdot 0 + 30 \cdot 1 + 35 \cdot 2 + 20 \cdot 3 = 160 15 ⋅ 0 + 30 ⋅ 1 + 35 ⋅ 2 + 20 ⋅ 3 = 160 Beratungen in Anspruch. Geteilt durch 100 Kunden ergibt das wieder 1,6.
x ˉ = 1,6 Beratungen je Kunde \bar{x} = 1{,}6 \text{ Beratungen je Kunde} x ˉ = 1 , 6 Beratungen je Kunde Interpretation: Im Durchschnitt nimmt ein Kunde 1,6 Beratungen in Anspruch.
Kein Kunde hat 1,6 Beratungen, es gibt nur ganze Zahlen. Das ist kein Fehler: Der Mittelwert ist eine Rechengröße und muss kein möglicher Wert sein. Darum nicht auf 2 runden. Anders gesagt: 100 Kunden nehmen zusammen etwa 160 Beratungen in Anspruch.
Der Mittelwert als Schwerpunkt: Stellt man sich die Balken der Grafik als Gewichte auf einer Wippe vor, bleibt sie genau über 1,6 im Gleichgewicht. Nachrechnen lässt sich das mit den Abweichungen x i − x ˉ x_i - \bar{x} x i − x ˉ : dem Abstand jedes Werts vom Mittelwert, mit Vorzeichen. Jede Abweichung mal ihr Anteil ergibt unter 1,6 zusammen −0,42 und über 1,6 zusammen +0,42. Beides hebt sich auf.
Plausibel? 1,6 liegt zwischen dem kleinsten Wert 0 und dem größten Wert 3. Und 1,6 liegt über dem falschen Wert 1,5, weil die großen Werte 2 und 3 zusammen mehr Kunden haben (55 %) als die kleinen Werte 0 und 1 (45 %).
s 2 = 3,5 − 1,6 2 = 0,94 s^2 = 3{,}5 - 1{,}6^2 = 0{,}94 s 2 = 3 , 5 − 1 , 6 2 = 0 , 94 Ergänzung, in der Aufgabe nicht gefragt. Der Mittelwert sagt, wo die Daten liegen. Er sagt nicht, wie weit die einzelnen Werte um ihn herum verteilt sind. Das nennt man Streuung . Ein Maß dafür heißt Streuungsmaß .
Ausgangspunkt sind die Abweichungen x i − x ˉ x_i - \bar{x} x i − x ˉ aus Schritt 5: −1,6, −0,6, +0,4 und +1,4 (die Zahlen in den Balken). Ihr gewichteter Durchschnitt ist immer 0, sie heben sich auf. Darum quadriert man sie zuerst: Quadrate sind nie negativ.
Die Varianz s 2 s^2 s 2 ist der gewichtete Durchschnitt der quadrierten Abweichungen. Die Formelsammlung der Klausur gibt für Daten mit Anteilen eine schnellere Form an: erst ∑ x i 2 ⋅ f i \sum x_i^2 \cdot f_i ∑ x i 2 ⋅ f i bilden, dann x ˉ 2 \bar{x}^2 x ˉ 2 abziehen. Beide Formen liefern dasselbe, die Rechnung zeigt es.
Die Einheit der Varianz ist „Beratungen zum Quadrat“. Das lässt sich schlecht deuten. Darum folgt im nächsten Schritt die Wurzel.
s = 0,94 ≈ 0,97 s = \sqrt{0{,}94} \approx 0{,}97 s = 0 , 94 ≈ 0 , 97 Ergänzung, nicht gefragt. Die Standardabweichung s s s ist die Wurzel aus der Varianz. Sie hat wieder die Einheit der Daten, hier Beratungen.
0,94 = 0,9695 … \sqrt{0{,}94} = 0{,}9695\ldots 0 , 94 = 0 , 9695 … , auf zwei Nachkommastellen gerundet 0,97 Beratungen.
Interpretation: Die Zahl der Beratungen eines Kunden weicht typischerweise um knapp eine Beratung vom Durchschnitt 1,6 ab. Das Band in der Grafik reicht von 1,6 − 0,97 ≈ 0,63 1{,}6 - 0{,}97 \approx 0{,}63 1 , 6 − 0 , 97 ≈ 0 , 63 bis 1,6 + 0,97 ≈ 2,57 1{,}6 + 0{,}97 \approx 2{,}57 1 , 6 + 0 , 97 ≈ 2 , 57 . Darin liegen die Werte 1 und 2, also 0,30 + 0,35 = 0,65 0{,}30 + 0{,}35 = 0{,}65 0 , 30 + 0 , 35 = 0 , 65 oder 65 % der Kunden.
Plausibel? Die Abweichungen liegen zwischen 0,4 und 1,6. Ein typischer Abstand von knapp 1 liegt dazwischen.
Antwort mit Satz für die Klausur: Im Durchschnitt nimmt ein Kunde 1,6 Beratungsleistungen in Anspruch.
Typische Fehler:
Die Werte 0, 1, 2, 3 ohne Anteile mitteln: 6 4 = 1,5 \tfrac{6}{4} = 1{,}5 4 6 = 1 , 5 ist falsch. Die Anteile mitteln: 1 4 = 0,25 \tfrac{1}{4} = 0{,}25 4 1 = 0 , 25 ist kein Durchschnitt der Beratungen, sondern nur der Durchschnitt der Anteile. Am Ende noch durch 4 (die Zahl der Spalten) teilen. Die Anteile ersetzen das Teilen durch n n n schon. Den Mittelwert auf 2 runden, weil Beratungen ganze Zahlen sind. Die Zeile mit 0 Beratungen weglassen. Ihr Beitrag ist 0, ihr Anteil zählt aber. Nur die Zahl hinschreiben, ohne Satz und ohne Einheit.