studyklar
Statistik · Probeklausur 1 · Aufgabe 2

Maschine und Qualität: Phi- und Kontingenzkoeffizient

Zwei Maschinen stellen dasselbe Produkt her. Bei Maschine 1 sind 15 von 55 Produkten fehlerhaft, bei Maschine 2 nur 5 von 55. Hängt die Qualität also von der Maschine ab, und wie stark? Das messen drei Kennzahlen: der Phi-Koeffizient, der Kontingenzkoeffizient und der korrigierte Kontingenzkoeffizient. Alles wird von Hand gerechnet, mit der Formelsammlung der Klausur. Der ganze Lösungsweg steht offen da, die Erklärung gehört jeweils zum aktuellen Schritt. Mit Weiter geht es Schritt für Schritt voran. Ein Klick auf einen Schritt springt direkt dorthin.

Die Aufgabe

Aufgabe 2: (10 Punkte)

Folgende „Vierfeldertafel“ stellt die Qualität eines Produkts (y) in Abhängigkeit des Maschinentyps (x) dar:

x (Maschine)y (in Ordnung): JaNeinSumme
1401555
250555
Summe9020110
  1. Berechnen Sie den Phi-Koeffizienten φ\varphi. (4 Punkte)
  2. Berechnen Sie den Kontingenzkoeffizienten CC und den korrigierten Kontingenzkoeffizienten CkorrC_{korr} und interpretieren diesen. (4 Punkte)
  3. Erklären Sie kurz den Vorteil des korrigieren Kontingenzkoeffizienten gegenüber dem Phi-Koeffizienten. (2 Punkte)

Die Vierfeldertafel lesen

zwei Merkmale, vier Felder, Randsummen

Merkmale, Felder und Randsummen

JaNeinZeilensumme
Maschine 1aa = 40bb = 15a+ba + b = 55
Maschine 2cc = 50dd = 5c+dc + d = 55
Spaltensummea+ca + c = 90b+db + d = 20nn = 110
Probe: alle vier Felder zusammen ergeben n
a+b+c+d=40+15+50+5=110=na + b + c + d = 40 + 15 + 50 + 5 = 110 = n

Was „Zusammenhang“ hier heißt

Anteil fehlerhafter Produkte je Maschine
Maschine 1: 1555=0,2727≈27,3 %\text{Maschine 1: } \frac{15}{55} = 0{,}2727 \approx 27{,}3\,\%
Maschine 2: 555=0,0909≈9,1 %\text{Maschine 2: } \frac{5}{55} = 0{,}0909 \approx 9{,}1\,\%
Beide Maschinen zusammen (Spaltensumme Nein durch n)
20110=0,1818≈18,2 %\frac{20}{110} = 0{,}1818 \approx 18{,}2\,\%

a) Der Phi-Koeffizient φ\varphi (4 Punkte)

Kennzahl für zwei Merkmale mit je zwei Ausprägungen

Die Formel und der Zähler a · d − b · c

Phi-Koeffizient (Formelsammlung der Klausur)
φ=a⋅d−b⋅c(a+b)(c+d)(a+c)(b+d)\varphi = \frac{a \cdot d - b \cdot c}{\sqrt{(a+b)(c+d)(a+c)(b+d)}}
Zähler, Zahlen aus Schritt 1
a⋅d=40⋅5=200a \cdot d = 40 \cdot 5 = 200
b⋅c=15⋅50=750b \cdot c = 15 \cdot 50 = 750
a⋅d−b⋅c=200−750=−550a \cdot d - b \cdot c = 200 - 750 = -550

Der Nenner und φ

Nenner: die vier Randsummen multiplizieren
(a+b)(c+d)(a+c)(b+d)=55⋅55⋅90⋅20(a+b)(c+d)(a+c)(b+d) = 55 \cdot 55 \cdot 90 \cdot 20
=3025⋅1800=5 445 000= 3025 \cdot 1800 = 5\,445\,000
Wurzel ziehen
5 445 000≈2333,45\sqrt{5\,445\,000} \approx 2333{,}45
Zähler aus Schritt 3 durch den Nenner
φ=−5502333,45=−0,2357≈−0,236\varphi = \frac{-550}{2333{,}45} = -0{,}2357 \approx -0{,}236

φ deuten: Vorzeichen und Stärke

Betrag: der Wert ohne Vorzeichen
∣φ∣=∣−0,236∣=0,236|\varphi| = |-0{,}236| = 0{,}236
Einordnung zwischen den Marken der Vorlesung
0,1<0,236<0,30{,}1 < 0{,}236 < 0{,}3

b) CC und CkorrC_{\text{korr}} (4 Punkte)

über Chi-Quadrat, in drei Schritten wie in der Formelsammlung

Erwartete Häufigkeiten ohne Zusammenhang

Erwartete Häufigkeit bei Unabhängigkeit (Formelsammlung der Klausur)
nij(E)=ni⋅⋅n⋅jn=Zeilensumme⋅Spaltensummenn_{ij}^{(E)} = \frac{n_{i\cdot} \cdot n_{\cdot j}}{n} = \frac{\text{Zeilensumme} \cdot \text{Spaltensumme}}{n}
Spalte Ja (Spaltensumme 90), für jede Maschine
55⋅90110=4950110=45\frac{55 \cdot 90}{110} = \frac{4950}{110} = 45
Spalte Nein (Spaltensumme 20), für jede Maschine
55⋅20110=1100110=10\frac{55 \cdot 20}{110} = \frac{1100}{110} = 10
beobachtet (erwartet)JaNeinSumme
Maschine 140 (45)15 (10)55
Maschine 250 (45)5 (10)55
Summe9020110

Die erwarteten Werte haben dieselben Randsummen wie die beobachteten.

Chi-Quadrat: die Abweichungen zusammenfassen

Chi-Quadrat (Formelsammlung der Klausur)
χ2=∑i=1k∑j=1l(nij(B)−nij(E))2nij(E)\chi^2 = \sum_{i=1}^{k}\sum_{j=1}^{l} \frac{\left(n_{ij}^{(B)} - n_{ij}^{(E)}\right)^2}{n_{ij}^{(E)}}
Die vier Felder: (beobachtet − erwartet)² / erwartet
M1, Ja: (40−45)245=2545=0,5556\text{M1, Ja: } \frac{(40 - 45)^2}{45} = \frac{25}{45} = 0{,}5556
M1, Nein: (15−10)210=2510=2,5\text{M1, Nein: } \frac{(15 - 10)^2}{10} = \frac{25}{10} = 2{,}5
M2, Ja: (50−45)245=2545=0,5556\text{M2, Ja: } \frac{(50 - 45)^2}{45} = \frac{25}{45} = 0{,}5556
M2, Nein: (5−10)210=2510=2,5\text{M2, Nein: } \frac{(5 - 10)^2}{10} = \frac{25}{10} = 2{,}5
Summe der vier Felder
χ2=0,5556+2,5+0,5556+2,5\chi^2 = 0{,}5556 + 2{,}5 + 0{,}5556 + 2{,}5
=6,1111≈6,111= 6{,}1111 \approx 6{,}111

Der Kontingenzkoeffizient C

Kontingenzkoeffizient (Formelsammlung der Klausur)
C=χ2χ2+nC = \sqrt{\frac{\chi^2}{\chi^2 + n}}
Eingesetzt
C=6,11116,1111+110=6,1111116,1111C = \sqrt{\frac{6{,}1111}{6{,}1111 + 110}} = \sqrt{\frac{6{,}1111}{116{,}1111}}
=0,05263=0,2294≈0,229= \sqrt{0{,}05263} = 0{,}2294 \approx 0{,}229

Der korrigierte Kontingenzkoeffizient und seine Deutung

Korrigierter Kontingenzkoeffizient (Formelsammlung der Klausur)
Ckorr=C⋅MM−1C_{\text{korr}} = C \cdot \sqrt{\frac{M}{M-1}}
M=Min(Spalten,Zeilen)M = \text{Min}(\text{Spalten}, \text{Zeilen})
M bestimmen: 2 Spalten, 2 Zeilen
M=Min(2,2)=2M = \text{Min}(2, 2) = 2
Eingesetzt, C ungerundet aus Schritt 8
Ckorr=0,2294⋅22−1=0,2294⋅2C_{\text{korr}} = 0{,}2294 \cdot \sqrt{\frac{2}{2-1}} = 0{,}2294 \cdot \sqrt{2}
=0,2294⋅1,4142=0,3244≈0,324= 0{,}2294 \cdot 1{,}4142 = 0{,}3244 \approx 0{,}324
Probe: C durch seinen größten Wert
0,22940,7071=0,3244\frac{0{,}2294}{0{,}7071} = 0{,}3244

c) Der Vorteil von CkorrC_{\text{korr}} (2 Punkte)

ein bis zwei Sätze, kein Rechnen

Was C korr kann und φ nicht

Antwort c), so in der Klausur:

Der korrigierte Kontingenzkoeffizient lässt sich für Kontingenztabellen beliebiger Größe berechnen, also auch für Merkmale mit mehr als zwei Ausprägungen. Der Phi-Koeffizient gilt nur für zwei dichotome Merkmale in einer Vierfeldertafel. Durch die Korrektur erreicht CkorrC_{\text{korr}} bei vollständigem Zusammenhang wie der Phi-Koeffizient den Wert 1; das unkorrigierte CC käme bei einer Vierfeldertafel nur bis 0,707.

Ergebnis

a) φ=40⋅5−15⋅5055⋅55⋅90⋅20=−5502333,45≈−0,236\varphi = \tfrac{40 \cdot 5 - 15 \cdot 50}{\sqrt{55 \cdot 55 \cdot 90 \cdot 20}} = \tfrac{-550}{2333{,}45} \approx -0{,}236
b) erwartet 45 | 10 je Maschine, χ2≈6,111\chi^2 \approx 6{,}111, C≈0,229C \approx 0{,}229, Ckorr≈0,324C_{\text{korr}} \approx 0{,}324: schwacher Zusammenhang
c) CkorrC_{\text{korr}} auch für Tafeln mit mehr als zwei Zeilen oder Spalten, erreicht wie ∣φ∣|\varphi| die 1; φ\varphi nur für zwei dichotome Merkmale
Probe: Bei einer Vierfeldertafel gilt χ2=n⋅φ2=110⋅0,05556=6,111\chi^2 = n \cdot \varphi^2 = 110 \cdot 0{,}05556 = 6{,}111. Das passt zu Schritt 7.
Plausibel: Die Anteile fehlerhafter Produkte (27,3 % und 9,1 %) sind deutlich verschieden, aber nicht extrem. Ein schwacher Zusammenhang passt dazu.
So holst du die Punkte: a) Formel, Werte für aa bis dd eingesetzt, Ergebnis. b) Tafel der erwarteten Werte, χ2\chi^2, CC, MM und CkorrC_{\text{korr}} mit Rechenweg, dazu ein Satz: „schwacher Zusammenhang zwischen Maschine und Qualität, Maschine 2 hat weniger fehlerhafte Produkte“. c) Ein Satz zur Tafelgröße (mehr als zwei Zeilen oder Spalten) und einer zur Korrektur.

Der Weg in Kürze: Die Tafel lesen und aa bis dd zuordnen. Für φ\varphi Diagonalprodukte abziehen und durch die Wurzel der Randsummen teilen. Für CC erst die erwarteten Häufigkeiten (Zeilensumme mal Spaltensumme durch nn), dann χ2\chi^2, dann C=χ2/(χ2+n)C = \sqrt{\chi^2/(\chi^2 + n)}, zuletzt mit M/(M−1)\sqrt{M/(M-1)} korrigieren. Deuten im Sachzusammenhang.