← Übersicht ESTO
ESTO · Übungsblatt 7 · Aufgabe 1

Gepaarter t-Test: wirkt das Haarwuchsmittel?

Bei fünf Männern wurden die Haare gezählt, einmal vor und einmal nach einem Monat mit einem Haarwuchsmittel. Vier haben danach mehr Haare, einer weniger. Ist das eine echte Wirkung oder nur Zufall? Diese Frage beantwortet ein statistischer Test. Hier wird das Testen von Grund auf erklärt: Hypothesen aufstellen, das Signifikanzniveau festlegen, eine Teststatistik von Hand ausrechnen, sie mit einem kritischen Wert vergleichen und den pp-Wert deuten. Rechts steht der ganze Lösungsweg, links die Erklärung zum aktuellen Schritt. Mit Weiter geht es Schritt für Schritt voran. Ein Klick auf einen Schritt springt direkt dorthin.

Schritt 0 Die Aufgabe

Ein Haarwuchsmittel soll auf Wirksamkeit getestet werden. Zu diesem Zweck werden fünf Männer mit leicht schütterem Haar zur Untersuchung eingeladen. Ein 5 cm² großes Stück Kopfhaut wird markiert und die Haare darin werden gezählt. Anschließend werden die Probanden aufgefordert, regelmäßig das Haarwuchsmittel zu benutzen. Einen Monat später werden die Haare auf der markierten Stelle wieder gezählt. Die Ergebnisse waren wie folgt:

Proband Versuchsbeginn Versuchsende
1 119 144
2 109 180
3 167 200
4 218 150
5 154 191

Testen Sie zum Niveau 5 %, ob sich eine Verbesserung eingestellt hat.

Zur Musterlösung: Sie schreibt die Alternative als H1H_1, hier heißt sie HAH_A wie im Skript — gemeint ist dasselbe. Das Ergebnis stimmt: t^≈0,84\hat t \approx 0{,}84 (Schritt 11), kritischer Wert 2,132{,}13 (Schritt 13), p≈0,22p \approx 0{,}22 (Schritt 14), H0H_0 wird beibehalten (Schritt 17). Nur eine Rundung weicht ab: Dort steht p=0,224p = 0{,}224; R gibt 0,2234956 aus, auf drei Stellen also 0,2230{,}223 (Schritt 14). An der Entscheidung ändert das nichts.

(1) Von den Daten zur Teststatistik

Test wählen, Hypothesen, Niveau, Rechnung von Hand

Schritt 1 Dieselben fünf Männer, zweimal gezählt

Haarzahl auf der markierten Fläche (5 cm²) von Proband i=1,…,5i = 1, \dots, 5
xi=Anzahl zu Versuchsbeginn,yi=Anzahl am Versuchsendex_i = \text{Anzahl zu Versuchsbeginn}, \qquad y_i = \text{Anzahl am Versuchsende}
Je Proband ein Paar von Zahlen
(x1,y1)=(119,144),(x2,y2)=(109,180),(x3,y3)=(167,200),(x_1, y_1) = (119, 144), \quad (x_2, y_2) = (109, 180), \quad (x_3, y_3) = (167, 200),
(x4,y4)=(218,150),(x5,y5)=(154,191)(x_4, y_4) = (218, 150), \quad (x_5, y_5) = (154, 191)
Anzahl der Paare
n=5n = 5

Schritt 2 Verbundene Stichprobe: die Differenzen bilden

Differenz von Proband ii: Ende minus Beginn
di=yi−xid_i = y_i - x_i
Für jeden Probanden einzeln
d1=144−119=+25,d2=180−109=+71,d3=200−167=+33,d_1 = 144 - 119 = +25, \quad d_2 = 180 - 109 = +71, \quad d_3 = 200 - 167 = +33,
d4=150−218=−68,d5=191−154=+37d_4 = 150 - 218 = -68, \quad d_5 = 191 - 154 = +37
Proband Beginn Ende Differenz
ii xix_i yiy_i di=yi−xid_i = y_i - x_i
1 119 144 +25
2 109 180 +71
3 167 200 +33
4 218 150 −68
5 154 191 +37

Schritt 3 Das Grundproblem: Wirkung oder Zufall?

Was die Stichprobe zeigt
4 Differenzen positiv,1 Differenz negativ (d4=−68)\text{4 Differenzen positiv}, \qquad \text{1 Differenz negativ } (d_4 = -68)
Was man eigentlich wissen will: die mittlere Veränderung aller Männer, die das Mittel benutzen würden
μD=unbekannter Erwartungswert der Differenz\mu_D = \text{unbekannter Erwartungswert der Differenz}
Die Frage der Aufgabe, in Zeichen
Gilt μD>0?\text{Gilt } \mu_D > 0\text{?}

Schritt 4 Der passende Test: gepaarter t-Test

Aus zwei Messreihen wird eine: nur noch die Differenzen zählen
d1,…,d5=25, 71, 33, −68, 37d_1, \dots, d_5 = 25,\ 71,\ 33,\ -68,\ 37
Gepaarter t-Test = t-Test für eine Stichprobe, angewandt auf die Differenzen, Vergleichswert 0
Ist μD gro¨ßer als μ0=0?\text{Ist } \mu_D \text{ größer als } \mu_0 = 0\text{?}
Voraussetzungen
d1,…,d5 unabha¨ngig und normalverteiltd_1, \dots, d_5 \text{ unabhängig und normalverteilt}

Schritt 5 Nullhypothese und Alternative

Alternative HAH_A: was man zeigen möchte — das Mittel bringt im Mittel mehr Haare
HA: μD>0H_A:\ \mu_D > 0
Nullhypothese H0H_0: das Gegenteil — keine Verbesserung (gleich viele oder weniger Haare)
H0: μD≤0H_0:\ \mu_D \le 0
Zusammen: H0H_0 gegen HAH_A, einseitig nach oben
H0: μD≤0gegenHA: μD>0H_0:\ \mu_D \le 0 \qquad \text{gegen} \qquad H_A:\ \mu_D > 0

Schritt 6 Signifikanzniveau α und Fehler 1. Art

Entscheidung: H0H_0 beibehalten Entscheidung: H0H_0 verwerfen
in Wahrheit gilt H0H_0
(Mittel wirkt nicht)
richtig Fehler 1. Art: Wirkung behauptet, die es nicht gibt
in Wahrheit gilt HAH_A
(Mittel wirkt)
Fehler 2. Art: Wirkung übersehen richtig
Signifikanzniveau: Obergrenze für die Wahrscheinlichkeit, eine wahre H0H_0 zu verwerfen (Fehler 1. Art), vor dem Test festgelegt
P(Fehler 1. Art)≤αP(\text{Fehler 1. Art}) \le \alpha
Vorgabe der Aufgabe: „zum Niveau 5 %“
α=5 %=0,05\alpha = 5\,\% = 0{,}05

Schritt 7 Der Mittelwert der Differenzen: 19,6

Summe der Differenzen
∑i=15di=25+71+33+(−68)+37=98\sum_{i=1}^{5} d_i = 25 + 71 + 33 + (-68) + 37 = 98
Stichprobenmittelwert der Differenzen: Summe geteilt durch die Anzahl
dˉ=1n∑i=1ndi=985=19,6\bar d = \frac{1}{n} \sum_{i=1}^{n} d_i = \frac{98}{5} = 19{,}6

Schritt 8 Die Abweichungen vom Mittelwert

Abweichung der ii-ten Differenz vom Mittelwert
di−dˉ=di−19,6d_i - \bar d = d_i - 19{,}6
Für jeden Probanden einzeln
25−19,6=5,4,71−19,6=51,4,33−19,6=13,4,25 - 19{,}6 = 5{,}4, \quad 71 - 19{,}6 = 51{,}4, \quad 33 - 19{,}6 = 13{,}4,
−68−19,6=−87,6,37−19,6=17,4-68 - 19{,}6 = -87{,}6, \quad 37 - 19{,}6 = 17{,}4
Probe: die Summe der Abweichungen ist 0
5,4+51,4+13,4+17,4−87,6=87,6−87,6=05{,}4 + 51{,}4 + 13{,}4 + 17{,}4 - 87{,}6 = 87{,}6 - 87{,}6 = 0

Schritt 9 Die Abweichungen quadrieren und addieren

Jede Abweichung mit sich selbst malnehmen
5,42=29,16,51,42=2.641,96,13,42=179,56,5{,}4^2 = 29{,}16, \quad 51{,}4^2 = 2.641{,}96, \quad 13{,}4^2 = 179{,}56,
(−87,6)2=7.673,76,17,42=302,76(-87{,}6)^2 = 7.673{,}76, \quad 17{,}4^2 = 302{,}76
Die Quadrate addieren
∑i=15(di−dˉ)2=29,16+2.641,96+179,56+7.673,76+302,76=10.827,2\sum_{i=1}^{5} (d_i - \bar d)^2 = 29{,}16 + 2.641{,}96 + 179{,}56 + 7.673{,}76 + 302{,}76 = 10.827{,}2
Proband Differenz Abweichung Quadrat
ii did_i di−dˉd_i - \bar d (di−dˉ)2(d_i - \bar d)^2
1 +25 +5,4 29,16
2 +71 +51,4 2.641,96
3 +33 +13,4 179,56
4 −68 −87,6 7.673,76
5 +37 +17,4 302,76
Σ\Sigma 98 0 10.827,2

Schritt 10 Varianz und Standardabweichung der Differenzen

Stichprobenvarianz der Differenzen: Summe der Quadrate geteilt durch n−1n - 1
sD2=1n−1∑i=1n(di−dˉ)2s_D^2 = \frac{1}{n-1} \sum_{i=1}^{n} (d_i - \bar d)^2
n=5n = 5 und die Summe 10.827,2 aus Schritt 9 einsetzen
sD2=10.827,25−1=10.827,24=2.706,8s_D^2 = \frac{10.827{,}2}{5 - 1} = \frac{10.827{,}2}{4} = 2.706{,}8
Standardabweichung: die Wurzel daraus, auf vier Nachkommastellen
sD=2.706,8=52,02691…≈52,0269s_D = \sqrt{2.706{,}8} = 52{,}02691\ldots \approx 52{,}0269

Schritt 11 Die Teststatistik: t̂ ≈ 0,84

Teststatistik des t-Tests für eine Stichprobe, mit dem Vergleichswert μ0\mu_0 (im Skript mit xˉn\bar x_n und sns_n; hier für die Differenzen dˉ\bar d und sDs_D)
t^=n⋅dˉ−μ0sD\hat t = \sqrt{n} \cdot \frac{\bar d - \mu_0}{s_D}
Beim gepaarten t-Test ist μ0=0\mu_0 = 0
t^=n⋅dˉ−0sD=n⋅dˉsD\hat t = \sqrt{n} \cdot \frac{\bar d - 0}{s_D} = \sqrt{n} \cdot \frac{\bar d}{s_D}
n=5n = 5, dˉ=19,6\bar d = 19{,}6 (Schritt 7) und sD≈52,0269s_D \approx 52{,}0269 (Schritt 10) einsetzen; 5=2,236068…\sqrt 5 = 2{,}236068\ldots
t^=5⋅19,652,0269=2,236068⋅19,652,0269=43,826952,0269≈0,8424\hat t = \sqrt{5} \cdot \frac{19{,}6}{52{,}0269} = \frac{2{,}236068 \cdot 19{,}6}{52{,}0269} = \frac{43{,}8269}{52{,}0269} \approx 0{,}8424
Dasselbe anders gelesen: dˉ\bar d geteilt durch den Standardfehler sD/ns_D / \sqrt{n}
sD5=52,02692,236068≈23,2671,t^=19,623,2671≈0,8424\frac{s_D}{\sqrt 5} = \frac{52{,}0269}{2{,}236068} \approx 23{,}2671, \qquad \hat t = \frac{19{,}6}{23{,}2671} \approx 0{,}8424

(2) Entscheiden: kritischer Wert und p-Wert

die t-Verteilung, Ablehnbereich, p-Wert, Voraussetzung, Antwort

Schritt 12 Die t-Verteilung mit 4 Freiheitsgraden

Stimmt H0H_0 im Grenzfall μD=0\mu_D = 0 und sind die Differenzen normalverteilt, dann gilt für die Teststatistik TT (vor dem Versuch eine Zufallsvariable):
T ist t-verteilt mit n−1 FreiheitsgradenT \text{ ist t-verteilt mit } n - 1 \text{ Freiheitsgraden}
Hier
n−1=5−1=4 Freiheitsgraden - 1 = 5 - 1 = 4 \text{ Freiheitsgrade}

Schritt 13 Kritischer Wert und Ablehnbereich

Kritischer Wert: das (1−α)(1-\alpha)-Quantil der t-Verteilung mit n−1n-1 Freiheitsgraden — rechts davon liegt die Fläche α\alpha
tn−1; 1−α=t4; 0,95t_{n-1;\,1-\alpha} = t_{4;\,0{,}95}
qt(0.95, df = 4)
#[1] 2.131847
Ablehnbereich für HA: μD>0H_A:\ \mu_D > 0 (Skript): H0H_0 verwerfen, falls
t^>t4; 0,95≈2,1318\hat t > t_{4;\,0{,}95} \approx 2{,}1318
Vergleich mit t^\hat t aus Schritt 11
t^≈0,8424 < 2,1318⇒t^ liegt nicht im Ablehnbereich (vorla¨ufig)\hat t \approx 0{,}8424 \ <\ 2{,}1318 \qquad \Rightarrow \qquad \hat t \text{ liegt nicht im Ablehnbereich (vorläufig)}

Schritt 14 Der p-Wert als Fläche

pp-Wert: Wahrscheinlichkeit, wenn H0H_0 stimmt, eine Teststatistik mindestens so groß wie die beobachtete zu erhalten
p=P(T≥t^)=P(T≥0,8424)=1−P(T≤0,8424)p = P(T \ge \hat t) = P(T \ge 0{,}8424) = 1 - P(T \le 0{,}8424)
1 - pt(0.8423896, df = 4)
#[1] 0.2234956
Gerundet, und die Regel: H0H_0 verwerfen, falls p≤αp \le \alpha
p≈0,2235=22,35 % > α=5 %⇒vorla¨ufig: H0 nicht verwerfenp \approx 0{,}2235 = 22{,}35\,\% \ >\ \alpha = 5\,\% \qquad \Rightarrow \qquad \text{vorläufig: } H_0 \text{ nicht verwerfen}

Schritt 15 Der p-Wert als Evidenzmaß

pp-Wert gegen H0H_0 spricht …
größer als 15 % nichts
10 % bis unter 15 % kaum etwas
5 % bis unter 10 % einiges
1 % bis unter 5 % vieles
unter 1 % sehr vieles
Hier
p≈22,35 %>15 %⇒nichts spricht gegen H0p \approx 22{,}35\,\% > 15\,\% \qquad \Rightarrow \qquad \text{nichts spricht gegen } H_0

Schritt 16 Die Voraussetzung prüfen: Shapiro-Wilk-Test

Ein eigener Test, nur für die Frage „normalverteilt?“
H0: Differenzen normalverteiltgegenHA: nicht normalverteiltH_0: \text{ Differenzen normalverteilt} \qquad \text{gegen} \qquad H_A: \text{ nicht normalverteilt}
beginn <- c(119, 109, 167, 218, 154)
ende   <- c(144, 180, 200, 150, 191)
shapiro.test(ende - beginn)
#	Shapiro-Wilk normality test
#data:  ende - beginn
#W = 0.83849, p-value = 0.1608
Lesen wie in Schritt 14 und 15
p≈0,1608=16,08 % > 5 %⇒Normalverteilung wird nicht verworfenp \approx 0{,}1608 = 16{,}08\,\% \ >\ 5\,\% \qquad \Rightarrow \qquad \text{Normalverteilung wird nicht verworfen}

Schritt 17 Entscheidung und Antwort

Weg 1: kritischer Wert (Schritt 13)
t^≈0,8424 ≤ t4; 0,95≈2,1318\hat t \approx 0{,}8424 \ \le\ t_{4;\,0{,}95} \approx 2{,}1318
Weg 2: pp-Wert (Schritt 14)
p≈0,2235 > α=0,05p \approx 0{,}2235 \ >\ \alpha = 0{,}05
Beide Wege, Voraussetzung erfüllt (Schritt 16)
⇒H0 beibehalten\Rightarrow \quad H_0 \text{ beibehalten}

Antwort: Zum Niveau 5 % lässt sich eine Verbesserung des Haarwuchses nicht nachweisen.

Schritt 18 „Beibehalten“ heißt nicht „bewiesen“

Was das Ergebnis sagt — und was nicht
H0 beibehalten ≠ H0 bewiesenH_0 \text{ beibehalten} \ \ne \ H_0 \text{ bewiesen}
Der Mittelwert war positiv, aber die Streuung ist groß und nn klein
dˉ=19,6>0,sD≈52,03,n=5\bar d = 19{,}6 > 0, \qquad s_D \approx 52{,}03, \qquad n = 5

Schritt 19 Probe mit R: t.test mit paired = TRUE

t.test(ende, beginn, paired = TRUE, alternative = "greater")
#	Paired t-test
#data:  ende and beginn
#t = 0.84239, df = 4, p-value = 0.2235
#alternative hypothesis: true mean difference is greater than 0
#95 percent confidence interval:
# -30.00199       Inf
#sample estimates:
#mean difference 
#           19.6
Vergleich mit der Rechnung von Hand
t^≈0,8424 ✓,n−1=4 ✓,p≈0,2235 ✓,dˉ=19,6 ✓\hat t \approx 0{,}8424 \ \checkmark, \quad n - 1 = 4 \ \checkmark, \quad p \approx 0{,}2235 \ \checkmark, \quad \bar d = 19{,}6 \ \checkmark
t.test(ende - beginn, mu = 0, alternative = "greater")
#	One Sample t-test
#t = 0.84239, df = 4, p-value = 0.2235

Schritt 20 Ergänzung: Ab welchem Mittelwert wäre verworfen worden?

Ergänzung — für die Lösung nicht nötig. Sie zeigt, wie weit die Daten vom Nachweis entfernt sind.

Verworfen wird, wenn t^\hat t über dem kritischen Wert 2,1318472{,}131847 liegt (sDs_D bleibt gleich)
5⋅dˉ52,0269>2,131847\sqrt 5 \cdot \frac{\bar d}{52{,}0269} > 2{,}131847
Beide Seiten mal 52,026952{,}0269
5⋅dˉ>2,131847⋅52,0269≈110,913\sqrt 5 \cdot \bar d > 2{,}131847 \cdot 52{,}0269 \approx 110{,}913
Beide Seiten durch 5≈2,236068\sqrt 5 \approx 2{,}236068
dˉ>110,9132,236068≈49,60\bar d > \frac{110{,}913}{2{,}236068} \approx 49{,}60
Vergleich
dˉ=19,6gegenu¨ber no¨tigen49,6\bar d = 19{,}6 \quad \text{gegenüber nötigen} \quad 49{,}6

Schritt 21 Ergebnis

✓Test: gepaarter t-Test, einseitig — dieselben fünf Männer vorher und nachher, also die Differenzen did_i = Ende − Beginn gegen 0 testen
✓H0: μD≤0H_0:\ \mu_D \le 0 gegen HA: μD>0H_A:\ \mu_D > 0, Niveau α=0,05\alpha = 0{,}05
✓dˉ=19,6\bar d = 19{,}6, sD≈52,03s_D \approx 52{,}03, t^=5⋅19,6/52,03≈0,84\hat t = \sqrt 5 \cdot 19{,}6 / 52{,}03 \approx \mathbf{0{,}84}
✓t^≈0,84≤t4; 0,95≈2,13\hat t \approx 0{,}84 \le t_{4;\,0{,}95} \approx 2{,}13 und p≈0,2235>0,05p \approx 0{,}2235 > 0{,}05 ⇒ H0H_0 beibehalten
✓Antwort: Zum Niveau 5 % lässt sich keine Verbesserung nachweisen. Das heißt nicht, dass das Mittel sicher nicht wirkt.

Proben: Die Abweichungen vom Mittelwert ergeben zusammen 0. R liefert mit t.test dieselben Werte t=0,84239t = 0{,}84239, 4 Freiheitsgrade und p=0,2235p = 0{,}2235. Kritischer Wert und pp-Wert führen zur selben Entscheidung.

Typische Fehler: Die beiden Messreihen wie zwei getrennte Gruppen behandeln, statt Differenzen zu bilden. Die Vermutung „das Mittel wirkt“ in H0H_0 schreiben statt in HAH_A. Durch nn statt n−1n - 1 teilen. In R die Reihenfolge vertauschen: t.test(beginn, ende, paired = TRUE, alternative = "greater") rechnet Beginn − Ende und liefert t=−0,84239t = -0{,}84239 und p=0,7765p = 0{,}7765. „H0H_0 beibehalten“ als „das Mittel wirkt nicht“ lesen. Den pp-Wert für die Wahrscheinlichkeit halten, dass H0H_0 stimmt.