Bisher wurden Wahrscheinlichkeiten ausgerechnet (Blatt 1 bis 4) und aus Daten Kennzahlen
geschätzt (Blatt 5). Jetzt kommt etwas Neues: Mit Daten wird eine
Ja-Nein-Frage entschieden . Das Werkzeug dafür heißt statistischer Test .
Die Frage hier: Wirkt ein Haarwuchsmittel? Fünf Männer mit leicht schütterem Haar machen mit.
Man nennt sie Probanden , also Versuchspersonen. Bei jedem wird auf einer markierten
Stelle von 5 cm² gezählt, wie viele Haare dort wachsen. Dann benutzt jeder einen Monat lang
das Mittel, und die Haare werden auf derselben Stelle noch einmal gezählt.
Gegeben sind also zehn Zahlen: für jeden der fünf Männer die Haarzahl zu Beginn und am Ende.
Gesucht ist eine Entscheidung „zum Niveau 5 %“: Hat sich eine Verbesserung eingestellt,
also im Mittel mehr Haare? Was „zum Niveau 5 %“ genau heißt, erklärt Schritt 6.
Der Weg in sechs Etappen:
Den passenden Test wählen (Schritte 1–4): Weil dieselben Männer zweimal gezählt wurden,
rechnet man mit den Differenzen Ende minus Beginn.
Die Hypothesen aufstellen und das Niveau festlegen (Schritte 5–6).
Die Teststatistik von Hand ausrechnen: Mittelwert und Streuung der Differenzen,
daraus eine einzige Zahl (Schritte 7–11).
Die Teststatistik mit einem kritischen Wert vergleichen und den
p p p -Wert bestimmen (Schritte 12–15).
Die Voraussetzung prüfen, entscheiden und die Antwort in Worten geben (Schritte 16–18).
Mit R nachprüfen (Schritt 19).
Merke: Ein Test beantwortet die Frage: Könnten die Daten auch dann so aussehen, wenn
das Mittel gar nicht wirkt? Nur wenn das sehr unwahrscheinlich ist, gilt die Wirkung als
nachgewiesen.
Zur Musterlösung: Sie nennt die Alternative
H 1 H_1 H 1 , hier heißt sie wie im Skript
H A H_A H A .
Beides meint dasselbe. Das Ergebnis der Musterlösung stimmt. Nur der
p p p -Wert ist dort mit
0,224 0{,}224 0 , 224 angegeben; R gibt 0,2234956 aus, auf drei Stellen gerundet also
0,223 0{,}223 0 , 223 (Schritt
14). An der Entscheidung ändert das nichts.
( x i , y i ) (x_i,\,y_i) ( x i , y i ) = (Beginn, Ende) für
i = 1 , … , 5 i = 1, \dots, 5 i = 1 , … , 5 ;
n = 5 n = 5 n = 5
Zuerst bekommen die Zahlen Namen. i i i ist die Nummer des Probanden, von 1 bis 5. x i x_i x i ist
seine Haarzahl zu Versuchsbeginn, y i y_i y i seine Haarzahl am Versuchsende. Proband 1 hat also
x 1 = 119 x_1 = 119 x 1 = 119 und y 1 = 144 y_1 = 144 y 1 = 144 .
Das Besondere: Die beiden Zahlen eines Probanden gehören zusammen. Sie stammen vom
selben Mann und von derselben Stelle der Kopfhaut. Man schreibt sie deshalb als
Paar ( x i , y i ) (x_i,\,y_i) ( x i , y i ) . Es gibt n = 5 n = 5 n = 5 Paare.
Im Bild hat jeder Proband eine Zeile. Der leere Kreis ist die Haarzahl zu Beginn, der
gefüllte Kreis die am Ende.
Auffällig: Die Männer unterscheiden sich schon zu Beginn stark. Proband 2 hat 109
Haare auf der Stelle, Proband 4 hat 218, also doppelt so viele. Dieser Unterschied hat
nichts mit dem Mittel zu tun. Er ist einfach da. Der nächste Schritt zeigt, wie man ihn
loswird.
d i = y i − x i d_i = y_i - x_i d i = y i − x i :
+ 25 , + 71 , + 33 , − 68 , + 37 +25,\ +71,\ +33,\ -68,\ +37 + 25 , + 71 , + 33 , − 68 , + 37
Wenn die Werte in Paaren vorliegen, die zusammengehören, heißt die Stichprobe
verbunden oder gepaart . Hier: dieselbe Person vorher und nachher.
Bei einer verbundenen Stichprobe vergleicht man jeden Mann mit sich selbst . Man
bildet für jedes Paar die Differenz , also den Unterschied:
d i = y i − x i d_i = y_i - x_i d i = y i − x i = Ende minus Beginn
Proband 1: 144 − 119 = + 25 144 - 119 = +25 144 − 119 = + 25
Proband 2: 180 − 109 = + 71 180 - 109 = +71 180 − 109 = + 71
Proband 3: 200 − 167 = + 33 200 - 167 = +33 200 − 167 = + 33
Proband 4: 150 − 218 = − 68 150 - 218 = -68 150 − 218 = − 68
Proband 5: 191 − 154 = + 37 191 - 154 = +37 191 − 154 = + 37
Plus heißt: am Ende mehr Haare als zu Beginn. Minus heißt: weniger. Die
Reihenfolge „Ende minus Beginn“ ist so gewählt, dass eine Verbesserung positiv
herauskommt. Das Skript schreibt allgemein D i = x i − y i D_i = x_i - y_i D i = x i − y i , also erste minus zweite
Reihe. Welche Reihe man abzieht, legt man selbst fest; nur muss die Richtung später zur
Alternative passen (Schritt 5).
Warum Differenzen? In der Differenz steckt nur noch die Veränderung. Ob ein Mann
von Natur aus 109 oder 218 Haare hat, fällt heraus. So stören die großen Unterschiede
zwischen den Männern den Vergleich nicht mehr.
Im Bild ist jede Differenz ein Pfeil von Beginn nach Ende: grün mit Plus nach rechts, rot
mit Minus nach links. Unten stehen die fünf Differenzen noch einmal auf einem eigenen
Zahlenstrahl.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Eine
Stichprobe ist ein kleiner Ausschnitt aus allen möglichen Beobachtungen. Aus ihr
berechnete Zahlen wie der Mittelwert sind
Schätzer für die unbekannten Werte
dahinter, etwa den Erwartungswert
μ \mu μ .
gesucht: gilt
μ D > 0 \mu_D > 0 μ D > 0 ? (
μ D \mu_D μ D unbekannt)
Vier Männer haben am Ende mehr Haare, einer hat 68 weniger. Spricht das für das Mittel?
Nicht unbedingt. Haarzahlen schwanken auch ohne Mittel: Jeden Tag fallen Haare aus und
wachsen nach, und beim Zählen passieren kleine Fehler. Auch ein völlig wirkungsloses
Mittel würde deshalb einige positive und einige negative Differenzen liefern. Ein paar
Pluszeichen können also Zufall sein.
Außerdem geht es nicht nur um diese fünf Männer. Gefragt ist, ob das Mittel
allgemein wirkt, also bei allen Männern, die es benutzen würden. Deren mittlere
Veränderung heißt μ D \mu_D μ D (gelesen „mü D“). Das ist der Erwartungswert der
Differenz: der Wert, um den die Differenzen im Mittel schwanken. Das kleine D D D steht für
Differenz.
μ D \mu_D μ D kennt niemand. Man sieht nur fünf Differenzen, eine Stichprobe . Die Frage
der Aufgabe lautet in Zeichen: Gilt μ D > 0 \mu_D > 0 μ D > 0 ?
Mit fünf Werten lässt sich das nicht sicher beantworten. Ein Test entscheidet trotzdem,
und zwar so, dass die Gefahr eines bestimmten Irrtums klein und bekannt ist. Wie, zeigen
die nächsten Schritte.
Differenzen
d 1 , … , d 5 d_1, \dots, d_5 d 1 , … , d 5 gegen
μ 0 = 0 \mu_0 = 0 μ 0 = 0 testen
Nach Schritt 2 zählen nur noch die Differenzen. Aus zwei Messreihen ist
eine Stichprobe geworden: d 1 , … , d 5 d_1, \dots, d_5 d 1 , … , d 5 . Die Frage ist, ob ihr Erwartungswert
μ D \mu_D μ D größer ist als ein Vergleichswert, hier μ 0 = 0 \mu_0 = 0 μ 0 = 0 („keine Änderung“).
Für die Frage „Ist der Erwartungswert einer Stichprobe größer als ein Vergleichswert
μ 0 \mu_0 μ 0 ?“ gibt es den t-Test für eine Stichprobe (Einstichproben-t-Test). Er passt,
wenn die Varianz unbekannt ist und aus den Daten geschätzt werden muss. So ist es hier.
Angewandt auf die Differenzen mit μ 0 = 0 \mu_0 = 0 μ 0 = 0 heißt er gepaarter t-Test . Das „t“ im
Namen kommt von der t-Verteilung in Schritt 12.
Warum nicht mit der Normalverteilung? Wäre die Standardabweichung σ \sigma σ der
Differenzen schon vorher bekannt, nähme man den Gauß-Test . Er rechnet mit der
Normalverteilung. Hier kennt niemand σ \sigma σ . Es wird aus den fünf Differenzen geschätzt
(Schritt 10). Diese zusätzliche Unsicherheit berücksichtigt der t-Test.
Voraussetzungen (Skript):
Die Differenzen sind unabhängig voneinander. Das passt: Es sind fünf verschiedene
Männer, die sich nicht gegenseitig beeinflussen.
Die Differenzen sind normalverteilt . Das prüft man mit einem eigenen Test in R,
dem Shapiro-Wilk-Test. Um sein Ergebnis zu lesen, braucht man den p p p -Wert. Der wird
erst in Schritt 14 erklärt. Deshalb steht die Prüfung in Schritt 16, vor der
Entscheidung.
Im Bild ist die gestrichelte Linie unten die 0, der Vergleichswert.
Merke: Gepaarter t-Test = t-Test für eine Stichprobe, angewandt auf die
Differenzen, mit dem Vergleichswert 0. Für zwei getrennte Gruppen von Personen gibt es
einen anderen Test (Aufgabe 2 dieses Blatts).
Aus Blatt 4, Aufgabe 1 („Normalverteilung: die σ-Regeln“): Eine normalverteilte
Größe hat eine glockenförmige Dichte um ihren Erwartungswert
μ \mu μ . Werte nahe der Mitte
sind häufig, weit entfernte selten.
H 0 : μ D ≤ 0 H_0:\ \mu_D \le 0 H 0 : μ D ≤ 0 gegen
H A : μ D > 0 H_A:\ \mu_D > 0 H A : μ D > 0
Ein Test stellt zwei Hypothesen gegeneinander. Eine Hypothese ist eine Behauptung,
die man prüft. Die beiden schließen sich aus, und zusammen decken sie alle Möglichkeiten
ab.
Die Alternative H A H_A H A ist das, was man zeigen möchte. Hier: Das Mittel
bringt im Mittel mehr Haare, μ D > 0 \mu_D > 0 μ D > 0 .
Die Nullhypothese H 0 H_0 H 0 ist das Gegenteil, also „nichts Besonderes“: keine
Verbesserung, μ D ≤ 0 \mu_D \le 0 μ D ≤ 0 .
Warum steht die Vermutung in H A H_A H A ? Ein Test arbeitet wie ein Gericht. Dort gilt:
unschuldig, bis die Beweise klar dagegen sprechen. Die Unschuld ist H 0 H_0 H 0 . Verurteilt wird
nur, wenn die Beweise sehr stark sind. Genauso gilt beim Test H 0 H_0 H 0 , bis die Daten klar
dagegen sprechen. Nur dann wird H 0 H_0 H 0 verworfen , und H A H_A H A gilt als gezeigt. Wer
also etwas zeigen will, muss das Gegenteil widerlegen. Deshalb kommt die Vermutung in
H A H_A H A (Skript: „wenn man eine Vermutung hat, sollte diese als H A H_A H A formuliert werden“).
Warum „≤ \le ≤ “ in H 0 H_0 H 0 und nicht „= = = “? H 0 H_0 H 0 muss alles abdecken, was nicht H A H_A H A
ist. Dazu gehört auch, dass das Mittel schadet (μ D < 0 \mu_D < 0 μ D < 0 ).
Einseitig: H A H_A H A schaut nur in eine Richtung, nach oben. Nur Daten mit deutlich
mehr Haaren sprechen gegen H 0 H_0 H 0 . Man nennt das einen einseitigen Test. Wäre
die Frage „Ändert sich überhaupt etwas?“, hieße die Alternative μ D ≠ 0 \mu_D \ne 0 μ D = 0 ; das wäre
ein zweiseitiger Test.
Im Bild liegt H 0 H_0 H 0 links der Null (einschließlich 0), H A H_A H A rechts davon.
Die Musterlösung schreibt H 1 H_1 H 1 statt H A H_A H A . Das ist nur ein anderer Name.
P ( Fehler 1. Art ) ≤ α = 0,05 P(\text{Fehler 1. Art}) \le \alpha = 0{,}05 P ( Fehler 1. Art ) ≤ α = 0 , 05
Am Ende steht eine von zwei Entscheidungen: „H 0 H_0 H 0 verwerfen“ (dann gilt H A H_A H A als
gezeigt) oder „H 0 H_0 H 0 beibehalten“. Weil die Daten vom Zufall abhängen, kann jede
Entscheidung falsch sein. Die Tabelle zeigt die vier Fälle.
Fehler 1. Art: H 0 H_0 H 0 wird verworfen, obwohl H 0 H_0 H 0 stimmt. Hier: Man erklärt das
Mittel für wirksam, obwohl es nicht wirkt.
Fehler 2. Art: H 0 H_0 H 0 wird beibehalten, obwohl H A H_A H A stimmt. Hier: Das Mittel
wirkt, aber der Test bemerkt es nicht.
Bei fester Stichprobengröße kann man nicht beide Fehler zugleich klein machen. Je
vorsichtiger ein Test mit dem Verwerfen ist, desto öfter übersieht er eine echte Wirkung.
Man legt deshalb nur für den Fehler 1. Art eine Obergrenze fest. Sie heißt
Signifikanzniveau α \alpha α („alpha“):
P ( Fehler 1. Art ) = P ( H 0 verwerfen, obwohl H 0 stimmt ) ≤ α P(\text{Fehler 1. Art}) = P(H_0 \text{ verwerfen, obwohl } H_0 \text{ stimmt}) \le
\alpha P ( Fehler 1. Art ) = P ( H 0 verwerfen, obwohl H 0 stimmt ) ≤ α
Signifikant heißt: zu deutlich, um noch als Zufall durchzugehen. Wird H 0 H_0 H 0
verworfen, nennt man das Ergebnis signifikant zum Niveau α \alpha α .
Die Aufgabe sagt „zum Niveau 5 %“, also α = 0,05 \alpha = 0{,}05 α = 0 , 05 . Das heißt: Wirkt das Mittel in
Wahrheit nicht, dann „beweist“ der Test seine Wirkung in höchstens 5 von 100 solchen
Studien. Übliche Werte sind 10 %, 5 % und 1 %.
α \alpha α wird vor dem Test festgelegt und danach nicht mehr geändert.
Vorsicht, häufige Fehldeutung: α \alpha α ist eine Eigenschaft des Verfahrens :
Stimmt H 0 H_0 H 0 , verwirft der Test sie höchstens mit Wahrscheinlichkeit α \alpha α . Das Skript
nennt α \alpha α deshalb auch Irrtumswahrscheinlichkeit. α \alpha α ist nicht die
Wahrscheinlichkeit, dass eine konkrete Entscheidung falsch ist. Wird H 0 H_0 H 0 verworfen,
heißt das auch nicht „H A H_A H A ist mit 95 % Wahrscheinlichkeit wahr“. Ob H 0 H_0 H 0 stimmt, ist
kein Zufall; zufällig sind nur die Daten.
Merke: Nur das Verwerfen von
H 0 H_0 H 0 ist abgesichert: Wenn
H 0 H_0 H 0 stimmt, verwirft der
Test sie höchstens mit Wahrscheinlichkeit
α \alpha α . Beim Beibehalten ist der Fehler 2. Art
nicht begrenzt. Das ist der Grund, warum die Vermutung in
H A H_A H A steht (Schritt 5), und
warum „beibehalten“ kein Beweis für
H 0 H_0 H 0 ist (Schritt 18).
d ˉ = 98 5 = 19,6 \bar d = \dfrac{98}{5} = 19{,}6 d ˉ = 5 98 = 19 , 6
Jetzt wird gerechnet. Zuerst der Stichprobenmittelwert der Differenzen, d ˉ \bar d d ˉ
(gelesen „d quer“): alle Differenzen addieren und durch ihre Anzahl teilen.
Summe: 25 + 71 + 33 + ( − 68 ) + 37 = 98 25 + 71 + 33 + (-68) + 37 = 98 25 + 71 + 33 + ( − 68 ) + 37 = 98 . Die − 68 -68 − 68 wird dabei abgezogen.
Geteilt durch n = 5 n = 5 n = 5 :
d ˉ = 98 5 = 19,6 \bar d = \dfrac{98}{5} = \mathbf{19{,}6} d ˉ = 5 98 = 19 , 6
Im Mittel hatten die fünf Männer am Ende also 19,6 Haare mehr auf der Stelle. d ˉ \bar d d ˉ ist
der Schätzer für die unbekannte mittlere Veränderung μ D \mu_D μ D .
19,6 ist größer als 0. Ob es deutlich genug größer ist, um Zufall auszuschließen,
ist genau die Frage des Tests. Dazu braucht man als Nächstes die Streuung der Differenzen.
Im Bild ist d ˉ \bar d d ˉ die gestrichelte Linie bei 19,6.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Der
Stichprobenmittelwert ist
x ˉ n = 1 n ∑ i = 1 n x i \bar x_n = \frac{1}{n}\sum_{i=1}^{n} x_i x ˉ n = n 1 ∑ i = 1 n x i , die Summe aller
Werte geteilt durch ihre Anzahl. Das Zeichen
Σ \Sigma Σ heißt „addiere für
i = 1 i = 1 i = 1 bis
n n n “.
Hier heißen die Werte
d i d_i d i statt
x i x_i x i .
d i − d ˉ d_i - \bar d d i − d ˉ :
5,4 , 51,4 , 13,4 , − 87,6 , 17,4 5{,}4,\ 51{,}4,\ 13{,}4,\ -87{,}6,\ 17{,}4 5 , 4 , 51 , 4 , 13 , 4 , − 87 , 6 , 17 , 4
Wie stark streuen die Differenzen? Das misst man wie bei jeder Stichprobe über die
Abweichungen vom Mittelwert: jede Differenz minus 19,6.
Proband 1: 25 − 19,6 = 5,4 25 - 19{,}6 = 5{,}4 25 − 19 , 6 = 5 , 4
Proband 2: 71 − 19,6 = 51,4 71 - 19{,}6 = 51{,}4 71 − 19 , 6 = 51 , 4
Proband 3: 33 − 19,6 = 13,4 33 - 19{,}6 = 13{,}4 33 − 19 , 6 = 13 , 4
Proband 4: − 68 − 19,6 = − 87,6 -68 - 19{,}6 = -87{,}6 − 68 − 19 , 6 = − 87 , 6
Proband 5: 37 − 19,6 = 17,4 37 - 19{,}6 = 17{,}4 37 − 19 , 6 = 17 , 4
Bei Proband 4 werden zwei negative Zahlen zusammengezählt: 68 unter null und noch einmal
19,6 weiter nach unten ergibt − 87,6 -87{,}6 − 87 , 6 .
Probe: Die Abweichungen ergeben zusammen immer 0. Die positiven sind 5,4 + 51,4 + 13,4 + 17,4 = 87,6 5{,}4 +
51{,}4 + 13{,}4 + 17{,}4 = 87{,}6 5 , 4 + 51 , 4 + 13 , 4 + 17 , 4 = 87 , 6 , die negative ist − 87,6 -87{,}6 − 87 , 6 . Zusammen 0. Die
Abweichungen stimmen also.
Im Bild sind die Abweichungen Pfeile von der Linie d ˉ \bar d d ˉ zu den Punkten.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Die Summe der
Abweichungen vom Mittelwert ist bei jeder Stichprobe 0. Deshalb taugt sie nicht als
Streuungsmaß, und man quadriert die Abweichungen.
∑ ( d i − d ˉ ) 2 = 10.827,2 \sum (d_i - \bar d)^2 = 10.827{,}2 ∑ ( d i − d ˉ ) 2 = 10.827 , 2
Jede Abweichung wird quadriert , also mit sich selbst malgenommen. Dann ist alles
positiv, und nichts hebt sich mehr auf:
5,4 2 = 5,4 ⋅ 5,4 = 29,16 5{,}4^2 = 5{,}4 \cdot 5{,}4 = 29{,}16 5 , 4 2 = 5 , 4 ⋅ 5 , 4 = 29 , 16
51,4 2 = 2.641,96 51{,}4^2 = 2.641{,}96 51 , 4 2 = 2.641 , 96
13,4 2 = 179,56 13{,}4^2 = 179{,}56 13 , 4 2 = 179 , 56
( − 87,6 ) 2 = ( − 87,6 ) ⋅ ( − 87,6 ) = 7.673,76 (-87{,}6)^2 = (-87{,}6) \cdot (-87{,}6) = 7.673{,}76 ( − 87 , 6 ) 2 = ( − 87 , 6 ) ⋅ ( − 87 , 6 ) = 7.673 , 76 (minus mal minus ist plus)
17,4 2 = 302,76 17{,}4^2 = 302{,}76 17 , 4 2 = 302 , 76
Zusammen:
29,16 + 2.641,96 + 179,56 + 7.673,76 + 302,76 = 10.827,2 29{,}16 + 2.641{,}96 + 179{,}56 + 7.673{,}76 + 302{,}76 = \mathbf{10.827{,}2} 29 , 16 + 2.641 , 96 + 179 , 56 + 7.673 , 76 + 302 , 76 = 10.827 , 2
Auffällig: Proband 4 allein trägt 7.673,76 bei, das sind 7.673,76 : 10.827,2 ≈ 0,71 7.673{,}76 : 10.827{,}2
\approx 0{,}71 7.673 , 76 : 10.827 , 2 ≈ 0 , 71 , also rund 71 % der ganzen Summe. Große Abweichungen zählen durch das
Quadrieren besonders stark. Der eine Mann mit 68 Haaren weniger macht die Streuung groß.
Die Tabelle rechts fasst die Rechnung aus den Schritten 7 bis 9 zusammen.
s D 2 = 10.827,2 4 = 2.706,8 s_D^2 = \dfrac{10.827{,}2}{4} = 2.706{,}8 s D 2 = 4 10.827 , 2 = 2.706 , 8 ,
s D ≈ 52,0269 s_D \approx 52{,}0269 s D ≈ 52 , 0269
Die Summe der Quadrate wird durch n − 1 = 4 n - 1 = 4 n − 1 = 4 geteilt. Das ergibt die
Stichprobenvarianz der Differenzen, s D 2 s_D^2 s D 2 :
s D 2 = 10.827,2 5 − 1 = 10.827,2 4 = 2.706,8 s_D^2 = \dfrac{10.827{,}2}{5 - 1} = \dfrac{10.827{,}2}{4} = \mathbf{2.706{,}8} s D 2 = 5 − 1 10.827 , 2 = 4 10.827 , 2 = 2.706 , 8
Die Wurzel daraus ist die Standardabweichung s D s_D s D . Sie hat wieder die Einheit der
Daten, also Anzahl Haare:
s D = 2.706,8 = 52,02691 … ≈ 52,0269 s_D = \sqrt{2.706{,}8} = 52{,}02691\ldots \approx \mathbf{52{,}0269} s D = 2.706 , 8 = 52 , 02691 … ≈ 52 , 0269
Gerundet wird auf vier Nachkommastellen, weil mit s D s_D s D weitergerechnet wird. Die
Musterlösung schreibt kürzer 52,03.
Was sagt die Zahl? Eine einzelne Differenz weicht typischerweise um rund 52 Haare
vom Mittelwert 19,6 ab. Das ist fast dreimal so viel wie der Mittelwert selbst. Das Band
im Bild reicht von 19,6 − 52,03 = − 32,43 19{,}6 - 52{,}03 = -32{,}43 19 , 6 − 52 , 03 = − 32 , 43 bis 19,6 + 52,03 = 71,63 19{,}6 + 52{,}03 = 71{,}63 19 , 6 + 52 , 03 = 71 , 63 . Die 0
liegt mitten darin.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): s 2 = 1 n − 1 ∑ i = 1 n ( x i − x ˉ n ) 2 s^2 =
\frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar x_n)^2 s 2 = n − 1 1 ∑ i = 1 n ( x i − x ˉ n ) 2 und
s = s 2 s = \sqrt{s^2} s = s 2 . Geteilt wird durch
n − 1 n
- 1 n − 1 , weil nur
n − 1 n - 1 n − 1 Abweichungen frei sind: Die letzte liegt fest, weil die Summe 0
sein muss.
t ^ = 5 ⋅ 19,6 52,0269 ≈ 0,8424 \hat t = \sqrt 5 \cdot \dfrac{19{,}6}{52{,}0269} \approx 0{,}8424 t ^ = 5 ⋅ 52 , 0269 19 , 6 ≈ 0 , 8424
Jetzt werden Mittelwert und Streuung zu einer Zahl zusammengefasst, der
Teststatistik t ^ \hat t t ^ (gelesen „t Dach“). An ihr wird am Ende entschieden.
Die Idee: d ˉ = 19,6 \bar d = 19{,}6 d ˉ = 19 , 6 allein sagt wenig. Ob 19,6 viel ist, hängt davon ab,
wie stark der Mittelwert von fünf Differenzen allein durch Zufall schwankt. Dieses Maß
heißt Standardfehler :
s D n = 52,0269 5 \dfrac{s_D}{\sqrt n} = \dfrac{52{,}0269}{\sqrt 5} n s D = 5 52 , 0269
Geteilt wird durch n \sqrt n n , weil ein Mittelwert weniger schwankt als ein einzelner Wert:
Zufällige Ausschläge nach oben und unten gleichen sich beim Mitteln teilweise aus. Wie
stark, folgt aus zwei Rechenregeln für die Varianz (Kasten unten). Hat jede Differenz die
Varianz σ 2 \sigma^2 σ 2 und sind die Differenzen unabhängig, dann gilt:
v a r ( D 1 + ⋯ + D n ) = n ⋅ σ 2 \mathrm{var}(D_1 + \dots + D_n) = n \cdot \sigma^2 var ( D 1 + ⋯ + D n ) = n ⋅ σ 2
Der Mittelwert ist diese Summe mal 1 n \frac{1}{n} n 1 . Der Faktor geht quadriert in die Varianz
ein:
v a r ( d ˉ ) = ( 1 n ) 2 ⋅ n ⋅ σ 2 = σ 2 n \mathrm{var}(\bar d) = \left(\frac{1}{n}\right)^2 \cdot n \cdot \sigma^2 =
\frac{\sigma^2}{n} var ( d ˉ ) = ( n 1 ) 2 ⋅ n ⋅ σ 2 = n σ 2
Die Wurzel daraus ist σ n \frac{\sigma}{\sqrt n} n σ : die Standardabweichung des Mittelwerts.
σ \sigma σ ist unbekannt, also setzt man den Schätzer s D s_D s D ein. Das ergibt den
Standardfehler s D n \frac{s_D}{\sqrt n} n s D .
Mit 5 = 2,236068 … \sqrt 5 = 2{,}236068\ldots 5 = 2 , 236068 … ist der Standardfehler 52,0269 : 2,236068 ≈ 23,2671 52{,}0269 : 2{,}236068 \approx
23{,}2671 52 , 0269 : 2 , 236068 ≈ 23 , 2671 .
t ^ \hat t t ^ misst den Abstand von d ˉ \bar d d ˉ zum Vergleichswert μ 0 = 0 \mu_0 = 0 μ 0 = 0 in Standardfehlern:
t ^ = 19,6 − 0 23,2671 ≈ 0,8424 \hat t = \dfrac{19{,}6 - 0}{23{,}2671} \approx \mathbf{0{,}8424} t ^ = 23 , 2671 19 , 6 − 0 ≈ 0 , 8424
Das Skript schreibt dieselbe Rechnung allgemein als t ^ = n ⋅ x ˉ n − μ 0 s n \hat t = \sqrt n \cdot \frac{\bar x_n
- \mu_0}{s_n} t ^ = n ⋅ s n x ˉ n − μ 0 . Beim gepaarten Test stehen x ˉ n \bar x_n x ˉ n und s n s_n s n für Mittelwert und
Standardabweichung der Differenzen, hier also d ˉ \bar d d ˉ und s D s_D s D : t ^ = n ⋅ d ˉ − μ 0 s D \hat t = \sqrt n \cdot
\frac{\bar d - \mu_0}{s_D} t ^ = n ⋅ s D d ˉ − μ 0 . Durch s D n \frac{s_D}{\sqrt n} n s D teilen ist dasselbe wie mit
n s D \frac{\sqrt n}{s_D} s D n malnehmen. Mit μ 0 = 0 \mu_0 = 0 μ 0 = 0 eingesetzt: 5 ⋅ 19,6 = 43,8269 \sqrt 5 \cdot 19{,}6 =
43{,}8269 5 ⋅ 19 , 6 = 43 , 8269 und 43,8269 : 52,0269 ≈ 0,8424 43{,}8269 : 52{,}0269 \approx 0{,}8424 43 , 8269 : 52 , 0269 ≈ 0 , 8424 . Gerechnet ist mit allen Stellen
von 5 \sqrt 5 5 ; gerundet wird erst am Ende.
Was sagt die Zahl? d ˉ \bar d d ˉ liegt nur 0,84 Standardfehler über 0, also weniger als
einen. Im Bild ist die obere Klammer (19,6) kürzer als die untere (23,27).
Ein großes t ^ \hat t t ^ spricht gegen H 0 H_0 H 0 . Wie groß „groß“ ist, klärt Teil 2.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“):
v a r ( a X + b ) = a 2 ⋅ v a r ( X ) \mathrm{var}(aX + b) = a^2 \cdot \mathrm{var}(X) var ( a X + b ) = a 2 ⋅ var ( X ) : Ein Faktor geht quadriert ein. Und bei
unabhängigen Zufallsvariablen addieren sich die Varianzen:
v a r ( X + Y ) = v a r ( X ) + v a r ( Y ) \mathrm{var}(X + Y) =
\mathrm{var}(X) + \mathrm{var}(Y) var ( X + Y ) = var ( X ) + var ( Y ) .
wenn
H 0 H_0 H 0 stimmt:
T T T t-verteilt mit
n − 1 = 4 n - 1 = 4 n − 1 = 4 Freiheitsgraden
Ist t ^ = 0,84 \hat t = 0{,}84 t ^ = 0 , 84 groß oder klein? Dafür ein Gedankenexperiment: Das Mittel wirkt gar
nicht, also μ D = 0 \mu_D = 0 μ D = 0 . Die Studie wird sehr oft wiederholt, jedes Mal mit fünf neuen
Männern. Jedes Mal kommen andere Differenzen und damit ein anderes t ^ \hat t t ^ heraus. Diese
Werte streuen um 0: mal positiv, mal negativ, selten weit weg.
Vor dem Versuch ist die Teststatistik also eine Zufallsvariable. Sie heißt T T T . t ^ = 0,8424 \hat t =
0{,}8424 t ^ = 0 , 8424 ist der eine Wert, der hier beobachtet wurde.
Wie T T T verteilt ist, weiß man genau, wenn die Differenzen normalverteilt sind: T T T ist
t-verteilt mit n − 1 n - 1 n − 1 Freiheitsgraden . Das Bild zeigt die Dichte dieser
Verteilung. Wahrscheinlichkeiten sind Flächen darunter.
Sie ist glockenförmig und symmetrisch um 0.
Sie hat mehr Fläche weit draußen als die Standardnormalverteilung (gestrichelt) und ist
in der Mitte flacher. Grund: In t ^ \hat t t ^ steckt s D s_D s D , und das ist aus nur fünf Werten
geschätzt. Fällt s D s_D s D zufällig klein aus, wird t ^ \hat t t ^ groß. Mit mehr Werten wird
dieser Effekt kleiner, und die t-Verteilung nähert sich der Standardnormalverteilung.
Die Zahl der Freiheitsgrade legt fest, welche t-Verteilung gemeint ist. Hier n − 1 = 5 − 1 = 4 n -
1 = 5 - 1 = 4 n − 1 = 5 − 1 = 4 , dieselbe 4 wie im Nenner von s D 2 s_D^2 s D 2 .
Warum darf man mit μ D = 0 \mu_D = 0 μ D = 0 rechnen, obwohl H 0 H_0 H 0 „≤ 0 \le 0 ≤ 0 “ sagt? μ D = 0 \mu_D = 0 μ D = 0
ist der Grenzfall. Schadet das Mittel sogar (μ D < 0 \mu_D < 0 μ D < 0 ), fällt t ^ \hat t t ^ im Mittel
noch kleiner aus. Große Werte werden dann noch seltener, und ein Fehler 1. Art wird noch
unwahrscheinlicher.
Aus Blatt 4, Aufgabe 1 („Normalverteilung: die σ-Regeln“): Bei einer stetigen
Verteilung ist die Wahrscheinlichkeit die Fläche unter der Dichte. Die ganze Fläche ist 1.
Aus Blatt 4, Aufgabe 3 („Standardnormalverteilung mit R“): Die
Standardnormalverteilung
N ( 0 , 1 ) N(0,\,1) N ( 0 , 1 ) ist die Normalverteilung mit Mitte 0 und
Standardabweichung 1.
t 4 ; 0,95 = 2,1318 t_{4;\,0{,}95} = 2{,}1318 t 4 ; 0 , 95 = 2 , 1318 ;
t ^ = 0,8424 < 2,1318 \hat t = 0{,}8424 < 2{,}1318 t ^ = 0 , 8424 < 2 , 1318
Welche Werte von t ^ \hat t t ^ sind „zu groß für Zufall“? Nach Schritt 5 sprechen nur große
positive Werte für H A H_A H A . Man zieht deshalb rechts eine Grenze, und zwar so: Im
Grenzfall μ D = 0 \mu_D = 0 μ D = 0 landet T T T genau mit Wahrscheinlichkeit α = 5 % \alpha = 5\,\% α = 5 % rechts
davon. Ist μ D < 0 \mu_D < 0 μ D < 0 , landet T T T noch seltener dort (Schritt 12). Für alle Fälle von
H 0 H_0 H 0 ist die Wahrscheinlichkeit für einen Fehler 1. Art also höchstens α \alpha α .
Rechts der Grenze liegen 5 % der Fläche, links also 95 %. Die Grenze ist damit das
95-%-Quantil der t-Verteilung mit 4 Freiheitsgraden. Sie heißt
kritischer Wert und wird so geschrieben:
t 4 ; 0,95 t_{4;\,0{,}95} t 4 ; 0 , 95 , allgemein t n − 1 ; 1 − α t_{n-1;\,1-\alpha} t n − 1 ; 1 − α
Die erste Zahl unten sind die Freiheitsgrade, die zweite ist die Fläche links der Grenze.
R hat dafür den Befehl qt: q für
Quantil, t für die t-Verteilung.
df sind die Freiheitsgrade (englisch degrees of freedom ).
R antwortet 2,131847, auf vier Stellen 2,1318 2{,}1318 2 , 1318 .
Der Ablehnbereich sind alle Werte über dem kritischen Wert, im Bild rot. Die Regel
aus dem Skript, hier für H A : μ D > μ 0 = 0 H_A:\ \mu_D > \mu_0 = 0 H A : μ D > μ 0 = 0 : H 0 H_0 H 0 verwerfen, falls t ^ > t n − 1 ; 1 − α \hat t >
t_{n-1;\,1-\alpha} t ^ > t n − 1 ; 1 − α .
Vergleich: t ^ = 0,8424 \hat t = 0{,}8424 t ^ = 0 , 8424 ist kleiner als 2,1318 2{,}1318 2 , 1318 . Es liegt deutlich links
der Grenze, also nicht im Ablehnbereich. Das ist ein vorläufiges Ergebnis.
Endgültig entschieden wird in Schritt 17, nachdem die Voraussetzung geprüft ist (Schritt
16).
Zum Vergleich: Bei der Standardnormalverteilung läge die 95-%-Grenze bei 1,6449
(qnorm(0.95)). Die t-Grenze liegt weiter rechts, weil die
t-Verteilung mehr Fläche weit draußen hat. Mit nur fünf Werten braucht man also stärkere
Belege.
Aus Blatt 4, Aufgabe 5 („Quantile: die Füllmenge einer Kaffeepackung“): Ein Quantil
ist eine Grenze, links von der ein vorgegebener Anteil der Fläche liegt. Das 95-%-Quantil
hat also 95 % der Fläche links von sich (hier
0,95 = 1 − α 0{,}95 = 1 - \alpha 0 , 95 = 1 − α ). Ein Quantil zählt
immer von links. Für die Normalverteilung rechnet es
qnorm, für
die t-Verteilung
qt.
p = P ( T ≥ 0,8424 ) ≈ 0,2235 > 0,05 p = P(T \ge 0{,}8424) \approx 0{,}2235 > 0{,}05 p = P ( T ≥ 0 , 8424 ) ≈ 0 , 2235 > 0 , 05
Es gibt einen zweiten Weg zur Entscheidung. Statt zu fragen „Liegt t ^ \hat t t ^ hinter der
Grenze?“, fragt man: Wie wahrscheinlich ist ein so großes t ^ \hat t t ^ , wenn H 0 H_0 H 0 stimmt?
Diese Wahrscheinlichkeit heißt p p p -Wert . Genau: Der p p p -Wert ist die
Wahrscheinlichkeit, unter H 0 H_0 H 0 eine Teststatistik zu erhalten, die mindestens so extrem
ist wie die beobachtete. „Extrem“ heißt hier: in Richtung H A H_A H A , also mindestens so groß.
Im Bild ist das die blaue Fläche rechts von 0,84.
p = P ( T ≥ 0,8424 ) p = P(T \ge 0{,}8424) p = P ( T ≥ 0 , 8424 )
Der R-Befehl pt gibt wie pnorm die
Fläche links einer Grenze. Die Fläche rechts ist deshalb 1 minus die Fläche links.
R antwortet 0,2234956, auf vier Stellen p ≈ 0,2235 p \approx 0{,}2235 p ≈ 0 , 2235 , also rund 22 %.
In Worten: Wirkte das Mittel gar nicht, käme trotzdem in rund 22 von 100 solchen
Studien ein t ^ \hat t t ^ von mindestens 0,84 heraus. Das Ergebnis ist also nichts
Ungewöhnliches, wenn H 0 H_0 H 0 stimmt.
Die Regel: H 0 H_0 H 0 verwerfen, falls p ≤ α p \le \alpha p ≤ α . Hier ist 0,2235 > 0,05 0{,}2235 > 0{,}05 0 , 2235 > 0 , 05 ,
also wird H 0 H_0 H 0 nicht verworfen. Auch das ist vorläufig; endgültig entscheidet Schritt 17.
Warum führen beide Wege zum selben Ergebnis? Liegt t ^ \hat t t ^ links vom kritischen
Wert, dann enthält die blaue Fläche rechts von t ^ \hat t t ^ die ganze rote 5-%-Fläche und noch
mehr. Also ist p p p größer als 5 %. Liegt t ^ \hat t t ^ im Ablehnbereich, ist die Fläche rechts
davon kleiner als 5 %.
Man kann den p p p -Wert auch so lesen: Er ist das kleinste Niveau, bei dem H 0 H_0 H 0 gerade noch
verworfen würde.
Zur Musterlösung: Dort steht p = 0,224 p = 0{,}224 p = 0 , 224 . Auf drei Stellen gerundet ist 0,2234956
aber 0,223. Die 0,224 entsteht, wenn man die R-Ausgabe 0,2235 noch einmal rundet. Für die
Entscheidung ist das ohne Bedeutung.
Aus Blatt 4, Aufgabe 3 („Standardnormalverteilung mit R“): „Größer als“ rechnet man
über das Gegenereignis:
P ( X ≥ x ) = 1 − P ( X ≤ x ) P(X \ge x) = 1 - P(X \le x) P ( X ≥ x ) = 1 − P ( X ≤ x ) , in R
1 - pnorm(x). Bei einer stetigen Verteilung ist es gleich, ob
≥ \ge ≥ oder
> > > steht.
p ≈ 22 % > 15 % p \approx 22\,\% > 15\,\% p ≈ 22 % > 15 % : nichts spricht gegen
H 0 H_0 H 0
Der p p p -Wert kann mehr als Ja oder Nein. Er zeigt auch, wie stark die Daten gegen
H 0 H_0 H 0 sprechen. Je kleiner p p p , desto weniger passen die Daten zu H 0 H_0 H 0 . Das Skript gibt
dafür die Tabelle rechts an. Ein Maß für die Stärke der Belege heißt Evidenzmaß .
Hier ist p ≈ 22,35 % p \approx 22{,}35\,\% p ≈ 22 , 35 % , also größer als 15 %. Nach der Tabelle spricht
nichts gegen H 0 H_0 H 0 . Die Daten sind mit einem wirkungslosen Mittel gut vereinbar.
Merke: α \alpha α wird vor dem Test gewählt, nie nach dem
p p p -Wert. Sonst könnte man
α \alpha α immer knapp über
p p p legen und alles „beweisen“. Die Grenze für den Fehler 1. Art
wäre dann wertlos.
Typischer Fehler: Der
p p p -Wert ist
nicht die Wahrscheinlichkeit, dass
H 0 H_0 H 0
stimmt. Er wird ja gerade unter der Annahme berechnet, dass
H 0 H_0 H 0 stimmt. Er sagt nur, wie
gut die Daten zu
H 0 H_0 H 0 passen.
shapiro.test:
p ≈ 0,1608 > 0,05 p \approx 0{,}1608 > 0{,}05 p ≈ 0 , 1608 > 0 , 05 ✓
Der t-Test gilt nur, wenn die Differenzen normalverteilt sind (Schritt 4). Mit dem
p p p -Wert lässt sich das jetzt prüfen.
Der Shapiro-Wilk-Test ist selbst ein Test, nur für diese eine Frage:
H 0 H_0 H 0 : Die Differenzen sind normalverteilt.
H A H_A H A : Sie sind nicht normalverteilt.
Seine Teststatistik rechnet nur R aus; von Hand ist das zu aufwendig. In R werden die
Daten mit c(…) eingegeben und mit
<- benannt. ende - beginn bildet
die fünf Differenzen, shapiro.test prüft sie.
R gibt zwei Zahlen aus. W = 0,83849 W = 0{,}83849 W = 0 , 83849 ist die Teststatistik. Sie liegt zwischen 0 und 1;
Werte nahe 1 heißen „sieht normalverteilt aus“. 0,84 wirkt klein, ist bei nur fünf Werten
aber nicht auffällig. Entschieden wird deshalb über den p p p -Wert: 0,1608 0{,}1608 0 , 1608 , rund 16 %.
Als Grenze nimmt man üblicherweise dasselbe Niveau wie beim eigentlichen Test, hier 5 %.
Gelesen wird wie in Schritt 14: 0,1608 > 0,05 0{,}1608 > 0{,}05 0 , 1608 > 0 , 05 , also wird H 0 H_0 H 0 nicht verworfen.
Nach der Tabelle aus Schritt 15 (über 15 %) spricht nichts gegen die Normalverteilung. Der
t-Test darf verwendet werden.
Und wenn p ≤ 0,05 p \le 0{,}05 p ≤ 0 , 05 gewesen wäre? Dann spräche zu viel gegen die
Normalverteilung, und der t-Test wäre nicht gültig. Man nähme dann einen Test, der keine
Normalverteilung voraussetzt, etwa eine Form des Wilcoxon-Tests. Wie der arbeitet, zeigt
Aufgabe 3 dieses Blatts („Wilcoxon-Test: welche Zeitschrift wird öfter zitiert?“).
Neu ist: Hier hofft man, H 0 H_0 H 0 beizubehalten. Man will ja nicht zeigen, dass
etwas nicht normalverteilt ist.
Mit Vorsicht: Bei nur fünf Werten erkennt der Test Abweichungen von der
Normalverteilung schlecht. „Nicht verworfen“ heißt nur: Die Daten sprechen nicht dagegen.
Bewiesen ist die Normalverteilung damit nicht. Die − 68 -68 − 68 von Proband 4 fällt auf, ist aber
für den Test noch kein klarer Ausreißer.
Die Musterlösung gibt p = 0,161 p = 0{,}161 p = 0 , 161 an, das ist 0,1608 auf drei Stellen.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Mit
x <- c(…) werden Daten in R eingegeben. Zahlen schreibt R mit
Dezimalpunkt statt Komma.
H 0 H_0 H 0 beibehalten: Verbesserung nicht nachweisbar
Jetzt ist alles beisammen:
Kritischer Wert (Schritt 13): t ^ ≈ 0,8424 \hat t \approx 0{,}8424 t ^ ≈ 0 , 8424 ist nicht größer als
t 4 ; 0,95 ≈ 2,1318 t_{4;\,0{,}95} \approx 2{,}1318 t 4 ; 0 , 95 ≈ 2 , 1318 .
p p p -Wert (Schritt 14): p ≈ 0,2235 p \approx 0{,}2235 p ≈ 0 , 2235 ist größer als α = 0,05 \alpha = 0{,}05 α = 0 , 05 .
Voraussetzung (Schritt 16): Nichts spricht gegen die Normalverteilung der
Differenzen.
Beide Wege sagen dasselbe: H 0 H_0 H 0 wird beibehalten.
Antwort im Sachzusammenhang: Zum Niveau 5 % lässt sich eine Verbesserung des
Haarwuchses durch das Mittel nicht nachweisen .
Das ist genau die Antwort der Musterlösung.
Merke: Die Antwort gehört immer in Worte der Aufgabe: nicht nur „
H 0 H_0 H 0
beibehalten“, sondern was das für das Haarwuchsmittel heißt.
H 0 H_0 H 0 beibehalten
≠ \ne = H 0 H_0 H 0 bewiesen
Heißt das Ergebnis „das Mittel wirkt nicht“? Nein. Der Test hat nur gezeigt, dass
die Daten nicht ausreichen, um eine Wirkung zu belegen.
Der Mittelwert d ˉ = 19,6 \bar d = 19{,}6 d ˉ = 19 , 6 ist positiv. Die Daten zeigen also in Richtung
Verbesserung, nur zu schwach.
Die Streuung ist groß (s D ≈ 52,03 s_D \approx 52{,}03 s D ≈ 52 , 03 ) und die Stichprobe klein (n = 5 n = 5 n = 5 ). Damit
ist der Standardfehler groß, und selbst eine echte Wirkung würde leicht übersehen.
Wer H 0 H_0 H 0 beibehält, kann einen Fehler 2. Art machen: H A H_A H A stimmt, aber der Test
bemerkt es nicht. Dessen Wahrscheinlichkeit ist nicht begrenzt (Schritt 6).
Wie vor Gericht: Ein Freispruch mangels Beweisen heißt nicht, dass die Unschuld bewiesen
ist.
Richtig formuliert: „Eine Verbesserung lässt sich zum Niveau 5 % nicht nachweisen.“
Falsch: „Das Mittel wirkt nicht.“ oder „H 0 H_0 H 0 ist wahr.“
Mehr Klarheit brächte eine größere Studie. Mit mehr Probanden wird n \sqrt n n größer und
der Standardfehler s D / n s_D/\sqrt n s D / n kleiner (Schritt 11). Dann fällt eine echte Wirkung
leichter auf.
Merke: Nur „
H 0 H_0 H 0 verwerfen“ ist ein Nachweis: Das Verfahren verwirft eine wahre
H 0 H_0 H 0 höchstens mit Wahrscheinlichkeit
α \alpha α . „
H 0 H_0 H 0 beibehalten“ heißt nur: nicht
nachweisbar.
t = 0.84239, df = 4, p-value = 0.2235 ✓
R rechnet den ganzen Test mit einem Befehl, t.test. Er prüft die
Rechnung von Hand; er ersetzt sie nicht. Die Angaben im Befehl:
ende, beginn: die beiden Messreihen, in dieser Reihenfolge. R
rechnet dann Ende minus Beginn, wie d i d_i d i in Schritt 2.
paired = TRUE: Die Werte sind gepaart (englisch
paired ), R bildet also die Differenzen.
alternative = "greater": Die Alternative ist „größer“, also
H A : μ D > 0 H_A:\ \mu_D > 0 H A : μ D > 0 . Für „kleiner“ stünde "less", für
„ungleich“ "two.sided".
Die Ausgabe, Zeile für Zeile:
t = 0.84239 ist t ^ \hat t t ^ aus Schritt 11.
df = 4 sind die Freiheitsgrade n − 1 n - 1 n − 1 aus Schritt 12.
p-value = 0.2235 ist der p p p -Wert aus Schritt 14.
alternative hypothesis: … greater than 0 wiederholt H A H_A H A : Die
mittlere Differenz ist größer als 0.
mean difference 19.6 ist d ˉ \bar d d ˉ aus Schritt 7.
Die Zeilen zum confidence interval gehören zu einem anderen Thema
(Konfidenzintervalle). Sie werden hier nicht gebraucht.
Der zweite Befehl rechnet einen t-Test für eine Stichprobe mit den Differenzen und dem
Vergleichswert mu = 0. Er liefert genau dieselben Zahlen. Das
bestätigt Schritt 4: Der gepaarte t-Test ist der t-Test für eine Stichprobe, angewandt auf
die Differenzen.
Typischer Fehler: Die Reihenfolge vertauschen.
t.test(beginn, ende, paired = TRUE, alternative = "greater")
rechnet Beginn minus Ende und prüft damit „weniger Haare“. R gibt dann
t = − 0,84239 t = -0{,}84239 t = − 0 , 84239
und
p = 0,7765 p = 0{,}7765 p = 0 , 7765 aus.
nötig:
d ˉ > 49,6 \bar d > 49{,}6 d ˉ > 49 , 6 ; beobachtet:
19,6 19{,}6 19 , 6
Diese Ergänzung geht über die Aufgabe hinaus. Sie zeigt, wie weit die Daten von
einem Nachweis entfernt sind.
Verworfen wird, wenn t ^ \hat t t ^ über dem kritischen Wert liegt. Angenommen, die Streuung
s D ≈ 52,0269 s_D \approx 52{,}0269 s D ≈ 52 , 0269 bliebe gleich. Welcher Mittelwert d ˉ \bar d d ˉ wäre dann nötig?
5 ⋅ d ˉ 52,0269 > 2,131847 \sqrt 5 \cdot \dfrac{\bar d}{52{,}0269} > 2{,}131847 5 ⋅ 52 , 0269 d ˉ > 2 , 131847
Beide Seiten mit 52,0269 52{,}0269 52 , 0269 malnehmen:
5 ⋅ d ˉ > 2,131847 ⋅ 52,0269 ≈ 110,913 \sqrt 5 \cdot \bar d > 2{,}131847 \cdot 52{,}0269 \approx 110{,}913 5 ⋅ d ˉ > 2 , 131847 ⋅ 52 , 0269 ≈ 110 , 913
Beide Seiten durch 5 ≈ 2,236068 \sqrt 5 \approx 2{,}236068 5 ≈ 2 , 236068 teilen:
d ˉ > 110,913 : 2,236068 ≈ 49,60 \bar d > 110{,}913 : 2{,}236068 \approx 49{,}60 d ˉ > 110 , 913 : 2 , 236068 ≈ 49 , 60
Im Mittel hätten die fünf Männer also mehr als 49,6 Haare dazugewinnen müssen. Beobachtet
wurden 19,6, nicht einmal die Hälfte. Im Bild ist das die Grenze zum roten Ablehnbereich.
Die Rechnung ist nur eine Orientierung: Andere Daten hätten auch ein anderes s D s_D s D .
Größe
Weg
Wert
Mittelwert d ˉ \bar d d ˉ
98 : 5 98 : 5 98 : 5
19,6
Standardabweichung s D s_D s D
10.827,2 : 4 \sqrt{10.827{,}2 : 4} 10.827 , 2 : 4
52,03
Teststatistik t ^ \hat t t ^
5 ⋅ 19,6 : 52,0269 \sqrt 5 \cdot 19{,}6 : 52{,}0269 5 ⋅ 19 , 6 : 52 , 0269
0,8424
kritischer Wert
qt(0.95, 4)
2,1318
p p p -Wert
1 - pt(t̂, 4)
0,2235
In Worten: Im Mittel hatten die fünf Männer nach einem Monat 19,6 Haare mehr. Das ist
aber weniger als ein Standardfehler über 0, weil die Differenzen stark streuen. Ein
mindestens so großes t ^ \hat t t ^ käme auch ohne jede Wirkung in rund 22 % solcher Studien vor.
Zum Niveau 5 % ist eine Verbesserung deshalb nicht nachweisbar . Widerlegt ist die
Wirkung damit nicht.
Rückblick — so läuft jeder Test ab: (1) Test wählen und Voraussetzung prüfen. (2)
H 0 H_0 H 0 und
H A H_A H A aufstellen, die Vermutung in
H A H_A H A ;
α \alpha α festlegen. (3) Teststatistik
ausrechnen. (4) Mit dem kritischen Wert vergleichen oder den
p p p -Wert bestimmen. (5)
Entscheiden und die Antwort in Worten der Aufgabe geben. (6) Mit R prüfen. In der Praxis
prüft man die Voraussetzung zuerst. Hier kam sie erst in Schritt 16, weil man zum Lesen
ihres Ergebnisses den
p p p -Wert braucht.
Gepaart oder nicht? Wurden dieselben Personen oder Dinge zweimal gemessen, sind die
Daten gepaart: Differenzen bilden und einen t-Test für eine Stichprobe gegen 0 rechnen.