Jemand behauptet: Ein bestimmter Stoff macht Papier schwerer entflammbar . Um das zu
prüfen, werden zehn Papierstreifen angezündet. Fünf davon sind mit dem Stoff behandelt, fünf
andere nicht. Gemessen wird jeweils die Brenndauer : wie viele Sekunden der Streifen
brennt, bis die Flamme erlischt.
Die Aufgabe schreibt die Einheit als „s“. Hier steht stattdessen immer „Sekunden“, weil der
Buchstabe s s s weiter unten in s X 2 s_X^2 s X 2 und s Y 2 s_Y^2 s Y 2 für die Stichprobenvarianz gebraucht wird.
Gesucht ist keine einzelne Zahl, sondern eine begründete Entscheidung: Reichen diese
zehn Messungen aus, um zum Niveau α = 1 % \alpha = 1\,\% α = 1 % zu zeigen , dass der Stoff wirkt? Das
Werkzeug dafür ist ein statistischer Test .
Aus Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Ein Test stellt zwei
Aussagen gegeneinander: die Nullhypothese
H 0 H_0 H 0 und die Alternative
H A H_A H A , also das, was man
zeigen möchte. Aus den Daten berechnet man eine Zahl, die Teststatistik. Liegt sie weit genug
in Richtung
H A H_A H A , verwirft man
H 0 H_0 H 0 . Sonst behält man
H 0 H_0 H 0 bei.
Der Weg in sechs Etappen:
Den passenden Test wählen: Die Gruppen bestehen aus verschiedenen Streifen, sind also
unabhängig. Beide Gruppen auf Normalverteilung prüfen (Schritte 1–3).
Die Richtung klären und die Hypothesen aufschreiben (Schritte 4–5).
Die Teststatistik t ^ \hat t t ^ von Hand berechnen: Mittelwerte, Varianzen, Standardfehler
(Schritte 6–11).
Den kritischen Wert und den p p p -Wert mit R bestimmen (Schritte 12–14).
Entscheiden und im Sachzusammenhang antworten (Schritte 15–16).
Mit R nachprüfen (Schritt 17). Danach folgt eine Ergänzung (Schritt 18).
Merke: Ein Test fragt: Ist der Unterschied in den Daten so groß, dass Zufall allein ihn
kaum erklären kann?
Zur Musterlösung: Sie schreibt die Alternative als
H 1 H_1 H 1 . Das Skript und dieser
Lösungsweg schreiben
H A H_A H A ; gemeint ist dasselbe. Zahlen und Entscheidung stimmen überein.
Zwei Stellen gehen darüber hinaus: (a) Ihr letzter Satz „der Stoff reduziert die
Entflammbarkeit also nicht“ sagt mehr, als der Test zeigt (Schritt 16). (b) Der R-Befehl
t.test würde hier anders entscheiden als die Rechnung nach dem
Skript. Das erklärt die Ergänzung in Schritt 18.
x 1 , … , x 5 x_1, \dots, x_5 x 1 , … , x 5 behandelt,
y 1 , … , y 5 y_1, \dots, y_5 y 1 , … , y 5 unbehandelt;
n = m = 5 n = m = 5 n = m = 5
Die Messwerte zerfallen in zwei Gruppen. Jede Gruppe ist eine Stichprobe : ein
kleiner Ausschnitt aus allen Streifen, die man so hätte messen können.
Gruppe X X X : die behandelten Streifen. Ihre Brenndauern heißen x 1 , … , x 5 x_1, \dots, x_5 x 1 , … , x 5 .
Ihre Anzahl heißt n n n , hier n = 5 n = 5 n = 5 .
Gruppe Y Y Y : die unbehandelten Streifen. Ihre Brenndauern heißen y 1 , … , y 5 y_1, \dots,
y_5 y 1 , … , y 5 . Ihre Anzahl heißt m m m , hier m = 5 m = 5 m = 5 .
Die Namen X X X , Y Y Y , n n n und m m m stammen aus dem Skript. Welche Gruppe X X X heißt, ist eine
Festlegung. Sie bestimmt später die Richtung der Hypothesen und die Reihenfolge im
R-Befehl.
Im Bild hat jeder Streifen eine eigene Zeile. Sein Punkt steht auf dem Zahlenstrahl bei
seiner Brenndauer. Oben liegen die behandelten Streifen, unten die unbehandelten. Schon
mit bloßem Auge: Die oberen Punkte liegen eher weiter rechts. Ob das mehr als Zufall ist,
klärt der Test.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Eine
Stichprobe
x 1 , … , x n x_1, \dots, x_n x 1 , … , x n sind
n n n gemessene Werte;
n n n heißt Stichprobenumfang. Aus
ihr schätzt man etwas über die unbekannte Verteilung dahinter.
zehn verschiedene Streifen → unabhängige Stichproben → Zweistichproben-t-Test
Das ist der zentrale Unterschied zu Aufgabe 1. Dort wurden bei
denselben fünf Männern die Haare zweimal gezählt, zu Beginn und am Ende. Je Mann
gab es also ein Paar von Werten. Die Differenz „Ende minus Beginn“ je Mann hatte
einen klaren Sinn: Sie zeigt, wie sich genau dieser Mann verändert hat.
Hier gibt es keine Paare. Jeder Streifen wird nur einmal gemessen, und die fünf
behandelten Streifen sind andere Streifen als die fünf unbehandelten. Der erste
behandelte Streifen hat mit dem ersten unbehandelten nichts zu tun. Die Reihenfolge in der
Tabelle ist zufällig.
Probe: Bildet man trotzdem Differenzen „Spalte für Spalte“, hängt das Ergebnis nur
von der Reihenfolge ab. 9,8 − 5,8 = 4,0 9{,}8 - 5{,}8 = 4{,}0 9 , 8 − 5 , 8 = 4 , 0 , aber mit dem zweiten unbehandelten Wert
9,8 − 2,4 = 7,4 9{,}8 - 2{,}4 = 7{,}4 9 , 8 − 2 , 4 = 7 , 4 . Beides wäre gleich „richtig“ — also ist keines von beiden
sinnvoll.
Solche Gruppen heißen unabhängige Stichproben : Die Brenndauer eines behandelten
Streifens verrät nichts über die Brenndauer eines unbehandelten. Man vergleicht deshalb
die Gruppen als Ganzes: den Mittelwert der einen mit dem Mittelwert der anderen. Der
passende Test heißt Zweistichproben-t-Test . Ein Hinweis darauf ist auch: Die
Gruppen könnten verschieden groß sein (n ≠ m n \ne m n = m ). Bei Paaren geht das nicht.
Im Bild stehen deshalb links „5 Streifen“ und „5 andere Streifen“.
Aus Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Bei
verbundenen Stichproben (dieselbe Person vorher und nachher) bildet man je Paar die
Differenz
d i d_i d i und testet nur noch diese eine Liste von Differenzen. Das geht nur, wenn
die Paare wirklich zusammengehören.
Merke: Dieselben Objekte zweimal gemessen → gepaart, Differenzen bilden.
Verschiedene Objekte in den Gruppen → unabhängig, Gruppen vergleichen.
shapiro.test:
p = 0,4543 p = 0{,}4543 p = 0 , 4543 und
0,8199 0{,}8199 0 , 8199 → nichts spricht
gegen Normalverteilung
Der Zweistichproben-t-Test beruht auf einem Modell. Laut Skript gilt:
Die Brenndauern der behandelten Streifen sind normalverteilt mit Erwartungswert
μ X \mu_X μ X und Varianz σ X 2 \sigma_X^2 σ X 2 .
Die der unbehandelten Streifen sind normalverteilt mit μ Y \mu_Y μ Y und σ Y 2 \sigma_Y^2 σ Y 2 .
Alle zehn Messungen sind voneinander unabhängig. Innerhalb einer Gruppe folgt jeder
Streifen derselben Verteilung. Das Skript kürzt das mit „u.i.v.“ ab: u nabhängig
und i dentisch v erteilt.
Die beiden Varianzen σ X 2 \sigma_X^2 σ X 2 und σ Y 2 \sigma_Y^2 σ Y 2 dürfen verschieden sein.
Die Normalverteilung ist wichtig, weil es nur fünf Werte je Gruppe gibt. Bei so wenigen
Werten stimmt die Rechnung nur, wenn schon die einzelnen Werte normalverteilt sind.
Prüfen mit R: Zuerst die Daten eingeben. beh und
unb sind die Namen der Musterlösung für „behandelt“ und
„unbehandelt“. Dann prüft der Shapiro-Wilk-Test (shapiro.test) jede Gruppe. Er ist selbst ein Test mit der Nullhypothese „die Daten sind
normalverteilt“. Seine Rechnung macht man nicht von Hand. Wichtig ist die Zahl hinter
p-value, der p p p -Wert. Genau erklärt wird er in Schritt 14. Hier
reicht: Ein großer p p p -Wert heißt, dass nichts gegen die Normalverteilung spricht.
Ein p p p -Wert über 5 % gilt hier als groß: Dann wird H 0 H_0 H 0 „normalverteilt“ nicht
verworfen.
Ergebnis: p = 0,4543 p = 0{,}4543 p = 0 , 4543 (rund 45 %) für die behandelten und p = 0,8199 p = 0{,}8199 p = 0 , 8199 (rund 82 %)
für die unbehandelten Streifen. Beide liegen weit über 5 %. Auch im Bild fällt kein
Ausreißer auf. Der Zweistichproben-t-Test darf also benutzt werden.
Vorsicht: „Nichts spricht dagegen“ heißt nicht „bewiesen normalverteilt“. Mit fünf
Werten je Gruppe ist diese Prüfung schwach. Sie deckt nur grobe Abweichungen auf, etwa
einen Ausreißer.
Aus Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Der
Shapiro-Wilk-Test prüft
H 0 H_0 H 0 : „Daten normalverteilt“. Ein großer
p p p -Wert (dort
0,161 > 0,05 0{,}161
> 0{,}05 0 , 161 > 0 , 05 ) heißt: Nichts spricht gegen die Normalverteilung, der t-Test darf benutzt
werden.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Mit
x <- c(…) werden Daten in R eingegeben. R schreibt
Dezimalzahlen mit Punkt statt Komma.
Stoff wirkt
⟺ \Longleftrightarrow ⟺ μ X > μ Y \mu_X > \mu_Y μ X > μ Y
Bevor man Hypothesen aufschreibt, muss man die Behauptung in eine Aussage über die
Messgröße übersetzen. Gemessen wird die Brenndauer. Was heißt „der Stoff reduziert die
Entflammbarkeit“ für die Brenndauer?
Die Aufgabe selbst legt das nicht fest. Die Musterlösung deutet es so: Schwer
entflammbares Papier brennt langsamer . Die Flamme braucht länger, bis sie den
Streifen verzehrt hat. Eine längere Brenndauer spricht also für den Stoff.
Man könnte „bis zum Erlöschen“ auch umgekehrt lesen: Ein Schutzstoff lässt die Flamme
früher ausgehen, der Streifen brennt also kürzer . Dieser Lösungsweg folgt der
Musterlösung und nimmt „länger brennen“. Wichtig ist nur: Die Richtung wird festgelegt,
bevor man auf die Daten schaut.
Nun zu den Symbolen. μ X \mu_X μ X ist die mittlere Brenndauer aller behandelten
Streifen, die man je messen könnte. Fachlich ist das der Erwartungswert der Brenndauer
eines behandelten Streifens. μ Y \mu_Y μ Y ist dasselbe für unbehandelte Streifen. Beide Zahlen
kennt niemand. Die Stichproben liefern nur Schätzungen dafür.
Die Behauptung lautet damit: Behandelte Streifen brennen im Mittel länger, also μ X > μ Y \mu_X
> \mu_Y μ X > μ Y . Im Bild heißt das: Die obere Gruppe liegt im Mittel weiter rechts.
Merke: Die Richtung kommt aus der Frage, nicht aus den Daten. Sie wird festgelegt,
bevor man die Messwerte auswertet.
H 0 : μ X ≤ μ Y H_0: \mu_X \le \mu_Y H 0 : μ X ≤ μ Y gegen
H A : μ X > μ Y H_A: \mu_X > \mu_Y H A : μ X > μ Y ,
α = 0,01 \alpha =
0{,}01 α = 0 , 01
Was man zeigen möchte, kommt in die Alternative H A H_A H A . Hier ist das „der Stoff
wirkt“:
H A : μ X > μ Y H_A: \mu_X > \mu_Y H A : μ X > μ Y
Die Nullhypothese H 0 H_0 H 0 ist das genaue Gegenteil. Sie umfasst alles andere, auch
den Gleichstand:
H 0 : μ X ≤ μ Y H_0: \mu_X \le \mu_Y H 0 : μ X ≤ μ Y — „der Stoff verlängert die Brenndauer nicht“.
Der Test ist einseitig : Nur eine Richtung zählt als Beleg für den Stoff. Brennten
die behandelten Streifen kürzer, spräche das nicht für H A H_A H A .
Das Signifikanzniveau gibt die Aufgabe vor: α = 1 % = 0,01 \alpha = 1\,\% = 0{,}01 α = 1 % = 0 , 01 . Es begrenzt
den Fehler 1. Art . Der bestünde hier darin, H 0 H_0 H 0 zu verwerfen, obwohl sie stimmt —
also zu behaupten, der Stoff wirke, obwohl er es nicht tut. Die Wahrscheinlichkeit dafür
soll höchstens 1 % sein. 1 % ist streng; der Stoff muss also deutlich überzeugen.
Aus Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): H A H_A H A enthält die
Vermutung,
H 0 H_0 H 0 das Gegenteil einschließlich „gleich“. Das Niveau
α \alpha α wird vor dem
Test festgelegt und danach nicht mehr geändert. Es ist die Höchstwahrscheinlichkeit,
H 0 H_0 H 0
zu verwerfen, obwohl sie stimmt (Fehler 1. Art).
t ^ = x ˉ − y ˉ s X 2 / n + s Y 2 / m \hat t = \dfrac{\bar x - \bar y}{\sqrt{s_X^2/n + s_Y^2/m}} t ^ = s X 2 / n + s Y 2 / m x ˉ − y ˉ
Die behandelten Streifen brennen in der Stichprobe länger. Das allein reicht aber nicht.
Auch wenn der Stoff gar nichts bewirkt, wären zwei Gruppen aus je fünf Streifen nie genau
gleich. Irgendein Unterschied entsteht immer durch Zufall.
Die eigentliche Frage ist deshalb: Wie groß ist der Unterschied
im Vergleich zu dem, was der Zufall allein anrichten kann ? Genau das misst die
Teststatistik t ^ \hat t t ^ (gelesen „t Dach“) des Zweistichproben-t-Tests. Das Dach
zeigt: Die Zahl wird aus den Daten berechnet.
Zähler x ˉ − y ˉ \bar x - \bar y x ˉ − y ˉ : der beobachtete Unterschied der Mittelwerte. x ˉ \bar x x ˉ
(„x quer“) ist der Mittelwert der behandelten, y ˉ \bar y y ˉ („y quer“) der der unbehandelten
Streifen.
Nenner : die typische zufällige Schwankung dieses Unterschieds. Sie heißt
Standardfehler . In ihr stecken die Stichprobenvarianzen s X 2 s_X^2 s X 2 und s Y 2 s_Y^2 s Y 2 (wie
stark jede Gruppe streut) und die Anzahlen n n n und m m m .
t ^ \hat t t ^ zählt also, wie viele Standardfehler der Unterschied groß ist. Ein großes
t ^ \hat t t ^ spricht für H A H_A H A . Groß wird es, wenn der Unterschied groß ist, wenn die Gruppen
wenig streuen oder wenn viele Werte vorliegen.
Das Skript schreibt x ˉ n \bar x_n x ˉ n und y ˉ m \bar y_m y ˉ m ; die kleinen Buchstaben unten nennen nur die
Anzahl der Werte. Hier steht kurz x ˉ \bar x x ˉ und y ˉ \bar y y ˉ , wie in der Musterlösung.
Die nächsten vier Schritte berechnen die Zutaten und setzen sie ein.
x ˉ = 8,66 \bar x = 8{,}66 x ˉ = 8 , 66 ,
y ˉ = 4,68 \bar y = 4{,}68 y ˉ = 4 , 68 ,
x ˉ − y ˉ = 3,98 \bar x - \bar y = 3{,}98 x ˉ − y ˉ = 3 , 98 Sekunden
Der Mittelwert ist die Summe aller Werte einer Gruppe geteilt durch ihre Anzahl.
Behandelt: 9,8 + 11,0 + 6,4 + 9,3 + 6,8 = 43,3 9{,}8 + 11{,}0 + 6{,}4 + 9{,}3 + 6{,}8 = 43{,}3 9 , 8 + 11 , 0 + 6 , 4 + 9 , 3 + 6 , 8 = 43 , 3 . Geteilt durch n = 5 n =
5 n = 5 :
x ˉ = 43,3 5 = 8,66 \bar x = \dfrac{43{,}3}{5} = \mathbf{8{,}66} x ˉ = 5 43 , 3 = 8 , 66 Sekunden
Unbehandelt: 5,8 + 2,4 + 7,2 + 4,9 + 3,1 = 23,4 5{,}8 + 2{,}4 + 7{,}2 + 4{,}9 + 3{,}1 = 23{,}4 5 , 8 + 2 , 4 + 7 , 2 + 4 , 9 + 3 , 1 = 23 , 4 . Geteilt durch m = 5 m =
5 m = 5 :
y ˉ = 23,4 5 = 4,68 \bar y = \dfrac{23{,}4}{5} = \mathbf{4{,}68} y ˉ = 5 23 , 4 = 4 , 68 Sekunden
Der Unterschied , also der Zähler von t ^ \hat t t ^ :
x ˉ − y ˉ = 8,66 − 4,68 = 3,98 \bar x - \bar y = 8{,}66 - 4{,}68 = \mathbf{3{,}98} x ˉ − y ˉ = 8 , 66 − 4 , 68 = 3 , 98 Sekunden
Er ist positiv: In der Stichprobe brennen die behandelten Streifen im Mittel fast 4
Sekunden länger. Das zeigt in Richtung H A H_A H A . Im Bild sind die beiden Mittelwerte die
gestrichelten Linien, die Klammer dazwischen ist der Unterschied.
Aus Blatt 5, Aufgabe 2 („Mittelwert und Median: ein Ausreißer bei den Ausgaben“):
Der Stichprobenmittelwert ist
x ˉ n = 1 n ∑ i = 1 n x i \bar x_n = \frac{1}{n}\sum_{i=1}^{n} x_i x ˉ n = n 1 ∑ i = 1 n x i , die Summe aller
Werte geteilt durch ihre Anzahl.
s X 2 = 15,752 5 − 1 = 3,938 s_X^2 = \dfrac{15{,}752}{5 - 1} = 3{,}938 s X 2 = 5 − 1 15 , 752 = 3 , 938 Sekunden²
Wie stark streuen die behandelten Streifen um ihren Mittelwert 8,66 8{,}66 8 , 66 ? Das misst die
Stichprobenvarianz s X 2 s_X^2 s X 2 . Der Weg ist derselbe wie auf Blatt 5:
Abweichungen vom Mittelwert: 9,8 − 8,66 = + 1,14 9{,}8 - 8{,}66 = +1{,}14 9 , 8 − 8 , 66 = + 1 , 14 , 11,0 − 8,66 = + 2,34 11{,}0 - 8{,}66 =
+2{,}34 11 , 0 − 8 , 66 = + 2 , 34 , 6,4 − 8,66 = − 2,26 6{,}4 - 8{,}66 = -2{,}26 6 , 4 − 8 , 66 = − 2 , 26 , 9,3 − 8,66 = + 0,64 9{,}3 - 8{,}66 = +0{,}64 9 , 3 − 8 , 66 = + 0 , 64 , 6,8 − 8,66 = − 1,86 6{,}8 - 8{,}66 =
-1{,}86 6 , 8 − 8 , 66 = − 1 , 86 .
Probe: Die Abweichungen ergeben zusammen 0: 1,14 + 2,34 + 0,64 = 4,12 1{,}14 + 2{,}34 + 0{,}64 = 4{,}12 1 , 14 + 2 , 34 + 0 , 64 = 4 , 12
und 2,26 + 1,86 = 4,12 2{,}26 + 1{,}86 = 4{,}12 2 , 26 + 1 , 86 = 4 , 12 .
Quadrieren: 1,14 2 = 1,2996 1{,}14^2 = 1{,}2996 1 , 1 4 2 = 1 , 2996 , 2,34 2 = 5,4756 2{,}34^2 = 5{,}4756 2 , 3 4 2 = 5 , 4756 , ( − 2,26 ) 2 = 5,1076 (-2{,}26)^2 =
5{,}1076 ( − 2 , 26 ) 2 = 5 , 1076 , 0,64 2 = 0,4096 0{,}64^2 = 0{,}4096 0 , 6 4 2 = 0 , 4096 , ( − 1,86 ) 2 = 3,4596 (-1{,}86)^2 = 3{,}4596 ( − 1 , 86 ) 2 = 3 , 4596 .
Addieren: 1,2996 + 5,4756 + 5,1076 + 0,4096 + 3,4596 = 15,752 1{,}2996 + 5{,}4756 + 5{,}1076 + 0{,}4096 + 3{,}4596 = 15{,}752 1 , 2996 + 5 , 4756 + 5 , 1076 + 0 , 4096 + 3 , 4596 = 15 , 752 .
Durch n − 1 = 4 n - 1 = 4 n − 1 = 4 teilen: s X 2 = 15,752 4 = 3,938 s_X^2 = \dfrac{15{,}752}{4} = \mathbf{3{,}938} s X 2 = 4 15 , 752 = 3 , 938
Sekunden².
Die Einheit ist Sekunden² (Sekunden mal Sekunden), weil Quadrate addiert wurden. Gerundet
wird nicht: Alle Zahlen gehen genau auf.
Im Bild zeigen die Pfeile oben die fünf Abweichungen: grün mit Plus nach rechts (länger
als der Mittelwert), rot mit Minus nach links (kürzer).
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): s 2 = 1 n − 1 ∑ i = 1 n ( x i − x ˉ n ) 2 s^2 =
\frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar x_n)^2 s 2 = n − 1 1 ∑ i = 1 n ( x i − x ˉ n ) 2 : Abweichungen vom Mittelwert quadrieren,
addieren, durch
n − 1 n - 1 n − 1 teilen. Die Abweichungen allein ergeben immer 0, deshalb wird
quadriert.
s Y 2 = 15,348 5 − 1 = 3,837 s_Y^2 = \dfrac{15{,}348}{5 - 1} = 3{,}837 s Y 2 = 5 − 1 15 , 348 = 3 , 837 Sekunden²
Dasselbe für die unbehandelten Streifen, um ihren Mittelwert 4,68 4{,}68 4 , 68 . Die Nummer heißt
hier j j j statt i i i , damit man die Gruppen nicht verwechselt.
Abweichungen: 5,8 − 4,68 = + 1,12 5{,}8 - 4{,}68 = +1{,}12 5 , 8 − 4 , 68 = + 1 , 12 , 2,4 − 4,68 = − 2,28 2{,}4 - 4{,}68 = -2{,}28 2 , 4 − 4 , 68 = − 2 , 28 , 7,2 − 4,68 = + 2,52 7{,}2 -
4{,}68 = +2{,}52 7 , 2 − 4 , 68 = + 2 , 52 , 4,9 − 4,68 = + 0,22 4{,}9 - 4{,}68 = +0{,}22 4 , 9 − 4 , 68 = + 0 , 22 , 3,1 − 4,68 = − 1,58 3{,}1 - 4{,}68 = -1{,}58 3 , 1 − 4 , 68 = − 1 , 58 .
Probe: 1,12 + 2,52 + 0,22 = 3,86 1{,}12 + 2{,}52 + 0{,}22 = 3{,}86 1 , 12 + 2 , 52 + 0 , 22 = 3 , 86 und 2,28 + 1,58 = 3,86 2{,}28 + 1{,}58 = 3{,}86 2 , 28 + 1 , 58 = 3 , 86 .
Zusammen 0.
Quadrieren: 1,12 2 = 1,2544 1{,}12^2 = 1{,}2544 1 , 1 2 2 = 1 , 2544 , ( − 2,28 ) 2 = 5,1984 (-2{,}28)^2 = 5{,}1984 ( − 2 , 28 ) 2 = 5 , 1984 , 2,52 2 = 6,3504 2{,}52^2 =
6{,}3504 2 , 5 2 2 = 6 , 3504 , 0,22 2 = 0,0484 0{,}22^2 = 0{,}0484 0 , 2 2 2 = 0 , 0484 , ( − 1,58 ) 2 = 2,4964 (-1{,}58)^2 = 2{,}4964 ( − 1 , 58 ) 2 = 2 , 4964 .
Addieren: 1,2544 + 5,1984 + 6,3504 + 0,0484 + 2,4964 = 15,348 1{,}2544 + 5{,}1984 + 6{,}3504 + 0{,}0484 + 2{,}4964 = 15{,}348 1 , 2544 + 5 , 1984 + 6 , 3504 + 0 , 0484 + 2 , 4964 = 15 , 348 .
Durch m − 1 = 4 m - 1 = 4 m − 1 = 4 teilen: s Y 2 = 15,348 4 = 3,837 s_Y^2 = \dfrac{15{,}348}{4} = \mathbf{3{,}837} s Y 2 = 4 15 , 348 = 3 , 837
Sekunden².
Beide Gruppen streuen fast gleich stark: 3,938 und 3,837. Das passt zum Bild: Die Pfeile
oben und unten sind ähnlich lang.
Damit sind alle vier Zutaten da: x ˉ \bar x x ˉ , y ˉ \bar y y ˉ , s X 2 s_X^2 s X 2 und s Y 2 s_Y^2 s Y 2 .
0,7876 + 0,7674 = 1,555 ≈ 1,247 \sqrt{0{,}7876 + 0{,}7674} = \sqrt{1{,}555} \approx 1{,}247 0 , 7876 + 0 , 7674 = 1 , 555 ≈ 1 , 247 Sekunden
Jetzt der Nenner. Er soll sagen, wie stark der Unterschied x ˉ − y ˉ \bar x - \bar y x ˉ − y ˉ allein durch
Zufall schwankt. Stellen Sie sich vor, man wiederholt den Versuch mit fünf neuen Streifen
je Gruppe. Dann käme jedes Mal ein anderer Mittelwert heraus. Diesen zufälligen Mittelwert
schreibt man mit großem Buchstaben: X ˉ \bar X X ˉ bzw. Y ˉ \bar Y Y ˉ . Seine Streuung misst die
Varianz v a r \mathrm{var} var .
1. Ein Mittelwert schwankt weniger als ein einzelner Wert. X ˉ \bar X X ˉ ist die Summe
X 1 + ⋯ + X n X_1 + \dots + X_n X 1 + ⋯ + X n mal 1 n \tfrac{1}{n} n 1 .
Die n n n Werte sind unabhängig, jeder hat die Varianz σ X 2 \sigma_X^2 σ X 2 . Also addieren sich
die Varianzen: Die Summe hat die Varianz n σ X 2 n\,\sigma_X^2 n σ X 2 .
Der Faktor 1 n \tfrac{1}{n} n 1 geht quadriert in die Varianz ein: 1 n 2 ⋅ n σ X 2 = σ X 2 n \tfrac{1}{n^2} \cdot
n\,\sigma_X^2 = \dfrac{\sigma_X^2}{n} n 2 1 ⋅ n σ X 2 = n σ X 2 .
Bei n = 5 n = 5 n = 5 ist die Varianz des Mittelwerts also nur ein Fünftel der Varianz eines
einzelnen Streifens.
2. Beim Unterschied addieren sich die Varianzen. Hier wird die Unabhängigkeit aus
Schritt 2 gebraucht. Weil die Gruppen unabhängig sind, gilt v a r ( X ˉ − Y ˉ ) = v a r ( X ˉ ) + v a r ( Y ˉ ) \mathrm{var}(\bar X - \bar Y)
= \mathrm{var}(\bar X) + \mathrm{var}(\bar Y) var ( X ˉ − Y ˉ ) = var ( X ˉ ) + var ( Y ˉ ) . Es steht ein Plus , obwohl abgezogen
wird: Beide Mittelwerte bringen ihre eigene Unsicherheit mit.
3. Schätzen und Wurzel ziehen. σ X 2 \sigma_X^2 σ X 2 und σ Y 2 \sigma_Y^2 σ Y 2 sind unbekannt. Man
setzt die Stichprobenvarianzen aus den Schritten 8 und 9 ein. Die Wurzel führt zurück von
Sekunden² zu Sekunden:
s X 2 n = 3,938 5 = 0,7876 \dfrac{s_X^2}{n} = \dfrac{3{,}938}{5} = 0{,}7876 n s X 2 = 5 3 , 938 = 0 , 7876
s Y 2 m = 3,837 5 = 0,7674 \dfrac{s_Y^2}{m} = \dfrac{3{,}837}{5} = 0{,}7674 m s Y 2 = 5 3 , 837 = 0 , 7674
0,7876 + 0,7674 = 1,555 0{,}7876 + 0{,}7674 = 1{,}555 0 , 7876 + 0 , 7674 = 1 , 555
1,555 = 1,246996 … ≈ 1,247 \sqrt{1{,}555} = 1{,}246996\ldots \approx \mathbf{1{,}247} 1 , 555 = 1 , 246996 … ≈ 1 , 247 Sekunden
Das ist der Standardfehler : Um etwa 1,247 Sekunden schwankt der Unterschied der
Mittelwerte typischerweise allein durch Zufall. Für den nächsten Schritt wird mit
1,246996 1{,}246996 1 , 246996 weitergerechnet, damit keine Rundung mitgeschleppt wird.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“):
v a r ( a X ) = a 2 v a r ( X ) \mathrm{var}(aX) = a^2\,\mathrm{var}(X) var ( a X ) = a 2 var ( X ) . Sind
X X X und
Y Y Y unabhängig, gilt
v a r ( c X + d Y ) = c 2 v a r ( X ) + d 2 v a r ( Y ) \mathrm{var}(cX + dY) = c^2\,\mathrm{var}(X) + d^2\,\mathrm{var}(Y) var ( c X + d Y ) = c 2 var ( X ) + d 2 var ( Y ) . Mit
c = 1 c = 1 c = 1 und
d = − 1 d
= -1 d = − 1 wird aus dem Minus ein Plus, weil
( − 1 ) 2 = 1 (-1)^2 = 1 ( − 1 ) 2 = 1 .
t ^ = 3,98 1,246996 = 3,191669 ≈ 3,19 \hat t = \dfrac{3{,}98}{1{,}246996} = 3{,}191669 \approx 3{,}19 t ^ = 1 , 246996 3 , 98 = 3 , 191669 ≈ 3 , 19
Nun beides in die Formel aus Schritt 6 einsetzen: den Unterschied 3,98 3{,}98 3 , 98 aus Schritt 7
in den Zähler, den Standardfehler 1,246996 1{,}246996 1 , 246996 aus Schritt 10 in den Nenner.
t ^ = 8,66 − 4,68 1,246996 = 3,98 1,246996 = 3,191669 … ≈ 3,19 \hat t = \dfrac{8{,}66 - 4{,}68}{1{,}246996} = \dfrac{3{,}98}{1{,}246996} =
3{,}191669\ldots \approx \mathbf{3{,}19} t ^ = 1 , 246996 8 , 66 − 4 , 68 = 1 , 246996 3 , 98 = 3 , 191669 … ≈ 3 , 19
Gerundet auf zwei Nachkommastellen: 3,19. Für den Vergleich in Schritt 14 wird der
genauere Wert 3,191669 benutzt.
In Worten: Der beobachtete Unterschied ist etwa 3,19 Standardfehler groß, also gut
dreimal so groß wie seine typische zufällige Schwankung. Im Bild legt ein Lineal den
Standardfehler dreimal in die Klammer; der Rest bis zum Ende ist das 0,19.
Ob „gut dreimal“ genügt, sagt t ^ \hat t t ^ allein noch nicht. Dafür braucht man einen Maßstab:
Wie groß wird t ^ \hat t t ^ , wenn der Stoff nicht wirkt? Das klärt der nächste Abschnitt.
min ( n , m ) − 1 = min ( 5 , 5 ) − 1 = 4 \min(n, m) - 1 = \min(5, 5) - 1 = 4 min ( n , m ) − 1 = min ( 5 , 5 ) − 1 = 4
Angenommen, der Stoff wirkt nicht und beide Gruppen brennen im Mittel gleich lang (μ X = μ Y \mu_X
= \mu_Y μ X = μ Y ). Dann schwankt t ^ \hat t t ^ zufällig um 0. Wie genau, beschreibt ungefähr eine
t-Verteilung : eine Glockenkurve um 0, ähnlich der Standardnormalverteilung, aber
mit dickeren Rändern. Das Bild zeigt sie.
Warum gerade der Fall μ X = μ Y \mu_X = \mu_Y μ X = μ Y ? Er ist der Fall von H 0 H_0 H 0 , der H A H_A H A am nächsten
liegt. Hält der Test hier den Fehler 1. Art bei höchstens 1 %, dann erst recht, wenn die
behandelten Streifen sogar kürzer brennen.
Wie dick die Ränder sind, hängt von einer Zahl ab, den Freiheitsgraden . Wenige
Freiheitsgrade heißen dicke Ränder: Große Werte von t ^ \hat t t ^ kommen dann auch durch Zufall
öfter vor. Beim Zweistichproben-t-Test gibt es keine einfache genaue Zahl. Das Skript
schreibt deshalb eine vorsichtige Wahl vor:
Freiheitsgrade = min ( n , m ) − 1 = min ( 5 , 5 ) − 1 = 4 \text{Freiheitsgrade} = \min(n, m) - 1 = \min(5, 5) - 1 = \mathbf{4} Freiheitsgrade = min ( n , m ) − 1 = min ( 5 , 5 ) − 1 = 4
min ( n , m ) \min(n, m) min ( n , m ) heißt „die kleinere der beiden Zahlen n n n und m m m “. Hier sind beide 5.
Warum vorsichtig? Das Skript nennt die Wahl „konservativ“: Sie nimmt eher zu wenige
Freiheitsgrade als zu viele. Die Ränder werden dadurch eher zu dick, und H 0 H_0 H 0 wird eher
beibehalten. R rechnet mit einer genaueren Näherung und kommt hier auf rund 8. Was das
ändert, zeigt die Ergänzung in Schritt 18.
Aus Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Die Teststatistik
eines t-Tests folgt unter
H 0 H_0 H 0 einer t-Verteilung. Beim gepaarten Test mit
n n n
Differenzen hat sie
n − 1 n - 1 n − 1 Freiheitsgrade; dort waren es
5 − 1 = 4 5 - 1 = 4 5 − 1 = 4 .
t 4 ; 0,99 = t_{4;\,0{,}99} = t 4 ; 0 , 99 = qt(0.99, df = 4) = 3,746947 = 3{,}746947 = 3 , 746947
H A H_A H A sagt „μ X \mu_X μ X ist größer“. Für H A H_A H A sprechen also große Werte von t ^ \hat t t ^ .
Man verwirft H 0 H_0 H 0 deshalb, wenn t ^ \hat t t ^ rechts von einer Grenze liegt. Diese Grenze
heißt kritischer Wert .
Sie wird so gelegt, dass rechts von ihr genau α = 1 % \alpha = 1\,\% α = 1 % der Fläche unter der
t-Verteilung liegt. Links von ihr liegen dann 99 %. Sie ist also das
99-%-Quantil der t-Verteilung mit 4 Freiheitsgraden. Man schreibt t 4 ; 0,99 t_{4;\,0{,}99} t 4 ; 0 , 99 :
unten zuerst die Freiheitsgrade, dann der Anteil links (1 − α = 0,99 1 - \alpha = 0{,}99 1 − α = 0 , 99 ).
R rechnet Quantile der t-Verteilung mit qt („q“ für Quantil, „t“
für t-Verteilung). Der Befehl bekommt den Anteil links, 0.99,
und die Freiheitsgrade, df = 4 (englisch
degrees of freedom ). R antwortet 3,746947.
Der Ablehnbereich sind alle Werte über 3,747 3{,}747 3 , 747 . Im Bild ist er rot. Er ist so
schmal und flach, dass man ihn erst in der Lupe rechts oben gut sieht.
Warum schützt das vor dem Fehler 1. Art? Wirkt der Stoff nicht, landet t ^ \hat t t ^ nur
mit 1 % Wahrscheinlichkeit im Ablehnbereich. Nur dann würde man fälschlich verwerfen.
Aus Blatt 4, Aufgabe 5 („Quantile: die Füllmenge einer Kaffeepackung“): Ein Quantil
ist eine Grenze, links von der ein vorgegebener Anteil der Fläche liegt. Das 99-%-Quantil
ist also die Grenze, links von der 99 % der Fläche liegen. Ein Quantil zählt immer von
links. Für die Normalverteilung rechnet es R mit qnorm.
Aus Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Bei
H A H_A H A „größer“
wird
H 0 H_0 H 0 verworfen, wenn
t ^ > t n − 1 ; 1 − α \hat t > t_{n-1;\,1-\alpha} t ^ > t n − 1 ; 1 − α . Das Quantil liefert
qt(1 - alpha, df).
p = 1 − p = 1 - p = 1 − pt(3.191669, df = 4) = 0,0166 = 1,66 % = 0{,}0166 = 1{,}66\,\% = 0 , 0166 = 1 , 66 %
Ein zweiter Weg zur selben Entscheidung ist der p p p -Wert . Er ist die
Wahrscheinlichkeit, unter H 0 H_0 H 0 ein t ^ \hat t t ^ zu bekommen, das mindestens so groß ist wie
das beobachtete. Kurz: Wie überraschend wären diese Daten, wenn der Stoff nicht wirkt?
T T T steht dabei für eine Zufallsvariable, die der t-Verteilung mit 4 Freiheitsgraden
folgt. Kurz: T ∼ t 4 T \sim t_4 T ∼ t 4 . Gesucht ist die Fläche rechts von 3,191669:
p = P ( T ≥ 3,191669 ) = 1 − P ( T ≤ 3,191669 ) p = P(T \ge 3{,}191669) = 1 - P(T \le 3{,}191669) p = P ( T ≥ 3 , 191669 ) = 1 − P ( T ≤ 3 , 191669 )
pt gibt die Fläche links von einer Grenze. Die Fläche
rechts ist 1 minus die Fläche links. R antwortet 0,01658167. Gerundet:
p ≈ 0,0166 = 1,66 % p \approx 0{,}0166 = \mathbf{1{,}66\,\%} p ≈ 0 , 0166 = 1 , 66 %
Vergleich mit dem Niveau: 1,66 % > 1 % 1{,}66\,\% > 1\,\% 1 , 66 % > 1 % . Der p p p -Wert ist größer als
α \alpha α . Also wird H 0 H_0 H 0 nicht verworfen. Das passt zum kritischen Wert: t ^ \hat t t ^
liegt links von 3,747 3{,}747 3 , 747 . Im Bild ist der p p p -Wert die ganze Fläche rechts von
t ^ \hat t t ^ bis zum rechten Rand (blau getönt). Die rote Fläche des Ablehnbereichs (1 %) ist
nur ein Teil davon: Sie beginnt erst bei 3,747 3{,}747 3 , 747 . Wo beide übereinanderliegen, mischen
sich die Farben. Beide Wege führen immer zur selben Entscheidung.
Als Evidenz gelesen: Nach der Tabelle im Skript spricht ein p p p -Wert zwischen 1 %
und 5 % „vieles“ gegen H 0 H_0 H 0 . Die Daten deuten also durchaus auf eine Wirkung. Für das
vorher festgelegte, strenge Niveau von 1 % reicht es aber nicht.
Aus Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Der
p p p -Wert ist
die Wahrscheinlichkeit, unter
H 0 H_0 H 0 die beobachtete oder eine noch extremere Teststatistik
zu erhalten. Ist
p ≤ α p \le \alpha p ≤ α , wird
H 0 H_0 H 0 verworfen; ist
p > α p > \alpha p > α , wird
H 0 H_0 H 0
beibehalten.
Aus Blatt 4, Aufgabe 3 („Standardnormalverteilung mit R“):
pnorm(x) gibt die Fläche links von
x x x . „Größer als“ rechnet man
über das Gegenereignis:
1 − 1 - 1 − pnorm(x).
pt macht dasselbe für die t-Verteilung.
t ^ = 3,19 < 3,747 \hat t = 3{,}19 < 3{,}747 t ^ = 3 , 19 < 3 , 747 bzw.
p = 1,66 % > 1 % p = 1{,}66\,\% > 1\,\% p = 1 , 66 % > 1 % →
H 0 H_0 H 0
beibehalten
Beide Wege liefern dasselbe:
t ^ = 3,19 \hat t = 3{,}19 t ^ = 3 , 19 ist kleiner als der kritische Wert 3,747 3{,}747 3 , 747 . Die Teststatistik
liegt nicht im Ablehnbereich.
p = 1,66 % p = 1{,}66\,\% p = 1 , 66 % ist größer als α = 1 % \alpha = 1\,\% α = 1 % .
Also wird H 0 H_0 H 0 beibehalten .
Anschaulich in Sekunden: Man verwirft, wenn t ^ > 3,747 \hat t > 3{,}747 t ^ > 3 , 747 ist, also wenn
x ˉ − y ˉ 1,247 > 3,747 \dfrac{\bar x - \bar y}{1{,}247} > 3{,}747 1 , 247 x ˉ − y ˉ > 3 , 747 . Beide Seiten mal den Standardfehler
genommen:
x ˉ − y ˉ > 3,746947 ⋅ 1,246996 = 4,67 \bar x - \bar y > 3{,}746947 \cdot 1{,}246996 = 4{,}67 x ˉ − y ˉ > 3 , 746947 ⋅ 1 , 246996 = 4 , 67 Sekunden
Die behandelten Streifen hätten im Mittel also mindestens 4,67 Sekunden länger brennen
müssen. Beobachtet sind 3,98 Sekunden. Das ist deutlich, aber nicht deutlich genug für das
Niveau 1 %.
Antwortsatz: Zum Niveau 1 % kann man nicht zeigen, dass behandelte Streifen
im Mittel länger brennen. Dass der Stoff die Entflammbarkeit reduziert, ist mit diesen
Daten also nicht nachgewiesen.
Merke: Man verwirft
H 0 H_0 H 0 nur, wenn die Teststatistik im Ablehnbereich liegt, also
genau dann, wenn
p ≤ α p \le \alpha p ≤ α ist. Die Antwort wiederholt die Frage der Aufgabe mit
„kann man (nicht) zeigen“.
H 0 H_0 H 0 beibehalten = Wirkung
nicht nachgewiesen ≠ \ne = keine Wirkung
Wichtig ist, was die Entscheidung nicht sagt. „H 0 H_0 H 0 beibehalten“ heißt nicht, dass
der Stoff wirkungslos ist. Es heißt nur: Die Daten reichen nicht, um eine Wirkung zum
Niveau 1 % zu belegen.
Warum diese Vorsicht? Der Test begrenzt nur den Fehler 1. Art (fälschlich
verwerfen) auf 1 %. Der umgekehrte Irrtum heißt Fehler 2. Art : H 0 H_0 H 0 beibehalten,
obwohl H A H_A H A stimmt. Seine Wahrscheinlichkeit kontrolliert der Test nicht. Mit nur fünf
Streifen je Gruppe kann sie groß sein. Eine echte, aber mäßige Wirkung geht dann leicht im
Zufall unter.
Hier deuten die Daten sogar auf eine Wirkung hin: p = 1,66 % p = 1{,}66\,\% p = 1 , 66 % , nach dem Skript
spricht „vieles“ gegen H 0 H_0 H 0 . Sinnvoll wäre ein neuer Versuch mit mehr Streifen.
Nicht erlaubt ist dagegen, nachträglich das Niveau auf 5 % zu erhöhen, weil
1,66 % < 5 % 1{,}66\,\% < 5\,\% 1 , 66 % < 5 % wäre. Das Niveau steht vor dem Test fest. Das Skript sagt dazu:
α \alpha α niemals anhand des p p p -Werts wählen.
Aus Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Verwirft man
H 0 H_0 H 0 ,
gilt
H A H_A H A als gezeigt. Die Irrtumswahrscheinlichkeit dabei ist höchstens
α \alpha α : Stimmt
H 0 H_0 H 0 in Wahrheit, verwirft der Test sie höchstens mit Wahrscheinlichkeit
α \alpha α . Das
ist eine Aussage über das Verfahren, nicht die Wahrscheinlichkeit, dass gerade dieses
Ergebnis falsch ist. Behält man
H 0 H_0 H 0 bei, weiß man nicht, ob
H 0 H_0 H 0 stimmt. „Beibehalten“
ist kein Beweis für
H 0 H_0 H 0 .
Zur Musterlösung: Sie schließt mit „der Stoff reduziert die Entflammbarkeit also
nicht“. Das sagt mehr, als der Test hergibt. Richtig ist: Eine Reduktion lässt sich zum
Niveau 1 % nicht nachweisen. Widerlegt ist sie damit nicht.
t.test(beh, unb, alternative = "greater") →
t = 3.1917 ✓
R prüft die Rechnung von Hand. mean und
var bestätigen x ˉ = 8,66 \bar x = 8{,}66 x ˉ = 8 , 66 , y ˉ = 4,68 \bar y = 4{,}68 y ˉ = 4 , 68 , s X 2 = 3,938 s_X^2 =
3{,}938 s X 2 = 3 , 938 und s Y 2 = 3,837 s_Y^2 = 3{,}837 s Y 2 = 3 , 837 .
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“):
mean(x) berechnet den Mittelwert,
var(x) die Stichprobenvarianz
s 2 s^2 s 2 — ebenfalls mit
n − 1 n - 1 n − 1 im
Nenner.
Den ganzen Test rechnet t.test. Er bekommt nach dem Skript:
zuerst die Gruppe X X X , hier beh, dann die Gruppe Y Y Y , hier
unb;
alternative = "greater" für H A : μ X > μ Y H_A: \mu_X > \mu_Y H A : μ X > μ Y („greater“
heißt „größer“). Für „kleiner“ stünde "less", für „ungleich“
"two.sided".
Kein paired = TRUE: Die Stichproben sind nicht gepaart (Schritt
2).
In der Ausgabe steht t = 3.1917. Das ist genau t ^ = 3,191669 \hat t =
3{,}191669 t ^ = 3 , 191669 aus Schritt 11, auf vier Nachkommastellen. Die Rechnung von Hand stimmt.
Aber: R nennt df = 7.9987 Freiheitsgrade statt 4 und
p-value = 0.006387 statt 0,01658. Das liegt nicht an einem
Rechenfehler. R bestimmt die Freiheitsgrade anders als das Skript. Die Ergänzung im
nächsten Schritt erklärt das.
Die Musterlösung zeigt für diese Aufgabe keinen t.test- Befehl.
Die Schreibweise hier folgt dem Skript.
R:
7,9987 7{,}9987 7 , 9987 Freiheitsgrade, kritischer Wert
2,897 < 3,19 2{,}897 < 3{,}19 2 , 897 < 3 , 19 ,
p = 0,64 % p = 0{,}64\,\% p = 0 , 64 %
Diese Ergänzung geht über die Aufgabe hinaus. Für die Lösung nach dem Skript gilt
Schritt 15: H 0 H_0 H 0 beibehalten.
R benutzt beim Zweistichproben-t-Test die Welch-Näherung , benannt nach dem
Statistiker Welch. Sie berechnet die Freiheitsgrade aus den Daten, statt die vorsichtige
Zahl min ( n , m ) − 1 \min(n, m) - 1 min ( n , m ) − 1 zu nehmen. Hier kommen 7,9987 7{,}9987 7 , 9987 heraus, also fast 8. Das ist der
größtmögliche Wert n + m − 2 = 8 n + m - 2 = 8 n + m − 2 = 8 . Er entsteht, weil beide Gruppen gleich groß sind und
fast gleich stark streuen.
Was ändert das? Mehr Freiheitsgrade heißen dünnere Ränder der t-Verteilung. Der
kritische Wert rückt nach links:
qt(0.99, df = 7.9987) = 2,897 = 2{,}897 = 2 , 897 statt 3,747 3{,}747 3 , 747 .
t ^ = 3,19 \hat t = 3{,}19 t ^ = 3 , 19 liegt jetzt rechts davon, im Ablehnbereich.
Ebenso ist p = 0,006387 = 0,64 % < 1 % p = 0{,}006387 = 0{,}64\,\% < 1\,\% p = 0 , 006387 = 0 , 64 % < 1 % .
Mit R allein würde man H 0 H_0 H 0 also verwerfen . Das Bild zeigt gestrichelt die
t-Verteilung mit 8 Freiheitsgraden und ihren kritischen Wert.
Was gilt? In dieser Übung gilt die Regel des Skripts. Die Musterlösung folgt ihr,
und von Hand rechnet man genauso. Das Skript sagt selbst: Die Freiheitsgrade sind
konservativ gewählt, H 0 H_0 H 0 wird also eher beibehalten; R verwendet eine bessere Näherung.
Diese Aufgabe ist genau so ein Grenzfall: Die vorsichtige Regel behält bei, die genauere
Näherung verwirft.
Nur für Interessierte: Die Welch-Freiheitsgrade berechnet man aus a = s X 2 / n = 0,7876 a = s_X^2/n =
0{,}7876 a = s X 2 / n = 0 , 7876 und b = s Y 2 / m = 0,7674 b = s_Y^2/m = 0{,}7674 b = s Y 2 / m = 0 , 7674 (Schritt 10). Die Formel steht im Lösungsweg:
1,555 2 = 2,418025 1{,}555^2 = 2{,}418025 1 , 55 5 2 = 2 , 418025 im Zähler, 0,7876 2 / 4 + 0,7674 2 / 4 = 0,302304 0{,}7876^2/4 + 0{,}7674^2/4 = 0{,}302304 0 , 787 6 2 /4 + 0 , 767 4 2 /4 = 0 , 302304 im Nenner,
zusammen 7,9987 7{,}9987 7 , 9987 .
Merke: Welche Regel gilt, steht vor dem Test fest. Man wechselt nicht nachträglich
zu der Rechnung, die das gewünschte Ergebnis liefert. Das Skript warnt ausdrücklich:
niemals Tests durchprobieren, bis man das gewünschte Ergebnis erhält.
Schritt
Weg
Wert
Unterschied
8,66 − 4,68 8{,}66 - 4{,}68 8 , 66 − 4 , 68
3,98 Sekunden
Standardfehler
3,938 / 5 + 3,837 / 5 \sqrt{3{,}938/5 + 3{,}837/5} 3 , 938/5 + 3 , 837/5
1,247 Sekunden
Teststatistik t ^ \hat t t ^
3,98 : 1,247 3{,}98 : 1{,}247 3 , 98 : 1 , 247
3,19
kritischer Wert
qt(0.99, df = 4)
3,747
p p p -Wert
1 - pt(3.191669, df = 4)
1,66 %
In Worten: In der Stichprobe brennen die behandelten Streifen im Mittel rund 4
Sekunden länger. Das sind gut drei Standardfehler — viel, aber nicht genug für das strenge
Niveau 1 % mit der vorsichtigen Regel des Skripts. H 0 H_0 H 0 wird beibehalten: Eine geringere
Entflammbarkeit ist nicht nachgewiesen , aber auch nicht widerlegt.
Proben: R bestätigt alle Zwischenwerte und t ^ = 3,1917 \hat t = 3{,}1917 t ^ = 3 , 1917 . Nötig gewesen wären
über 4,67 Sekunden Unterschied.
Rückblick — so geht man bei zwei Gruppen vor: Erst fragen: dieselben Objekte zweimal
gemessen (gepaart) oder verschiedene Objekte (unabhängig)? Bei unabhängigen,
normalverteilten Gruppen: Mittelwerte und Varianzen je Gruppe, Standardfehler
s X 2 / n + s Y 2 / m \sqrt{s_X^2/n
+ s_Y^2/m} s X 2 / n + s Y 2 / m , dann
t ^ \hat t t ^ = Unterschied durch Standardfehler. Mit
t min ( n , m ) − 1 ; 1 − α t_{\min(n,m)-1;\,1-\alpha} t m i n ( n , m ) − 1 ; 1 − α vergleichen. Die Antwort mit „kann man (nicht) zeigen“
formulieren.