Jemand hat fünf Werte gemessen: 0,70; 0,22; 0,35; 0,51; −0,10. Ihr Mittelwert ist 0,336, also
größer als 0. Die Frage: Liegt das nur am Zufall? Oder ist der Erwartungswert μ \mu μ der
Messungen wirklich von 0 verschieden? μ \mu μ ist der Wert, um den die Messungen auf lange Sicht
im Mittel schwanken. Man kennt ihn nicht, man hat nur die fünf Zahlen.
Gesucht sind:
(i) eine Entscheidung: Kann man mit diesen fünf Werten zum Niveau α = 5 % \alpha = 5\,\% α = 5 % zeigen,
dass μ ≠ 0 \mu \neq 0 μ = 0 ist? Die Antwort ist „ja“ oder „nein“, begründet mit einem Test.
(ii) eine sechste Messung x 6 x_6 x 6 , mit der es klappt. Eine Zahl genügt.
Der Weg in drei Etappen:
(i) Hypothesen aufstellen. Den passenden Test wählen: den t-Test, weil die Streuung σ \sigma σ
unbekannt ist. Mittelwert und Standardabweichung von Hand berechnen, daraus die
Teststatistik t ^ \hat t t ^ . Sie mit einer Grenze aus R vergleichen und entscheiden.
(ii) Dieselbe Rechnung mit x 6 = 0,5 x_6 = 0{,}5 x 6 = 0 , 5 , also mit sechs Werten.
Ergänzung: Welche x 6 x_6 x 6 reichen, welche nicht — und warum ein zu großes x 6 x_6 x 6 wieder
scheitert.
Merke: Ein Test kann nur die Alternative
H A H_A H A zeigen, indem er die Nullhypothese
H 0 H_0 H 0
verwirft. Scheitert er, ist nichts gezeigt — auch nicht das Gegenteil.
Zur Musterlösung: Beide Antworten stimmen. Sie rechnet mit gerundeten Zwischenwerten
weiter und schreibt deshalb
t ^ ≈ 2,4821 \hat t \approx 2{,}4821 t ^ ≈ 2 , 4821 statt
2,4820 2{,}4820 2 , 4820 (Schritt 8) und
t ^ ≈ 3,1907 \hat t
\approx 3{,}1907 t ^ ≈ 3 , 1907 statt
3,1910 3{,}1910 3 , 1910 (Schritt 18). R bestätigt die ungerundeten Werte 2.482021
und 3.191011. An den Entscheidungen ändert das nichts.
H 0 : μ = 0 H_0:\ \mu = 0 H 0 : μ = 0 gegen
H A : μ ≠ 0 H_A:\ \mu \neq 0 H A : μ = 0 ,
α = 0,05 \alpha = 0{,}05 α = 0 , 05
Ein Test braucht zuerst zwei gegensätzliche Aussagen über den unbekannten Erwartungswert
μ \mu μ :
Die Alternative H A H_A H A : das, was man zeigen möchte. Hier ist das μ ≠ 0 \mu \neq 0 μ = 0 ,
gelesen „μ \mu μ ist ungleich 0“.
Die Nullhypothese H 0 H_0 H 0 : das genaue Gegenteil, hier μ = 0 \mu = 0 μ = 0 .
Die Zahl, mit der μ \mu μ verglichen wird, heißt μ 0 \mu_0 μ 0 . Hier ist μ 0 = 0 \mu_0 = 0 μ 0 = 0 .
Warum kommt die Vermutung in H A H_A H A ? Ein Test kann H 0 H_0 H 0 nur verwerfen oder
nicht verwerfen . Nur das Verwerfen ist eine belastbare Aussage. „μ ≠ 0 \mu \neq 0 μ = 0
zeigen“ heißt deshalb: H 0 : μ = 0 H_0\!: \mu = 0 H 0 : μ = 0 verwerfen.
Das Signifikanzniveau α = 5 % = 0,05 \alpha = 5\,\% = 0{,}05 α = 5 % = 0 , 05 begrenzt das Risiko, sich dabei zu
irren. Wird H 0 H_0 H 0 verworfen, obwohl H 0 H_0 H 0 stimmt, heißt das Fehler 1. Art . Seine
Wahrscheinlichkeit ist höchstens α \alpha α .
Aus Aufgabe 4 („Gauß-Test: sind die Dachbalken zu kurz?“): Die Vermutung kommt in
H A H_A H A , ihr Gegenteil in
H 0 H_0 H 0 . „Zeigen“ heißt
H 0 H_0 H 0 verwerfen. Das Signifikanzniveau
α \alpha α ist die Obergrenze für den Fehler 1. Art. Dort lautete die Vermutung „
μ < 750 \mu <
750 μ < 750 “, also eine Richtung; hier ist es „
μ ≠ 0 \mu \neq 0 μ = 0 “, beide Richtungen.
X 1 , … , X 5 ∼ N ( μ , σ 2 ) X_1, \dots, X_5 \sim N(\mu, \sigma^2) X 1 , … , X 5 ∼ N ( μ , σ 2 ) unabhängig,
n = 5 n = 5 n = 5
Die Aufgabe beschreibt, wie die Daten entstanden sind: Die Messwerte sind eine
Realisierung von X 1 , … , X 5 X_1, \dots, X_5 X 1 , … , X 5 . Das heißt:
Vor der Messung ist jeder Wert noch zufällig. Dafür stehen die großen Buchstaben X 1 , … , X 5 X_1,
\dots, X_5 X 1 , … , X 5 , die Zufallsvariablen .
Nach der Messung liegen konkrete Zahlen vor, die kleinen Buchstaben x 1 = 0,70 x_1 = 0{,}70 x 1 = 0 , 70 bis
x 5 = − 0,10 x_5 = -0{,}10 x 5 = − 0 , 10 . Diese Zahlen sind die Realisierung.
Unabhängig und identisch verteilt heißt: Jede Messung folgt derselben Verteilung,
und keine beeinflusst eine andere. Die Verteilung ist hier die Normalverteilung N ( μ , σ 2 ) N(\mu,
\sigma^2) N ( μ , σ 2 ) .
Beide Zahlen darin sind unbekannt : der Erwartungswert μ \mu μ (um den geht es) und
die Varianz σ 2 \sigma^2 σ 2 , also die Streuung der Messungen. Genau das zweite entscheidet im
nächsten Schritt, welcher Test passt.
Der Stichprobenumfang ist n = 5 n = 5 n = 5 .
Aus Blatt 4, Aufgabe 1 („Normalverteilung: die σ-Regeln“): X ∼ N ( μ , σ 2 ) X \sim N(\mu,
\sigma^2) X ∼ N ( μ , σ 2 ) hat eine glockenförmige Dichte mit der Mitte
μ \mu μ .
σ 2 \sigma^2 σ 2 ist die Varianz,
σ \sigma σ die Standardabweichung.
t ^ = n ⋅ x ˉ n − μ 0 s n \hat t = \sqrt{n}\cdot\dfrac{\bar x_n - \mu_0}{s_n} t ^ = n ⋅ s n x ˉ n − μ 0 ,
n − 1 = 4 n - 1 = 4 n − 1 = 4
Freiheitsgrade
Der Gauß-Test aus Aufgabe 4 misst den Abstand zwischen Mittelwert und μ 0 \mu_0 μ 0 in Einheiten
von σ / n \sigma/\sqrt{n} σ / n . Dafür braucht er σ \sigma σ . Hier ist σ \sigma σ unbekannt — der
Gauß-Test geht also nicht.
Der Ausweg: σ \sigma σ durch die Stichproben-Standardabweichung s n s_n s n ersetzen, die
man aus den Daten berechnet. Das ergibt den Einstichproben-t-Test . „Einstichproben“
heißt: Es gibt eine einzige Stichprobe, und ihr Mittelwert wird mit einer festen Zahl
μ 0 \mu_0 μ 0 verglichen. Die Teststatistik lautet
t ^ = n ⋅ x ˉ n − μ 0 s n \hat t = \sqrt{n}\cdot\dfrac{\bar x_n - \mu_0}{s_n} t ^ = n ⋅ s n x ˉ n − μ 0 (gelesen „t Dach“).
x ˉ n \bar x_n x ˉ n ist der Stichprobenmittelwert,
μ 0 = 0 \mu_0 = 0 μ 0 = 0 der Vergleichswert aus Schritt 1,
s n s_n s n die Stichproben-Standardabweichung — das ist das s s s aus Blatt 5, Aufgabe 3; der
Index nennt den Stichprobenumfang.
Was die Zahl misst: Mal n \sqrt{n} n ist dasselbe wie geteilt durch 1 / n 1/\sqrt{n} 1/ n .
Also ist
t ^ = x ˉ n − μ 0 s n / n \hat t = \dfrac{\bar x_n - \mu_0}{s_n/\sqrt{n}} t ^ = s n / n x ˉ n − μ 0 .
Der Nenner s n / n s_n/\sqrt{n} s n / n heißt geschätzter Standardfehler : die aus den Daten
geschätzte Standardabweichung des Mittelwerts. Beim Gauß-Test (Aufgabe 4) stand dort
σ / n \sigma/\sqrt{n} σ / n . t ^ \hat t t ^ zählt also, wie viele geschätzte Standardfehler x ˉ n \bar x_n x ˉ n von
μ 0 \mu_0 μ 0 entfernt liegt. Je größer ∣ t ^ ∣ |\hat t| ∣ t ^ ∣ , desto schlechter passen die Daten zu H 0 H_0 H 0 .
Warum eine andere Verteilung? Weil s n s_n s n selbst aus den Daten geschätzt ist und
schwankt, streut t ^ \hat t t ^ stärker als Z Z Z . Stimmt H 0 H_0 H 0 , folgt t ^ \hat t t ^ einer
t-Verteilung mit n − 1 = 4 n - 1 = 4 n − 1 = 4 Freiheitsgraden. Das Bild zeigt ihre Dichte.
Aus Aufgabe 2 („Konfidenzintervall mit geschätzter Varianz: Kaffeepackungen“): Wird
σ \sigma σ durch
s n s_n s n ersetzt, gehört die t-Verteilung mit
n − 1 n - 1 n − 1 Freiheitsgraden dazu.
Sie ist glockenförmig wie die Standardnormalverteilung, hat aber breitere Ränder. Mit mehr
Freiheitsgraden wird sie ihr immer ähnlicher.
Aus Aufgabe 4 („Gauß-Test: sind die Dachbalken zu kurz?“): Die Teststatistik fasst
die Daten in einer Zahl zusammen. Beim Gauß-Test ist das
Z = n ⋅ x ˉ n − μ 0 σ Z = \sqrt{n}\cdot\frac{\bar x_n
- \mu_0}{\sigma} Z = n ⋅ σ x ˉ n − μ 0 . Ist
μ = μ 0 \mu = \mu_0 μ = μ 0 , dann ist
Z Z Z standardnormalverteilt,
Z ∼ N ( 0 , 1 ) Z \sim
N(0,\,1) Z ∼ N ( 0 , 1 ) (dort näherungsweise, weil die Normalverteilung nicht vorausgesetzt war).
H 0 H_0 H 0 verwerfen, falls
∣ t ^ ∣ > t 4 ; 0,975 |\hat t| > t_{4;\,0{,}975} ∣ t ^ ∣ > t 4 ; 0 , 975
H A H_A H A lautet „μ ≠ 0 \mu \neq 0 μ = 0 “. Gegen H 0 H_0 H 0 spricht deshalb ein t ^ \hat t t ^ , das
weit rechts liegt (Mittelwert deutlich über 0), aber genauso eines, das
weit links liegt (deutlich unter 0). Beide Ränder zählen. So ein Test heißt
zweiseitig . Diesen zweiseitigen Fall gab es schon in Aufgabe 3 (Test gegen 500 g).
Das Risiko α = 5 % \alpha = 5\,\% α = 5 % wird deshalb auf beide Ränder verteilt:
α 2 = 0,05 2 = 0,025 = 2,5 % \dfrac{\alpha}{2} = \dfrac{0{,}05}{2} = 0{,}025 = 2{,}5\,\% 2 α = 2 0 , 05 = 0 , 025 = 2 , 5 % je Rand.
Im Bild sind das die roten Flächen. Die Werte von t ^ \hat t t ^ darin heißen
Ablehnbereich : Landet t ^ \hat t t ^ dort, wird H 0 H_0 H 0 verworfen.
Die rechte Grenze hat links von sich 100 % − 2,5 % = 97,5 % 100\,\% - 2{,}5\,\% = 97{,}5\,\% 100 % − 2 , 5 % = 97 , 5 % der Fläche. Sie
ist also das 0,975-Quantil der t-Verteilung mit 4 Freiheitsgraden, kurz
t 4 ; 0,975 t_{4;\,0{,}975} t 4 ; 0 , 975 . Allgemein: t n − 1 ; 1 − α / 2 t_{n-1;\,1-\alpha/2} t n − 1 ; 1 − α /2 . Das Semikolon trennt die
Freiheitsgrade vom Anteil, weil das Komma schon Dezimalzeichen ist. Die linke Grenze ist
− t 4 ; 0,975 -t_{4;\,0{,}975} − t 4 ; 0 , 975 , weil die Kurve symmetrisch um 0 ist.
Die Regel fasst beide Seiten zusammen. Die Betragsstriche ∣ t ^ ∣ |\hat t| ∣ t ^ ∣ lassen das Vorzeichen
weg: ∣ 2,5 ∣ = ∣ − 2,5 ∣ = 2,5 |2{,}5| = |-2{,}5| = 2{,}5 ∣2 , 5∣ = ∣ − 2 , 5∣ = 2 , 5 .
H 0 H_0 H 0 verwerfen, falls ∣ t ^ ∣ > t n − 1 ; 1 − α / 2 |\hat t| > t_{n-1;\,1-\alpha/2} ∣ t ^ ∣ > t n − 1 ; 1 − α /2 .
Aus Blatt 4, Aufgabe 5 („Quantile: die Füllmenge einer Kaffeepackung“): Ein Quantil
ist eine Grenze, links von der ein vorgegebener Anteil der Fläche liegt. Das 0,975-Quantil
hat 97,5 % links und 2,5 % rechts von sich.
Aus Aufgabe 4 („Gauß-Test: sind die Dachbalken zu kurz?“): Dort war der Test
einseitig : Nur zu kurze Balken sprachen gegen
H 0 H_0 H 0 , darum lag das ganze
α \alpha α
an einem Rand. Die Werte, bei denen man verwirft, hießen dort
Ablehnbereich , seine
Grenze
kritischer Wert (
− 2,3263 -2{,}3263 − 2 , 3263 ). Hier gibt es an jedem Rand einen solchen
Bereich.
x ˉ 5 = 1,68 5 = 0,336 \bar x_5 = \dfrac{1{,}68}{5} = 0{,}336 x ˉ 5 = 5 1 , 68 = 0 , 336
Für t ^ \hat t t ^ braucht man zwei Zahlen aus den Daten: den Mittelwert x ˉ 5 \bar x_5 x ˉ 5 und die
Standardabweichung s 5 s_5 s 5 . Zuerst der Mittelwert.
Alle Werte addieren. Der letzte ist negativ, er wird also abgezogen:
0,70 + 0,22 + 0,35 + 0,51 − 0,10 = 1,68 0{,}70 + 0{,}22 + 0{,}35 + 0{,}51 - 0{,}10 = 1{,}68 0 , 70 + 0 , 22 + 0 , 35 + 0 , 51 − 0 , 10 = 1 , 68
Durch die Anzahl n = 5 n = 5 n = 5 teilen:
x ˉ 5 = 1,68 5 = 0,336 \bar x_5 = \dfrac{1{,}68}{5} = \mathbf{0{,}336} x ˉ 5 = 5 1 , 68 = 0 , 336
Der Mittelwert liegt über μ 0 = 0 \mu_0 = 0 μ 0 = 0 . Ob das „deutlich“ ist, hängt davon ab, wie stark
die Werte streuen. Das misst s 5 s_5 s 5 in den nächsten beiden Schritten.
Aus Blatt 5, Aufgabe 2 („Mittelwert und Median: ein Ausreißer bei den Ausgaben“):
Der Stichprobenmittelwert ist
x ˉ n = 1 n ∑ i = 1 n x i \bar x_n = \frac{1}{n}\sum_{i=1}^{n} x_i x ˉ n = n 1 ∑ i = 1 n x i , die Summe aller
Werte geteilt durch ihre Anzahl.
∑ ( x i − x ˉ 5 ) 2 = 0,36652 \sum (x_i - \bar x_5)^2 = 0{,}36652 ∑ ( x i − x ˉ 5 ) 2 = 0 , 36652
Jetzt die Streuung, mit derselben Tabelle wie in Blatt 5, Aufgabe 3.
Abweichungen: jeden Wert minus 0,336.
0,70 − 0,336 = + 0,364 0{,}70 - 0{,}336 = +0{,}364 0 , 70 − 0 , 336 = + 0 , 364
0,22 − 0,336 = − 0,116 0{,}22 - 0{,}336 = -0{,}116 0 , 22 − 0 , 336 = − 0 , 116
0,35 − 0,336 = + 0,014 0{,}35 - 0{,}336 = +0{,}014 0 , 35 − 0 , 336 = + 0 , 014
0,51 − 0,336 = + 0,174 0{,}51 - 0{,}336 = +0{,}174 0 , 51 − 0 , 336 = + 0 , 174
− 0,10 − 0,336 = − 0,436 -0{,}10 - 0{,}336 = -0{,}436 − 0 , 10 − 0 , 336 = − 0 , 436
Probe: Die Summe muss 0 sein. Plus-Teile 0,552 0{,}552 0 , 552 , Minus-Teile 0,552 0{,}552 0 , 552 — stimmt.
Quadrate: jede Abweichung mit sich selbst malnehmen, z. B. 0,364 2 = 0,364 ⋅ 0,364 = 0,132496 0{,}364^2 = 0{,}364
\cdot 0{,}364 = 0{,}132496 0 , 36 4 2 = 0 , 364 ⋅ 0 , 364 = 0 , 132496 und ( − 0,436 ) 2 = 0,190096 (-0{,}436)^2 = 0{,}190096 ( − 0 , 436 ) 2 = 0 , 190096 . Die Summe aller fünf Quadrate
ist 0,36652 \mathbf{0{,}36652} 0 , 36652 .
Den größten Beitrag liefert der negative Wert − 0,10 -0{,}10 − 0 , 10 : Er liegt am weitesten vom
Mittelwert weg.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Die
Abweichungen vom Mittelwert ergeben zusammen immer 0. Deshalb quadriert man sie, bevor man
addiert.
s 5 2 = 0,36652 4 = 0,09163 s_5^2 = \dfrac{0{,}36652}{4} = 0{,}09163 s 5 2 = 4 0 , 36652 = 0 , 09163 ,
s 5 ≈ 0,3027 s_5 \approx 0{,}3027 s 5 ≈ 0 , 3027
Die Summe der Quadrate durch n − 1 = 4 n - 1 = 4 n − 1 = 4 teilen ergibt die Stichprobenvarianz :
s 5 2 = 0,36652 4 = 0,09163 s_5^2 = \dfrac{0{,}36652}{4} = 0{,}09163 s 5 2 = 4 0 , 36652 = 0 , 09163
Die Wurzel daraus ist die Stichproben-Standardabweichung :
s 5 = 0,09163 = 0,302704 … ≈ 0,3027 s_5 = \sqrt{0{,}09163} = 0{,}302704\ldots \approx \mathbf{0{,}3027} s 5 = 0 , 09163 = 0 , 302704 … ≈ 0 , 3027
Auf vier Nachkommastellen gerundet ist das 0,3027. Weitergerechnet wird aber mit dem
genaueren Wert 0,302704, damit t ^ \hat t t ^ in der vierten Stelle stimmt.
R prüft beides: mean(x) gibt 0,336,
sd(x) gibt 0,3027045.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): s 2 = 1 n − 1 ∑ ( x i − x ˉ n ) 2 s^2 =
\frac{1}{n-1}\sum(x_i - \bar x_n)^2 s 2 = n − 1 1 ∑ ( x i − x ˉ n ) 2 und
s = s 2 s = \sqrt{s^2} s = s 2 . Geteilt wird durch
n − 1 n - 1 n − 1 . R
rechnet das mit
var und
sd. Hier heißt
s s s mit Index
s 5 s_5 s 5 , weil es aus fünf Werten berechnet ist.
t ^ = 5 ⋅ 0,336 0,302704 ≈ 2,4820 \hat t = \sqrt{5}\cdot\dfrac{0{,}336}{0{,}302704} \approx 2{,}4820 t ^ = 5 ⋅ 0 , 302704 0 , 336 ≈ 2 , 4820
Alle Zutaten liegen vor: n = 5 n = 5 n = 5 , x ˉ 5 = 0,336 \bar x_5 = 0{,}336 x ˉ 5 = 0 , 336 , μ 0 = 0 \mu_0 = 0 μ 0 = 0 und s 5 = 0,302704 s_5 =
0{,}302704 s 5 = 0 , 302704 . Eingesetzt in die Formel aus Schritt 3:
t ^ = 5 ⋅ 0,336 − 0 0,302704 \hat t = \sqrt{5}\cdot\dfrac{0{,}336 - 0}{0{,}302704} t ^ = 5 ⋅ 0 , 302704 0 , 336 − 0
5 = 2,236068 \sqrt{5} = 2{,}236068 5 = 2 , 236068 . Zähler zuerst: 2,236068 ⋅ 0,336 = 0,751319 2{,}236068 \cdot 0{,}336 = 0{,}751319 2 , 236068 ⋅ 0 , 336 = 0 , 751319 . Dann
teilen:
t ^ = 0,751319 0,302704 ≈ 2,4820 \hat t = \dfrac{0{,}751319}{0{,}302704} \approx \mathbf{2{,}4820} t ^ = 0 , 302704 0 , 751319 ≈ 2 , 4820
Probe über den Standardfehler (Schritt 3): s 5 / 5 = 0,302704 / 2,236068 ≈ 0,135374 s_5/\sqrt{5} = 0{,}302704 / 2{,}236068
\approx 0{,}135374 s 5 / 5 = 0 , 302704/2 , 236068 ≈ 0 , 135374 und 0,336 / 0,135374 ≈ 2,4820 0{,}336 / 0{,}135374 \approx 2{,}4820 0 , 336/0 , 135374 ≈ 2 , 4820 .
Der Mittelwert liegt also knapp 2,5 geschätzte Standardfehler über 0. Im Bild ist das der
Punkt auf der Achse. Er liegt rechts von 0, weil x ˉ 5 \bar x_5 x ˉ 5 über μ 0 \mu_0 μ 0 liegt.
Zur Rundung: Wer mit dem gerundeten s 5 = 0,3027 s_5 = 0{,}3027 s 5 = 0 , 3027 rechnet, bekommt 0,751319 / 0,3027 ≈ 2,4821 0{,}751319 /
0{,}3027 \approx 2{,}4821 0 , 751319/0 , 3027 ≈ 2 , 4821 . So steht es in der Musterlösung. R rechnet mit vollen Stellen
und gibt 2.482021 aus, also 2,4820.
qt(0.975, df = 4) →
t 4 ; 0,975 ≈ 2,7764 t_{4;\,0{,}975} \approx 2{,}7764 t 4 ; 0 , 975 ≈ 2 , 7764
Jetzt die Grenze aus Schritt 4. Das 0,975-Quantil der t-Verteilung liefert R mit
qt. Es bekommt zwei Angaben:
0.975: den Anteil links von der Grenze,
df = 4: die Freiheitsgrade n − 1 = 4 n - 1 = 4 n − 1 = 4 (englisch
degrees of freedom ).
R antwortet 2,776445. Auf vier Nachkommastellen: t 4 ; 0,975 ≈ 2,7764 t_{4;\,0{,}975} \approx
\mathbf{2{,}7764} t 4 ; 0 , 975 ≈ 2 , 7764 . Diese Grenze heißt kritischer Wert .
Der Ablehnbereich ist damit: t ^ \hat t t ^ kleiner als − 2,7764 -2{,}7764 − 2 , 7764 oder größer als 2,7764 2{,}7764 2 , 7764 .
Im Bild beginnen dort die roten Flächen mit je 2,5 %.
Zum Vergleich: Bei der Standardnormalverteilung läge die Grenze bei q 0,975 ≈ 1,96 q_{0{,}975} \approx
1{,}96 q 0 , 975 ≈ 1 , 96 (Aufgabe 1, „Konfidenzintervall bei bekannter Varianz“). Die t-Verteilung mit nur
4 Freiheitsgraden hat breitere Ränder, deshalb liegt ihre Grenze viel weiter draußen.
Aus Aufgabe 2 („Konfidenzintervall mit geschätzter Varianz: Kaffeepackungen“):
qt(p, df = …) gibt die Grenze, links von der der Anteil
p p p
unter der t-Dichte liegt. Dort war es
qt(0.975, df = 11) ≈
2,201.
∣ t ^ ∣ = 2,4820 < 2,7764 |\hat t| = 2{,}4820 < 2{,}7764 ∣ t ^ ∣ = 2 , 4820 < 2 , 7764 ⇒
H 0 H_0 H 0 nicht verwerfen
Vergleich nach der Regel aus Schritt 4. t ^ \hat t t ^ ist positiv, der Betrag ändert also
nichts:
∣ t ^ ∣ = 2,4820 < 2,7764 |\hat t| = 2{,}4820 \; < \; 2{,}7764 ∣ t ^ ∣ = 2 , 4820 < 2 , 7764
t ^ \hat t t ^ liegt nicht im Ablehnbereich. Im Bild steht der Punkt links von der
rechten roten Grenze, im mittleren Bereich. Auch die Balken unten zeigen es: Die
Teststatistik ist kürzer als der kritische Wert.
Antwort auf (i): Nein. Zum Niveau α = 5 % \alpha = 5\,\% α = 5 % kann man mit diesen fünf Werten
nicht zeigen, dass μ ≠ 0 \mu \neq 0 μ = 0 ist.
Merke: Beim zweiseitigen t-Test wird
∣ t ^ ∣ |\hat t| ∣ t ^ ∣ mit
t n − 1 ; 1 − α / 2 t_{n-1;\,1-\alpha/2} t n − 1 ; 1 − α /2
verglichen. Nur wenn
∣ t ^ ∣ |\hat t| ∣ t ^ ∣ größer ist, wird
H 0 H_0 H 0 verworfen.
nicht verworfen ≠
μ = 0 \mu = 0 μ = 0 gezeigt
Das Ergebnis heißt nicht : „μ \mu μ ist 0.“ Es heißt nur: Die fünf Werte reichen nicht
als Beleg für μ ≠ 0 \mu \neq 0 μ = 0 .
Warum man μ = 0 \mu = 0 μ = 0 nicht folgern darf: Der Mittelwert ist 0,336, also gar nicht
nahe bei 0. Aber die Werte streuen stark (von −0,10 bis 0,70), und es sind nur fünf. Ein
so großer Mittelwert kann dann auch entstehen, wenn μ = 0 \mu = 0 μ = 0 ist — nicht oft, aber zu oft
für α = 5 % \alpha = 5\,\% α = 5 % . Umgekehrt kann μ \mu μ genauso gut 0,3 sein; dazu passen die Daten
sogar besser.
Beide Möglichkeiten bleiben offen. Mehr Daten könnten sie trennen. Genau darum geht es in
(ii).
Merke: H 0 H_0 H 0 verwerfen heißt:
H A H_A H A ist gezeigt, mit einer
Irrtumswahrscheinlichkeit von höchstens
α \alpha α .
H 0 H_0 H 0 nicht verwerfen heißt: Es ist
nichts gezeigt — weder
H A H_A H A noch
H 0 H_0 H 0 .
Aus Aufgabe 3 („Ein Ausreißer im Konfidenzintervall: Mehlpackungen“): Dort wurde
H 0 : μ = 500 H_0\!: \mu = 500 H 0 : μ = 500 nicht verworfen. Das hieß nur: Eine Abweichung ist nicht belegt —
nicht, dass
μ = 500 \mu = 500 μ = 500 ist.
t.test(x, mu = 0): t = 2,482,
p ≈ 0,0681 > 0,05 p \approx 0{,}0681 > 0{,}05 p ≈ 0 , 0681 > 0 , 05
Diese Ergänzung geht über die Aufgabe hinaus. R kann den ganzen Test mit einem
Befehl rechnen: t.test(x, mu = 0).
mu = 0 ist μ 0 \mu_0 μ 0 . Ohne weitere Angabe rechnet R zweiseitig.
Die Ausgabe (gekürzt) bestätigt die Rechnung: t = 2.482 ist
t ^ \hat t t ^ , df = 4 sind die Freiheitsgrade.
Außerdem gibt R den p-Wert aus (p-value). Er ist die
Wahrscheinlichkeit, dass t ^ \hat t t ^ mindestens so weit von 0 weg liegt wie beobachtet —
gerechnet unter der Annahme, dass H 0 H_0 H 0 stimmt. Zweiseitig zählen beide Seiten. T 4 T_4 T 4
steht dabei für eine Zufallsvariable mit t-Verteilung mit 4 Freiheitsgraden:
p = 2 ⋅ P ( T 4 > 2,4820 ) ≈ 0,0681 p = 2 \cdot P(T_4 > 2{,}4820) \approx 0{,}0681 p = 2 ⋅ P ( T 4 > 2 , 4820 ) ≈ 0 , 0681
Im Bild sind das die blauen Flächen jenseits von ± 2,4820 \pm 2{,}4820 ± 2 , 4820 , je etwa 3,4 %. Sie sind
größer als die roten mit je 2,5 %. Deshalb gilt dieselbe Entscheidung in anderer Form: p = 0,0681 > 0,05 = α p
= 0{,}0681 > 0{,}05 = \alpha p = 0 , 0681 > 0 , 05 = α , also nicht verwerfen.
Die letzte Zeile ist das 95-%-Konfidenzintervall [ − 0,0399 ; 0,7119 ] [-0{,}0399;\, 0{,}7119] [ − 0 , 0399 ; 0 , 7119 ] . Es enthält
μ 0 = 0 \mu_0 = 0 μ 0 = 0 — auch das passt zu „nicht verwerfen“.
Aus Aufgabe 3 („Ein Ausreißer im Konfidenzintervall: Mehlpackungen“): Der
zweiseitige t-Test zum Niveau
α \alpha α verwirft
H 0 : μ = μ 0 H_0\!: \mu = \mu_0 H 0 : μ = μ 0 genau dann, wenn
μ 0 \mu_0 μ 0 nicht im
( 1 − α ) (1-\alpha) ( 1 − α ) -Konfidenzintervall liegt.
Aus Aufgabe 4 („Gauß-Test: sind die Dachbalken zu kurz?“): Der p-Wert ist die
Wahrscheinlichkeit, unter
H 0 H_0 H 0 ein mindestens so extremes Ergebnis zu bekommen wie das
beobachtete. Ist
p ≤ α p \le \alpha p ≤ α , verwirft man
H 0 H_0 H 0 . Dort war der Test einseitig, es
zählte nur die Fläche links. Hier zählen beide Ränder, daher der Faktor 2.
t ^ = n ⋅ x ˉ n s n \hat t = \sqrt{n}\cdot\dfrac{\bar x_n}{s_n} t ^ = n ⋅ s n x ˉ n :
n \sqrt{n} n ↑,
x ˉ n \bar x_n x ˉ n ↑,
s n s_n s n ↓
In (i) fehlte nicht viel: 2,4820 2{,}4820 2 , 4820 statt über 2,7764 2{,}7764 2 , 7764 . Eine sechste Messung soll
t ^ \hat t t ^ über die Grenze schieben. Dazu lohnt ein Blick in die Formel. Mit μ 0 = 0 \mu_0 = 0 μ 0 = 0
lautet sie
t ^ = n ⋅ x ˉ n s n \hat t = \sqrt{n}\cdot\dfrac{\bar x_n}{s_n} t ^ = n ⋅ s n x ˉ n .
Ein Bruch wird größer, wenn der Zähler wächst oder der Nenner schrumpft. x 6 x_6 x 6 greift an
drei Stellen an:
n \sqrt{n} n wächst von 5 \sqrt{5} 5 auf 6 \sqrt{6} 6 — egal, welches x 6 x_6 x 6 man nimmt.
Zähler x ˉ n \bar x_n x ˉ n : Ein x 6 x_6 x 6 über dem bisherigen Mittelwert 0,336 zieht den
Mittelwert nach oben.
Nenner s n s_n s n : Ein x 6 x_6 x 6 nahe beim bisherigen Mittelwert macht die Streuung
kleiner.
x ˉ 5 \bar x_5 x ˉ 5 ist positiv, t ^ \hat t t ^ auch. Also soll t ^ \hat t t ^ weiter nach rechts , und
x 6 x_6 x 6 sollte positiv sein. Im Bild ist das alte t ^ \hat t t ^ der hohle Punkt; gestrichelt sind
die Kurve und die Grenzen aus (i).
x 6 = 0,5 x_6 = 0{,}5 x 6 = 0 , 5 ,
n = 6 n = 6 n = 6
Die Musterlösung wählt x 6 = 0,5 x_6 = 0{,}5 x 6 = 0 , 5 . Das bedient den Zähler und den Nenner zugleich:
0,5 liegt über x ˉ 5 = 0,336 \bar x_5 = 0{,}336 x ˉ 5 = 0 , 336 — der Mittelwert steigt.
0,5 liegt mitten zwischen den bisherigen Werten (−0,10 bis 0,70), nicht weit draußen —
die Streuung wächst nicht, sie wird eher kleiner.
Es ist ein Vorschlag, noch kein Beweis. Ob er reicht, zeigt erst die Rechnung. Sie läuft
genau wie in (i), nur mit sechs Werten: n = 6 n = 6 n = 6 .
Welche anderen Werte auch reichen würden, klärt die Ergänzung ab Schritt 21.
x ˉ 6 = 2,18 6 ≈ 0,3633 \bar x_6 = \dfrac{2{,}18}{6} \approx 0{,}3633 x ˉ 6 = 6 2 , 18 ≈ 0 , 3633
Die Summe der fünf alten Werte ist aus Schritt 5 bekannt: 1,68. Dazu kommt x 6 = 0,5 x_6 = 0{,}5 x 6 = 0 , 5 :
1,68 + 0,5 = 2,18 1{,}68 + 0{,}5 = 2{,}18 1 , 68 + 0 , 5 = 2 , 18
Jetzt durch n = 6 n = 6 n = 6 teilen, nicht mehr durch 5:
x ˉ 6 = 2,18 6 = 0,363333 … ≈ 0,3633 \bar x_6 = \dfrac{2{,}18}{6} = 0{,}363333\ldots \approx \mathbf{0{,}3633} x ˉ 6 = 6 2 , 18 = 0 , 363333 … ≈ 0 , 3633
Die 3 wiederholt sich unendlich. Gerechnet wird mit 0,363333, angezeigt wird 0,3633.
Der Mittelwert ist von 0,336 auf 0,3633 gestiegen. Das ist der Zähler-Effekt : t ^ \hat
t t ^ wird dadurch größer.
∑ ( x i − x ˉ 6 ) 2 = 0,388933 \sum (x_i - \bar x_6)^2 = 0{,}388933 ∑ ( x i − x ˉ 6 ) 2 = 0 , 388933
Weil sich der Mittelwert geändert hat, ändern sich alle Abweichungen — nicht nur
die neue. Die alte Tabelle aus Schritt 6 ist nicht mehr brauchbar.
Jeder Wert minus 0,363333, zum Beispiel:
0,70 − 0,363333 = + 0,336667 0{,}70 - 0{,}363333 = +0{,}336667 0 , 70 − 0 , 363333 = + 0 , 336667
− 0,10 − 0,363333 = − 0,463333 -0{,}10 - 0{,}363333 = -0{,}463333 − 0 , 10 − 0 , 363333 = − 0 , 463333
0,50 − 0,363333 = + 0,136667 0{,}50 - 0{,}363333 = +0{,}136667 0 , 50 − 0 , 363333 = + 0 , 136667 (die neue Messung)
Die Abweichungen sind auf sechs Nachkommastellen gerundet. Ihre Summe ist 0, bis auf einen
Rundungsrest in der sechsten Stelle.
Die Quadrate addiert ergeben 0,388933 \mathbf{0{,}388933} 0 , 388933 . Die Quadrate sind aus den ungerundeten
Abweichungen berechnet.
Die neue Messung trägt nur 0,018678 zur Summe bei. Sie liegt nahe am Mittelwert und bläht
die Streuung kaum auf.
s 6 = 0,388933 / 5 ≈ 0,2789 s_6 = \sqrt{0{,}388933 / 5} \approx 0{,}2789 s 6 = 0 , 388933/5 ≈ 0 , 2789
Wie in Schritt 7, aber jetzt durch n − 1 = 6 − 1 = 5 n - 1 = 6 - 1 = 5 n − 1 = 6 − 1 = 5 teilen:
s 6 2 = 0,388933 5 = 0,077787 s_6^2 = \dfrac{0{,}388933}{5} = 0{,}077787 s 6 2 = 5 0 , 388933 = 0 , 077787
s 6 = 0,077787 = 0,278903 … ≈ 0,2789 s_6 = \sqrt{0{,}077787} = 0{,}278903\ldots \approx \mathbf{0{,}2789} s 6 = 0 , 077787 = 0 , 278903 … ≈ 0 , 2789
Die Standardabweichung ist kleiner geworden: von 0,3027 auf 0,2789. Das ist der
Nenner-Effekt . Warum, obwohl die Summe der Quadrate von 0,36652 auf 0,388933
gewachsen ist? Weil jetzt durch 5 statt durch 4 geteilt wird. Die Summe ist um 6 %
gewachsen, der Teiler um 25 %.
R bestätigt mit y <- c(x, 0.5) (die alten Werte plus 0,5)
beide Zahlen: 0,3633333 und 0,2789026.
t ^ = 6 ⋅ 0,363333 0,278903 ≈ 3,1910 \hat t = \sqrt{6}\cdot\dfrac{0{,}363333}{0{,}278903} \approx 3{,}1910 t ^ = 6 ⋅ 0 , 278903 0 , 363333 ≈ 3 , 1910
Einsetzen wie in Schritt 8, jetzt mit n = 6 n = 6 n = 6 :
t ^ = 6 ⋅ 0,363333 − 0 0,278903 \hat t = \sqrt{6}\cdot\dfrac{0{,}363333 - 0}{0{,}278903} t ^ = 6 ⋅ 0 , 278903 0 , 363333 − 0
6 = 2,449490 \sqrt{6} = 2{,}449490 6 = 2 , 449490 . Zähler: 2,449490 ⋅ 0,363333 = 0,889981 2{,}449490 \cdot 0{,}363333 = 0{,}889981 2 , 449490 ⋅ 0 , 363333 = 0 , 889981 . Geteilt durch
0,278903 0{,}278903 0 , 278903 :
t ^ ≈ 3,1910 \hat t \approx \mathbf{3{,}1910} t ^ ≈ 3 , 1910
Von 2,4820 auf 3,1910 — ein großer Sprung durch einen einzigen Wert. Im Bild springt der
Punkt vom hohlen zum gefüllten, schon rechts der alten Grenze 2,7764.
Zur Musterlösung: Sie rechnet mit den gerundeten Werten 6 ⋅ 0,3633 / 0,2789 \sqrt{6}\cdot 0{,}3633 /
0{,}2789 6 ⋅ 0 , 3633/0 , 2789 und bekommt 3,1907 3{,}1907 3 , 1907 . Mit vollen Stellen sind es 3,1910 3{,}1910 3 , 1910 (R: 3.191011). Die
Entscheidung ist dieselbe.
qt(0.975, df = 5) →
t 5 ; 0,975 ≈ 2,5706 t_{5;\,0{,}975} \approx 2{,}5706 t 5 ; 0 , 975 ≈ 2 , 5706
Mit sechs Werten hat die t-Verteilung n − 1 = 5 n - 1 = 5 n − 1 = 5 Freiheitsgrade. Der kritische Wert muss
deshalb neu bestimmt werden. Die alte Grenze 2,7764 gilt nicht mehr.
R: qt(0.975, df = 5) gibt 2,570582, also t 5 ; 0,975 ≈ 2,5706 t_{5;\,0{,}975}
\approx \mathbf{2{,}5706} t 5 ; 0 , 975 ≈ 2 , 5706 .
Warum kleiner? Mit sechs Werten ist s 6 s_6 s 6 eine etwas verlässlichere Schätzung von
σ \sigma σ als s 5 s_5 s 5 . t ^ \hat t t ^ schwankt dann etwas weniger, die t-Verteilung hat dünnere
Ränder. Im Bild ist die neue Kurve durchgezogen, die alte mit 4 Freiheitsgraden
gestrichelt. Damit an jedem Rand wieder genau 2,5 % liegen, rückt die Grenze nach innen.
Das ist ein vierter Effekt der zusätzlichen Messung. Zu n \sqrt{n} n , Zähler und
Nenner aus Schritt 13 kommt dazu: Auch der kritische Wert sinkt.
Aus Aufgabe 2 („Konfidenzintervall mit geschätzter Varianz: Kaffeepackungen“): Je
mehr Freiheitsgrade, desto ähnlicher wird die t-Verteilung der Standardnormalverteilung,
und desto näher rückt ihr 0,975-Quantil an 1,96 heran.
∣ t ^ ∣ = 3,1910 > 2,5706 |\hat t| = 3{,}1910 > 2{,}5706 ∣ t ^ ∣ = 3 , 1910 > 2 , 5706 ⇒
H 0 H_0 H 0 verwerfen
Vergleich wie in Schritt 10:
∣ t ^ ∣ = 3,1910 > 2,5706 |\hat t| = 3{,}1910 \; > \; 2{,}5706 ∣ t ^ ∣ = 3 , 1910 > 2 , 5706
Jetzt liegt t ^ \hat t t ^ im Ablehnbereich, im rechten roten Rand. Die Balken unten
zeigen es auch: Die Teststatistik ist länger als der kritische Wert.
Antwort auf (ii): Mit x 6 = 0,5 x_6 = 0{,}5 x 6 = 0 , 5 wird H 0 : μ = 0 H_0\!: \mu = 0 H 0 : μ = 0 verworfen. Damit ist μ ≠ 0 \mu
\neq 0 μ = 0 zum Niveau α = 5 % \alpha = 5\,\% α = 5 % gezeigt — mit einer Irrtumswahrscheinlichkeit von
höchstens 5 %.
Probe mit R (Ergänzung): t.test(y, mu = 0) gibt t = 3,191
bei 5 Freiheitsgraden und den p-Wert 0,0242. Er ist kleiner als α = 0,05 \alpha = 0{,}05 α = 0 , 05 —
dieselbe Entscheidung.
Hätte man noch mit der alten Grenze 2,7764 verglichen, wäre die Entscheidung hier dieselbe
gewesen, denn 3,1910 > 2,7764 3{,}1910 > 2{,}7764 3 , 1910 > 2 , 7764 . Dass das nicht bei jedem x 6 x_6 x 6 so ist, zeigt Schritt
25.
× 1,0954 \times 1{,}0954 × 1 , 0954 (
n \sqrt{n} n )
× 1,0813 \times 1{,}0813 × 1 , 0813 (
x ˉ \bar x x ˉ )
× 1,0853 \times 1{,}0853 × 1 , 0853 (
1 / s 1/s 1/ s ) ⇒
t ^ \hat t t ^ :
× 1,2857 \times 1{,}2857 × 1 , 2857
Ab hier geht es über die Aufgabe hinaus. Gefragt war ein passendes x 6 x_6 x 6 — das ist
gefunden. Die folgenden Schritte zeigen, warum 0,5 funktioniert und welche Werte es nicht
tun. Das ist die eigentliche Einsicht dieser Aufgabe.
t ^ \hat t t ^ ist ein Produkt aus drei Teilen: n \sqrt{n} n , x ˉ n \bar x_n x ˉ n und 1 s n \frac{1}{s_n} s n 1 . Die
Tabelle zeigt, um welchen Faktor jeder Teil durch x 6 = 0,5 x_6 = 0{,}5 x 6 = 0 , 5 gewachsen ist:
n \sqrt{n} n : 2,4495 / 2,2361 ≈ 1,0954 2{,}4495 / 2{,}2361 \approx 1{,}0954 2 , 4495/2 , 2361 ≈ 1 , 0954 — gut 9 % mehr.
x ˉ n \bar x_n x ˉ n : 0,3633 / 0,3360 ≈ 1,0813 0{,}3633 / 0{,}3360 \approx 1{,}0813 0 , 3633/0 , 3360 ≈ 1 , 0813 — gut 8 % mehr.
s n s_n s n im Nenner: kleiner geworden. Durch eine kleinere Zahl teilen gibt mehr, und zwar
0,3027 / 0,2789 ≈ 1,0853 0{,}3027 / 0{,}2789 \approx 1{,}0853 0 , 3027/0 , 2789 ≈ 1 , 0853 — gut 8 % mehr.
Zusammen: 3,1910 / 2,4820 ≈ 1,2857 3{,}1910 / 2{,}4820 \approx 1{,}2857 3 , 1910/2 , 4820 ≈ 1 , 2857 . Das Produkt der gerundeten Faktoren ist
1,0954 ⋅ 1,0813 ⋅ 1,0853 ≈ 1,2855 1{,}0954 \cdot 1{,}0813 \cdot 1{,}0853 \approx 1{,}2855 1 , 0954 ⋅ 1 , 0813 ⋅ 1 , 0853 ≈ 1 , 2855 ; die Abweichung kommt vom
Runden. Probe: 2,4820 ⋅ 1,2857 ≈ 3,191 2{,}4820 \cdot 1{,}2857 \approx 3{,}191 2 , 4820 ⋅ 1 , 2857 ≈ 3 , 191 .
Zusammen heben die drei Teile t ^ \hat t t ^ um fast 29 %. Dazu kommt als vierter Effekt, dass
der kritische Wert von 2,7764 auf 2,5706 sinkt (Schritt 19).
Das Bild zeigt nun t ^ \hat t t ^ für jede denkbare sechste Messung: waagerecht x 6 x_6 x 6 ,
senkrecht das zugehörige t ^ \hat t t ^ . Der hervorgehobene Punkt ist x 6 = 0,5 x_6 = 0{,}5 x 6 = 0 , 5 .
x 6 = 0,336 x_6 = 0{,}336 x 6 = 0 , 336 :
x ˉ 6 = 0,336 \bar x_6 = 0{,}336 x ˉ 6 = 0 , 336 ,
s 6 ≈ 0,2707 s_6 \approx 0{,}2707 s 6 ≈ 0 , 2707 ,
t ^ ≈ 3,0398 \hat t \approx
3{,}0398 t ^ ≈ 3 , 0398
Ein Gedankenexperiment trennt die Effekte. Man legt x 6 x_6 x 6 genau auf den alten Mittelwert:
x 6 = x ˉ 5 = 0,336 x_6 = \bar x_5 = 0{,}336 x 6 = x ˉ 5 = 0 , 336 .
Zähler: Der Mittelwert bleibt 0,336. Denn 1,68 + 0,336 6 = 2,016 6 = 0,336 \frac{1{,}68 + 0{,}336}{6} =
\frac{2{,}016}{6} = 0{,}336 6 1 , 68 + 0 , 336 = 6 2 , 016 = 0 , 336 . Ein Wert genau in der Mitte verschiebt die Mitte nicht.
Nenner: Die neue Abweichung ist 0,336 − 0,336 = 0 0{,}336 - 0{,}336 = 0 0 , 336 − 0 , 336 = 0 . Die alten Abweichungen
bleiben gleich, weil der Mittelwert gleich bleibt. Die Summe der Quadrate bleibt also
0,36652 — geteilt wird aber durch 5 statt durch 4:
s 6 2 = 0,36652 5 = 0,073304 s_6^2 = \dfrac{0{,}36652}{5} = 0{,}073304 s 6 2 = 5 0 , 36652 = 0 , 073304 , s 6 ≈ 0,270747 s_6 \approx 0{,}270747 s 6 ≈ 0 , 270747
Damit t ^ = 6 ⋅ 0,336 0,270747 ≈ 3,0398 \hat t = \sqrt{6}\cdot\dfrac{0{,}336}{0{,}270747} \approx \mathbf{3{,}0398} t ^ = 6 ⋅ 0 , 270747 0 , 336 ≈ 3 , 0398 .
Das reicht schon über 2,5706 — obwohl der Mittelwert sich gar nicht bewegt hat.
Hier wirken nur der kleinere Nenner und 6 \sqrt{6} 6 .
x 6 = 2 x_6 = 2 x 6 = 2 :
x ˉ 6 ≈ 0,6133 \bar x_6 \approx 0{,}6133 x ˉ 6 ≈ 0 , 6133 ,
s 6 ≈ 0,7313 s_6 \approx 0{,}7313 s 6 ≈ 0 , 7313 ,
t ^ ≈ 2,0544 \hat t \approx
2{,}0544 t ^ ≈ 2 , 0544
Jetzt das andere Extrem. Man könnte denken: je größer x 6 x_6 x 6 , desto größer der Mittelwert,
desto größer t ^ \hat t t ^ . Probe mit x 6 = 2 x_6 = 2 x 6 = 2 :
x ˉ 6 = 1,68 + 2 6 = 3,68 6 ≈ 0,6133 \bar x_6 = \dfrac{1{,}68 + 2}{6} = \dfrac{3{,}68}{6} \approx 0{,}6133 x ˉ 6 = 6 1 , 68 + 2 = 6 3 , 68 ≈ 0 , 6133 — fast doppelt so
groß wie 0,336.
Aber die Tabelle zeigt, was mit der Streuung passiert. Die neue Messung liegt 1,386667
über dem neuen Mittelwert. Ihr Quadrat ist 1,922844 — allein mehr als das Fünffache der
ganzen alten Summe 0,36652. Auch die alten Werte liegen jetzt weiter vom Mittelwert weg,
weil er nach oben gerutscht ist.
Die Quadrate sind wie in Schritt 16 aus den ungerundeten Abweichungen berechnet; deshalb
ergeben die angezeigten Quadrate zusammen 2,673932 statt 2,673933.
Summe der Quadrate 2,673933, geteilt durch 5, Wurzel: s 6 ≈ 0,7313 s_6 \approx 0{,}7313 s 6 ≈ 0 , 7313 . Und damit
t ^ = 6 ⋅ 0,613333 0,731291 ≈ 2,0544 \hat t = \sqrt{6}\cdot\dfrac{0{,}613333}{0{,}731291} \approx \mathbf{2{,}0544} t ^ = 6 ⋅ 0 , 731291 0 , 613333 ≈ 2 , 0544 — kleiner
als in (i) und weit unter 2,5706.
Der Grund: Der Mittelwert wächst um den Faktor 1,83, die Standardabweichung um den
Faktor 2,42. Der Nenner wächst schneller als der Zähler. Beim Mittelwert zählt x 6 x_6 x 6 nur
mit einem Sechstel. Bei der Streuung geht sein Abstand zum Mittelwert
quadriert ein.
Aus Aufgabe 3 („Ein Ausreißer im Konfidenzintervall: Mehlpackungen“): Dort machte
ein einzelner weit entfernter Wert (528 g) die Standardabweichung deutlich größer: 10,43 g
mit ihm, 6,56 g ohne ihn. Hier passiert dasselbe, nur umgekehrt: Man fügt einen solchen
Wert hinzu.
t ^ > 2,5706 \hat t > 2{,}5706 t ^ > 2 , 5706 genau für
0,1161 < x 6 < 1,2749 0{,}1161 < x_6 < 1{,}2749 0 , 1161 < x 6 < 1 , 2749
Rechnet man t ^ \hat t t ^ für sehr viele x 6 x_6 x 6 aus, entsteht die Kurve im Bild. Sie steigt,
erreicht einen höchsten Wert und fällt wieder.
Links: x 6 x_6 x 6 zu klein. Der Mittelwert sinkt, und ein Wert weit unter 0,336 bläht
zugleich die Streuung auf. Bei x 6 = 0 x_6 = 0 x 6 = 0 ist t ^ = 2,2597 \hat t = 2{,}2597 t ^ = 2 , 2597 . Für jedes x 6 ≤ 0 x_6 \le 0 x 6 ≤ 0
bleibt t ^ \hat t t ^ höchstens so groß. Ein negativer Wert hilft also nie.
Mitte: Der höchste Wert ist t ^ ≈ 3,20 \hat t \approx 3{,}20 t ^ ≈ 3 , 20 bei x 6 ≈ 0,55 x_6 \approx 0{,}55 x 6 ≈ 0 , 55 . Die
Wahl 0,5 der Musterlösung liegt fast dort.
Rechts: x 6 x_6 x 6 zu groß. Die Streuung wächst schneller als der Mittelwert (Schritt
23). Schon bei x 6 = 1,3 x_6 = 1{,}3 x 6 = 1 , 3 reicht es nicht mehr. Für sehr große x 6 x_6 x 6 nähert sich
t ^ \hat t t ^ sogar der 1.
Wo die Kurve über der roten Linie 2,5706 liegt, ist sie grün hinterlegt. Das sind genau
die sechsten Messungen mit
0,1161 < x 6 < 1,2749 0{,}1161 < x_6 < 1{,}2749 0 , 1161 < x 6 < 1 , 2749 (auf vier Stellen gerundet).
Mit R (Ergänzung): Die Funktion t_dach rechnet t ^ \hat t t ^
für ein beliebiges x 6 x_6 x 6 . sapply wendet sie auf mehrere Werte
an. uniroot sucht die Stelle zwischen zwei Grenzen, an der t ^ − 2,5706 = 0 \hat
t - 2{,}5706 = 0 t ^ − 2 , 5706 = 0 wird, also wo die Kurve die rote Linie schneidet. Die Grenzen (0 bis 0,4
und 0,5 bis 2) sind aus dem Bild abgelesen: In jedem dieser Stücke schneidet die Kurve die
Linie genau einmal. tol = 1e-8 verlangt eine hohe Genauigkeit.
mit 2,7764: nur
0,1998 < x 6 < 1,0732 0{,}1998 < x_6 < 1{,}0732 0 , 1998 < x 6 < 1 , 0732 ;
x 6 = 1,2 x_6 = 1{,}2 x 6 = 1 , 2 :
t ^ ≈ 2,6442 \hat t \approx
2{,}6442 t ^ ≈ 2 , 6442
Schritt 19 hat gezeigt: Mit sechs Werten sinkt der kritische Wert von 2,7764 auf 2,5706.
Wie viel das ausmacht, zeigt die gestrichelte Linie im Bild.
Läge der kritische Wert noch bei 2,7764, müsste die Kurve höher hinaus. Der passende
Bereich wäre dann nur
0,1998 < x 6 < 1,0732 0{,}1998 < x_6 < 1{,}0732 0 , 1998 < x 6 < 1 , 0732
statt 0,1161 0{,}1161 0 , 1161 bis 1,2749 1{,}2749 1 , 2749 .
Beispiel x 6 = 1,2 x_6 = 1{,}2 x 6 = 1 , 2 : t ^ ≈ 2,6442 \hat t \approx 2{,}6442 t ^ ≈ 2 , 6442 . Das liegt über 2,5706, aber
unter 2,7764. Mit diesem x 6 x_6 x 6 wird H 0 H_0 H 0 nur deshalb verworfen, weil der sechste Wert
auch einen Freiheitsgrad mehr bringt.
Merke: Eine zusätzliche Messung wirkt auf den t-Test vierfach:
n \sqrt{n} n wächst,
der Mittelwert ändert sich, die Streuung ändert sich, und der kritische Wert sinkt. Der
erste und der letzte helfen immer; ob Mittelwert und Streuung helfen, hängt vom Wert ab.
Daten „passend machen“ ⇒
α \alpha α gilt nicht mehr
Die Aufgabe ist ein Gedankenexperiment : Sie fragt, wie t ^ \hat t t ^ auf einen
zusätzlichen Wert reagiert. In einer echten Untersuchung darf man Messwerte nicht
aussuchen.
Warum nicht? Das Signifikanzniveau verspricht: Wenn H 0 H_0 H 0 stimmt, wird H 0 H_0 H 0
höchstens mit Wahrscheinlichkeit 5 % verworfen. Dieses Versprechen gilt nur, wenn die
Daten so entstehen, wie das Modell es annimmt — zufällig und unabhängig. Wer so lange
Werte hinzufügt, weglässt oder „passend“ wählt, bis t ^ \hat t t ^ über der Grenze liegt,
verwirft H 0 H_0 H 0 viel öfter als in 5 % der Fälle. Das Ergebnis sagt dann nichts mehr.
Das Skript sagt dazu: α \alpha α wird vor dem Test gewählt und nicht mehr verändert.
Und man darf Tests nicht so lange durchprobieren, bis das gewünschte Ergebnis herauskommt.
Erlaubt ist dagegen, vorher zu planen, wie viele Messungen man braucht, und dann
alle zu verwenden, die dabei herauskommen.
Teil
Rechnung
Wert
(i) t ^ \hat t t ^
5 ⋅ 0,336 / 0,302704 \sqrt{5}\cdot 0{,}336 / 0{,}302704 5 ⋅ 0 , 336/0 , 302704
2,4820
(i) Grenze
qt(0.975, df = 4)
2,7764
(i) Entscheidung
2,4820 < 2,7764 2{,}4820 < 2{,}7764 2 , 4820 < 2 , 7764
nicht verwerfen
(ii) t ^ \hat t t ^ , x 6 = 0,5 x_6 = 0{,}5 x 6 = 0 , 5
6 ⋅ 0,363333 / 0,278903 \sqrt{6}\cdot 0{,}363333 / 0{,}278903 6 ⋅ 0 , 363333/0 , 278903
3,1910
(ii) Grenze
qt(0.975, df = 5)
2,5706
(ii) Entscheidung
3,1910 > 2,5706 3{,}1910 > 2{,}5706 3 , 1910 > 2 , 5706
verwerfen
In Worten: Mit den fünf Messwerten kann man zum Niveau 5 % nicht zeigen, dass der
Erwartungswert von 0 verschieden ist. Das heißt nicht, dass er 0 ist — die Daten reichen nur
nicht. Mit einer sechsten Messung x 6 = 0,5 x_6 = 0{,}5 x 6 = 0 , 5 reicht es: Dann ist μ ≠ 0 \mu \neq 0 μ = 0 zum Niveau
5 % gezeigt.
Die Einsicht aus der Ergänzung: Nicht jeder zusätzliche Wert hilft. Es funktionieren
nur x 6 x_6 x 6 zwischen etwa 0,1161 und 1,2749. Ein zu großer Wert hebt zwar den Mittelwert,
bläht aber die Streuung stärker auf.
Rückblick — so geht ein zweiseitiger t-Test: Vermutung „
μ ≠ μ 0 \mu \neq \mu_0 μ = μ 0 “ in
H A H_A H A ,
Gegenteil in
H 0 H_0 H 0 .
σ \sigma σ unbekannt, also t-Test.
x ˉ n \bar x_n x ˉ n und
s n s_n s n berechnen,
t ^ = n ⋅ x ˉ n − μ 0 s n \hat t
= \sqrt{n}\cdot\frac{\bar x_n - \mu_0}{s_n} t ^ = n ⋅ s n x ˉ n − μ 0 bilden. Kritischer Wert
t n − 1 ; 1 − α / 2 t_{n-1;\,1-\alpha/2} t n − 1 ; 1 − α /2
mit
qt(1 - alpha/2, df = n - 1).
H 0 H_0 H 0 verwerfen, falls
∣ t ^ ∣ |\hat t| ∣ t ^ ∣
größer ist.