← Übersicht ESTO
ESTO · Übungsblatt 6 · Aufgabe 2

Konfidenzintervall mit geschätzter Varianz: Kaffeepackungen

Zwölf Kaffeepackungen wurden gewogen. Gesucht ist ein 95-%-Konfidenzintervall für den mittleren Inhalt aller Packungen. Anders als in Aufgabe 1 kennt man die Streuung σ\sigma nicht, man muss sie aus denselben zwölf Werten schätzen. Deshalb reicht der Faktor 1,96 nicht mehr: An seine Stelle tritt ein Quantil der t-Verteilung, und das Intervall wird etwas breiter. Rechts steht der ganze Lösungsweg, links die Erklärung zum aktuellen Schritt. Mit Weiter geht es Schritt für Schritt voran. Ein Klick auf einen Schritt springt direkt dorthin.

Schritt 0 Die Aufgabe

Die Füllmengen in Kaffeepackungen können als normalverteilt angenommen werden. Eine Stichprobe vom Umfang n=12n = 12 ergibt folgende Füllmengen:

434.5 445.3 457.5 449.2 454.5 436.3
443.3 445.3 435.8 434.8 457.3 448.1

Bestimmen Sie ein 95 %-Konfidenzintervall für den mittleren Packungsinhalt μ\mu.

Zur Einheit: Die Aufgabe nennt keine Einheit. Die Werte um 445 passen zu Gramm (in Blatt 4, Aufgabe 5 sollten Kaffeepackungen 500 g enthalten). Wir rechnen deshalb in Gramm und schreiben die Zahlen mit Komma: 434,5 g usw.
Hinweis zur Musterlösung: Das Ergebnis stimmt. Dort steht als untere Grenze 439,7316; R rechnet ohne Runden 439,7317 (Schritt 18). Die vierte Nachkommastelle kommt vom Runden der Zwischenergebnisse, auf zwei Stellen sind beide 439,73439{,}73 g. Skript und Musterlösung schreiben das Quantil allgemein als tn−1, 1−α/2t_{n-1,\,1-\alpha/2} mit Komma. Hier steht überall ein Semikolon, weil das Komma Dezimalzeichen ist. Bei den Zahlen schreibt die Musterlösung selbst t11; 0.975t_{11;\,0.975}.

(1) Mittelwert und Standardabweichung von Hand

die Tabelle wie in Blatt 5

Schritt 1 Die zwölf Füllmengen als Stichprobe

Die Beobachtungen, durchnummeriert mit i=1,…,12i = 1, \dots, 12 (in g)
x1=434,5,x2=445,3,x3=457,5,x4=449,2,x5=454,5,x6=436,3,x_1 = 434{,}5, \quad x_2 = 445{,}3, \quad x_3 = 457{,}5, \quad x_4 = 449{,}2, \quad x_5 = 454{,}5, \quad x_6 = 436{,}3,
x7=443,3,x8=445,3,x9=435,8,x10=434,8,x11=457,3,x12=448,1x_7 = 443{,}3, \quad x_8 = 445{,}3, \quad x_9 = 435{,}8, \quad x_{10} = 434{,}8, \quad x_{11} = 457{,}3, \quad x_{12} = 448{,}1
Stichprobenumfang
n=12n = 12
Das Modell der Aufgabe: XiX_i = Füllmenge der ii-ten Packung, unabhängig und identisch verteilt
X1,…,X12∼N(μ, σ2),μ und σ2 unbekanntX_1, \dots, X_{12} \sim N(\mu,\,\sigma^2), \qquad \mu \text{ und } \sigma^2 \text{ unbekannt}
x <- c(434.5, 445.3, 457.5, 449.2, 454.5, 436.3,
 443.3, 445.3, 435.8, 434.8, 457.3, 448.1)

Schritt 2 Der Stichprobenmittelwert: 445,16 g

Alle zwölf Füllmengen addieren
∑i=112xi=434,5+445,3+457,5+449,2+454,5+436,3\sum_{i=1}^{12} x_i = 434{,}5 + 445{,}3 + 457{,}5 + 449{,}2 + 454{,}5 + 436{,}3
+443,3+445,3+435,8+434,8+457,3+448,1=5.341,9\qquad + 443{,}3 + 445{,}3 + 435{,}8 + 434{,}8 + 457{,}3 + 448{,}1 = 5.341{,}9
Stichprobenmittelwert: Summe geteilt durch die Anzahl
xˉn=1n∑i=1nxi\bar x_n = \frac{1}{n} \sum_{i=1}^{n} x_i
Mit n=12n = 12 eingesetzt, auf vier Nachkommastellen gerundet
xˉ12=5.341,912=445,158333…≈445,1583 g\bar x_{12} = \frac{5.341{,}9}{12} = 445{,}158333\ldots \approx 445{,}1583 \text{ g}
mean(x)
#[1] 445.1583

Schritt 3 Die Abweichungen vom Mittelwert

Abweichung der ii-ten Packung: ihre Füllmenge minus den Mittelwert
xi−xˉ12=xi−445,1583x_i - \bar x_{12} = x_i - 445{,}1583
Nr. Füllmenge in g Abweichung in g
ii xix_i xi−xˉ12x_i - \bar x_{12}
1 434,5 −10,6583
2 445,3 +0,1417
3 457,5 +12,3417
4 449,2 +4,0417
5 454,5 +9,3417
6 436,3 −8,8583
7 443,3 −1,8583
8 445,3 +0,1417
9 435,8 −9,3583
10 434,8 −10,3583
11 457,3 +12,1417
12 448,1 +2,9417
Σ\Sigma 5.341,9 0,0004
Probe: Plus-Abweichungen gegen Minus-Abweichungen
(0,1417+12,3417+4,0417+9,3417+0,1417+12,1417+2,9417)=41,0919(0{,}1417 + 12{,}3417 + 4{,}0417 + 9{,}3417 + 0{,}1417 + 12{,}1417 + 2{,}9417) = 41{,}0919
(10,6583+8,8583+1,8583+9,3583+10,3583)=41,0915(10{,}6583 + 8{,}8583 + 1{,}8583 + 9{,}3583 + 10{,}3583) = 41{,}0915
41,0919−41,0915=0,000441{,}0919 - 41{,}0915 = 0{,}0004
Warum nicht genau 0: der Mittelwert wurde gerundet, jede Abweichung ist um 0,0000333…0{,}0000333\ldots zu groß
5.341,9−12⋅445,1583=5.341,9−5.341,8996=0,00045.341{,}9 - 12 \cdot 445{,}1583 = 5.341{,}9 - 5.341{,}8996 = 0{,}0004

Schritt 4 Die Abweichungen quadrieren und addieren

Jede Abweichung mit sich selbst malnehmen (in g²), z. B.
(−10,6583)2=113,5994,(+12,3417)2=152,3176(-10{,}6583)^2 = 113{,}5994, \qquad (+12{,}3417)^2 = 152{,}3176
Nr. Füllmenge in g Abweichung in g Quadrat in g²
ii xix_i xi−xˉ12x_i - \bar x_{12} (xi−xˉ12)2(x_i - \bar x_{12})^2
1 434,5 −10,6583 113,5994
2 445,3 +0,1417 0,0201
3 457,5 +12,3417 152,3176
4 449,2 +4,0417 16,3353
5 454,5 +9,3417 87,2674
6 436,3 −8,8583 78,4695
7 443,3 −1,8583 3,4533
8 445,3 +0,1417 0,0201
9 435,8 −9,3583 87,5778
10 434,8 −10,3583 107,2944
11 457,3 +12,1417 147,4209
12 448,1 +2,9417 8,6536
Σ\Sigma 5.341,9 0,0004 802,4294
Die Summe der Quadrate
∑i=112(xi−xˉ12)2=802,4294 g2\sum_{i=1}^{12} (x_i - \bar x_{12})^2 = 802{,}4294 \text{ g}^2

Schritt 5 Die Stichprobenvarianz: 72,95 g²

Stichprobenvarianz: Summe der Quadrate geteilt durch n−1n - 1
sn2=1n−1∑i=1n(xi−xˉn)2s_n^2 = \frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar x_n)^2
n=12n = 12 und die Summe aus Schritt 4 einsetzen, auf vier Nachkommastellen gerundet
s122=112−1⋅802,4294=802,429411=72,94813…≈72,9481 g2s_{12}^2 = \frac{1}{12-1} \cdot 802{,}4294 = \frac{802{,}4294}{11} = 72{,}94813\ldots \approx 72{,}9481 \text{ g}^2
var(x)
#[1] 72.94811

Schritt 6 Die Standardabweichung: 8,54 g

Stichproben-Standardabweichung: die Wurzel aus der Stichprobenvarianz
sn=sn2s_n = \sqrt{s_n^2}
Eingesetzt, auf vier Nachkommastellen gerundet
s12=72,9481=8,540966…≈8,5410 gs_{12} = \sqrt{72{,}9481} = 8{,}540966\ldots \approx 8{,}5410 \text{ g}
sd(x)
#[1] 8.540966

(2) Warum nicht 1,96? Die t-Verteilung

was sich ändert, wenn σ geschätzt wird

Schritt 7 Das Rezept aus Aufgabe 1 braucht σ

Bei bekanntem σ\sigma: Xˉn\bar X_n standardisiert ist standardnormalverteilt
Xˉn∼N(μ, σ2n)⟹Xˉn−μσ/n∼N(0, 1)\bar X_n \sim N\Big(\mu,\,\frac{\sigma^2}{n}\Big) \quad \Longrightarrow \quad \frac{\bar X_n - \mu}{\sigma/\sqrt{n}} \sim N(0,\,1)
95 % der Fläche von N(0, 1)N(0,\,1) liegen zwischen −q0,975-q_{0{,}975} und q0,975q_{0{,}975}
q0,975=1,959964≈1,96q_{0{,}975} = 1{,}959964 \approx 1{,}96
Das (1 − α)-Konfidenzintervall aus Aufgabe 1
I=[xˉn−σn⋅q1−α/2;  xˉn+σn⋅q1−α/2]I = \Big[\bar x_n - \frac{\sigma}{\sqrt{n}} \cdot q_{1-\alpha/2};\; \bar x_n + \frac{\sigma}{\sqrt{n}} \cdot q_{1-\alpha/2}\Big]
Hier fehlt eine Zutat
σ=  ?\sigma = \;?

Schritt 8 σ durch s₁₂ ersetzen: 1,96 reicht nicht mehr

Naheliegend: die unbekannte Zahl σ\sigma durch die geschätzte Standardabweichung ersetzen (vor dem Wiegen die Zufallsgröße SnS_n, gemessen s12≈8,5410s_{12} \approx 8{,}5410 g)
Xˉn−μσ/n⟶Xˉn−μSn/n\frac{\bar X_n - \mu}{\sigma/\sqrt{n}} \quad \longrightarrow \quad \frac{\bar X_n - \mu}{S_n/\sqrt{n}}
Links schwankt nur der Zähler. Rechts schwanken Zähler und Nenner
σ festgegenu¨berSn von Stichprobe zu Stichprobe verschieden\sigma \text{ fest} \qquad \text{gegenüber} \qquad S_n \text{ von Stichprobe zu Stichprobe verschieden}
Fällt SnS_n zufällig zu klein aus, wird der Bruch groß
Sn<σ⟹∣Xˉn−μSn/n∣>∣Xˉn−μσ/n∣S_n < \sigma \quad \Longrightarrow \quad \Big|\frac{\bar X_n - \mu}{S_n/\sqrt{n}}\Big| > \Big|\frac{\bar X_n - \mu}{\sigma/\sqrt{n}}\Big|

Schritt 9 Die t-Verteilung: breitere Ränder

Satz (Skript, Fall 2): Bei normalverteilten Daten ist der Bruch mit SnS_n t-verteilt
Xˉn−μSn/n∼tn−1\frac{\bar X_n - \mu}{S_n/\sqrt{n}} \sim t_{n-1}
Die Form im Vergleich zu N(0, 1)N(0,\,1)
symmetrisch um 0,niedrigerer Gipfel,mehr Fla¨che an den Ra¨ndern\text{symmetrisch um } 0, \quad \text{niedrigerer Gipfel}, \quad \text{mehr Fläche an den Rändern}
Höhe der Kurven in der Mitte (Dichte bei 0)
N(0, 1): 0,3989t-Verteilung, 11 Freiheitsgrade: 0,3900N(0,\,1): \ 0{,}3989 \qquad t\text{-Verteilung, 11 Freiheitsgrade}: \ 0{,}3900

Schritt 10 Freiheitsgrade: 11 = n − 1

Die t-Verteilung hat einen Parameter: die Zahl der Freiheitsgrade
Freiheitsgrade=n−1=12−1=11\text{Freiheitsgrade} = n - 1 = 12 - 1 = 11
Dieselbe Zahl wie im Nenner von s122s_{12}^2 (Schritt 5)
s122=802,429411s_{12}^2 = \frac{802{,}4294}{\mathbf{11}}
Warum 11: Die Abweichungen ergeben zusammen 0, also liegt die zwölfte fest, wenn elf bekannt sind
x12−xˉ12=−[(x1−xˉ12)+⋯+(x11−xˉ12)]x_{12} - \bar x_{12} = -\big[(x_1 - \bar x_{12}) + \dots + (x_{11} - \bar x_{12})\big]

Schritt 11 Das Quantil 2,201 mit qt

Irrtumswahrscheinlichkeit α=0,05\alpha = 0{,}05, je zur Hälfte auf beide Ränder verteilt
α2=0,052=0,025⟹1−α2=0,975\frac{\alpha}{2} = \frac{0{,}05}{2} = 0{,}025 \qquad \Longrightarrow \qquad 1 - \frac{\alpha}{2} = 0{,}975
Gesucht: die Grenze, links von der 97,5 % der Fläche der t-Verteilung mit 11 Freiheitsgraden liegen
tn−1; 1−α/2=t11; 0,975t_{n-1;\,1-\alpha/2} = t_{11;\,0{,}975}
qt(0.975, df = 11)
#[1] 2.200985
Wegen der Symmetrie liegt die linke Grenze bei minus demselben Wert
t11; 0,975=2,200985≈2,201,t11; 0,025=−2,200985t_{11;\,0{,}975} = 2{,}200985 \approx 2{,}201, \qquad t_{11;\,0{,}025} = -2{,}200985

Schritt 12 Je größer n, desto näher an N(0, 1)

Stichprobenumfang nn Freiheitsgrade n−1n - 1 0,975-Quantil tn−1; 0,975t_{n-1;\,0{,}975}
3 2 4,303
5 4 2,776
12 (diese Aufgabe) 11 2,201
30 29 2,045
101 100 1,984
σ\sigma bekannt: N(0, 1)N(0,\,1) — 1,960
qt(0.975, df = c(2, 4, 11, 29, 100))
#[1] 4.302653 2.776445 2.200985 2.045230 1.983972

(3) Das Konfidenzintervall

Formel, Zahlen, Deutung, Probe

Schritt 13 Die Formel bei unbekanntem σ

Ausgangspunkt: 95 % der Fläche von t11t_{11} liegen zwischen −t11; 0,975-t_{11;\,0{,}975} und t11; 0,975t_{11;\,0{,}975} (kurz tt)
P(−t≤Xˉn−μSn/n≤t)=0,95P\Big(-t \le \frac{\bar X_n - \mu}{S_n/\sqrt{n}} \le t\Big) = 0{,}95
Alle drei Teile mit Sn/nS_n/\sqrt{n} malnehmen (positiv, die Zeichen bleiben)
−t⋅Snn≤Xˉn−μ≤t⋅Snn-t \cdot \frac{S_n}{\sqrt{n}} \le \bar X_n - \mu \le t \cdot \frac{S_n}{\sqrt{n}}
Xˉn\bar X_n abziehen
−Xˉn−t⋅Snn≤−μ≤−Xˉn+t⋅Snn-\bar X_n - t \cdot \frac{S_n}{\sqrt{n}} \le -\mu \le -\bar X_n + t \cdot \frac{S_n}{\sqrt{n}}
Mit −1-1 malnehmen (die Zeichen drehen sich um) und von rechts nach links lesen
Xˉn−t⋅Snn≤μ≤Xˉn+t⋅Snn\bar X_n - t \cdot \frac{S_n}{\sqrt{n}} \le \mu \le \bar X_n + t \cdot \frac{S_n}{\sqrt{n}}
Das (1 − α)-Konfidenzintervall bei unbekanntem σ\sigma (Skript: Fall 2), mit den gemessenen Zahlen xˉn\bar x_n und sns_n
I=[xˉn−snn⋅tn−1; 1−α/2;  xˉn+snn⋅tn−1; 1−α/2]I = \Big[\bar x_n - \frac{s_n}{\sqrt{n}} \cdot t_{n-1;\,1-\alpha/2};\; \bar x_n + \frac{s_n}{\sqrt{n}} \cdot t_{n-1;\,1-\alpha/2}\Big]

Schritt 14 Die Streuung des Mittelwerts: 2,47 g

Die Wurzel aus dem Stichprobenumfang
12=3,464102…≈3,4641\sqrt{12} = 3{,}464102\ldots \approx 3{,}4641
s12s_{12} aus Schritt 6 durch 12\sqrt{12} teilen, auf vier Nachkommastellen gerundet
s1212=8,54103,4641=2,46557…≈2,4656 g\frac{s_{12}}{\sqrt{12}} = \frac{8{,}5410}{3{,}4641} = 2{,}46557\ldots \approx 2{,}4656 \text{ g}

Schritt 15 Die halbe Breite: 5,43 g

Das Quantil aus Schritt 11 mal die Streuung des Mittelwerts aus Schritt 14
s1212⋅t11; 0,975=2,4656⋅2,200985=5,42675…≈5,4267 g\frac{s_{12}}{\sqrt{12}} \cdot t_{11;\,0{,}975} = 2{,}4656 \cdot 2{,}200985 = 5{,}42675\ldots \approx 5{,}4267 \text{ g}

Schritt 16 Die Grenzen: 439,73 g bis 450,59 g

Untere Grenze: Mittelwert minus halbe Breite
I1=445,1583−5,4267=439,7316 gI_1 = 445{,}1583 - 5{,}4267 = 439{,}7316 \text{ g}
Obere Grenze: Mittelwert plus halbe Breite
I2=445,1583+5,4267=450,5850 gI_2 = 445{,}1583 + 5{,}4267 = 450{,}5850 \text{ g}
Auf zwei Nachkommastellen gerundet
I=[I1; I2]≈[439,73; 450,59] gI = [I_1;\, I_2] \approx [439{,}73;\, 450{,}59] \text{ g}
Länge des Intervalls: zweimal die halbe Breite
L=I2−I1=450,5850−439,7316=10,8534≈10,85 gL = I_2 - I_1 = 450{,}5850 - 439{,}7316 = 10{,}8534 \approx 10{,}85 \text{ g}

Schritt 17 Was das Intervall bedeutet

Richtig: Das Verfahren trifft bei 95 % aller Stichproben
Von 100 Stichproben mit je 12 Packungen liefern im Mittel 95 ein Intervall, das μ entha¨lt.\text{Von 100 Stichproben mit je 12 Packungen liefern im Mittel 95 ein Intervall, das } \mu \text{ enthält.}
Fest ist μ\mu, zufällig sind die Grenzen: sie hängen von xˉ12\bar x_{12} und s12s_{12} ab
μ fest, aber unbekanntI1,I2 a¨ndern sich mit der Stichprobe\mu \text{ fest, aber unbekannt} \qquad I_1, I_2 \text{ ändern sich mit der Stichprobe}
Falsch: „μ\mu liegt mit 95 % Wahrscheinlichkeit in [439,73; 450,59][439{,}73;\, 450{,}59]“
Fu¨r dieses eine Intervall gilt: μ liegt darin oder nicht.\text{Für dieses eine Intervall gilt: } \mu \text{ liegt darin oder nicht.}

Schritt 18 Probe mit R: t.test

t.test(x)$conf.int
#[1] 439.7317 450.5850
#attr(,"conf.level")
#[1] 0.95
Vergleich mit Schritt 16
439,7317≈439,7316,450,5850=450,5850✓439{,}7317 \approx 439{,}7316, \qquad 450{,}5850 = 450{,}5850 \quad \checkmark
Der Unterschied in der vierten Nachkommastelle kommt vom Runden: R rechnet mit
xˉ12=445,158333…,halbe Breite=5,426671…\bar x_{12} = 445{,}158333\ldots, \qquad \text{halbe Breite} = 5{,}426671\ldots
445,158333−5,426671=439,731662≈439,7317445{,}158333 - 5{,}426671 = 439{,}731662 \approx 439{,}7317

Schritt 19 Ergänzung: Mit 1,96 wäre es zu schmal

Ergänzung — für die Lösung nicht nötig. Sie zeigt, was der Fehler „1,96 statt 2,201“ anrichtet.

Halbe Breite mit dem Quantil der Normalverteilung
2,4656⋅1,96=4,8326 g2{,}4656 \cdot 1{,}96 = 4{,}8326 \text{ g}
Das zu schmale Intervall und seine Länge
[445,1583−4,8326;  445,1583+4,8326]=[440,3257; 449,9909]≈[440,33; 449,99] g[445{,}1583 - 4{,}8326;\; 445{,}1583 + 4{,}8326] = [440{,}3257;\, 449{,}9909] \approx [440{,}33;\, 449{,}99] \text{ g}
L=2⋅4,8326=9,6652≈9,67 gstatt 10,85 gL = 2 \cdot 4{,}8326 = 9{,}6652 \approx 9{,}67 \text{ g} \qquad \text{statt } 10{,}85 \text{ g}
Wie oft läge ein t-verteilter Wert (11 Freiheitsgrade) außerhalb von ±1,96?
2⋅P(t11<−1,96)≈0,0758≈7,6 %statt 5 %2 \cdot P(t_{11} < -1{,}96) \approx 0{,}0758 \approx 7{,}6\,\% \qquad \text{statt } 5\,\%
2 * pt(-1.96, df = 11)
#[1] 0.07581443

Schritt 20 Ergebnis

✓Stichprobe: xˉ12≈445,16\bar x_{12} \approx \mathbf{445{,}16} g, s122≈72,95s_{12}^2 \approx 72{,}95 g², s12≈8,54s_{12} \approx \mathbf{8{,}54} g
✓σ\sigma unbekannt, also t-Verteilung mit n−1=11n - 1 = 11 Freiheitsgraden: t11; 0,975≈2,201t_{11;\,0{,}975} \approx \mathbf{2{,}201} statt 1,96
✓95-%-Konfidenzintervall für den mittleren Packungsinhalt μ\mu: I≈[439,73; 450,59]I \approx \mathbf{[439{,}73;\, 450{,}59]} g, Länge L≈10,85L \approx 10{,}85 g

Proben: R liefert mit t.test(x)$conf.int dieselben Grenzen. Die Mitte des Intervalls ist xˉ12\bar x_{12}: (439,7316+450,5850):2=445,1583(439{,}7316 + 450{,}5850) : 2 = 445{,}1583. Das Intervall ist viel schmaler als der Bereich der Daten (434,5 bis 457,5 g), weil es den Mittelwert eingrenzt und nicht einzelne Packungen.

Typische Fehler: 1,96 statt 2,201 nehmen (Intervall zu schmal). Mit n=12n = 12 statt n−1=11n - 1 = 11 Freiheitsgraden rechnen (qt(0.975, df = 12) gibt 2,1788). In qt 0.95 statt 0.975 eingeben (gibt 1,7959). s12s_{12} nicht durch 12\sqrt{12} teilen (halbe Breite 18,80 statt 5,43 g). Die Varianz 72,95 statt der Standardabweichung 8,54 einsetzen.