← Übersicht ESTO
ESTO · Übungsblatt 8 · Aufgabe 3

Lineare Regression: Sauerstoff in warmem Wasser

Je wärmer Wasser ist, desto weniger Sauerstoff löst sich darin. Für zwölf Temperaturen wurde gemessen, wie viel. Die Aufgabe: diesen Zusammenhang durch eine Gleichung beschreiben, erst durch eine Gerade, dann durch eine Parabel, und entscheiden, welche Gleichung man nehmen sollte. Das Werkzeug dafür heißt lineare Regression. Hier wird sie von Grund auf erklärt: das Modell, die Methode der kleinsten Quadrate, die Rechnung von Hand, das Bestimmtheitsmaß R2R^2 und das Lesen der Ausgabe von R. Rechts steht der ganze Lösungsweg, links die Erklärung zum aktuellen Schritt. Mit → geht es Schritt für Schritt voran. Ein Klick auf einen Schritt springt direkt dorthin.

Schritt 0 Die Aufgabe

Für 12 verschiedene Wassertemperaturen xx (in °C) wurde die Löslichkeit yy von Sauerstoff in Wasser (in g O₂/100 g H₂O) gemessen:

Temperatur xx Löslichkeit yy
15 0,0048
20 0,0043
25 0,0039
30 0,0036
35 0,0033
40 0,0031
45 0,0029
50 0,0027
60 0,0023
70 0,0019
80 0,0014
90 0,0008
  1. Beschreiben Sie die Abhängigkeit der Löslichkeit von der Temperatur mit Hilfe von linearer Regression und bewerten Sie die Modellgüte.
  2. Sagen Sie mit dem Modell die Löslichkeit bei einer Temperatur von 55 °C vorher.
  3. Beschreiben Sie die Abhängigkeit der Löslichkeit von der Temperatur mit Hilfe eines Regressionspolynoms 2. Grades und bewerten Sie die Modellgüte. Welches Modell würden Sie wählen?
Zur Musterlösung: Gerade, Vorhersage und Modellwahl stimmen. Drei Stellen weichen ab. (1) Dort heißt R2≈0,9829R^2 \approx 0{,}9829 das Bestimmtheitsmaß. Das ist aber das adjustierte R2R^2 (Adjusted R-squared). Das Bestimmtheitsmaß nach der Formel des Skripts ist R2≈0,9844R^2 \approx 0{,}9844: 98,4 % der Streuung sind erklärt, nicht 98,3 % (Schritte 17 und 21). An der Bewertung „sehr hoch“ ändert das nichts. (2) Die Parabel y^≈0,0029167−0,0038830 x+0,0002817 x2\hat y \approx 0{,}0029167 - 0{,}0038830\,x + 0{,}0002817\,x^2 ist falsch abgelesen. Die Zahlen aus poly(x, 2) gehören nicht zu xx und x2x^2. Setzt man x=55x = 55 ein, kommt 0,64150{,}6415 heraus, über 130-mal so viel wie der größte Messwert. Richtig ist y^≈0,005543−0,00006596 x+0,0000001668 x2\hat y \approx 0{,}005543 - 0{,}00006596\,x + 0{,}0000001668\,x^2 (Schritt 27). R2R^2 und pp-Wert sind davon nicht betroffen; die Wahl des linearen Modells bleibt richtig. (3) Im Befehl zur Vorhersage steht predict(m1, …); das Modell heißt dort aber fit (Schritt 23).

(i) und (ii) Die Regressionsgerade

Modell, Rechnung von Hand, Modellgüte, R, Vorhersage

Schritt 1 Zwölf Messpaare und eine handliche Einheit

Messung i=1,…,12i = 1, \dots, 12: Temperatur xix_i und Löslichkeit yiy_i gehören zusammen
(x1,y1)=(15; 0,0048),(x2,y2)=(20; 0,0043),…,(x12,y12)=(90; 0,0008)(x_1, y_1) = (15;\ 0{,}0048), \quad (x_2, y_2) = (20;\ 0{,}0043), \quad \dots, \quad (x_{12}, y_{12}) = (90;\ 0{,}0008)
Anzahl der Paare
n=12n = 12
Die yy-Werte in Zehntausendsteln schreiben: 10−4=0,000110^{-4} = 0{,}0001
y1=0,0048=48⋅0,0001=48⋅10−4y_1 = 0{,}0048 = 48 \cdot 0{,}0001 = 48 \cdot 10^{-4}
Messung Temperatur in °C Löslichkeit Löslichkeit in 10−410^{-4}
ii xix_i yiy_i yiy_i
1 15 0,0048 48
2 20 0,0043 43
3 25 0,0039 39
4 30 0,0036 36
5 35 0,0033 33
6 40 0,0031 31
7 45 0,0029 29
8 50 0,0027 27
9 60 0,0023 23
10 70 0,0019 19
11 80 0,0014 14
12 90 0,0008 8

Schritt 2 Unabhängige und abhängige Variable

Unabhängige Variable: wird vorgegeben (im Versuch eingestellt)
x=Temperatur des Wassersx = \text{Temperatur des Wassers}
Abhängige Variable: wird gemessen und soll erklärt werden
y=Lo¨slichkeit von Sauerstoffy = \text{Löslichkeit von Sauerstoff}
Gesucht: eine Gleichung, die yy aus xx berechnet
y≈f(x)y \approx f(x)

Schritt 3 Das Streudiagramm: die Punkte fallen fast auf einer Geraden

Von der kältesten zur wärmsten Messung
x:15→90 °C,y:48⋅10−4→8⋅10−4x: 15 \to 90 \text{ °C}, \qquad y: 48 \cdot 10^{-4} \to 8 \cdot 10^{-4}
Richtung: je höher xx, desto kleiner yy
negativer Zusammenhang\text{negativer Zusammenhang}
Form: die Punkte liegen fast auf einer fallenden Geraden
Ansatz: y≈Gerade in x\text{Ansatz: } y \approx \text{Gerade in } x

Schritt 4 Das lineare Modell

Modell der einfachen linearen Regression: Gerade plus Fehler
yi=β0+β1xi+εi,i=1,…,12y_i = \beta_0 + \beta_1 x_i + \varepsilon_i, \qquad i = 1, \dots, 12
Zeichen Name Bedeutung hier
β0\beta_0 Achsenabschnitt (Interzept) Wert der Geraden bei x=0x = 0
β1\beta_1 Steigung Änderung von yy, wenn xx um 1 °C steigt
εi\varepsilon_i Fehler zufällige Abweichung der Messung ii von der Geraden
Annahme an die Fehler (Skript): unabhängig, gleich verteilt, im Mittel null
ε1,…,ε12 u.i.v.,E(εi)=0\varepsilon_1, \dots, \varepsilon_{12} \text{ u.i.v.}, \qquad E(\varepsilon_i) = 0

Schritt 5 Geschätzte Gerade und Residuen

β0\beta_0 und β1\beta_1 sind unbekannt; aus den Daten geschätzt heißen sie β^0\hat\beta_0 und β^1\hat\beta_1
y^=β^0+β^1x\hat y = \hat\beta_0 + \hat\beta_1 x
Angepasster Wert: der Punkt auf der Geraden bei xix_i
y^i=β^0+β^1xi\hat y_i = \hat\beta_0 + \hat\beta_1 x_i
Residuum: Messwert minus angepasster Wert
ei=yi−y^i{ei>0:Punkt u¨ber der Geradenei<0:Punkt unter der Geradene_i = y_i - \hat y_i \qquad \begin{cases} e_i > 0: & \text{Punkt über der Geraden} \\ e_i < 0: & \text{Punkt unter der Geraden} \end{cases}

Schritt 6 Methode der kleinsten Quadrate

Summe der Residuenquadrate (SSE, englisch sum of squared errors; quadriert werden die Residuen eie_i)
SSE=∑i=112(yi−y^i)2=∑i=112ei2SSE = \sum_{i=1}^{12} (y_i - \hat y_i)^2 = \sum_{i=1}^{12} e_i^2
Die beste Gerade macht diese Summe so klein wie möglich
SSE→min⁡SSE \to \min
Warum Quadrate: ohne Quadrat heben sich Plus und Minus auf
(+3)+(−3)=0,(+3)2+(−3)2=9+9=18(+3) + (-3) = 0, \qquad (+3)^2 + (-3)^2 = 9 + 9 = 18

Schritt 7 Die Formeln für Steigung und Achsenabschnitt

Steigung der Kleinste-Quadrate-Geraden (xˉ\bar x, yˉ\bar y: Mittelwerte)
β^1=∑i=1n(xi−xˉ)(yi−yˉ)∑i=1n(xi−xˉ)2\hat\beta_1 = \frac{\sum_{i=1}^{n} (x_i - \bar x)(y_i - \bar y)}{\sum_{i=1}^{n} (x_i - \bar x)^2}
Achsenabschnitt
β^0=yˉ−β^1xˉ\hat\beta_0 = \bar y - \hat\beta_1 \bar x
Zähler und Nenner durch n−1n - 1 geteilt: Kovarianz durch Varianz von xx
β^1=1n−1∑(xi−xˉ)(yi−yˉ)1n−1∑(xi−xˉ)2=sXYsX2\hat\beta_1 = \frac{\frac{1}{n-1}\sum (x_i - \bar x)(y_i - \bar y)}{\frac{1}{n-1}\sum (x_i - \bar x)^2} = \frac{s_{XY}}{s_X^2}

Diese Formeln stehen nicht im Skript. Das Skript rechnet mit R (lm); lm rechnet genau diese Formeln aus (Probe in Schritt 19).

Schritt 8 Die Mittelwerte: der Schwerpunkt der Punktwolke

Summe und Mittelwert der Temperaturen
∑i=112xi=15+20+25+30+35+40+45+50+60+70+80+90=560\sum_{i=1}^{12} x_i = 15 + 20 + 25 + 30 + 35 + 40 + 45 + 50 + 60 + 70 + 80 + 90 = 560
xˉ=56012=46,6667\bar x = \frac{560}{12} = 46{,}6667
Summe und Mittelwert der Löslichkeiten (in 10−410^{-4})
∑i=112yi=(48+43+39+36+33+31+29+27+23+19+14+8)⋅10−4=350⋅10−4\sum_{i=1}^{12} y_i = (48 + 43 + 39 + 36 + 33 + 31 + 29 + 27 + 23 + 19 + 14 + 8) \cdot 10^{-4} = 350 \cdot 10^{-4}
yˉ=350⋅10−412=29,1667⋅10−4=0,00291667\bar y = \frac{350 \cdot 10^{-4}}{12} = 29{,}1667 \cdot 10^{-4} = 0{,}00291667
Schwerpunkt der Punktwolke
(xˉ; yˉ)=(46,6667; 29,1667⋅10−4)(\bar x;\ \bar y) = (46{,}6667;\ 29{,}1667 \cdot 10^{-4})

Schritt 9 Die Abweichungen vom Mittelwert

Für Messung 1
x1−xˉ=15−46,6667=−31,6667,y1−yˉ=(48−29,1667)⋅10−4=+18,8333⋅10−4x_1 - \bar x = 15 - 46{,}6667 = -31{,}6667, \qquad y_1 - \bar y = (48 - 29{,}1667) \cdot 10^{-4} = +18{,}8333 \cdot 10^{-4}
Messung Temperatur Löslichkeit in 10−410^{-4} Abweichung Abweichung in 10−410^{-4}
ii xix_i yiy_i xi−xˉx_i - \bar x yi−yˉy_i - \bar y
1 15 48 −31,6667 +18,8333
2 20 43 −26,6667 +13,8333
3 25 39 −21,6667 +9,8333
4 30 36 −16,6667 +6,8333
5 35 33 −11,6667 +3,8333
6 40 31 −6,6667 +1,8333
7 45 29 −1,6667 −0,1667
8 50 27 +3,3333 −2,1667
9 60 23 +13,3333 −6,1667
10 70 19 +23,3333 −10,1667
11 80 14 +33,3333 −15,1667
12 90 8 +43,3333 −21,1667
Σ\Sigma 560 350 0 0
Probe: Abweichungen vom Mittelwert ergeben zusammen immer 0 (mit ungerundeten Werten)
∑(xi−xˉ)=560−12⋅56012=560−560=0,∑(yi−yˉ)=0\sum (x_i - \bar x) = 560 - 12 \cdot \tfrac{560}{12} = 560 - 560 = 0, \qquad \sum (y_i - \bar y) = 0

Schritt 10 Produkte und Quadrate aufsummieren

Für Messung 1
(x1−xˉ)(y1−yˉ)=(−31,6667)⋅(+18,8333)⋅10−4=−596,39⋅10−4(x_1 - \bar x)(y_1 - \bar y) = (-31{,}6667) \cdot (+18{,}8333) \cdot 10^{-4} = -596{,}39 \cdot 10^{-4}
(x1−xˉ)2=(−31,6667)2=1.002,78(x_1 - \bar x)^2 = (-31{,}6667)^2 = 1.002{,}78
Messung Abweichung Abweichung in 10−410^{-4} Produkt in 10−410^{-4} Quadrat
ii xi−xˉx_i - \bar x yi−yˉy_i - \bar y (xi−xˉ)(yi−yˉ)(x_i - \bar x)(y_i - \bar y) (xi−xˉ)2(x_i - \bar x)^2
1 −31,6667 +18,8333 −596,39 1.002,78
2 −26,6667 +13,8333 −368,89 711,11
3 −21,6667 +9,8333 −213,06 469,44
4 −16,6667 +6,8333 −113,89 277,78
5 −11,6667 +3,8333 −44,72 136,11
6 −6,6667 +1,8333 −12,22 44,44
7 −1,6667 −0,1667 +0,28 2,78
8 +3,3333 −2,1667 −7,22 11,11
9 +13,3333 −6,1667 −82,22 177,78
10 +23,3333 −10,1667 −237,22 544,44
11 +33,3333 −15,1667 −505,56 1.111,11
12 +43,3333 −21,1667 −917,22 1.877,78
Σ\Sigma 0 0 −3.098,33 6.366,67
Die beiden Summen für die Formel aus Schritt 7
∑i=112(xi−xˉ)(yi−yˉ)=−3.098,33⋅10−4,∑i=112(xi−xˉ)2=6.366,67\sum_{i=1}^{12} (x_i - \bar x)(y_i - \bar y) = -3.098{,}33 \cdot 10^{-4}, \qquad \sum_{i=1}^{12} (x_i - \bar x)^2 = 6.366{,}67

Schritt 11 Die Steigung

Formel aus Schritt 7, Summen aus Schritt 10 einsetzen
β^1=∑(xi−xˉ)(yi−yˉ)∑(xi−xˉ)2=−3.098,33⋅10−46.366,67\hat\beta_1 = \frac{\sum (x_i - \bar x)(y_i - \bar y)}{\sum (x_i - \bar x)^2} = \frac{-3.098{,}33 \cdot 10^{-4}}{6.366{,}67}
Ausrechnen, auf sechs Stellen
β^1=−0,486649⋅10−4=−0,0000486649\hat\beta_1 = -0{,}486649 \cdot 10^{-4} = -0{,}0000486649
Derselbe Wert als Kovarianz durch Varianz (n−1=11n - 1 = 11)
sXY=−3.098,33⋅10−411=−281,667⋅10−4,sX2=6.366,6711=578,788s_{XY} = \frac{-3.098{,}33 \cdot 10^{-4}}{11} = -281{,}667 \cdot 10^{-4}, \qquad s_X^2 = \frac{6.366{,}67}{11} = 578{,}788
β^1=sXYsX2=−281,667⋅10−4578,788=−0,486649⋅10−4\hat\beta_1 = \frac{s_{XY}}{s_X^2} = \frac{-281{,}667 \cdot 10^{-4}}{578{,}788} = -0{,}486649 \cdot 10^{-4}

Schritt 12 Der Achsenabschnitt

Formel aus Schritt 7, xˉ\bar x und yˉ\bar y aus Schritt 8, β^1\hat\beta_1 aus Schritt 11
β^0=yˉ−β^1xˉ=29,1667⋅10−4−(−0,486649⋅10−4)⋅46,6667\hat\beta_0 = \bar y - \hat\beta_1 \bar x = 29{,}1667 \cdot 10^{-4} - (-0{,}486649 \cdot 10^{-4}) \cdot 46{,}6667
Minus mal minus ist plus
β^0=(29,1667+22,7103)⋅10−4=51,8770⋅10−4=0,00518770\hat\beta_0 = (29{,}1667 + 22{,}7103) \cdot 10^{-4} = 51{,}8770 \cdot 10^{-4} = 0{,}00518770
Folge der Formel: die Gerade läuft durch den Schwerpunkt
β^0+β^1xˉ=(yˉ−β^1xˉ)+β^1xˉ=yˉ\hat\beta_0 + \hat\beta_1 \bar x = (\bar y - \hat\beta_1 \bar x) + \hat\beta_1 \bar x = \bar y

Schritt 13 Die Regressionsgerade deuten

Die geschätzte Regressionsgerade, Koeffizienten auf vier gültige Ziffern
y^=0,005188−0,00004866 x\hat y = 0{,}005188 - 0{,}00004866\,x
Steigung: je 1 °C und je 10 °C wärmer
Δy=−0,0000487 je 1 °C,10⋅(−0,0000486649)=−0,000487≈−0,00049 je 10 °C\Delta y = -0{,}0000487 \text{ je } 1 \text{ °C}, \qquad 10 \cdot (-0{,}0000486649) = -0{,}000487 \approx -0{,}00049 \text{ je } 10 \text{ °C}
Achsenabschnitt: der Wert der Geraden bei x=0x = 0 °C
y^(0)=β^0≈0,005188(0 °C liegt außerhalb der Messungen)\hat y(0) = \hat\beta_0 \approx 0{,}005188 \qquad (0 \text{ °C liegt außerhalb der Messungen})

Schritt 14 Angepasste Werte und Residuen

Für Messung 1 (alles in 10−410^{-4})
y^1=51,8770−0,486649⋅15=51,8770−7,2997=44,577\hat y_1 = 51{,}8770 - 0{,}486649 \cdot 15 = 51{,}8770 - 7{,}2997 = 44{,}577
e1=y1−y^1=48−44,577=+3,423e_1 = y_1 - \hat y_1 = 48 - 44{,}577 = +3{,}423
Messung Temperatur gemessen auf der Geraden Residuum
ii xix_i yiy_i y^i\hat y_i ei=yi−y^ie_i = y_i - \hat y_i
1 15 48 44,577 +3,423
2 20 43 42,144 +0,856
3 25 39 39,711 −0,711
4 30 36 37,277 −1,277
5 35 33 34,844 −1,844
6 40 31 32,411 −1,411
7 45 29 29,978 −0,978
8 50 27 27,545 −0,545
9 60 23 22,678 +0,322
10 70 19 17,812 +1,188
11 80 14 12,945 +1,055
12 90 8 8,079 −0,079
Σ\Sigma 0

yiy_i, y^i\hat y_i und eie_i in 10−410^{-4}. Die Residuen ergeben zusammen 0 (gerundet 6,844−6,845=−0,0016{,}844 - 6{,}845 = -0{,}001, Rundungsrest).

Schritt 15 Die Summe der Residuenquadrate SSE

Für Messung 1: (10−4)2=10−8(10^{-4})^2 = 10^{-8}
e12=(3,423⋅10−4)2=11,72⋅10−8e_1^2 = (3{,}423 \cdot 10^{-4})^2 = 11{,}72 \cdot 10^{-8}
Messung Residuum in 10−410^{-4} Quadrat in 10−810^{-8}
ii eie_i ei2e_i^2
1 +3,423 11,72
2 +0,856 0,73
3 −0,711 0,51
4 −1,277 1,63
5 −1,844 3,40
6 −1,411 1,99
7 −0,978 0,96
8 −0,545 0,30
9 +0,322 0,10
10 +1,188 1,41
11 +1,055 1,11
12 −0,079 0,01
Σ\Sigma 0 23,87
Die Summe, mit ungerundeten Residuen gerechnet
SSE=∑i=112ei2=23,865⋅10−8=0,00000023865SSE = \sum_{i=1}^{12} e_i^2 = 23{,}865 \cdot 10^{-8} = 0{,}00000023865

Schritt 16 Die Gesamtstreuung von y

Wie stark streuen die Messwerte um ihren Mittelwert yˉ\bar y? Abweichungen aus Schritt 9 quadrieren
(y1−yˉ)2=(18,8333⋅10−4)2=354,69⋅10−8(y_1 - \bar y)^2 = (18{,}8333 \cdot 10^{-4})^2 = 354{,}69 \cdot 10^{-8}
Messung Abweichung in 10−410^{-4} Quadrat in 10−810^{-8}
ii yi−yˉy_i - \bar y (yi−yˉ)2(y_i - \bar y)^2
1 +18,8333 354,69
2 +13,8333 191,36
3 +9,8333 96,69
4 +6,8333 46,69
5 +3,8333 14,69
6 +1,8333 3,36
7 −0,1667 0,03
8 −2,1667 4,69
9 −6,1667 38,03
10 −10,1667 103,36
11 −15,1667 230,03
12 −21,1667 448,03
Σ\Sigma 0 1.531,67
Die Summe, mit ungerundeten Abweichungen gerechnet
∑i=112(yi−yˉ)2=1.531,67⋅10−8=0,0000153167\sum_{i=1}^{12} (y_i - \bar y)^2 = 1.531{,}67 \cdot 10^{-8} = 0{,}0000153167

Schritt 17 Das Bestimmtheitsmaß R²

Bestimmtheitsmaß (Skript): 1 minus der Anteil der Streuung, der übrig bleibt
R2=1−SSE∑i=1n(yi−yˉ)2,0≤R2≤1R^2 = 1 - \frac{SSE}{\sum_{i=1}^{n} (y_i - \bar y)^2}, \qquad 0 \le R^2 \le 1
SSESSE aus Schritt 15, Gesamtstreuung aus Schritt 16; 10−810^{-8} kürzt sich
R2=1−23,865⋅10−81.531,67⋅10−8=1−0,01558=0,98442≈0,9844R^2 = 1 - \frac{23{,}865 \cdot 10^{-8}}{1.531{,}67 \cdot 10^{-8}} = 1 - 0{,}01558 = 0{,}98442 \approx 0{,}9844
R2R^2 das Modell beschreibt die Variation … (Faustregel, Skript)
0,25 bis unter 0,50 schwach
0,50 bis unter 0,75 mäßig
ab 0,75 substantiell
Hier
R2≈0,9844≥0,75⇒substantiell: 98,4 % der Streuung erkla¨rtR^2 \approx 0{,}9844 \ge 0{,}75 \quad \Rightarrow \quad \text{substantiell: } 98{,}4\,\% \text{ der Streuung erklärt}

Schritt 18 Probe: R² ist das Quadrat der Korrelation

Stichprobenkorrelation (Aufgabe 1 dieses Blatts)
ρ^=sXYsX sY\hat\rho = \frac{s_{XY}}{s_X\, s_Y}
Die Standardabweichungen: sX2s_X^2 aus Schritt 11, sY2s_Y^2 aus der Summe in Schritt 16
sX=578,788=24,0580s_X = \sqrt{578{,}788} = 24{,}0580
sY2=1.531,67⋅10−811=139,242⋅10−8,sY=139,242⋅10−4=11,8001⋅10−4s_Y^2 = \frac{1.531{,}67 \cdot 10^{-8}}{11} = 139{,}242 \cdot 10^{-8}, \qquad s_Y = \sqrt{139{,}242} \cdot 10^{-4} = 11{,}8001 \cdot 10^{-4}
Einsetzen, sXY=−281,667⋅10−4s_{XY} = -281{,}667 \cdot 10^{-4} aus Schritt 11; 10−410^{-4} kürzt sich
ρ^=−281,66724,0580⋅11,8001=−281,667283,887=−0,99218\hat\rho = \frac{-281{,}667}{24{,}0580 \cdot 11{,}8001} = \frac{-281{,}667}{283{,}887} = -0{,}99218
Quadriert: dasselbe wie R2R^2 aus Schritt 17
ρ^2=(−0,99218)2=0,98442=R2 ✓\hat\rho^2 = (-0{,}99218)^2 = 0{,}98442 = R^2 \ \checkmark

Schritt 19 In R: lm und die geschätzten Koeffizienten

x <- c(15, 20, 25, 30, 35, 40, 45, 50, 60, 70, 80, 90)
y <- c(0.0048, 0.0043, 0.0039, 0.0036, 0.0033, 0.0031,
 0.0029, 0.0027, 0.0023, 0.0019, 0.0014, 0.0008)
fit <- lm(y ~ x)
summary(fit)
#Call:
#lm(formula = y ~ x)
#Residuals:
#       Min         1Q     Median         3Q        Max
#-1.844e-04 -1.053e-04 -3.115e-05  9.058e-05  3.423e-04
#Coefficients:
#              Estimate Std. Error t value Pr(>|t|)
#(Intercept)  5.188e-03  1.008e-04   51.49 1.85e-13 ***
#x           -4.867e-05  1.936e-06  -25.14 2.27e-10 ***
#---
#Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
#Residual standard error: 0.0001545 on 10 degrees of freedom
#Multiple R-squared:  0.9844,	Adjusted R-squared:  0.9829
#F-statistic: 631.8 on 1 and 10 DF,  p-value: 2.275e-10
Spalte Estimate (Schätzwert), mit 5.188e-03=5,188⋅10−35.188\text{e-}03 = 5{,}188 \cdot 10^{-3}
β^0=0,005188 ✓ (Schritt 12),β^1=−0,00004867 (Schritt 11: −0,0000486649)\hat\beta_0 = 0{,}005188 \ \checkmark \text{ (Schritt 12)}, \qquad \hat\beta_1 = -0{,}00004867 \ \text{(Schritt 11: } -0{,}0000486649)
coef(fit)
#  (Intercept)             x
# 5.187696e-03 -4.866492e-05

Schritt 20 Die p-Werte der Koeffizienten

Jede Zeile der Tabelle Coefficients ist ein eigener Test. Für die Steigung:
H0: β1=0 (Temperatur ohne Einfluss)gegenHA: β1≠0H_0:\ \beta_1 = 0 \ \text{(Temperatur ohne Einfluss)} \qquad \text{gegen} \qquad H_A:\ \beta_1 \ne 0
t value = Estimate geteilt durch Std. Error (Standardfehler)
t^=−4,866⋅10−51,936⋅10−6≈−25,13(R, ungerundet: −25,136≈−25,14)\hat t = \frac{-4{,}866 \cdot 10^{-5}}{1{,}936 \cdot 10^{-6}} \approx -25{,}13 \qquad \text{(R, ungerundet: } -25{,}136 \approx -25{,}14)
Pr(>|t|) ist der pp-Wert (bei normalverteilten Fehlern εi\varepsilon_i; t-Verteilung mit n−2=10n - 2 = 10 Freiheitsgraden)
p=2,27⋅10−10=0,000000000227 < 0,05⇒H0 verwerfenp = 2{,}27 \cdot 10^{-10} = 0{,}000000000227 \ < \ 0{,}05 \quad \Rightarrow \quad H_0 \text{ verwerfen}
Zeichen hinter dem pp-Wert pp-Wert
*** 0 bis 0,001
** über 0,001 bis 0,01
* über 0,01 bis 0,05
. über 0,05 bis 0,1
(leer) über 0,1

Schritt 21 Multiple R-squared und Adjusted R-squared

#Multiple R-squared:  0.9844,	Adjusted R-squared:  0.9829
Multiple R-squared ist das Bestimmtheitsmaß aus Schritt 17
R2=0,9844 ✓R^2 = 0{,}9844 \ \checkmark
Adjusted R-squared ist eine andere Zahl: das adjustierte R2R^2 (gebraucht in Teil (iii), Schritt 28)
Radj2=0,9829 ≠ R2R^2_{\text{adj}} = 0{,}9829 \ \ne \ R^2
cor(x, y)
#[1] -0.9921788
cor(x, y)^2
#[1] 0.9844188

Schritt 22 Antwort zu (i)

Die Abhängigkeit als Gleichung
y^=0,005188−0,00004866 x\hat y = 0{,}005188 - 0{,}00004866\,x
Modellgüte
R2≈0,9844 (substantiell),Steigung: p=2,27⋅10−10 (∗∗∗)R^2 \approx 0{,}9844 \ \text{(substantiell)}, \qquad \text{Steigung: } p = 2{,}27 \cdot 10^{-10} \ (***)

Antwort: Die Löslichkeit sinkt mit steigender Temperatur, und zwar fast genau linear: je 10 °C um rund 0,00049 g O₂ je 100 g H₂O. Die Gerade erklärt 98,4 % der Streuung der Messwerte. Die Modellgüte ist nach der Faustregel substantiell, also sehr hoch.

Schritt 23 Vorhersage bei 55 °C

x=55x = 55 in die Gerade einsetzen, mit den Koeffizienten aus Schritt 11 und 12
y^(55)=β^0+β^1⋅55=51,8770⋅10−4−0,486649⋅10−4⋅55\hat y(55) = \hat\beta_0 + \hat\beta_1 \cdot 55 = 51{,}8770 \cdot 10^{-4} - 0{,}486649 \cdot 10^{-4} \cdot 55
Ausrechnen
y^(55)=(51,8770−26,7657)⋅10−4=25,1113⋅10−4≈0,00251\hat y(55) = (51{,}8770 - 26{,}7657) \cdot 10^{-4} = 25{,}1113 \cdot 10^{-4} \approx 0{,}00251
predict(fit, data.frame(x = 55))
#          1
#0.002511126
Plausibel: liegt zwischen den Messwerten bei 50 °C und 60 °C
0,0023 < 0,00251 < 0,00270{,}0023 \ < \ 0{,}00251 \ < \ 0{,}0027

Schritt 24 Interpolation ja, Extrapolation nein

55 °C liegt im Messbereich: Interpolation, zulässig
15≤55≤9015 \le 55 \le 90
Gegenbeispiel außerhalb (Extrapolation): x=110x = 110 °C
y^(110)=(51,8770−0,486649⋅110)⋅10−4\hat y(110) = (51{,}8770 - 0{,}486649 \cdot 110) \cdot 10^{-4}
=(51,8770−53,5314)⋅10−4=−1,654⋅10−4 < 0= (51{,}8770 - 53{,}5314) \cdot 10^{-4} = -1{,}654 \cdot 10^{-4} \ < \ 0
Ab hier würde die Gerade negativ: y^=0\hat y = 0 auflösen
51,8770−0,486649 x=0⇒x=51,87700,486649≈106,6 °C51{,}8770 - 0{,}486649\,x = 0 \quad \Rightarrow \quad x = \frac{51{,}8770}{0{,}486649} \approx 106{,}6 \text{ °C}

(iii) Das Regressionspolynom 2. Grades

Parabel, Gleichung, adjustiertes R², Test, Modellwahl

Schritt 25 Das quadratische Modell

Regressionspolynom 2. Grades: zur Geraden kommt ein Glied mit x2x^2 dazu
yi=β0+β1xi+β2xi2+εiy_i = \beta_0 + \beta_1 x_i + \beta_2 x_i^2 + \varepsilon_i
Immer noch ein lineares Modell im Sinn des Skripts: linear in den β\beta, mit f1(x)=xf_1(x) = x und f2(x)=x2f_2(x) = x^2
yi=β0+β1f1(xi)+β2f2(xi)+εiy_i = \beta_0 + \beta_1 f_1(x_i) + \beta_2 f_2(x_i) + \varepsilon_i
Geschätzt wieder mit der Methode der kleinsten Quadrate
SSE=∑i=112(yi−(β^0+β^1xi+β^2xi2))2→min⁡SSE = \sum_{i=1}^{12} \big(y_i - (\hat\beta_0 + \hat\beta_1 x_i + \hat\beta_2 x_i^2)\big)^2 \to \min
fit2 <- lm(y ~ poly(x, 2))
summary(fit2)

Schritt 26 Die Ausgabe von summary(fit2)

#Coefficients:
#              Estimate Std. Error t value Pr(>|t|)
#(Intercept)  0.0029167  0.0000384  75.947 6.02e-14 ***
#poly(x, 2)1 -0.0038830  0.0001330 -29.188 3.17e-10 ***
#poly(x, 2)2  0.0002817  0.0001330   2.118   0.0633 .
#---
#Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
#Residual standard error: 0.000133 on 9 degrees of freedom
#Multiple R-squared:  0.9896,	Adjusted R-squared:  0.9873
#F-statistic: 428.2 on 2 and 9 DF,  p-value: 1.193e-09
Bestimmtheitsmaß und adjustiertes R2R^2 der Parabel
R2=0,9896,Radj2=0,9873R^2 = 0{,}9896, \qquad R^2_{\text{adj}} = 0{,}9873
Die Zeile poly(x, 2)2 gehört zum quadratischen Glied
p=0,0633(Zeichen .)p = 0{,}0633 \quad (\text{Zeichen } .)

Schritt 27 Vorsicht: poly(x, 2) liefert nicht die Parabelgleichung

Die Estimate-Werte aus Schritt 26 falsch als Gleichung gelesen (so in der Musterlösung)
y^=?0,0029167−0,0038830 x+0,0002817 x2\hat y \overset{?}{=} 0{,}0029167 - 0{,}0038830\,x + 0{,}0002817\,x^2
Probe bei x=55x = 55: unmöglich groß
0,0029167−0,0038830⋅55+0,0002817⋅3.0250{,}0029167 - 0{,}0038830 \cdot 55 + 0{,}0002817 \cdot 3.025
=0,0029167−0,2135650+0,8521425=0,6415= 0{,}0029167 - 0{,}2135650 + 0{,}8521425 = 0{,}6415
fit3 <- lm(y ~ x + I(x^2))
coef(fit3)
#  (Intercept)             x        I(x^2)
# 5.543212e-03 -6.596160e-05  1.667676e-07
Die richtige Gleichung der Parabel
y^=0,005543−0,00006596 x+0,0000001668 x2\hat y = 0{,}005543 - 0{,}00006596\,x + 0{,}0000001668\,x^2
Probe bei x=55x = 55 (552=3.02555^2 = 3.025)
0,0055432−0,0036278+0,0005046=0,0024200≈0,002420{,}0055432 - 0{,}0036278 + 0{,}0005046 = 0{,}0024200 \approx 0{,}00242
predict(fit2, data.frame(x = 55))
#          1
#0.002419796

Schritt 28 R² steigt immer, deshalb das adjustierte R²

SSESSE der Parabel aus ihrem R2R^2 (Schritt 26) und der Gesamtstreuung (Schritt 16)
SSE=(1−R2)⋅∑(yi−yˉ)2=(1−0,98960)⋅1.531,67⋅10−8≈15,93⋅10−8SSE = (1 - R^2) \cdot \sum (y_i - \bar y)^2 = (1 - 0{,}98960) \cdot 1.531{,}67 \cdot 10^{-8} \approx 15{,}93 \cdot 10^{-8}
Die Parabel hat eine kleinere Summe der Residuenquadrate, R2R^2 steigt
SSE: 23,865⋅10−8→15,93⋅10−8,R2: 0,9844→0,9896SSE: \ 23{,}865 \cdot 10^{-8} \to 15{,}93 \cdot 10^{-8}, \qquad R^2: \ 0{,}9844 \to 0{,}9896
Grund: die Gerade ist die Parabel mit β2=0\beta_2 = 0; die beste Parabel ist mindestens so gut
SSEParabel≤SSEGerade⇒RParabel2≥RGerade2SSE_{\text{Parabel}} \le SSE_{\text{Gerade}} \quad \Rightarrow \quad R^2_{\text{Parabel}} \ge R^2_{\text{Gerade}}
Für den Vergleich: das adjustierte R2R^2 aus R
Radj2: 0,9829 (Gerade)→0,9873 (Parabel),Zuwachs 0,0044R^2_{\text{adj}}: \ 0{,}9829 \ \text{(Gerade)} \to 0{,}9873 \ \text{(Parabel)}, \qquad \text{Zuwachs } 0{,}0044
Das adjustierte R2R^2 steigt schon, wenn ∣t∣>1|t| > 1 — eine niedrige Hürde (Signifikanz bräuchte ∣t∣>2,262|t| > 2{,}262)
t=2,118>1⇒Radj2 steigt leichtt = 2{,}118 > 1 \quad \Rightarrow \quad R^2_{\text{adj}} \text{ steigt leicht}

Ergänzung, zum Nachrechnen: n=12n = 12 Messungen, pp Glieder außer β0\beta_0 (Gerade p=1p = 1, Parabel p=2p = 2).

Formel des adjustierten R2R^2
Radj2=1−(1−R2)⋅n−1n−p−1R^2_{\text{adj}} = 1 - (1 - R^2) \cdot \frac{n - 1}{n - p - 1}
Gerade (p=1p = 1) und Parabel (p=2p = 2)
Gerade: 1−(1−0,98442)⋅1110=1−0,01714=0,98286\text{Gerade: } 1 - (1 - 0{,}98442) \cdot \tfrac{11}{10} = 1 - 0{,}01714 = 0{,}98286
Parabel: 1−(1−0,98960)⋅119=1−0,01271=0,98729\text{Parabel: } 1 - (1 - 0{,}98960) \cdot \tfrac{11}{9} = 1 - 0{,}01271 = 0{,}98729

Schritt 29 Ist das quadratische Glied signifikant?

Test zur Zeile des quadratischen Glieds, Niveau α=0,05\alpha = 0{,}05
H0: β2=0 (Gerade reicht)gegenHA: β2≠0H_0:\ \beta_2 = 0 \ \text{(Gerade reicht)} \qquad \text{gegen} \qquad H_A:\ \beta_2 \ne 0
pp-Wert aus Schritt 26
p=0,0633 > 0,05⇒H0 nicht verwerfenp = 0{,}0633 \ > \ 0{,}05 \quad \Rightarrow \quad H_0 \text{ nicht verwerfen}
Gleichwertig: ∣t∣|t| mit dem Quantil der t-Verteilung mit n−3=9n - 3 = 9 Freiheitsgraden vergleichen (normalverteilte Fehler vorausgesetzt)
∣t∣=2,118 < t9; 0,975=2,262|t| = 2{,}118 \ < \ t_{9;\,0{,}975} = 2{,}262
summary(fit3)
#              Estimate Std. Error t value Pr(>|t|)
#I(x^2)       1.668e-07  7.875e-08   2.118   0.0633 .

Schritt 30 Welches Modell? Das einfachere

Gerade Parabel
Anzahl Koeffizienten 2 3
Bestimmtheitsmaß R2R^2 0,9844 0,9896
adjustiertes R2R^2 0,9829 0,9873
pp-Wert des zusätzlichen Glieds – 0,0633
Vorhersage bei 55 °C 0,00251 0,00242
Adjustiertes R2R^2 steigt leicht (t=2,118>1t = 2{,}118 > 1), der Test weist das Glied aber nicht nach (p=0,0633p = 0{,}0633): kleiner Zugewinn, nicht signifikant, also das einfachere Modell
⇒lineares Modell y^=0,005188−0,00004866 x\Rightarrow \quad \text{lineares Modell } \hat y = 0{,}005188 - 0{,}00004866\,x

Schritt 31 Ergänzung: das Muster der Residuen

Ergänzung: für die Lösung nicht nötig. Sie zeigt, was die Parabel einfängt.

10 20 30 40 50 60 70 80 90 −2 −1 0 +1 +2 +3 +4 Residuum e = y − ŷ der Geraden, in 0,0001 g O₂ je 100 g H₂O Temperatur x in °C Gerade: Residuum 0 gestrichelt: Parabel minus Gerade +3,42 +0,86 −0,71 −1,28 −1,84 −1,41 −0,98 −0,54 +0,32 +1,19 +1,05 −0,08 Ränder: Residuen positiv · Mitte: negativ
● Residuum der Geraden (Messwert minus Gerade), in 0,0001  ·  gestrichelt: Parabel minus Gerade
Vorzeichen der Residuen der Geraden, von 15 bis 90 °C (Schritt 14)
+ + − − − − − − + + + −+\ +\ -\ -\ -\ -\ -\ -\ +\ +\ +\ -
Das quadratische Glied mit β^2>0\hat\beta_2 > 0 biegt die Kurve nach oben
β^2=0,0000001668>0\hat\beta_2 = 0{,}0000001668 > 0

Schritt 32 Ergebnis

✓(i) Regressionsgerade y^=0,005188−0,00004866 x\hat y = 0{,}005188 - 0{,}00004866\,x: Je 10 °C wärmer löst sich rund 0,00049 g O₂ je 100 g H₂O weniger.
✓(i) Modellgüte: R2≈0,9844R^2 \approx 0{,}9844, also 98,4 % der Streuung erklärt, substantiell; Steigung signifikant (p=2,27⋅10−10p = 2{,}27 \cdot 10^{-10}).
✓(ii) Vorhersage bei 55 °C: y^(55)≈0,00251\hat y(55) \approx \mathbf{0{,}00251} g O₂ je 100 g H₂O (Interpolation, also zulässig).
✓(iii) Parabel y^=0,005543−0,00006596 x+0,0000001668 x2\hat y = 0{,}005543 - 0{,}00006596\,x + 0{,}0000001668\,x^2 mit R2=0,9896R^2 = 0{,}9896 und Radj2=0,9873R^2_{\text{adj}} = 0{,}9873 (Gerade: 0,98290{,}9829).
✓(iii) Quadratisches Glied nicht signifikant (p=0,0633>0,05p = 0{,}0633 > 0{,}05), Zugewinn klein ⇒ lineares Modell wählen.

Proben: Die Gerade läuft durch den Schwerpunkt (46,67; 0,002917)(46{,}67;\ 0{,}002917). Die Residuen ergeben zusammen 0. R2=ρ^2=(−0,99218)2=0,98442R^2 = \hat\rho^2 = (-0{,}99218)^2 = 0{,}98442. R liefert mit lm dieselben Koeffizienten und dasselbe R2R^2, mit predict dieselbe Vorhersage 0,002511.

Typische Fehler: xx und yy vertauschen (lm(x ~ y) sagt die Temperatur aus der Löslichkeit vorher). Adjusted R-squared als Bestimmtheitsmaß angeben. Die Zahlen aus poly(x, 2) als Parabelgleichung lesen. Zwei Modelle mit dem gewöhnlichen R2R^2 vergleichen. Die Gerade weit außerhalb von 15 bis 90 °C benutzen. Den Faktor 10−410^{-4} unterwegs verlieren.