In Aufgabe 1 und 2 dieses Blatts ging es darum, ob und wie stark zwei Größen
zusammenhängen. Jetzt kommt der nächste Schritt: Der Zusammenhang soll durch eine
Gleichung beschrieben werden. Mit ihr kann man dann rechnen, zum Beispiel für eine
Temperatur, bei der gar nicht gemessen wurde. Das Werkzeug dafür heißt Regression .
Worum es geht: Wie viel Sauerstoff sich in Wasser löst, hängt von der Temperatur ab.
Die Löslichkeit gibt an, wie viel Gramm Sauerstoff (O₂) sich in 100 Gramm Wasser (H₂O)
lösen. Bei 15 °C sind es 0,0048 g, bei 90 °C nur noch 0,0008 g. Gemessen wurde bei zwölf
Temperaturen.
Gesucht:
(i) eine Gerade, die die Löslichkeit aus der Temperatur berechnet, und ein Urteil, wie gut
sie zu den Messwerten passt (die Modellgüte );
(ii) mit dieser Geraden die Löslichkeit bei 55 °C (dort wurde nicht gemessen);
(iii) statt der Geraden eine Parabel, deren Güte, und die Entscheidung, welche der beiden
Gleichungen man nehmen sollte.
Der Weg in sechs Etappen:
Daten ansehen und das Modell aufstellen (Schritte 1–6).
Die Gerade von Hand ausrechnen (Schritte 7–13).
Die Modellgüte mit dem Bestimmtheitsmaß R 2 R^2 R 2 bewerten (Schritte 14–18).
Dasselbe in R nachrechnen und die Ausgabe Zeile für Zeile lesen, dann (i) beantworten
(Schritte 19–22).
(ii) die Vorhersage bei 55 °C (Schritte 23–24).
(iii) die Parabel, ihre Gleichung, der Vergleich und die Wahl (Schritte 25–31).
Merke: Regression heißt hier: eine Gleichung finden, die
y y y aus
x x x möglichst gut
berechnet. „Möglichst gut“ heißt: Die Messpunkte liegen insgesamt so nah wie möglich an der
Gleichung.
Zur Musterlösung: Gerade, Vorhersage und die Wahl des linearen Modells stimmen. Drei
Stellen weichen ab; sie werden an Ort und Stelle mit Rechnung erklärt. (1) Dort heißt
0,9829 0{,}9829 0 , 9829 das Bestimmtheitsmaß. Das ist das
adjustierte R 2 R^2 R 2 . Das Bestimmtheitsmaß
nach der Formel des Skripts ist
0,9844 0{,}9844 0 , 9844 (Schritte 17 und 21). (2) Die Gleichung der Parabel
ist falsch abgelesen. Richtig ist
y ^ ≈ 0,005543 − 0,00006596 x + 0,0000001668 x 2 \hat y \approx 0{,}005543 - 0{,}00006596\,x +
0{,}0000001668\,x^2 y ^ ≈ 0 , 005543 − 0 , 00006596 x + 0 , 0000001668 x 2 (Schritt 27). (3) Im Befehl steht
predict(m1, …); das Modell heißt aber
fit (Schritt 23).
( x i , y i ) (x_i,\,y_i) ( x i , y i ) für
i = 1 , … , 12 i = 1, \dots, 12 i = 1 , … , 12 ;
0,0048 = 48 ⋅ 10 − 4 0{,}0048 = 48 \cdot 10^{-4} 0 , 0048 = 48 ⋅ 1 0 − 4
Zuerst bekommen die Zahlen Namen. i i i ist die Nummer der Messung, von 1 bis 12. x i x_i x i ist
die Temperatur bei Messung i i i in °C, y i y_i y i die gemessene Löslichkeit in g O₂ je 100 g
H₂O. Messung 1 hat also x 1 = 15 x_1 = 15 x 1 = 15 und y 1 = 0,0048 y_1 = 0{,}0048 y 1 = 0 , 0048 .
Die beiden Zahlen einer Messung gehören zusammen. Man schreibt sie deshalb als
Paar ( x i , y i ) (x_i,\,y_i) ( x i , y i ) . Es gibt n = 12 n = 12 n = 12 Paare.
Eine handlichere Schreibweise. Die Löslichkeiten sind sehr kleine Zahlen mit vielen
Nullen. Damit rechnet man leicht falsch. Deshalb werden sie hier in Zehntausendsteln
geschrieben: 10 − 4 10^{-4} 1 0 − 4 bedeutet 1 10.000 = 0,0001 \frac{1}{10.000} = 0{,}0001 10.000 1 = 0 , 0001 . So wird aus 0,0048 0{,}0048 0 , 0048 die
Zahl 48 ⋅ 10 − 4 48 \cdot 10^{-4} 48 ⋅ 1 0 − 4 . Rechts in der Tabelle steht in der letzten Spalte nur noch die
48.
Das ist nur eine andere Einheit, wie Cent statt Euro. Die Werte selbst ändern sich nicht.
In jeder Formel steht der Faktor 10 − 4 10^{-4} 1 0 − 4 dabei, und am Ende wird wieder in die
ursprüngliche Einheit umgerechnet.
Im Bild ist jede Messung ein Punkt: Temperatur nach rechts, Löslichkeit (in 10 − 4 10^{-4} 1 0 − 4 )
nach oben.
x x x = Temperatur (unabhängig),
y y y = Löslichkeit (abhängig)
Bei einer Regression spielen die beiden Größen verschiedene Rollen.
Die unabhängige Variable x x x ist die Größe, die man vorgibt oder einstellt. Hier:
die Temperatur. Man kann Wasser auf 15, 20 oder 55 °C bringen.
Die abhängige Variable y y y ist die Größe, die man misst und erklären möchte.
Hier: die Löslichkeit. Sie stellt sich je nach Temperatur ein.
Warum ist das wichtig? Die Regression berechnet y y y aus x x x , nicht umgekehrt. Die
Temperatur beeinflusst, wie viel Sauerstoff sich löst. Der gelöste Sauerstoff ändert aber
nicht die Temperatur. Deshalb steht die Temperatur auf der waagerechten Achse und die
Löslichkeit auf der senkrechten.
Gesucht ist also eine Gleichung y ≈ f ( x ) y \approx f(x) y ≈ f ( x ) : Temperatur rein, Löslichkeit raus. Das
Zeichen ≈ \approx ≈ („ungefähr gleich“) steht da, weil Messwerte nie genau auf einer
Gleichung liegen.
Das Skript nennt als Ziel der Regression auch: eine Messgröße aus der anderen
vorhersagen . Genau das verlangt Teil (ii).
negativer Zusammenhang, fast auf einer Geraden
Das Bild rechts ist ein Streudiagramm : Jedes Paar ( x i , y i ) (x_i,\,y_i) ( x i , y i ) ist ein Punkt.
Bevor man rechnet, schaut man es sich immer an. Zwei Dinge fallen auf.
Richtung: Die Punkte fallen von links oben nach rechts unten. Je wärmer das
Wasser, desto weniger Sauerstoff löst sich. Das nennt man einen
negativen Zusammenhang.
Form: Die Punkte liegen fast auf einer geraden Linie. Nur ganz leicht sind sie
gebogen.
Deshalb ist eine Gerade der naheliegende erste Ansatz. Dieser Ansatz heißt
lineare Regression : „linear“ bedeutet „wie eine Gerade“.
Die leichte Biegung ist der Grund, warum Teil (iii) auch eine gebogene Kurve ausprobiert.
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“): Im
Streudiagramm ist jedes Messpaar ein Punkt. Steigt
y y y tendenziell mit
x x x , heißt der
Zusammenhang positiv; fällt
y y y , heißt er negativ.
y i = β 0 + β 1 x i + ε i y_i = \beta_0 + \beta_1 x_i + \varepsilon_i y i = β 0 + β 1 x i + ε i
Ein Modell ist eine Annahme darüber, wie die Daten entstehen. Das Modell der
linearen Regression sagt: Jeder Messwert ist ein Punkt auf einer Geraden plus eine kleine
zufällige Abweichung.
y i = β 0 + β 1 x i + ε i y_i = \beta_0 + \beta_1 x_i + \varepsilon_i y i = β 0 + β 1 x i + ε i
Die Zeichen (gelesen „beta null“, „beta eins“, „epsilon“):
β 0 \beta_0 β 0 ist der Achsenabschnitt , im Skript auch Interzept genannt. Das
ist der Wert der Geraden bei x = 0 x = 0 x = 0 , also dort, wo sie die senkrechte Achse schneidet.
β 1 \beta_1 β 1 ist die Steigung . Sie sagt, um wie viel sich y y y ändert, wenn x x x um 1
größer wird. Hier: um wie viel sich die Löslichkeit ändert, wenn das Wasser 1 °C wärmer
wird. Ist β 1 \beta_1 β 1 negativ, fällt die Gerade.
ε i \varepsilon_i ε i ist der Fehler von Messung i i i : die zufällige Abweichung des
Messwerts von der Geraden. Er entsteht zum Beispiel durch kleine Ungenauigkeiten beim
Messen.
Annahme an die Fehler (Skript): ε 1 , … , ε 12 \varepsilon_1, \dots, \varepsilon_{12} ε 1 , … , ε 12 sind
u.i.v. , das heißt u nabhängig voneinander und i dentisch (gleich)
v erteilt. Und E ( ε i ) = 0 E(\varepsilon_i) = 0 E ( ε i ) = 0 : Im Mittel ist der Fehler null. Die Punkte
liegen also mal etwas über, mal etwas unter der Geraden, aber nicht systematisch auf einer
Seite.
β 0 \beta_0 β 0 und β 1 \beta_1 β 1 kennt niemand. Sie müssen aus den zwölf Messpaaren geschätzt
werden. Wie, zeigen die nächsten Schritte.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“): Der
Erwartungswert
E ( X ) E(X) E ( X ) einer Zufallsvariablen ist der Wert, um den sie im Mittel schwankt.
y ^ i = β ^ 0 + β ^ 1 x i \hat y_i = \hat\beta_0 + \hat\beta_1 x_i y ^ i = β ^ 0 + β ^ 1 x i ,
e i = y i − y ^ i e_i = y_i - \hat y_i e i = y i − y ^ i
Aus den Daten werden Schätzwerte für β 0 \beta_0 β 0 und β 1 \beta_1 β 1 berechnet. Ein Dach über dem
Zeichen heißt „geschätzt“: β ^ 0 \hat\beta_0 β ^ 0 und β ^ 1 \hat\beta_1 β ^ 1 (gelesen „beta null Dach“,
„beta eins Dach“). Damit hat man die geschätzte Gerade , die
Regressionsgerade :
y ^ = β ^ 0 + β ^ 1 x \hat y = \hat\beta_0 + \hat\beta_1 x y ^ = β ^ 0 + β ^ 1 x
Zwei Begriffe braucht man ab jetzt ständig:
Der angepasste Wert y ^ i \hat y_i y ^ i ist der Punkt auf der Geraden bei der Temperatur
x i x_i x i . Er ist das, was die Gerade für Messung i i i „erwartet“.
Das Residuum e i = y i − y ^ i e_i = y_i - \hat y_i e i = y i − y ^ i (Mehrzahl: Residuen) ist der Rest, den die
Gerade nicht erklärt: Messwert minus Wert auf der Geraden.
Liegt ein Punkt über der Geraden, ist sein Residuum positiv. Liegt er
darunter , ist es negativ.
Im Bild ist die Gerade schon eingezeichnet. Wie man sie findet, zeigen die Schritte 6 bis
12. Die senkrechten Striche sind die Residuen: grün mit „+“ für Punkte über der Geraden,
rot mit „−“ für Punkte darunter.
Residuum und Fehler sind nicht dasselbe. Der Fehler ε i \varepsilon_i ε i ist der Abstand
zur wahren , unbekannten Geraden. Das Residuum e i e_i e i ist der Abstand zur
geschätzten Geraden. Das Residuum kann man ausrechnen, den Fehler nicht.
S S E = ∑ e i 2 → min SSE = \sum e_i^2 \to \min S S E = ∑ e i 2 → min
Durch zwölf Punkte kann man viele Geraden legen. Welche ist die beste? Die Antwort des
Skripts heißt Methode der kleinsten Quadrate :
Jedes Residuum wird quadriert, also mit sich selbst malgenommen.
Die Quadrate werden addiert. Die Summe heißt S S E SSE S S E , vom englischen
sum of squared errors . Das Wort errors (Fehler) ist dabei ungenau:
Quadriert werden nicht die unbekannten Fehler ε i \varepsilon_i ε i aus Schritt 5, sondern die
Residuen e i e_i e i . Hier heißt S S E SSE S S E deshalb Summe der Residuenquadrate .
Die beste Gerade ist die, bei der S S E SSE S S E so klein wie möglich ist.
Warum quadrieren? Man könnte die Residuen auch einfach addieren. Aber dann heben
sich Plus und Minus auf: Ein Punkt 3 über der Geraden und einer 3 darunter ergeben
zusammen + 3 + ( − 3 ) = 0 +3 + (-3) = 0 + 3 + ( − 3 ) = 0 , als läge alles perfekt. Quadriert ist beides positiv: 9 + 9 = 18 9 + 9 =
18 9 + 9 = 18 . Jede Abweichung zählt, egal in welche Richtung.
Ein zweiter Grund: Durch das Quadrat zählen große Abweichungen besonders stark. Ein
Residuum von 2 trägt 4 bei, eines von 4 schon 16. Die Gerade vermeidet deshalb vor allem
große Ausreißer von der Linie. Und für die Summe der Quadrate gibt es eine feste Formel
für die beste Gerade (nächster Schritt).
Im Bild hat Messung 1 bei 15 °C das größte Residuum. Es trägt am meisten zu S S E SSE S S E bei.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Auch dort
wurden Abweichungen quadriert, bevor man sie addiert, damit sich positive und negative
nicht aufheben.
β ^ 1 = ∑ ( x i − x ˉ ) ( y i − y ˉ ) ∑ ( x i − x ˉ ) 2 \hat\beta_1 = \dfrac{\sum (x_i-\bar x)(y_i-\bar y)}{\sum (x_i-\bar x)^2} β ^ 1 = ∑ ( x i − x ˉ ) 2 ∑ ( x i − x ˉ ) ( y i − y ˉ ) ,
β ^ 0 = y ˉ − β ^ 1 x ˉ \hat\beta_0 = \bar y - \hat\beta_1 \bar x β ^ 0 = y ˉ − β ^ 1 x ˉ
Welche Gerade macht S S E SSE S S E am kleinsten? Das lässt sich mit Differentialrechnung ein für
alle Mal lösen. Das Ergebnis sind zwei Formeln. Die Herleitung ist hier nicht nötig; man
benutzt die Formeln wie ein Rezept.
Steigung:
β ^ 1 = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) ∑ i = 1 n ( x i − x ˉ ) 2 \hat\beta_1 = \dfrac{\sum_{i=1}^{n} (x_i - \bar x)(y_i - \bar y)}{\sum_{i=1}^{n} (x_i -
\bar x)^2} β ^ 1 = ∑ i = 1 n ( x i − x ˉ ) 2 ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ )
Achsenabschnitt:
β ^ 0 = y ˉ − β ^ 1 x ˉ \hat\beta_0 = \bar y - \hat\beta_1 \bar x β ^ 0 = y ˉ − β ^ 1 x ˉ
Dabei ist x ˉ \bar x x ˉ (gelesen „x quer“) der Mittelwert der Temperaturen und y ˉ \bar y y ˉ der
Mittelwert der Löslichkeiten. Das Zeichen ∑ \sum ∑ heißt: für alle i i i von 1 bis n n n
ausrechnen und addieren.
Was steckt in der Steigung? Im Zähler steht dieselbe Summe wie in der
Stichprobenkovarianz s X Y s_{XY} s X Y , im Nenner dieselbe wie in der Stichprobenvarianz s X 2 s_X^2 s X 2
von x x x . Beide haben den Vorfaktor 1 n − 1 \frac{1}{n-1} n − 1 1 . Teilt man Zähler und Nenner durch n − 1 n -
1 n − 1 , ändert sich der Bruch nicht, und es steht da: β ^ 1 = s X Y s X 2 \hat\beta_1 = \frac{s_{XY}}{s_X^2} β ^ 1 = s X 2 s X Y .
Das Vorzeichen der Steigung ist also das Vorzeichen der Kovarianz.
Wichtig: Diese Formeln stehen nicht im Skript . Das Skript und die
Musterlösung rechnen nur mit R, mit dem Befehl lm. R rechnet
dabei genau diese Formeln aus. Die Rechnung von Hand zeigt, was hinter der R-Ausgabe
steckt; Schritt 19 prüft, dass dieselben Zahlen herauskommen.
Für die Formeln braucht man: die beiden Mittelwerte (Schritt 8), die Abweichungen davon
(Schritt 9) und zwei Summen (Schritt 10).
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“):
Stichprobenkovarianz
s X Y = 1 n − 1 ∑ ( x i − x ˉ ) ( y i − y ˉ ) s_{XY} = \frac{1}{n-1}\sum (x_i - \bar x)(y_i - \bar y) s X Y = n − 1 1 ∑ ( x i − x ˉ ) ( y i − y ˉ ) . Sie ist
positiv bei gleichgerichtetem und negativ bei gegenläufigem Zusammenhang.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“):
Stichprobenvarianz
s X 2 = 1 n − 1 ∑ ( x i − x ˉ ) 2 s_X^2 = \frac{1}{n-1}\sum (x_i - \bar x)^2 s X 2 = n − 1 1 ∑ ( x i − x ˉ ) 2 : die quadrierten
Abweichungen vom Mittelwert, addiert und durch
n − 1 n - 1 n − 1 geteilt.
x ˉ = 46,6667 \bar x = 46{,}6667 x ˉ = 46 , 6667 ,
y ˉ = 29,1667 ⋅ 10 − 4 \bar y = 29{,}1667 \cdot 10^{-4} y ˉ = 29 , 1667 ⋅ 1 0 − 4
Zuerst die beiden Mittelwerte : alle Werte addieren und durch ihre Anzahl n = 12 n = 12 n = 12
teilen.
Temperaturen: Die Summe ist 560. Geteilt durch 12:
x ˉ = 560 12 = 46,6667 \bar x = \dfrac{560}{12} = 46{,}6667 x ˉ = 12 560 = 46 , 6667 °C (genau 46 2 3 46\tfrac{2}{3} 46 3 2 )
Löslichkeiten: Die Summe der Zahlen in 10 − 4 10^{-4} 1 0 − 4 ist 350, also 350 ⋅ 10 − 4 = 0,035 350 \cdot 10^{-4} =
0{,}035 350 ⋅ 1 0 − 4 = 0 , 035 . Geteilt durch 12:
y ˉ = 350 ⋅ 10 − 4 12 = 29,1667 ⋅ 10 − 4 = 0,00291667 \bar y = \dfrac{350 \cdot 10^{-4}}{12} = 29{,}1667 \cdot 10^{-4} = 0{,}00291667 y ˉ = 12 350 ⋅ 1 0 − 4 = 29 , 1667 ⋅ 1 0 − 4 = 0 , 00291667
Gerundet wird auf vier Nachkommastellen, weil mit beiden Werten weitergerechnet wird.
Der Punkt ( x ˉ ; y ˉ ) (\bar x;\ \bar y) ( x ˉ ; y ˉ ) heißt Schwerpunkt der Punktwolke. Im Bild ist er die
Raute. Er liegt in der „Mitte“ der Punkte, nach rechts und nach oben gemittelt.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Der
Stichprobenmittelwert ist
x ˉ = 1 n ∑ i = 1 n x i \bar x = \frac{1}{n}\sum_{i=1}^{n} x_i x ˉ = n 1 ∑ i = 1 n x i , die Summe aller Werte
geteilt durch ihre Anzahl.
x 1 − x ˉ = − 31,6667 x_1 - \bar x = -31{,}6667 x 1 − x ˉ = − 31 , 6667 ,
y 1 − y ˉ = + 18,8333 ⋅ 10 − 4 y_1 - \bar y = +18{,}8333 \cdot 10^{-4} y 1 − y ˉ = + 18 , 8333 ⋅ 1 0 − 4
Die Formel für β ^ 1 \hat\beta_1 β ^ 1 rechnet nicht mit den Messwerten selbst, sondern mit ihren
Abweichungen vom Mittelwert. Für jede Messung zwei Zahlen:
x i − x ˉ x_i - \bar x x i − x ˉ : wie weit die Temperatur vom Mittel 46,6667 °C entfernt ist.
y i − y ˉ y_i - \bar y y i − y ˉ : wie weit die Löslichkeit vom Mittel 29,1667 ⋅ 10 − 4 29{,}1667 \cdot 10^{-4} 29 , 1667 ⋅ 1 0 − 4 entfernt
ist.
Für Messung 1: 15 − 46,6667 = − 31,6667 15 - 46{,}6667 = -31{,}6667 15 − 46 , 6667 = − 31 , 6667 (kälter als im Mittel) und 48 − 29,1667 = + 18,8333 48 - 29{,}1667 =
+18{,}8333 48 − 29 , 1667 = + 18 , 8333 , also + 18,8333 ⋅ 10 − 4 +18{,}8333 \cdot 10^{-4} + 18 , 8333 ⋅ 1 0 − 4 (mehr Sauerstoff als im Mittel). Die Tabelle
rechts zeigt alle zwölf.
Im Bild teilen die beiden gestrichelten Linien durch den Schwerpunkt die Fläche in vier
Viertel. Links der senkrechten Linie ist x i − x ˉ x_i - \bar x x i − x ˉ negativ, rechts positiv. Über der
waagerechten Linie ist y i − y ˉ y_i - \bar y y i − y ˉ positiv, darunter negativ.
Auffällig: Die kalten Messungen (links) liegen alle oben, die warmen (rechts) alle
unten. Nur Messung 7 bei 45 °C liegt ganz knapp links unten, fast auf dem Schwerpunkt.
Probe: Die Abweichungen vom Mittelwert ergeben zusammen 0. Das gilt immer, weil der
Mittelwert genau so festgelegt ist. Mit den gerundeten Zahlen der Tabelle bleibt ein
kleiner Rundungsrest.
∑ ( x i − x ˉ ) ( y i − y ˉ ) = − 3.098,33 ⋅ 10 − 4 \sum (x_i-\bar x)(y_i-\bar y) = -3.098{,}33 \cdot 10^{-4} ∑ ( x i − x ˉ ) ( y i − y ˉ ) = − 3.098 , 33 ⋅ 1 0 − 4 ,
∑ ( x i − x ˉ ) 2 = 6.366,67 \sum (x_i-\bar x)^2 =
6.366{,}67 ∑ ( x i − x ˉ ) 2 = 6.366 , 67
Jetzt die beiden Summen aus der Formel von Schritt 7.
Zähler: Für jede Messung die beiden Abweichungen malnehmen, dann alles addieren.
Für Messung 1:
( − 31,6667 ) ⋅ ( + 18,8333 ) = − 596,39 (-31{,}6667) \cdot (+18{,}8333) = -596{,}39 ( − 31 , 6667 ) ⋅ ( + 18 , 8333 ) = − 596 , 39 , also − 596,39 ⋅ 10 − 4 -596{,}39 \cdot 10^{-4} − 596 , 39 ⋅ 1 0 − 4
Minus mal plus ergibt minus. Im Bild ist das die Fläche des roten Rechtecks zwischen Punkt
1 und dem Schwerpunkt: 31,67 31{,}67 31 , 67 breit und 18,83 18{,}83 18 , 83 hoch, mit negativem Vorzeichen, weil
es links oben liegt.
Warum sind fast alle Produkte negativ? Links oben ist x i − x ˉ x_i - \bar x x i − x ˉ negativ und
y i − y ˉ y_i - \bar y y i − y ˉ positiv, rechts unten umgekehrt. In beiden Fällen ist das Produkt negativ.
Fast alle Punkte liegen in diesen zwei Vierteln. Nur Messung 7 liegt links unten:
( − 1,6667 ) ⋅ ( − 0,1667 ) = + 0,28 (-1{,}6667) \cdot (-0{,}1667) = +0{,}28 ( − 1 , 6667 ) ⋅ ( − 0 , 1667 ) = + 0 , 28 , ein winziges Plus.
Alle zwölf Produkte addiert:
∑ ( x i − x ˉ ) ( y i − y ˉ ) = − 3.098,33 ⋅ 10 − 4 \sum (x_i - \bar x)(y_i - \bar y) = \mathbf{-3.098{,}33 \cdot 10^{-4}} ∑ ( x i − x ˉ ) ( y i − y ˉ ) = − 3.098 , 33 ⋅ 1 0 − 4
Nenner: Jede Temperatur-Abweichung quadrieren und addieren. Für Messung 1:
( − 31,6667 ) 2 = 1.002,78 (-31{,}6667)^2 = 1.002{,}78 ( − 31 , 6667 ) 2 = 1.002 , 78 . Alle zwölf zusammen:
∑ ( x i − x ˉ ) 2 = 6.366,67 \sum (x_i - \bar x)^2 = \mathbf{6.366{,}67} ∑ ( x i − x ˉ ) 2 = 6.366 , 67
Zur Rundung: Die Summen sind mit ungerundeten Werten gerechnet. Wer die gerundeten
Zahlen der Tabelle addiert, bekommt beim Nenner 6.366,66. Der Unterschied in der letzten
Stelle ist nur Rundung.
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“):
Jedes Paar spannt mit dem Schwerpunkt ein Rechteck mit der Fläche
( x i − x ˉ ) ( y i − y ˉ ) (x_i - \bar x)(y_i -
\bar y) ( x i − x ˉ ) ( y i − y ˉ ) auf. Rechts oben und links unten zählt es positiv, links oben und rechts unten
negativ. Die Summe zeigt die gemeinsame Richtung der Punkte.
β ^ 1 = − 3.098,33 ⋅ 10 − 4 6.366,67 = − 0,486649 ⋅ 10 − 4 \hat\beta_1 = \dfrac{-3.098{,}33 \cdot 10^{-4}}{6.366{,}67} = -0{,}486649 \cdot
10^{-4} β ^ 1 = 6.366 , 67 − 3.098 , 33 ⋅ 1 0 − 4 = − 0 , 486649 ⋅ 1 0 − 4
Beide Summen aus Schritt 10 in die Formel aus Schritt 7 einsetzen:
β ^ 1 = − 3.098,33 ⋅ 10 − 4 6.366,67 \hat\beta_1 = \dfrac{-3.098{,}33 \cdot 10^{-4}}{6.366{,}67} β ^ 1 = 6.366 , 67 − 3.098 , 33 ⋅ 1 0 − 4
3.098,33 : 6.366,67 = 0,486649 3.098{,}33 : 6.366{,}67 = 0{,}486649 3.098 , 33 : 6.366 , 67 = 0 , 486649 . Der Faktor 10 − 4 10^{-4} 1 0 − 4 bleibt stehen:
β ^ 1 = − 0,486649 ⋅ 10 − 4 = − 0,0000486649 \hat\beta_1 = -0{,}486649 \cdot 10^{-4} = \mathbf{-0{,}0000486649} β ^ 1 = − 0 , 486649 ⋅ 1 0 − 4 = − 0 , 0000486649
Gerundet wird auf sechs Stellen, weil mit β ^ 1 \hat\beta_1 β ^ 1 weitergerechnet wird.
Die Einheit: y y y ist in g O₂ je 100 g H₂O, x x x in °C. Die Steigung ist
„y y y -Einheiten je x x x -Einheit“: g O₂ je 100 g H₂O je °C . Was die Zahl bedeutet,
zeigt Schritt 13.
Zweiter Weg, dasselbe Ergebnis: Erst die Stichprobenkovarianz und die
Stichprobenvarianz von x x x ausrechnen, beide mit n − 1 = 11 n - 1 = 11 n − 1 = 11 :
s X Y = − 3.098,33 ⋅ 10 − 4 : 11 = − 281,667 ⋅ 10 − 4 s_{XY} = -3.098{,}33 \cdot 10^{-4} : 11 = -281{,}667 \cdot 10^{-4} s X Y = − 3.098 , 33 ⋅ 1 0 − 4 : 11 = − 281 , 667 ⋅ 1 0 − 4
s X 2 = 6.366,67 : 11 = 578,788 s_X^2 = 6.366{,}67 : 11 = 578{,}788 s X 2 = 6.366 , 67 : 11 = 578 , 788
Dann β ^ 1 = s X Y : s X 2 = − 281,667 ⋅ 10 − 4 : 578,788 = − 0,486649 ⋅ 10 − 4 \hat\beta_1 = s_{XY} : s_X^2 = -281{,}667 \cdot 10^{-4} : 578{,}788 = -0{,}486649
\cdot 10^{-4} β ^ 1 = s X Y : s X 2 = − 281 , 667 ⋅ 1 0 − 4 : 578 , 788 = − 0 , 486649 ⋅ 1 0 − 4 . Die 11 kürzt sich weg, deshalb kommt dasselbe heraus. Mit den Daten in R
(Eingabe in Schritt 19) gibt cov(x, y) den Wert −0,02816667 aus,
also − 281,667 ⋅ 10 − 4 -281{,}667 \cdot 10^{-4} − 281 , 667 ⋅ 1 0 − 4 , und var(x) den Wert 578,7879.
Das sind genau diese beiden Zahlen.
Im Bild zeigt das Dreieck an der Geraden die Steigung: 10 °C nach rechts, dann 10 ⋅ 0,486649 ≈ 4,87 10 \cdot
0{,}486649 \approx 4{,}87 10 ⋅ 0 , 486649 ≈ 4 , 87 nach unten.
β ^ 0 = 29,1667 ⋅ 10 − 4 + 22,7103 ⋅ 10 − 4 = 51,8770 ⋅ 10 − 4 \hat\beta_0 = 29{,}1667 \cdot 10^{-4} + 22{,}7103 \cdot 10^{-4} = 51{,}8770 \cdot
10^{-4} β ^ 0 = 29 , 1667 ⋅ 1 0 − 4 + 22 , 7103 ⋅ 1 0 − 4 = 51 , 8770 ⋅ 1 0 − 4
Jetzt der Achsenabschnitt mit der zweiten Formel aus Schritt 7:
β ^ 0 = y ˉ − β ^ 1 x ˉ \hat\beta_0 = \bar y - \hat\beta_1 \bar x β ^ 0 = y ˉ − β ^ 1 x ˉ
Eingesetzt: y ˉ = 29,1667 ⋅ 10 − 4 \bar y = 29{,}1667 \cdot 10^{-4} y ˉ = 29 , 1667 ⋅ 1 0 − 4 und x ˉ = 46,6667 \bar x = 46{,}6667 x ˉ = 46 , 6667 aus Schritt 8,
β ^ 1 = − 0,486649 ⋅ 10 − 4 \hat\beta_1 = -0{,}486649 \cdot 10^{-4} β ^ 1 = − 0 , 486649 ⋅ 1 0 − 4 aus Schritt 11.
Zuerst das Produkt: 0,486649 ⋅ 46,6667 = 22,7103 0{,}486649 \cdot 46{,}6667 = 22{,}7103 0 , 486649 ⋅ 46 , 6667 = 22 , 7103 . Weil β ^ 1 \hat\beta_1 β ^ 1 negativ
ist, steht da „minus minus 22,7103“. Minus mal minus ist plus:
β ^ 0 = ( 29,1667 + 22,7103 ) ⋅ 10 − 4 = 51,8770 ⋅ 10 − 4 = 0,00518770 \hat\beta_0 = (29{,}1667 + 22{,}7103) \cdot 10^{-4} = 51{,}8770 \cdot 10^{-4} =
\mathbf{0{,}00518770} β ^ 0 = ( 29 , 1667 + 22 , 7103 ) ⋅ 1 0 − 4 = 51 , 8770 ⋅ 1 0 − 4 = 0 , 00518770
Was die Formel bedeutet: Setzt man x = x ˉ x = \bar x x = x ˉ in die Gerade ein, kommt genau
y ˉ \bar y y ˉ heraus (rechts die Umformung: β ^ 1 x ˉ \hat\beta_1 \bar x β ^ 1 x ˉ wird erst abgezogen und dann
wieder addiert). Die Regressionsgerade läuft also immer
durch den Schwerpunkt ( x ˉ ; y ˉ ) (\bar x;\ \bar y) ( x ˉ ; y ˉ ) . Im Bild geht die Gerade durch die Raute.
Links im Bild ist die Gerade gestrichelt bis x = 0 x = 0 x = 0 verlängert. Dort schneidet sie die
senkrechte Achse bei 51,88, also bei β ^ 0 \hat\beta_0 β ^ 0 .
y ^ = 0,005188 − 0,00004866 x \hat y = 0{,}005188 - 0{,}00004866\,x y ^ = 0 , 005188 − 0 , 00004866 x
Mit β ^ 0 \hat\beta_0 β ^ 0 und β ^ 1 \hat\beta_1 β ^ 1 steht die Regressionsgerade fest. Für die Antwort
werden die Koeffizienten (so heißen die Zahlen β ^ 0 \hat\beta_0 β ^ 0 und β ^ 1 \hat\beta_1 β ^ 1 vor
den Gliedern der Gleichung) auf vier gültige Ziffern gerundet (gültige Ziffern
zählen ab der ersten Ziffer, die nicht 0 ist):
y ^ = 0,005188 − 0,00004866 x \hat y = 0{,}005188 - 0{,}00004866\,x y ^ = 0 , 005188 − 0 , 00004866 x
Das Minus kommt vom negativen β ^ 1 \hat\beta_1 β ^ 1 : Die Gerade fällt.
Die Steigung in Worten: Wird das Wasser um 1 °C wärmer, lösen sich rund 0,0000487 g
Sauerstoff je 100 g Wasser weniger . Das ist eine unhandlich kleine Zahl.
Anschaulicher je 10 °C: 10 ⋅ 0,0000486649 = 0,000487 10 \cdot 0{,}0000486649 = 0{,}000487 10 ⋅ 0 , 0000486649 = 0 , 000487 , also rund 0,00049 g
weniger. Zum Vergleich: Von 15 °C auf 25 °C fielen die Messwerte von 0,0048 auf 0,0039,
also um 0,0009; von 50 °C auf 60 °C um 0,0004. Die Gerade gibt den Durchschnitt über den
ganzen Bereich.
Der Achsenabschnitt in Worten: Bei 0 °C sagt die Gerade 0,005188 voraus. Gemessen
wurde aber erst ab 15 °C. Ob die Gerade bis 0 °C noch stimmt, geben die Daten nicht her.
β ^ 0 \hat\beta_0 β ^ 0 ist hier vor allem eine Rechengröße, die die Höhe der Geraden festlegt. Mehr
dazu in Schritt 24.
Merke zum Lesen: Das Dreieck im Bild zeigt: 10 °C nach rechts, 4,87 nach unten (in
10 − 4 10^{-4} 1 0 − 4 ).
y ^ 1 = 44,577 \hat y_1 = 44{,}577 y ^ 1 = 44 , 577 ,
e 1 = + 3,423 e_1 = +3{,}423 e 1 = + 3 , 423 (in
10 − 4 10^{-4} 1 0 − 4 )
Wie gut passt die Gerade? Dazu rechnet man für jede Messung aus, wie weit sie von der
Geraden entfernt ist. Das sind die Residuen aus Schritt 5.
Angepasster Wert für Messung 1 (alles in 10 − 4 10^{-4} 1 0 − 4 ): die Temperatur x 1 = 15 x_1 = 15 x 1 = 15 in
die Gerade einsetzen.
y ^ 1 = 51,8770 − 0,486649 ⋅ 15 = 51,8770 − 7,2997 = 44,577 \hat y_1 = 51{,}8770 - 0{,}486649 \cdot 15 = 51{,}8770 - 7{,}2997 = 44{,}577 y ^ 1 = 51 , 8770 − 0 , 486649 ⋅ 15 = 51 , 8770 − 7 , 2997 = 44 , 577
Residuum: gemessen minus Gerade.
e 1 = 48 − 44,577 = + 3,423 e_1 = 48 - 44{,}577 = +3{,}423 e 1 = 48 − 44 , 577 = + 3 , 423
Messung 1 liegt also 3,423 ⋅ 10 − 4 = 0,00034 3{,}423 \cdot 10^{-4} = 0{,}00034 3 , 423 ⋅ 1 0 − 4 = 0 , 00034 über der Geraden. Die Tabelle
rechts zeigt alle zwölf, gerundet auf drei Nachkommastellen.
Probe: Die Residuen ergeben zusammen 0. Das gilt bei der Methode der kleinsten
Quadrate immer, weil die Gerade durch den Schwerpunkt läuft. Mit den gerundeten Werten:
Plus 6,844 6{,}844 6 , 844 , Minus 6,845 6{,}845 6 , 845 , Rest − 0,001 -0{,}001 − 0 , 001 aus der Rundung.
Auffällig: Die Vorzeichen sind nicht bunt gemischt. Vorne zwei Plus, in der Mitte
sechs Minus, dann drei Plus. Das greift die Ergänzung in Schritt 31 wieder auf.
S S E = ∑ e i 2 = 23,865 ⋅ 10 − 8 SSE = \sum e_i^2 = 23{,}865 \cdot 10^{-8} S S E = ∑ e i 2 = 23 , 865 ⋅ 1 0 − 8
Jetzt die Summe aus Schritt 6 für die gefundene Gerade: alle Residuen quadrieren und
addieren.
Zur Einheit: Ein Residuum in 10 − 4 10^{-4} 1 0 − 4 ergibt quadriert 10 − 4 ⋅ 10 − 4 = 10 − 8 10^{-4} \cdot 10^{-4} =
10^{-8} 1 0 − 4 ⋅ 1 0 − 4 = 1 0 − 8 . Beim Quadrieren wird also auch der Faktor quadriert.
Für Messung 1: 3,423 2 = 11,72 3{,}423^2 = 11{,}72 3 , 42 3 2 = 11 , 72 , also 11,72 ⋅ 10 − 8 11{,}72 \cdot 10^{-8} 11 , 72 ⋅ 1 0 − 8 .
Alle zwölf zusammen (mit ungerundeten Residuen gerechnet):
S S E = 23,865 ⋅ 10 − 8 SSE = 23{,}865 \cdot 10^{-8} S S E = 23 , 865 ⋅ 1 0 − 8
Was sagt die Zahl? Allein ist sie schwer zu deuten: Sie hängt von der Einheit ab
und wird mit mehr Messungen größer. Man braucht einen Vergleich. Den liefert der nächste
Schritt.
Auffällig: Messung 1 trägt allein 11,72 bei, fast die Hälfte der ganzen Summe. Das
ist die Wirkung des Quadrierens aus Schritt 6.
Keine andere Gerade hat ein kleineres S S E SSE S S E . Genau so wurde sie gefunden.
∑ ( y i − y ˉ ) 2 = 1.531,67 ⋅ 10 − 8 \sum (y_i - \bar y)^2 = 1.531{,}67 \cdot 10^{-8} ∑ ( y i − y ˉ ) 2 = 1.531 , 67 ⋅ 1 0 − 8
Womit vergleicht man S S E SSE S S E ? Mit der Streuung, die man ohne jedes Modell hätte.
Angenommen, man kennt die Temperatur nicht. Dann wäre die beste Vorhersage für jede
Messung einfach der Mittelwert y ˉ = 29,1667 ⋅ 10 − 4 \bar y = 29{,}1667 \cdot 10^{-4} y ˉ = 29 , 1667 ⋅ 1 0 − 4 . Die Abweichungen davon
sind y i − y ˉ y_i - \bar y y i − y ˉ (Schritt 9). Quadriert und addiert ergibt das die
Gesamtstreuung von y y y :
∑ i = 1 12 ( y i − y ˉ ) 2 \sum_{i=1}^{12} (y_i - \bar y)^2 ∑ i = 1 12 ( y i − y ˉ ) 2
Für Messung 1: 18,8333 2 = 354,69 18{,}8333^2 = 354{,}69 18 , 833 3 2 = 354 , 69 , also 354,69 ⋅ 10 − 8 354{,}69 \cdot 10^{-8} 354 , 69 ⋅ 1 0 − 8 . Alle zwölf
zusammen (mit ungerundeten Abweichungen gerechnet):
∑ ( y i − y ˉ ) 2 = 1.531,67 ⋅ 10 − 8 \sum (y_i - \bar y)^2 = \mathbf{1.531{,}67 \cdot 10^{-8}} ∑ ( y i − y ˉ ) 2 = 1.531 , 67 ⋅ 1 0 − 8
Im Bild sind das die gestrichelten senkrechten Striche von jedem Punkt zur waagerechten
Linie y ˉ \bar y y ˉ . Sie sind viel länger als die Residuen zur Geraden.
Der Vergleich: Ohne Modell bleibt eine Streuung von 1.531,67 (in 10 − 8 10^{-8} 1 0 − 8 ). Mit
der Geraden bleibt nur noch S S E = 23,865 SSE = 23{,}865 S S E = 23 , 865 . Die Gerade hat also fast die ganze Streuung
erklärt. Diesen Vergleich fasst der nächste Schritt in eine Zahl.
Mit den gerundeten Zahlen der Tabelle kommt 1.531,65 heraus; das ist nur Rundung.
R 2 = 1 − 23,865 1.531,67 = 0,9844 R^2 = 1 - \dfrac{23{,}865}{1.531{,}67} = 0{,}9844 R 2 = 1 − 1.531 , 67 23 , 865 = 0 , 9844 (substantiell)
Das Bestimmtheitsmaß R 2 R^2 R 2 (gelesen „R Quadrat“) beschreibt laut Skript den Anteil
der Variation in den Daten, der durch das Modell erklärt wird. „Variation“ heißt hier: die
Streuung der y y y -Werte aus Schritt 16. Die Formel aus dem Skript:
R 2 = 1 − S S E ∑ ( y i − y ˉ ) 2 R^2 = 1 - \dfrac{SSE}{\sum (y_i - \bar y)^2} R 2 = 1 − ∑ ( y i − y ˉ ) 2 S S E
So liest man sie: Der Bruch ist der Anteil der Streuung, der mit der Geraden
übrig bleibt . 1 minus dieser Anteil ist der Teil, den die Gerade erklärt .
Eingesetzt, S S E SSE S S E aus Schritt 15 und die Gesamtstreuung aus Schritt 16. Der Faktor
10 − 8 10^{-8} 1 0 − 8 steht oben und unten und kürzt sich:
23,865 1.531,67 = 0,01558 \dfrac{23{,}865}{1.531{,}67} = 0{,}01558 1.531 , 67 23 , 865 = 0 , 01558
R 2 = 1 − 0,01558 = 0,98442 ≈ 0,9844 R^2 = 1 - 0{,}01558 = 0{,}98442 \approx \mathbf{0{,}9844} R 2 = 1 − 0 , 01558 = 0 , 98442 ≈ 0 , 9844
In Worten: Nur 1,6 % der Streuung der Löslichkeit bleiben übrig.
98,4 % erklärt die Gerade durch die Temperatur.
Die Grenzen: R 2 R^2 R 2 liegt immer zwischen 0 und 1. R 2 = 1 R^2 = 1 R 2 = 1 hieße: alle Punkte genau
auf der Geraden, S S E = 0 SSE = 0 S S E = 0 . R 2 = 0 R^2 = 0 R 2 = 0 hieße: Die Gerade erklärt nichts, sie ist nicht
besser als der Mittelwert.
Bewertung mit der Faustregel aus dem Skript (Tabelle rechts): 0,9844 ≥ 0,75 0{,}9844 \ge
0{,}75 0 , 9844 ≥ 0 , 75 . Das Modell beschreibt die Variation substantiell . Weil der Wert sogar nahe
an 1 liegt, kann man die Modellgüte „sehr hoch“ nennen.
ρ ^ = − 0,99218 \hat\rho = -0{,}99218 ρ ^ = − 0 , 99218 ,
ρ ^ 2 = 0,98442 = R 2 \hat\rho^2 = 0{,}98442 = R^2 ρ ^ 2 = 0 , 98442 = R 2 ✓
Bei einer Geraden (einfache lineare Regression, nur ein x x x ) gilt eine nützliche
Beziehung: Das Bestimmtheitsmaß ist das Quadrat der Stichprobenkorrelation, R 2 = ρ ^ 2 R^2 =
\hat\rho^2 R 2 = ρ ^ 2 . Das ist eine gute Probe für die Rechnung.
Die Stichprobenkorrelation ist ρ ^ = s X Y s X s Y \hat\rho = \frac{s_{XY}}{s_X\, s_Y} ρ ^ = s X s Y s X Y (gelesen „rho Dach“).
Gebraucht werden die beiden Standardabweichungen:
s X = s X 2 = 578,788 = 24,0580 s_X = \sqrt{s_X^2} = \sqrt{578{,}788} = 24{,}0580 s X = s X 2 = 578 , 788 = 24 , 0580 (mit s X 2 s_X^2 s X 2 aus Schritt 11)
s Y 2 = 1.531,67 ⋅ 10 − 8 : 11 = 139,242 ⋅ 10 − 8 s_Y^2 = 1.531{,}67 \cdot 10^{-8} : 11 = 139{,}242 \cdot 10^{-8} s Y 2 = 1.531 , 67 ⋅ 1 0 − 8 : 11 = 139 , 242 ⋅ 1 0 − 8 (Summe aus Schritt
16), also s Y = 139,242 ⋅ 10 − 4 = 11,8001 ⋅ 10 − 4 s_Y = \sqrt{139{,}242} \cdot 10^{-4} = 11{,}8001 \cdot 10^{-4} s Y = 139 , 242 ⋅ 1 0 − 4 = 11 , 8001 ⋅ 1 0 − 4 . Die Wurzel
aus 10 − 8 10^{-8} 1 0 − 8 ist 10 − 4 10^{-4} 1 0 − 4 .
Eingesetzt mit s X Y = − 281,667 ⋅ 10 − 4 s_{XY} = -281{,}667 \cdot 10^{-4} s X Y = − 281 , 667 ⋅ 1 0 − 4 aus Schritt 11. Oben und unten steht
10 − 4 10^{-4} 1 0 − 4 und kürzt sich:
ρ ^ = − 281,667 24,0580 ⋅ 11,8001 = − 281,667 283,887 = − 0,99218 \hat\rho = \dfrac{-281{,}667}{24{,}0580 \cdot 11{,}8001} = \dfrac{-281{,}667}{283{,}887}
= -0{,}99218 ρ ^ = 24 , 0580 ⋅ 11 , 8001 − 281 , 667 = 283 , 887 − 281 , 667 = − 0 , 99218
Nach der Daumenregel aus Aufgabe 1 ist das eine starke negative Korrelation, denn
∣ ρ ^ ∣ > 0,7 |\hat\rho| > 0{,}7 ∣ ρ ^ ∣ > 0 , 7 .
Quadriert: ( − 0,99218 ) 2 = 0,98442 (-0{,}99218)^2 = 0{,}98442 ( − 0 , 99218 ) 2 = 0 , 98442 . Das ist genau R 2 R^2 R 2 aus Schritt 17. Die Rechnung
stimmt.
Beachte: ρ ^ \hat\rho ρ ^ hat ein Vorzeichen, R 2 R^2 R 2 nicht. Die Richtung des Zusammenhangs
(hier fallend) steckt in der Steigung β ^ 1 \hat\beta_1 β ^ 1 , nicht in R 2 R^2 R 2 . Die Beziehung R 2 = ρ ^ 2 R^2 =
\hat\rho^2 R 2 = ρ ^ 2 gilt nur für die Gerade, nicht für die Parabel aus Teil (iii).
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“): Die
Stichprobenkorrelation
ρ ^ = s X Y s X s Y \hat\rho = \frac{s_{XY}}{s_X s_Y} ρ ^ = s X s Y s X Y liegt zwischen
− 1 -1 − 1 und
1 1 1 .
Daumenregel: schwach für
0,5 < ∣ ρ ^ ∣ ≤ 0,7 0{,}5 < |\hat\rho| \le 0{,}7 0 , 5 < ∣ ρ ^ ∣ ≤ 0 , 7 , stark für
∣ ρ ^ ∣ > 0,7 |\hat\rho| >
0{,}7 ∣ ρ ^ ∣ > 0 , 7 . In R:
cor(x, y).
Estimate:
5,188 ⋅ 10 − 3 5{,}188 \cdot 10^{-3} 5 , 188 ⋅ 1 0 − 3 und
− 4,867 ⋅ 10 − 5 -4{,}867 \cdot 10^{-5} − 4 , 867 ⋅ 1 0 − 5
✓
Die Musterlösung rechnet (i) mit R. Die Befehle:
x <- c(…) und y <- c(…) geben
die Daten ein. R schreibt Zahlen mit Punkt statt Komma.
lm steht für linear model , lineares Modell.
y ~ x heißt: „y y y in Abhängigkeit von x x x “. Die abhängige
Variable steht links der Tilde ~.
fit <- speichert das Ergebnis unter dem Namen
fit.
summary(fit) gibt eine Zusammenfassung aus.
Die Ausgabe ist lang. Für die Aufgabe braucht man nur drei Stellen: die Spalte
Estimate (hier), die Spalte
Pr(>|t|) (Schritt 20) und die R 2 R^2 R 2 -Zeile (Schritt 21).
Call wiederholt den Befehl,
Residuals fasst die Residuen aus Schritt 14 zusammen (kleinstes
− 1,844 ⋅ 10 − 4 -1{,}844 \cdot 10^{-4} − 1 , 844 ⋅ 1 0 − 4 , größtes + 3,423 ⋅ 10 − 4 +3{,}423 \cdot 10^{-4} + 3 , 423 ⋅ 1 0 − 4 ).
Die Zahlenschreibweise: 5.188e-03 heißt 5,188 ⋅ 10 − 3 5{,}188 \cdot
10^{-3} 5 , 188 ⋅ 1 0 − 3 , also das Komma um drei Stellen nach links: 0,005188 0{,}005188 0 , 005188 . Ebenso ist
-4.867e-05 gleich − 4,867 ⋅ 10 − 5 = − 0,00004867 -4{,}867 \cdot 10^{-5} = -0{,}00004867 − 4 , 867 ⋅ 1 0 − 5 = − 0 , 00004867 .
Spalte Estimate (Schätzwert):
Zeile (Intercept), der Achsenabschnitt: 0,005188 0{,}005188 0 , 005188 . Von Hand
(Schritt 12): 0,0051877 0{,}0051877 0 , 0051877 ✓
Zeile x, die Steigung: − 0,00004867 -0{,}00004867 − 0 , 00004867 . Von Hand (Schritt 11):
− 0,0000486649 -0{,}0000486649 − 0 , 0000486649 .
Warum 4867 und nicht 4866? summary rundet in zwei Stufen und
landet dadurch in der letzten Stelle eins höher. Den genauen Wert zeigt
coef(fit) (von coefficients , Koeffizienten): − 4,866492 ⋅ 10 − 5 -4{,}866492
\cdot 10^{-5} − 4 , 866492 ⋅ 1 0 − 5 . Das stimmt mit der Rechnung von Hand überein. R rechnet also genau die
Formeln aus Schritt 7.
Steigung:
p = 2,27 ⋅ 10 − 10 < 0,05 p = 2{,}27 \cdot 10^{-10} < 0{,}05 p = 2 , 27 ⋅ 1 0 − 10 < 0 , 05 (***)
Rechts neben dem Schätzwert stehen in jeder Zeile drei Spalten. Zusammen sind sie ein
Test . Für die Steigung fragt er: Könnte das wahre β 1 \beta_1 β 1 null sein, sodass die
Temperatur die Löslichkeit gar nicht beeinflusst?
H 0 : β 1 = 0 H_0:\ \beta_1 = 0 H 0 : β 1 = 0 gegen H A : β 1 ≠ 0 H_A:\ \beta_1 \ne 0 H A : β 1 = 0
Std. Error ist der Standardfehler des Schätzwerts: wie
stark β ^ 1 \hat\beta_1 β ^ 1 allein durch Zufall schwanken würde.
t value ist die Teststatistik: Schätzwert geteilt durch
Standardfehler. Mit den gerundeten Zahlen: − 4,866 ⋅ 10 − 5 : 1,936 ⋅ 10 − 6 ≈ − 25,13 -4{,}866 \cdot 10^{-5} : 1{,}936 \cdot
10^{-6} \approx -25{,}13 − 4 , 866 ⋅ 1 0 − 5 : 1 , 936 ⋅ 1 0 − 6 ≈ − 25 , 13 . R zeigt − 25,14 -25{,}14 − 25 , 14 , weil es ungerundet rechnet: − 4,866492 ⋅ 10 − 5 : 1,936094 ⋅ 10 − 6 = − 25,136 -4{,}866492
\cdot 10^{-5} : 1{,}936094 \cdot 10^{-6} = -25{,}136 − 4 , 866492 ⋅ 1 0 − 5 : 1 , 936094 ⋅ 1 0 − 6 = − 25 , 136 . Der Schätzwert liegt also gut 25
Standardfehler von 0 entfernt.
Pr(>|t|) ist der p p p -Wert . „Pr“ steht für
probability , Wahrscheinlichkeit. ∣ t ∣ |t| ∣ t ∣ ist der Betrag von t t t (die Zahl ohne
Vorzeichen). Getestet wird zweiseitig.
Voraussetzung: Diese p p p -Werte gelten, wenn die Fehler ε i \varepsilon_i ε i zusätzlich
zu Schritt 4 normalverteilt sind. Dann ist die Teststatistik unter H 0 H_0 H 0 t-verteilt
mit n − 2 = 12 − 2 = 10 n - 2 = 12 - 2 = 10 n − 2 = 12 − 2 = 10 Freiheitsgraden (zwei Koeffizienten geschätzt). Das meint R mit
on 10 degrees of freedom in der Zeile
Residual standard error.
Hier: p = 2,27 ⋅ 10 − 10 = 0,000000000227 p = 2{,}27 \cdot 10^{-10} = 0{,}000000000227 p = 2 , 27 ⋅ 1 0 − 10 = 0 , 000000000227 . Das ist winzig und weit unter
α = 0,05 \alpha = 0{,}05 α = 0 , 05 . Also wird H 0 H_0 H 0 verworfen: Die Steigung ist signifikant von 0
verschieden. Die Temperatur hat nachweisbar einen Einfluss.
Die Sternchen hinter dem p p p -Wert sind eine Kurzschrift dafür, wie klein er ist. R
erklärt sie in der Zeile Signif. codes; die Tabelle rechts
übersetzt sie. Drei Sternchen heißen p ≤ 0,001 p \le 0{,}001 p ≤ 0 , 001 .
Die Zeile (Intercept) testet H 0 : β 0 = 0 H_0:\ \beta_0 = 0 H 0 : β 0 = 0 . Das ist hier
ohne Bedeutung: Niemand erwartet, dass sich bei 0 °C kein Sauerstoff löst.
Nur für Interessierte: Bei der Geraden ist dieser Test genau der Korrelationstest
nach Pearson. Seine Teststatistik n − 2 ⋅ ρ ^ 1 − ρ ^ 2 = 10 ⋅ − 0,99218 0,01558 ≈ − 25,14 \sqrt{n-2} \cdot \frac{\hat\rho}{\sqrt{1 - \hat\rho^2}}
= \sqrt{10} \cdot \frac{-0{,}99218}{\sqrt{0{,}01558}} \approx -25{,}14 n − 2 ⋅ 1 − ρ ^ 2 ρ ^ = 10 ⋅ 0 , 01558 − 0 , 99218 ≈ − 25 , 14 ist derselbe
t value.
Aus Blatt 7, Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Ein Test
stellt
H 0 H_0 H 0 gegen
H A H_A H A . Der
p p p -Wert ist die Wahrscheinlichkeit, unter
H 0 H_0 H 0 ein
mindestens so extremes Ergebnis zu erhalten. Ist
p ≤ α p \le \alpha p ≤ α , wird
H 0 H_0 H 0 verworfen; das
Ergebnis heißt dann signifikant.
Aus Aufgabe 2 dieses Blatts („Korrelationstest: Gewicht und Stärke von Kartoffeln“):
Der Korrelationstest prüft
H 0 : ρ = 0 H_0:\ \rho = 0 H 0 : ρ = 0 mit der Teststatistik
n − 2 ⋅ ρ ^ / 1 − ρ ^ 2 \sqrt{n-2} \cdot
\hat\rho / \sqrt{1 - \hat\rho^2} n − 2 ⋅ ρ ^ / 1 − ρ ^ 2 .
Multiple R-squared = R 2 = 0,9844 = R^2 = 0{,}9844 = R 2 = 0 , 9844 ✓
In der vorletzten Zeile stehen zwei Zahlen mit „R-squared“, englisch für „R Quadrat“.
Multiple R-squared: 0.9844 ist das
Bestimmtheitsmaß R 2 R^2 R 2 aus Schritt 17, genau nach der Formel des Skripts. ✓
Adjusted R-squared: 0.9829 ist das
adjustierte (angepasste) R 2 R^2 R 2 . Es ist etwas kleiner und dient einem anderen
Zweck: dem Vergleich von Modellen mit verschieden vielen Koeffizienten. Gebraucht wird
es erst in Teil (iii); Schritt 28 erklärt es.
Zur Musterlösung: Dort steht „Das Bestimmtheitsmaß R 2 ≈ 0,9829 R^2 \approx 0{,}9829 R 2 ≈ 0 , 9829 (Adjusted
R-squared) zeigt, dass rund 98,3 % der Streuung erklärt werden“. Das Bestimmtheitsmaß nach
der Skriptformel ist aber 0,9844 0{,}9844 0 , 9844 ; erklärt sind also 98,4 %. Probe: 1 − 23,865 1.531,67 = 0,9844 1 -
\frac{23{,}865}{1.531{,}67} = 0{,}9844 1 − 1.531 , 67 23 , 865 = 0 , 9844 (Schritt 17), und ρ ^ 2 = 0,9844 \hat\rho^2 = 0{,}9844 ρ ^ 2 = 0 , 9844 (Schritt
18). Für die Bewertung ändert das nichts: Beide Werte sind weit über 0,75.
Probe in R: cor(x, y) gibt die Stichprobenkorrelation
− 0,9921788 -0{,}9921788 − 0 , 9921788 aus, ihr Quadrat ist 0,9844188 0{,}9844188 0 , 9844188 . Das ist genau
Multiple R-squared, wie in Schritt 18 von Hand gezeigt.
Die übrigen Zeilen (Residual standard error,
F-statistic) werden für diese Aufgabe nicht gebraucht.
y ^ = 0,005188 − 0,00004866 x \hat y = 0{,}005188 - 0{,}00004866\,x y ^ = 0 , 005188 − 0 , 00004866 x ,
R 2 ≈ 0,9844 R^2 \approx 0{,}9844 R 2 ≈ 0 , 9844
Jetzt ist alles für die Antwort zu (i) beisammen.
Abhängigkeit: Die Regressionsgerade ist y ^ = 0,005188 − 0,00004866 x \hat y = 0{,}005188 - 0{,}00004866\,x y ^ = 0 , 005188 − 0 , 00004866 x
(Schritte 11 bis 13). Die Löslichkeit sinkt mit steigender Temperatur, je 10 °C
um rund 0,00049 g O₂ je 100 g H₂O.
Modellgüte: R 2 ≈ 0,9844 R^2 \approx 0{,}9844 R 2 ≈ 0 , 9844 (Schritt 17). Die Gerade erklärt 98,4 % der
Streuung. Nach der Faustregel ist das substantiell, also eine sehr hohe Modellgüte.
Zusätzlich: Die Steigung ist hochsignifikant, p = 2,27 ⋅ 10 − 10 p = 2{,}27 \cdot 10^{-10} p = 2 , 27 ⋅ 1 0 − 10
(Schritt 20). Ein Zufallsergebnis ist praktisch ausgeschlossen.
Merke: Eine Regression beschreibt man immer mit zwei Teilen: der Gleichung (was
passiert, wie stark) und der Modellgüte (wie gut die Gleichung zu den Daten passt). Die
Gleichung gehört in Worten der Aufgabe gedeutet.
y ^ ( 55 ) = ( 51,8770 − 26,7657 ) ⋅ 10 − 4 ≈ 0,00251 \hat y(55) = (51{,}8770 - 26{,}7657) \cdot 10^{-4} \approx 0{,}00251 y ^ ( 55 ) = ( 51 , 8770 − 26 , 7657 ) ⋅ 1 0 − 4 ≈ 0 , 00251
Bei 55 °C wurde nicht gemessen. Die Gerade liefert trotzdem einen Wert: x = 55 x = 55 x = 55
einsetzen. Das Ergebnis heißt Vorhersage .
y ^ ( 55 ) = β ^ 0 + β ^ 1 ⋅ 55 \hat y(55) = \hat\beta_0 + \hat\beta_1 \cdot 55 y ^ ( 55 ) = β ^ 0 + β ^ 1 ⋅ 55
Mit β ^ 0 = 51,8770 ⋅ 10 − 4 \hat\beta_0 = 51{,}8770 \cdot 10^{-4} β ^ 0 = 51 , 8770 ⋅ 1 0 − 4 und β ^ 1 = − 0,486649 ⋅ 10 − 4 \hat\beta_1 = -0{,}486649 \cdot 10^{-4} β ^ 1 = − 0 , 486649 ⋅ 1 0 − 4 :
0,486649 ⋅ 55 = 26,7657 0{,}486649 \cdot 55 = 26{,}7657 0 , 486649 ⋅ 55 = 26 , 7657
y ^ ( 55 ) = ( 51,8770 − 26,7657 ) ⋅ 10 − 4 = 25,1113 ⋅ 10 − 4 \hat y(55) = (51{,}8770 - 26{,}7657) \cdot 10^{-4} = 25{,}1113 \cdot 10^{-4} y ^ ( 55 ) = ( 51 , 8770 − 26 , 7657 ) ⋅ 1 0 − 4 = 25 , 1113 ⋅ 1 0 − 4
Zurück in die ursprüngliche Einheit: 25,1113 ⋅ 10 − 4 = 0,00251113 ≈ 0,00251 25{,}1113 \cdot 10^{-4} = 0{,}00251113 \approx
\mathbf{0{,}00251} 25 , 1113 ⋅ 1 0 − 4 = 0 , 00251113 ≈ 0 , 00251 g O₂ je 100 g H₂O.
Mit den gerundeten Koeffizienten der Gleichung aus Schritt 13 kommt dasselbe heraus:
0,005188 − 0,00004866 ⋅ 55 = 0,005188 − 0,0026763 = 0,0025117 ≈ 0,00251 0{,}005188 - 0{,}00004866 \cdot 55 = 0{,}005188 - 0{,}0026763 = 0{,}0025117 \approx
0{,}00251 0 , 005188 − 0 , 00004866 ⋅ 55 = 0 , 005188 − 0 , 0026763 = 0 , 0025117 ≈ 0 , 00251 .
In R macht das predict: Modell und neuer x x x -Wert als
Tabelle (data.frame). Die Spalte muss
x heißen wie im Modell. Ergebnis 0,002511126 ✓.
Zur Musterlösung: Dort steht predict(m1, …). Ein Modell
m1 gibt es aber nicht; es heißt fit.
Mit m1 meldet R einen Fehler.
Plausibel? Bei 50 °C wurden 0,0027 gemessen, bei 60 °C 0,0023. 0,00251 liegt
dazwischen, fast in der Mitte. Im Bild ist das der Punkt auf der Geraden über x = 55 x = 55 x = 55 .
15 ≤ 55 ≤ 90: Interpolation;
y ^ ( 110 ) < 0 \hat y(110) < 0 y ^ ( 110 ) < 0 ✗
Darf man der Vorhersage trauen? Das hängt davon ab, wo man vorhersagt.
Interpolation („dazwischen schätzen“): Der neue x x x -Wert liegt
innerhalb des Bereichs, in dem gemessen wurde. Hier wurde von 15 bis 90 °C
gemessen, und 55 liegt dazwischen. Die Gerade passt in diesem Bereich sehr gut (R 2 = 0,9844 R^2 =
0{,}9844 R 2 = 0 , 9844 ). Die Vorhersage ist also zulässig .
Extrapolation („darüber hinaus schätzen“): Der neue x x x -Wert liegt
außerhalb des Messbereichs. Dort weiß niemand, ob der Zusammenhang noch gerade
verläuft. Die Daten sagen darüber nichts.
Warum das wichtig ist, zeigt ein Gegenbeispiel: Setzt man x = 110 x = 110 x = 110 °C ein, kommt
eine negative Löslichkeit heraus:
y ^ ( 110 ) = ( 51,8770 − 53,5314 ) ⋅ 10 − 4 = − 1,654 ⋅ 10 − 4 \hat y(110) = (51{,}8770 - 53{,}5314) \cdot 10^{-4} = -1{,}654 \cdot 10^{-4} y ^ ( 110 ) = ( 51 , 8770 − 53 , 5314 ) ⋅ 1 0 − 4 = − 1 , 654 ⋅ 1 0 − 4
Weniger als nichts kann sich nicht lösen. Die Gerade fällt ab etwa 106,6 °C unter null
(rechts: y ^ = 0 \hat y = 0 y ^ = 0 nach x x x aufgelöst). Außerdem siedet Wasser bei normalem Luftdruck
schon bei 100 °C. Außerhalb des Messbereichs liefert die Gerade also Unsinn.
Im Bild ist der Messbereich hell hinterlegt. Die gestrichelten Verlängerungen der Geraden
links und rechts sind Extrapolation.
Merke: Ein Regressionsmodell gilt nur im Bereich der Daten, aus denen es geschätzt
wurde. Vorhersagen weit außerhalb (Extrapolation) können grob falsch sein, auch wenn
R 2 R^2 R 2
sehr hoch ist.
y i = β 0 + β 1 x i + β 2 x i 2 + ε i y_i = \beta_0 + \beta_1 x_i + \beta_2 x_i^2 + \varepsilon_i y i = β 0 + β 1 x i + β 2 x i 2 + ε i
Teil (iii) verlangt ein Regressionspolynom 2. Grades . Ein Polynom 2. Grades ist
eine Summe aus einer Zahl, einem Vielfachen von x x x und einem Vielfachen von x 2 x^2 x 2 . „2.
Grades“ heißt: Die höchste Potenz ist x 2 x^2 x 2 . Sein Bild ist eine Parabel , eine
gebogene Kurve.
y i = β 0 + β 1 x i + β 2 x i 2 + ε i y_i = \beta_0 + \beta_1 x_i + \beta_2 x_i^2 + \varepsilon_i y i = β 0 + β 1 x i + β 2 x i 2 + ε i
Neu ist nur das Glied β 2 x i 2 \beta_2 x_i^2 β 2 x i 2 (gelesen „beta zwei“). Ein Glied (auch
Term ) ist ein Summand der Gleichung. Es biegt die Gerade: Ist β 2 \beta_2 β 2 positiv,
ist die Kurve nach oben geöffnet wie ein U. Ist β 2 \beta_2 β 2 negativ, ist sie nach unten
geöffnet. Ist β 2 = 0 \beta_2 = 0 β 2 = 0 , bleibt eine Gerade übrig.
Warum ausprobieren? In Schritt 3 lagen die Punkte fast, aber nicht ganz auf einer
Geraden. Eine Parabel kann eine leichte Biegung mitnehmen. Die Frage ist, ob sich das
lohnt.
Immer noch „linear“? Ja, im Sinn des Skripts. Dort heißt ein Modell linear, wenn es
eine Summe von Koeffizienten mal festen Funktionen von x x x ist: y i = β 0 + β 1 f 1 ( x i ) + β 2 f 2 ( x i ) + ε i y_i = \beta_0 + \beta_1
f_1(x_i) + \beta_2 f_2(x_i) + \varepsilon_i y i = β 0 + β 1 f 1 ( x i ) + β 2 f 2 ( x i ) + ε i . Hier ist f 1 ( x ) = x f_1(x) = x f 1 ( x ) = x und f 2 ( x ) = x 2 f_2(x) = x^2 f 2 ( x ) = x 2 .
„Linear“ bezieht sich auf die β \beta β , nicht auf die Form der Kurve. Deshalb schätzt man
die Parabel mit derselben Methode der kleinsten Quadrate und in R wieder mit
lm.
Der Befehl aus Skript und Musterlösung:
lm(y ~ poly(x, 2)). poly steht für
Polynom, die 2 für den Grad.
Im Bild rechts, einem vergrößerten Ausschnitt, ist die Parabel gestrichelt. Sie weicht
kaum sichtbar von der Geraden ab.
R 2 = 0,9896 R^2 = 0{,}9896 R 2 = 0 , 9896 ,
R adj 2 = 0,9873 R^2_{\text{adj}} = 0{,}9873 R adj 2 = 0 , 9873 ,
p = 0,0633 p = 0{,}0633 p = 0 , 0633
Die Ausgabe ist gebaut wie in Schritt 19. Gelesen wird wieder an drei Stellen.
Coefficients: Jetzt gibt es drei Zeilen.
(Intercept) gehört zur Konstanten,
poly(x, 2)1 zum linearen Glied,
poly(x, 2)2 zum quadratischen Glied . Die letzte Zeile ist
die interessante: Sie prüft, ob die Biegung nötig ist. Ihr p p p -Wert ist 0,0633 0{,}0633 0 , 0633 ,
dahinter steht ein Punkt „.“. Was das bedeutet, klärt Schritt 29.
Achtung bei der Spalte Estimate: Diese Zahlen sind nicht die Koeffizienten
vor 1 1 1 , x x x und x 2 x^2 x 2 . Warum, zeigt der nächste Schritt.
R-squared:
Multiple R-squared: 0.9896: Das Bestimmtheitsmaß der Parabel.
Sie erklärt 99,0 % der Streuung (Gerade: 98,4 %).
Adjusted R-squared: 0.9873: das adjustierte R 2 R^2 R 2 der Parabel
(Gerade: 0,9829).
Nach der Faustregel ist auch die Parabel substantiell. Die Modellgüte ist sehr hoch, noch
etwas höher als bei der Geraden. Ob dieser Zugewinn echt ist, prüfen die Schritte 28 und
29.
richtig:
y ^ = 0,005543 − 0,00006596 x + 0,0000001668 x 2 \hat y = 0{,}005543 - 0{,}00006596\,x + 0{,}0000001668\,x^2 y ^ = 0 , 005543 − 0 , 00006596 x + 0 , 0000001668 x 2
Die Musterlösung liest die Spalte Estimate als Gleichung: y ^ ≈ 0,0029167 − 0,0038830 x + 0,0002817 x 2 \hat y \approx 0{,}0029167 -
0{,}0038830\,x + 0{,}0002817\,x^2 y ^ ≈ 0 , 0029167 − 0 , 0038830 x + 0 , 0002817 x 2 . Das ist falsch , und die Probe zeigt es sofort.
Probe bei x = 55 x = 55 x = 55 : 55 2 = 3.025 55^2 = 3.025 5 5 2 = 3.025 .
0,0038830 ⋅ 55 = 0,2135650 0{,}0038830 \cdot 55 = 0{,}2135650 0 , 0038830 ⋅ 55 = 0 , 2135650
0,0002817 ⋅ 3.025 = 0,8521425 0{,}0002817 \cdot 3.025 = 0{,}8521425 0 , 0002817 ⋅ 3.025 = 0 , 8521425
0,0029167 − 0,2135650 + 0,8521425 = 0,6415 0{,}0029167 - 0{,}2135650 + 0{,}8521425 = 0{,}6415 0 , 0029167 − 0 , 2135650 + 0 , 8521425 = 0 , 6415
Das wären 0,64 g Sauerstoff je 100 g Wasser, über 130-mal so viel wie der größte Messwert
0,0048. Unmöglich.
Der Grund: poly(x, 2) rechnet nicht direkt mit x x x und
x 2 x^2 x 2 . Es baut aus ihnen zwei neue, umgerechnete Spalten, sogenannte
orthogonale Polynome . Das macht die Rechnung im Computer stabiler. Die Kurve, R 2 R^2 R 2
und der p p p -Wert des quadratischen Glieds sind dieselben. Aber die Estimate-Werte gehören
zu den umgerechneten Spalten, nicht zu x x x und x 2 x^2 x 2 .
So bekommt man die richtige Gleichung: mit
lm(y ~ x + I(x^2)). I(x^2)
heißt: x 2 x^2 x 2 wirklich ausrechnen und als eigene Spalte nehmen (ohne
I( ) hätte ^ in einer R-Formel eine
andere Bedeutung). Gleichwertig ist poly(x, 2, raw = TRUE);
raw heißt „roh“, also unverändert.
y ^ = 0,005543 − 0,00006596 x + 0,0000001668 x 2 \hat y = 0{,}005543 - 0{,}00006596\,x + 0{,}0000001668\,x^2 y ^ = 0 , 005543 − 0 , 00006596 x + 0 , 0000001668 x 2
Probe bei x = 55 x = 55 x = 55 : 0,00006596 ⋅ 55 = 0,0036278 0{,}00006596 \cdot 55 = 0{,}0036278 0 , 00006596 ⋅ 55 = 0 , 0036278 und 0,0000001668 ⋅ 3.025 = 0,0005046 0{,}0000001668 \cdot
3.025 = 0{,}0005046 0 , 0000001668 ⋅ 3.025 = 0 , 0005046 . Also 0,0055432 − 0,0036278 + 0,0005046 = 0,00242 0{,}0055432 - 0{,}0036278 + 0{,}0005046 = 0{,}00242 0 , 0055432 − 0 , 0036278 + 0 , 0005046 = 0 , 00242 . Das
passt zu den Messwerten. predict(fit2, …) rechnet übrigens
richtig (0,002419796); falsch ist nur das Ablesen der Gleichung von Hand.
Das kleine positive β ^ 2 = 0,0000001668 \hat\beta_2 = 0{,}0000001668 β ^ 2 = 0 , 0000001668 heißt: Die Parabel ist ganz leicht nach
oben geöffnet.
Für die Modellwahl ändert sich nichts: R 2 R^2 R 2 , adjustiertes R 2 R^2 R 2 und der p p p -Wert des
quadratischen Glieds sind in beiden Schreibweisen gleich.
R adj 2 R^2_{\text{adj}} R adj 2 :
0,9829 0{,}9829 0 , 9829 (Gerade) →
0,9873 0{,}9873 0 , 9873 (Parabel)
Die Parabel hat das größere R 2 R^2 R 2 : 0,9896 0{,}9896 0 , 9896 statt 0,9844 0{,}9844 0 , 9844 . Ist sie deshalb besser?
Nicht unbedingt.
R 2 R^2 R 2 kann durch ein zusätzliches Glied nie sinken. Die Gerade ist ja selbst eine
Parabel, nämlich die mit β 2 = 0 \beta_2 = 0 β 2 = 0 . Die Methode der kleinsten Quadrate sucht unter
allen Parabeln die mit dem kleinsten S S E SSE S S E ; die Gerade ist eine davon. Also ist das
S S E SSE S S E der besten Parabel höchstens so groß wie das der Geraden. Hier: 15,93 15{,}93 15 , 93 statt
23,865 23{,}865 23 , 865 (in 10 − 8 10^{-8} 1 0 − 8 ). Kleineres S S E SSE S S E heißt größeres R 2 R^2 R 2 .
Woher die 15,93? Die Formel aus Schritt 17 nach S S E SSE S S E umgestellt: S S E = ( 1 − R 2 ) ⋅ ∑ ( y i − y ˉ ) 2 SSE = (1 - R^2)
\cdot \sum (y_i - \bar y)^2 S S E = ( 1 − R 2 ) ⋅ ∑ ( y i − y ˉ ) 2 . Die Gesamtstreuung 1.531,67 ⋅ 10 − 8 1.531{,}67 \cdot 10^{-8} 1.531 , 67 ⋅ 1 0 − 8 aus Schritt 16
ist für beide Modelle dieselbe, denn sie hängt nur von den Messwerten ab. Mit R 2 = 0,98960 R^2 =
0{,}98960 R 2 = 0 , 98960 der Parabel (Schritt 26): ( 1 − 0,98960 ) ⋅ 1.531,67 ⋅ 10 − 8 = 0,01040 ⋅ 1.531,67 ⋅ 10 − 8 ≈ 15,93 ⋅ 10 − 8 (1 - 0{,}98960) \cdot 1.531{,}67 \cdot 10^{-8} =
0{,}01040 \cdot 1.531{,}67 \cdot 10^{-8} \approx 15{,}93 \cdot 10^{-8} ( 1 − 0 , 98960 ) ⋅ 1.531 , 67 ⋅ 1 0 − 8 = 0 , 01040 ⋅ 1.531 , 67 ⋅ 1 0 − 8 ≈ 15 , 93 ⋅ 1 0 − 8 . Ungerundet sind
es 15,929 ⋅ 10 − 8 15{,}929 \cdot 10^{-8} 15 , 929 ⋅ 1 0 − 8 ; in R liefert das
sum(resid(fit2)^2).
Das gilt für jedes zusätzliche Glied, selbst für eines ohne jeden Sinn. Mit genug
Gliedern kann man R 2 R^2 R 2 beliebig nah an 1 bringen. Das gewöhnliche R 2 R^2 R 2 taugt deshalb
nicht für den Vergleich von Modellen mit verschieden vielen Koeffizienten.
Das adjustierte R 2 R^2 R 2 (englisch adjusted , angepasst) zieht für jedes
zusätzliche Glied etwas ab. Es steigt nur, wenn das neue Glied S S E SSE S S E stärker senkt, als es
ein Glied ohne jeden Sinn im Mittel täte. In der R-Ausgabe heißt das: Der
t value des neuen Glieds ist dem Betrag nach größer als 1. Das
ist eine niedrige Hürde . Für Signifikanz zum Niveau 5 % müsste ∣ t ∣ |t| ∣ t ∣ hier größer
als t 9 ; 0,975 = 2,262 t_{9;\,0{,}975} = 2{,}262 t 9 ; 0 , 975 = 2 , 262 sein (Schritt 29). Das adjustierte R 2 R^2 R 2 ist also fairer
als das gewöhnliche, beweist aber nicht, dass das neue Glied nötig ist. Man schaut deshalb
auf beides: adjustiertes R 2 R^2 R 2 und Test. R gibt das adjustierte R 2 R^2 R 2 aus:
Gerade 0,9829 0{,}9829 0 , 9829 , Parabel 0,9873 0{,}9873 0 , 9873 . Der Zuwachs ist 0,9873 − 0,9829 = 0,0044 0{,}9873 - 0{,}9829 = 0{,}0044 0 , 9873 − 0 , 9829 = 0 , 0044 ,
also klein. Er passt zur Hürde oben: Das quadratische Glied hat in Schritt 26 den
t value 2,118 2{,}118 2 , 118 , und der ist größer als 1.
Die Musterlösung vergleicht genau diese beiden Werte. Das ist für den Vergleich richtig.
Ergänzung zum Nachrechnen (Formel rechts): n = 12 n = 12 n = 12 ist die Zahl der Messungen, p p p
die Zahl der Glieder außer β 0 \beta_0 β 0 . Die Gerade hat p = 1 p = 1 p = 1 (nur x x x ), die Parabel p = 2 p =
2 p = 2 (x x x und x 2 x^2 x 2 ). Hier bezeichnet p p p also keinen p p p -Wert.
Gerade: n − 1 = 11 n - 1 = 11 n − 1 = 11 , n − p − 1 = 10 n - p - 1 = 10 n − p − 1 = 10 . 1 − 0,98442 = 0,01558 1 - 0{,}98442 = 0{,}01558 1 − 0 , 98442 = 0 , 01558 , mal 11 10 \frac{11}{10} 10 11
ergibt 0,01714 0{,}01714 0 , 01714 , also R adj 2 = 0,98286 R^2_{\text{adj}} = 0{,}98286 R adj 2 = 0 , 98286 .
Parabel: n − p − 1 = 9 n - p - 1 = 9 n − p − 1 = 9 . 1 − 0,98960 = 0,01040 1 - 0{,}98960 = 0{,}01040 1 − 0 , 98960 = 0 , 01040 , mal 11 9 \frac{11}{9} 9 11 ergibt
0,01271 0{,}01271 0 , 01271 , also R adj 2 = 0,98729 R^2_{\text{adj}} = 0{,}98729 R adj 2 = 0 , 98729 .
Der Faktor n − 1 n − p − 1 \frac{n-1}{n-p-1} n − p − 1 n − 1 ist größer als 1 und wächst mit jedem Glied. Er vergrößert
den unerklärten Anteil ein wenig; das ist die „Strafe“.
p = 0,0633 > 0,05 p = 0{,}0633 > 0{,}05 p = 0 , 0633 > 0 , 05 :
H 0 : β 2 = 0 H_0:\ \beta_2 = 0 H 0 : β 2 = 0 nicht verwerfen
Der zweite Blick gilt dem p p p -Wert in der Zeile des quadratischen Glieds. Getestet wird,
ob die Biegung wirklich da ist:
H 0 : β 2 = 0 H_0:\ \beta_2 = 0 H 0 : β 2 = 0 (keine Biegung, die Gerade reicht) gegen H A : β 2 ≠ 0 H_A:\ \beta_2
\ne 0 H A : β 2 = 0
p = 0,0633 p = 0{,}0633 p = 0 , 0633 . Mit dem üblichen Niveau α = 0,05 \alpha = 0{,}05 α = 0 , 05 : 0,0633 > 0,05 0{,}0633 > 0{,}05 0 , 0633 > 0 , 05 , also
wird H 0 H_0 H 0 nicht verworfen . Das quadratische Glied ist zum Niveau 5 %
nicht signifikant .
Der Punkt „.“ heißt nach der Tabelle aus Schritt 20: p p p liegt zwischen 0,05 und
0,1. Es spricht also einiges für eine Biegung, aber nicht genug für einen Nachweis. Die
Musterlösung nennt das „wenig signifikant“; genauer ist: zum Niveau 5 % nicht signifikant.
Beibehalten heißt nicht bewiesen. Der Test zeigt nicht, dass die Punkte genau auf
einer Geraden liegen. Er zeigt nur, dass zwölf Messungen nicht reichen, um eine Biegung
sicher nachzuweisen.
Wie in Schritt 20 gilt der p p p -Wert unter der Annahme normalverteilter Fehler
ε i \varepsilon_i ε i . Die Parabel hat drei Koeffizienten, deshalb rechnet R mit der
t-Verteilung mit n − 3 = 9 n - 3 = 9 n − 3 = 9 Freiheitsgraden (on 9 degrees of freedom). Die Grenze für ∣ t ∣ |t| ∣ t ∣ ist dann t 9 ; 0,975 = 2,262 t_{9;\,0{,}975} = 2{,}262 t 9 ; 0 , 975 = 2 , 262 (qt(0.975, 9)). Der t value 2,118 2{,}118 2 , 118 liegt knapp darunter; das ist derselbe
Befund wie p = 0,0633 > 0,05 p = 0{,}0633 > 0{,}05 p = 0 , 0633 > 0 , 05 .
Mit summary(fit3) aus Schritt 27 steht in der Zeile
I(x^2) derselbe p p p -Wert 0,0633. Die Schreibweise mit
poly ändert am Test nichts.
Aus Blatt 7, Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Ist
p > α p
> \alpha p > α , wird
H 0 H_0 H 0 beibehalten. Das ist kein Beweis für
H 0 H_0 H 0 , nur: nicht
nachweisbar. Nach dem Evidenzmaß spricht bei
p p p zwischen 5 % und 10 % „einiges“ gegen
H 0 H_0 H 0 .
Wahl: lineares Modell (Sparsamkeit)
Die Tabelle rechts stellt beide Modelle nebeneinander. Die Frage aus (iii): Welches würde
man wählen?
Das quadratische Glied ist zum Niveau 5 % nicht signifikant (p = 0,0633 p = 0{,}0633 p = 0 , 0633 ,
Schritt 29).
Das adjustierte R 2 R^2 R 2 steigt nur wenig, von 0,9829 auf 0,9873 (Schritt 28). Die Gerade
erklärt schon 98,4 %.
Die Vorhersagen unterscheiden sich kaum: bei 55 °C 0,00251 gegen 0,00242, ein
Unterschied von 0,00009. Das ist kleiner als viele Residuen der Geraden (Schritt 14, zum
Beispiel − 1,844 ⋅ 10 − 4 = − 0,00018 -1{,}844 \cdot 10^{-4} = -0{,}00018 − 1 , 844 ⋅ 1 0 − 4 = − 0 , 00018 bei 35 °C).
Die Gerade ist einfacher : zwei Koeffizienten statt drei, und die Steigung lässt
sich direkt deuten („je 10 °C rund 0,00049 weniger“). Bei der Parabel ändert sich die
Abnahme je Grad von Temperatur zu Temperatur.
Die beiden Kriterien zeigen in verschiedene Richtungen. Das adjustierte R 2 R^2 R 2
steigt leicht, weil t = 2,118 t = 2{,}118 t = 2 , 118 größer als 1 ist (Schritt 28). Der Test weist das Glied
aber nicht nach, weil p = 0,0633 > 0,05 p = 0{,}0633 > 0{,}05 p = 0 , 0633 > 0 , 05 (Schritt 29). Das ist kein Widerspruch:
Die Hürde für das adjustierte R 2 R^2 R 2 ist viel niedriger als die für Signifikanz. Zusammen
heißt das: kleiner Zugewinn, nicht nachgewiesen.
Entscheidung: das lineare Modell . Dahinter steht das Prinzip der
Sparsamkeit : Von zwei Modellen, die die Daten fast gleich gut beschreiben, nimmt
man das einfachere. Ein zusätzliches Glied muss sich seinen Platz verdienen, zum Beispiel
durch Signifikanz. Das ist auch die Wahl der Musterlösung.
Im Bild sind die beiden Vorhersagen bei 55 °C markiert: gefüllt die Gerade, leer die
Parabel. Sie liegen dicht beieinander.
Merke: Modelle vergleicht man nicht mit dem gewöhnlichen
R 2 R^2 R 2 , denn das steigt mit
jedem Glied. Man schaut auf das adjustierte
R 2 R^2 R 2 und darauf, ob das zusätzliche Glied
signifikant ist. Steigt das adjustierte
R 2 R^2 R 2 nur wenig und ist das Glied nicht
signifikant, gewinnt das einfachere Modell.
Ränder
+ + + , Mitte
− - − : leichte Biegung, nicht signifikant
Diese Ergänzung geht über die Aufgabe hinaus. Sie zeigt, welche Biegung die Parabel
eigentlich einfängt, und warum sie trotzdem nicht nachweisbar ist.
Das Bild in diesem Schritt ist ein Residuenplot : waagerecht die Temperatur,
senkrecht das Residuum e i e_i e i der Geraden aus Schritt 14. Die Gerade selbst ist darin die
Nulllinie. So werden die kleinen Abstände stark vergrößert sichtbar.
Passt eine Gerade gut, liegen die Residuen regellos um die Null, mal darüber, mal
darunter. Hier gibt es ein Muster : links positiv (15 und 20 °C), dazwischen negativ
(25 bis 50 °C), rechts wieder positiv (60 bis 80 °C). Nur der letzte Punkt bei 90 °C ist
mit − 0,08 -0{,}08 − 0 , 08 praktisch null. Die Punkte liegen also in der Mitte etwas unter und an den
Rändern etwas über der Geraden: Sie sind ganz leicht nach oben gebogen, wie ein flaches U.
Diese Biegung fängt das quadratische Glied ein. Die gestrichelte Kurve ist der Abstand der
Parabel von der Geraden. Sie hat dieselbe U-Form: links und rechts über null, dazwischen
darunter. Ganz genau folgt sie den Punkten nicht (bei 60 und 70 °C liegt sie noch knapp
unter null); sie ist die Parabel mit dem kleinsten S S E SSE S S E . Weil sie nach oben geöffnet ist,
ist β ^ 2 \hat\beta_2 β ^ 2 positiv.
Warum dann nicht signifikant? Die Biegung ist klein im Vergleich zur Streuung der
Punkte um die Kurve. Der größte Ausschlag, + 3,42 +3{,}42 + 3 , 42 bei 15 °C, ist ein einzelner Punkt.
Wäre die wahre Beziehung eine Gerade, käme eine mindestens so starke Biegung bei zwölf
Messungen in gut 6 % der Fälle allein durch Zufall zustande (p = 0,0633 p = 0{,}0633 p = 0 , 0633 ). Zum Niveau 5
% reicht das nicht für einen Nachweis.
Mit mehr Messungen, vor allem an den Rändern, ließe sich eine echte Biegung sicherer
erkennen.
Größe
Weg
Wert
Steigung β ^ 1 \hat\beta_1 β ^ 1
− 3.098,33 ⋅ 10 − 4 : 6.366,67 -3.098{,}33 \cdot 10^{-4} : 6.366{,}67 − 3.098 , 33 ⋅ 1 0 − 4 : 6.366 , 67
−0,00004866
Achsenabschnitt β ^ 0 \hat\beta_0 β ^ 0
y ˉ − β ^ 1 x ˉ \bar y - \hat\beta_1 \bar x y ˉ − β ^ 1 x ˉ
0,005188
Bestimmtheitsmaß R 2 R^2 R 2
1 − 23,865 : 1.531,67 1 - 23{,}865 : 1.531{,}67 1 − 23 , 865 : 1.531 , 67
0,9844
Vorhersage bei 55 °C
β ^ 0 + 55 β ^ 1 \hat\beta_0 + 55\,\hat\beta_1 β ^ 0 + 55 β ^ 1
0,00251
adjustiertes R 2 R^2 R 2
Gerade / Parabel
0,9829 / 0,9873
p p p -Wert von x 2 x^2 x 2
summary(fit2)
0,0633
In Worten: Je wärmer das Wasser, desto weniger Sauerstoff löst sich, und zwar fast
genau linear: je 10 °C rund 0,00049 g O₂ je 100 g H₂O weniger. Die Gerade erklärt 98,4 % der
Streuung. Bei 55 °C sagt sie 0,00251 g O₂ je 100 g H₂O voraus. Eine Parabel passt nur wenig
besser, und ihre Biegung ist zum Niveau 5 % nicht nachweisbar. Deshalb wählt man die Gerade.
Rückblick, so läuft eine Regression ab: (1) Streudiagramm ansehen,
x x x und
y y y
festlegen. (2) Modell wählen und mit der Methode der kleinsten Quadrate schätzen. (3)
Gleichung in Worten deuten. (4) Modellgüte mit
R 2 R^2 R 2 und der Faustregel bewerten. (5) Nur im
Messbereich vorhersagen. (6) Konkurrierende Modelle mit dem adjustierten
R 2 R^2 R 2 und dem
p p p -Wert des zusätzlichen Glieds vergleichen, im Zweifel das einfachere nehmen.
Die Formeln von Hand:
β ^ 1 = ∑ ( x i − x ˉ ) ( y i − y ˉ ) ∑ ( x i − x ˉ ) 2 \hat\beta_1 = \frac{\sum (x_i-\bar x)(y_i-\bar y)}{\sum (x_i-\bar x)^2} β ^ 1 = ∑ ( x i − x ˉ ) 2 ∑ ( x i − x ˉ ) ( y i − y ˉ ) ,
β ^ 0 = y ˉ − β ^ 1 x ˉ \hat\beta_0 =
\bar y - \hat\beta_1 \bar x β ^ 0 = y ˉ − β ^ 1 x ˉ ,
R 2 = 1 − S S E ∑ ( y i − y ˉ ) 2 R^2 = 1 - \frac{SSE}{\sum (y_i-\bar y)^2} R 2 = 1 − ∑ ( y i − y ˉ ) 2 S S E . R rechnet mit
lm genau dasselbe.