Blatt 8 handelt vom linearen Zusammenhang : Steigt die eine Größe im Mittel, wenn die
andere steigt? In Aufgabe 1 wurde das aus Daten gemessen, mit Kovarianz und Korrelation. Diese
Aufgabe ist ein Gedankenexperiment ohne Daten. Sie zeigt, was die Korrelation
nicht sehen kann.
Gegeben: Eine Zufallsvariable X X X hat drei mögliche Werte, − 1 -1 − 1 , 0 0 0 und 1 1 1 . Jeder
kommt mit Wahrscheinlichkeit 1 3 \tfrac13 3 1 vor. Eine zweite Zufallsvariable Y Y Y entsteht aus X X X
durch Quadrieren: Y = X 2 Y = X^2 Y = X 2 . Wer X X X kennt, kennt also auch Y Y Y .
Gesucht , in eigenen Worten:
Fünf Zahlen: die Erwartungswerte E ( X ) E(X) E ( X ) , E ( Y ) E(Y) E ( Y ) , E ( X Y ) E(XY) E ( X Y ) , daraus die Kovarianz und die
Korrelation ρ \rho ρ (griechisch „rho“).
Zwei Ja-Nein-Fragen mit Begründung: Ist ρ = 0 \rho = 0 ρ = 0 ? Sind X X X und Y Y Y unabhängig?
Was folgt daraus allgemein für die beiden Begriffe? Und wann bedeuten sie dasselbe?
Zusatz: die Varianz der Summe X + Y X + Y X + Y , mit der passenden Rechenregel.
Der Weg in fünf Etappen:
Die Verteilungen aufschreiben und klären, was hier anders ist als bei Daten (Schritte 1–2).
(i) Erwartungswerte, Kovarianz, Varianzen und Korrelation von Hand (Schritte 3–10).
(ii) Unkorreliert? Ja — und warum, obwohl Y Y Y ganz von X X X abhängt (Schritte 11–13).
Unabhängig? Nein — gezeigt an einer Tabelle (Schritte 14–18).
(iii) Wie die beiden Begriffe zusammenhängen (Schritte 19–21).
(iv) v a r ( X + Y ) \mathrm{var}(X + Y) var ( X + Y ) mit Rechenregel und Probe (Schritte 22–24), dazu eine Probe mit R
(Schritt 25).
Merke: Die Korrelation misst nur, wie gut ein Zusammenhang zu einer
Geraden passt. Ein Zusammenhang, der keine Gerade ist, kann ihr ganz entgehen.
ρ = 0 \rho =
0 ρ = 0 heißt deshalb „kein linearer Zusammenhang“, nicht „kein Zusammenhang“.
Zur Musterlösung: Alle Ergebnisse stimmen. In der Zeile für
E ( Y ) E(Y) E ( Y ) steht ein
Tippfehler: „(−91²“, also eine 9 statt der schließenden Klammer. Gemeint ist
( − 1 ) 2 (-1)^2 ( − 1 ) 2 . Richtig
heißt die Zeile
E ( Y ) = 1 3 ⋅ ( − 1 ) 2 + 1 3 ⋅ 0 2 + 1 3 ⋅ 1 2 = 2 3 E(Y) = \tfrac13 \cdot (-1)^2 + \tfrac13 \cdot 0^2 + \tfrac13 \cdot 1^2 =
\tfrac23 E ( Y ) = 3 1 ⋅ ( − 1 ) 2 + 3 1 ⋅ 0 2 + 3 1 ⋅ 1 2 = 3 2 (Schritt 4). Das Ergebnis
2 3 \tfrac23 3 2 steht dort richtig.
P ( X = − 1 ) = P ( X = 0 ) = P ( X = 1 ) = 1 3 P(X = -1) = P(X = 0) = P(X = 1) = \tfrac13 P ( X = − 1 ) = P ( X = 0 ) = P ( X = 1 ) = 3 1 ;
P ( Y = 0 ) = 1 3 P(Y = 0) = \tfrac13 P ( Y = 0 ) = 3 1 ,
P ( Y = 1 ) = 2 3 P(Y = 1) =
\tfrac23 P ( Y = 1 ) = 3 2
Zuerst bekommen die Werte Namen: x 1 = − 1 x_1 = -1 x 1 = − 1 , x 2 = 0 x_2 = 0 x 2 = 0 , x 3 = 1 x_3 = 1 x 3 = 1 . Das kleine i i i in x i x_i x i
ist nur die Nummer des Werts. P ( X = x i ) P(X = x_i) P ( X = x i ) ist die Wahrscheinlichkeit, dass X X X genau den
Wert x i x_i x i annimmt. Hier ist sie für alle drei Werte 1 3 \tfrac13 3 1 . Zusammen ergibt das 1 1 1 .
Dann wird jeder Wert quadriert, also mit sich selbst malgenommen. So entsteht der
zugehörige Wert von Y Y Y :
( − 1 ) 2 = ( − 1 ) ⋅ ( − 1 ) = 1 (-1)^2 = (-1) \cdot (-1) = 1 ( − 1 ) 2 = ( − 1 ) ⋅ ( − 1 ) = 1 (minus mal minus ist plus)
0 2 = 0 0^2 = 0 0 2 = 0
1 2 = 1 1^2 = 1 1 2 = 1
Y Y Y hat also nur zwei mögliche Werte: 0 0 0 und 1 1 1 . Den Wert 1 1 1 bekommt Y Y Y auf
zwei Wegen, nämlich bei X = − 1 X = -1 X = − 1 und bei X = 1 X = 1 X = 1 . Beides kann nicht zugleich passieren.
Deshalb werden die beiden Wahrscheinlichkeiten addiert: P ( Y = 1 ) = 1 3 + 1 3 = 2 3 P(Y = 1) = \tfrac13 + \tfrac13 =
\tfrac23 P ( Y = 1 ) = 3 1 + 3 1 = 3 2 . Den Wert 0 0 0 bekommt Y Y Y nur bei X = 0 X = 0 X = 0 : P ( Y = 0 ) = 1 3 P(Y = 0) = \tfrac13 P ( Y = 0 ) = 3 1 .
Im Bild ist jedes mögliche Paar ein Punkt: ( − 1 ∣ 1 ) (-1 \mid 1) ( − 1 ∣ 1 ) heißt „X = − 1 X = -1 X = − 1 und Y = 1 Y = 1 Y = 1 “.
Alle drei Punkte liegen auf der Parabel y = x 2 y = x^2 y = x 2 , jeder mit Wahrscheinlichkeit
1 3 \tfrac13 3 1 .
Aus Blatt 3, Aufgabe 1 („Von den Einzelwahrscheinlichkeiten zur
Verteilungsfunktion“):
Eine Zufallsvariable ordnet jedem Ergebnis eines Zufallsversuchs eine Zahl zu. Die
Wahrscheinlichkeiten aller ihrer Werte ergeben zusammen 1.
Daten:
x ˉ = 1 n ∑ x i \bar x = \frac1n \sum x_i x ˉ = n 1 ∑ x i ↔ Zufallsvariable:
E ( X ) = ∑ P ( X = x i ) ⋅ x i E(X) = \sum P(X = x_i)
\cdot x_i E ( X ) = ∑ P ( X = x i ) ⋅ x i
In Aufgabe 1 lagen Daten vor: n n n gemessene Paare ( x i , y i ) (x_i,\ y_i) ( x i , y i ) . Aus ihnen wurden
Mittelwerte, die Stichprobenkovarianz s X Y s_{XY} s X Y und die Stichprobenkorrelation ρ ^ \hat\rho ρ ^
berechnet. Das sind Schätzungen . Mit anderen Daten kämen andere Zahlen heraus.
Hier gibt es keine Daten. X X X ist eine Zufallsvariable , von der alles bekannt ist:
alle möglichen Werte und ihre genauen Wahrscheinlichkeiten. Man rechnet deshalb nicht mit
Mittelwerten von Beobachtungen, sondern mit Erwartungswerten . Das Ergebnis ist eine
feste Zahl, der wahre Wert.
Der Unterschied steckt in den Gewichten (Tabelle rechts):
Beim Stichprobenmittelwert x ˉ \bar x x ˉ (gelesen „x quer“) zählt jede Beobachtung gleich
viel, nämlich 1 n \frac1n n 1 .
Beim Erwartungswert E ( X ) E(X) E ( X ) zählt jeder mögliche Wert so viel wie seine
Wahrscheinlichkeit P ( X = x i ) P(X = x_i) P ( X = x i ) .
Das Zeichen ∑ \sum ∑ (großes griechisches Sigma, gelesen „Summe“) heißt: den Ausdruck
dahinter für jedes i i i aufschreiben und alles addieren. Wie das mit den Zahlen dieser
Aufgabe aussieht, zeigt Schritt 3.
Dasselbe gilt für die anderen Kennzahlen: Zur Stichprobenkovarianz s X Y s_{XY} s X Y gehört hier
die Kovarianz c o v ( X , Y ) \mathrm{cov}(X, Y) cov ( X , Y ) (Schritt 6), zur Stichprobenkorrelation ρ ^ \hat\rho ρ ^
(gelesen „rho Dach“; das Dach steht für „aus Daten geschätzt“) die Korrelation ρ \rho ρ
(Schritt 10). Die Idee ist jeweils dieselbe, nur die Gewichte sind andere.
Zusammenhang: Würde man den Zufallsversuch sehr oft wiederholen und die Ergebnisse
als Daten sammeln, lägen die Stichprobenwerte nahe an den Erwartungswerten. Die
Stichprobengrößen schätzen die Größen dieser Aufgabe.
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“): Aus
n n n Datenpaaren berechnet man
s X Y = 1 n − 1 ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) s_{XY} = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar x)(y_i -
\bar y) s X Y = n − 1 1 ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) und
ρ ^ = s X Y s X s Y \hat\rho = \frac{s_{XY}}{s_X\,s_Y} ρ ^ = s X s Y s X Y . Beides sind Schätzer aus Daten.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Der
Stichprobenmittelwert ist
x ˉ = 1 n ∑ i = 1 n x i \bar x = \frac{1}{n}\sum_{i=1}^{n} x_i x ˉ = n 1 ∑ i = 1 n x i : alle Werte addieren
und durch ihre Anzahl teilen. Er schätzt den unbekannten Erwartungswert.
E ( X ) = 1 3 ⋅ ( − 1 ) + 1 3 ⋅ 0 + 1 3 ⋅ 1 = 0 E(X) = \tfrac13 \cdot (-1) + \tfrac13 \cdot 0 + \tfrac13 \cdot 1 = 0 E ( X ) = 3 1 ⋅ ( − 1 ) + 3 1 ⋅ 0 + 3 1 ⋅ 1 = 0
Der Erwartungswert E ( X ) E(X) E ( X ) ist der Wert, den X X X im Mittel annimmt. Man nimmt jeden
möglichen Wert mal seine Wahrscheinlichkeit und addiert alles:
E ( X ) = ∑ i = 1 3 P ( X = x i ) ⋅ x i E(X) = \sum_{i=1}^{3} P(X = x_i) \cdot x_i E ( X ) = ∑ i = 1 3 P ( X = x i ) ⋅ x i
Das Summenzeichen aus Schritt 2 hat hier die Grenzen i = 1 i = 1 i = 1 (unten) bis 3 3 3 (oben): den
Ausdruck für i = 1 i = 1 i = 1 , 2 2 2 und 3 3 3 aufschreiben und addieren.
Mit den Zahlen aus Schritt 1:
1 3 ⋅ ( − 1 ) + 1 3 ⋅ 0 + 1 3 ⋅ 1 = − 1 3 + 0 + 1 3 = 0 \tfrac13 \cdot (-1) + \tfrac13 \cdot 0 + \tfrac13 \cdot 1 = -\tfrac13 + 0 + \tfrac13 =
\mathbf{0} 3 1 ⋅ ( − 1 ) + 3 1 ⋅ 0 + 3 1 ⋅ 1 = − 3 1 + 0 + 3 1 = 0
Anschaulich: Bei 300 Wiederholungen kommt jeder Wert etwa 100-mal vor. Alle Werte
zusammen ergeben 100 ⋅ ( − 1 ) + 100 ⋅ 0 + 100 ⋅ 1 = 0 100 \cdot (-1) + 100 \cdot 0 + 100 \cdot 1 = 0 100 ⋅ ( − 1 ) + 100 ⋅ 0 + 100 ⋅ 1 = 0 , im Schnitt also 0. Die
− 1 -1 − 1 und die + 1 +1 + 1 sind gleich wahrscheinlich und heben sich auf.
Im Bild ist E ( X ) = 0 E(X) = 0 E ( X ) = 0 die gestrichelte senkrechte Linie. Sie liegt genau in der Mitte
zwischen den Punkten links und rechts.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“): Der
Erwartungswert ist ein gewichteter Mittelwert: jeder Wert mal seine Wahrscheinlichkeit,
alles addiert. Er ist der Schwerpunkt der Verteilung.
E ( Y ) = E ( X 2 ) = 1 3 ⋅ ( − 1 ) 2 + 1 3 ⋅ 0 2 + 1 3 ⋅ 1 2 = 2 3 E(Y) = E(X^2) = \tfrac13 \cdot (-1)^2 + \tfrac13 \cdot 0^2 + \tfrac13 \cdot 1^2 =
\tfrac23 E ( Y ) = E ( X 2 ) = 3 1 ⋅ ( − 1 ) 2 + 3 1 ⋅ 0 2 + 3 1 ⋅ 1 2 = 3 2
Y = X 2 Y = X^2 Y = X 2 hängt nur von X X X ab. Für solche Größen gibt es eine bequeme Regel: Man nimmt
die Werte von X X X , wendet die Rechnung darauf an und gewichtet mit den
Wahrscheinlichkeiten von X X X :
E ( g ( X ) ) = ∑ i = 1 3 P ( X = x i ) ⋅ g ( x i ) E\big(g(X)\big) = \sum_{i=1}^{3} P(X = x_i) \cdot g(x_i) E ( g ( X ) ) = ∑ i = 1 3 P ( X = x i ) ⋅ g ( x i )
g g g steht für die Rechenvorschrift, hier „quadrieren“: g ( x ) = x 2 g(x) = x^2 g ( x ) = x 2 . Die Regel stimmt,
weil Y Y Y genau dann den Wert g ( x i ) g(x_i) g ( x i ) hat, wenn X X X den Wert x i x_i x i hat. Also mit derselben
Wahrscheinlichkeit.
Eingesetzt:
E ( Y ) = 1 3 ⋅ ( − 1 ) 2 + 1 3 ⋅ 0 2 + 1 3 ⋅ 1 2 = 1 3 ⋅ 1 + 1 3 ⋅ 0 + 1 3 ⋅ 1 = 1 3 + 0 + 1 3 = 2 3 ≈ 0,6667 E(Y) = \tfrac13 \cdot (-1)^2 + \tfrac13 \cdot 0^2 + \tfrac13 \cdot 1^2 = \tfrac13 \cdot 1
+ \tfrac13 \cdot 0 + \tfrac13 \cdot 1 = \tfrac13 + 0 + \tfrac13 = \mathbf{\tfrac23}
\approx 0{,}6667 E ( Y ) = 3 1 ⋅ ( − 1 ) 2 + 3 1 ⋅ 0 2 + 3 1 ⋅ 1 2 = 3 1 ⋅ 1 + 3 1 ⋅ 0 + 3 1 ⋅ 1 = 3 1 + 0 + 3 1 = 3 2 ≈ 0 , 6667
Probe mit der Verteilung von Y Y Y aus Schritt 1: Y Y Y ist 0 0 0 mit 1 3 \tfrac13 3 1 und 1 1 1
mit 2 3 \tfrac23 3 2 . Also E ( Y ) = 1 3 ⋅ 0 + 2 3 ⋅ 1 = 2 3 E(Y) = \tfrac13 \cdot 0 + \tfrac23 \cdot 1 = \tfrac23 E ( Y ) = 3 1 ⋅ 0 + 3 2 ⋅ 1 = 3 2 . Dasselbe.
2 3 \tfrac23 3 2 ist selbst kein möglicher Wert von Y Y Y . Das muss ein Erwartungswert auch nicht
sein. Im Bild ist E ( Y ) = 2 3 E(Y) = \tfrac23 E ( Y ) = 3 2 die gestrichelte waagerechte Linie: Zwei der drei
Punkte liegen auf Höhe 1, einer auf Höhe 0.
Achtung: E ( X 2 ) E(X^2) E ( X 2 ) ist nicht dasselbe wie
E ( X ) 2 E(X)^2 E ( X ) 2 .
E ( X 2 ) = 2 3 E(X^2) = \tfrac23 E ( X 2 ) = 3 2 : erst
quadrieren, dann mitteln.
E ( X ) 2 = 0 2 = 0 E(X)^2 = 0^2 = 0 E ( X ) 2 = 0 2 = 0 : erst mitteln, dann quadrieren.
Zur Musterlösung: In dieser Zeile steht dort „(−91²“, eine 9 statt der schließenden
Klammer. Gemeint ist ( − 1 ) 2 = 1 (-1)^2 = 1 ( − 1 ) 2 = 1 . Das Ergebnis 2 3 \tfrac23 3 2 stimmt.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“): Eine
Rechnung mit einer Zufallsvariablen ergibt eine neue Zufallsvariable, etwa
X 2 X^2 X 2 : den Wert
von
X X X nehmen und quadrieren. Die Wahrscheinlichkeiten bleiben dieselben. Quadriert
werden die Werte, nicht die Wahrscheinlichkeiten.
E ( X Y ) = E ( X 3 ) = 1 3 ⋅ ( − 1 ) + 1 3 ⋅ 0 + 1 3 ⋅ 1 = 0 E(XY) = E(X^3) = \tfrac13 \cdot (-1) + \tfrac13 \cdot 0 + \tfrac13 \cdot 1 = 0 E ( X Y ) = E ( X 3 ) = 3 1 ⋅ ( − 1 ) + 3 1 ⋅ 0 + 3 1 ⋅ 1 = 0
Für die Kovarianz im nächsten Schritt braucht man noch den Erwartungswert des Produkts X ⋅ Y X
\cdot Y X ⋅ Y , kurz X Y XY X Y .
Da Y = X 2 Y = X^2 Y = X 2 ist, gilt X Y = X ⋅ X 2 = X 3 XY = X \cdot X^2 = X^3 X Y = X ⋅ X 2 = X 3 . Bei Potenzen mit gleicher Basis werden
die Hochzahlen addiert: x 1 ⋅ x 2 = x 1 + 2 = x 3 x^1 \cdot x^2 = x^{1+2} = x^3 x 1 ⋅ x 2 = x 1 + 2 = x 3 .
X Y XY X Y ist also wieder eine Rechnung mit X X X allein, hier „hoch 3“. Die Regel aus Schritt 4
gilt mit g ( x ) = x 3 g(x) = x^3 g ( x ) = x 3 :
( − 1 ) 3 = ( − 1 ) ⋅ ( − 1 ) ⋅ ( − 1 ) = − 1 (-1)^3 = (-1) \cdot (-1) \cdot (-1) = -1 ( − 1 ) 3 = ( − 1 ) ⋅ ( − 1 ) ⋅ ( − 1 ) = − 1
0 3 = 0 0^3 = 0 0 3 = 0
1 3 = 1 1^3 = 1 1 3 = 1
E ( X Y ) = 1 3 ⋅ ( − 1 ) + 1 3 ⋅ 0 + 1 3 ⋅ 1 = − 1 3 + 0 + 1 3 = 0 E(XY) = \tfrac13 \cdot (-1) + \tfrac13 \cdot 0 + \tfrac13 \cdot 1 = -\tfrac13 + 0 +
\tfrac13 = \mathbf{0} E ( X Y ) = 3 1 ⋅ ( − 1 ) + 3 1 ⋅ 0 + 3 1 ⋅ 1 = − 3 1 + 0 + 3 1 = 0
Das ist dieselbe Rechnung wie in Schritt 3: X 3 X^3 X 3 hat genau dieselben Werte wie X X X
selbst. Die Hochzahl 3 ist ungerade, das Minuszeichen bleibt erhalten.
Unten im Bild stehen die Werte von X Y XY X Y . Sie ergeben sich auch direkt aus den Punkten:
( − 1 ) ⋅ 1 = − 1 (-1) \cdot 1 = -1 ( − 1 ) ⋅ 1 = − 1 , 0 ⋅ 0 = 0 0 \cdot 0 = 0 0 ⋅ 0 = 0 , 1 ⋅ 1 = 1 1 \cdot 1 = 1 1 ⋅ 1 = 1 .
c o v ( X , Y ) = E ( X Y ) − E ( X ) ⋅ E ( Y ) = 0 − 0 ⋅ 2 3 = 0 \mathrm{cov}(X, Y) = E(XY) - E(X) \cdot E(Y) = 0 - 0 \cdot \tfrac23 = 0 cov ( X , Y ) = E ( X Y ) − E ( X ) ⋅ E ( Y ) = 0 − 0 ⋅ 3 2 = 0
Die Kovarianz c o v ( X , Y ) \mathrm{cov}(X, Y) cov ( X , Y ) misst, ob X X X und Y Y Y gemeinsam von ihren
Erwartungswerten abweichen:
Liegt Y Y Y meist über E ( Y ) E(Y) E ( Y ) , wenn X X X über E ( X ) E(X) E ( X ) liegt (und beide meist darunter
zugleich), ist sie positiv .
Liegt Y Y Y meist unter E ( Y ) E(Y) E ( Y ) , wenn X X X über E ( X ) E(X) E ( X ) liegt, ist sie negativ .
Die Definition aus dem Skript ist der Erwartungswert des Produkts der beiden Abweichungen:
c o v ( X , Y ) = E ( [ X − E ( X ) ] ⋅ [ Y − E ( Y ) ] ) \mathrm{cov}(X, Y) = E\big([X - E(X)] \cdot [Y - E(Y)]\big) cov ( X , Y ) = E ( [ X − E ( X )] ⋅ [ Y − E ( Y )] )
Schneller rechnet man mit der zweiten Form, die das Skript gleich dahinter angibt:
c o v ( X , Y ) = E ( X Y ) − E ( X ) ⋅ E ( Y ) \mathrm{cov}(X, Y) = E(XY) - E(X) \cdot E(Y) cov ( X , Y ) = E ( X Y ) − E ( X ) ⋅ E ( Y )
Alle drei Zahlen sind schon da: E ( X Y ) = 0 E(XY) = 0 E ( X Y ) = 0 (Schritt 5), E ( X ) = 0 E(X) = 0 E ( X ) = 0 (Schritt 3), E ( Y ) = 2 3 E(Y) =
\tfrac23 E ( Y ) = 3 2 (Schritt 4). Eingesetzt:
c o v ( X , Y ) = 0 − 0 ⋅ 2 3 = 0 − 0 = 0 \mathrm{cov}(X, Y) = 0 - 0 \cdot \tfrac23 = 0 - 0 = \mathbf{0} cov ( X , Y ) = 0 − 0 ⋅ 3 2 = 0 − 0 = 0
Das ist die Kovarianz von Zufallsvariablen. In Aufgabe 1 stand an derselben Stelle die
Stichprobenkovarianz s X Y s_{XY} s X Y (Formel rechts unten). Sie mittelt dieselben Produkte, aber
aus Daten und mit dem Faktor 1 n − 1 \frac{1}{n-1} n − 1 1 statt den Wahrscheinlichkeiten (Schritt 2).
Nur für Interessierte — warum beide Formen gleich sind: Klammern ausmultiplizieren,
[ X − E ( X ) ] [ Y − E ( Y ) ] = X Y − E ( Y ) X − E ( X ) Y + E ( X ) E ( Y ) [X - E(X)][Y - E(Y)] = XY - E(Y)\,X - E(X)\,Y + E(X)\,E(Y) [ X − E ( X )] [ Y − E ( Y )] = X Y − E ( Y ) X − E ( X ) Y + E ( X ) E ( Y ) . Den Erwartungswert davon
darf man Summand für Summand bilden, feste Zahlen wie E ( Y ) E(Y) E ( Y ) bleiben als Faktor stehen:
E ( X Y ) − E ( Y ) E ( X ) − E ( X ) E ( Y ) + E ( X ) E ( Y ) = E ( X Y ) − E ( X ) E ( Y ) E(XY) - E(Y)E(X) - E(X)E(Y) + E(X)E(Y) = E(XY) - E(X)E(Y) E ( X Y ) − E ( Y ) E ( X ) − E ( X ) E ( Y ) + E ( X ) E ( Y ) = E ( X Y ) − E ( X ) E ( Y ) .
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“):
Positive Kovarianz heißt: Große
x x x -Werte gehen mit großen
y y y -Werten einher. Negative
Kovarianz: große
x x x -Werte mit kleinen
y y y -Werten.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“): Der
Erwartungswert einer Summe ist die Summe der Erwartungswerte, und
E ( a X + b ) = a ⋅ E ( X ) + b E(aX + b) = a \cdot
E(X) + b E ( a X + b ) = a ⋅ E ( X ) + b für feste Zahlen
a a a ,
b b b .
1 3 ⋅ ( − 1 3 ) + 1 3 ⋅ 0 + 1 3 ⋅ ( + 1 3 ) = 0 \tfrac13 \cdot (-\tfrac13) + \tfrac13 \cdot 0 + \tfrac13 \cdot (+\tfrac13) = 0 3 1 ⋅ ( − 3 1 ) + 3 1 ⋅ 0 + 3 1 ⋅ ( + 3 1 ) = 0 ✓
Jetzt dieselbe Kovarianz über die Definition. Das zeigt, warum sie 0 ist.
Der Punkt ( E ( X ) ∣ E ( Y ) ) = ( 0 ∣ 2 3 ) (E(X) \mid E(Y)) = (0 \mid \tfrac23) ( E ( X ) ∣ E ( Y )) = ( 0 ∣ 3 2 ) heißt Schwerpunkt . Im Bild ist er
die Raute. Jeder der drei Punkte spannt mit ihm ein Rechteck auf. Die Seitenlängen sind
die Abweichungen x i − E ( X ) x_i - E(X) x i − E ( X ) und y i − E ( Y ) y_i - E(Y) y i − E ( Y ) , die Fläche mit Vorzeichen ist ihr Produkt:
( − 1 ∣ 1 ) (-1 \mid 1) ( − 1 ∣ 1 ) liegt links oben vom Schwerpunkt: ( − 1 ) ⋅ ( + 1 3 ) = − 1 3 (-1) \cdot (+\tfrac13) =
-\tfrac13 ( − 1 ) ⋅ ( + 3 1 ) = − 3 1 (rot, Minus).
( 1 ∣ 1 ) (1 \mid 1) ( 1 ∣ 1 ) liegt rechts oben : ( + 1 ) ⋅ ( + 1 3 ) = + 1 3 (+1) \cdot (+\tfrac13) = +\tfrac13 ( + 1 ) ⋅ ( + 3 1 ) = + 3 1 (grün,
Plus).
( 0 ∣ 0 ) (0 \mid 0) ( 0 ∣ 0 ) liegt genau unter dem Schwerpunkt. Das Rechteck hat die Breite 0: 0 ⋅ ( − 2 3 ) = 0 0
\cdot (-\tfrac23) = 0 0 ⋅ ( − 3 2 ) = 0 .
Die Regel dahinter: Rechts oben und links unten ergibt Plus, links oben und rechts unten
Minus.
Die Kovarianz ist der Erwartungswert dieser Produkte. Jedes Produkt wird also mit seiner
Wahrscheinlichkeit 1 3 \tfrac13 3 1 gewichtet:
1 3 ⋅ ( − 1 3 ) + 1 3 ⋅ 0 + 1 3 ⋅ 1 3 = − 1 9 + 0 + 1 9 = 0 \tfrac13 \cdot (-\tfrac13) + \tfrac13 \cdot 0 + \tfrac13 \cdot \tfrac13 = -\tfrac19 + 0 +
\tfrac19 = 0 3 1 ⋅ ( − 3 1 ) + 3 1 ⋅ 0 + 3 1 ⋅ 3 1 = − 9 1 + 0 + 9 1 = 0
Dasselbe Ergebnis wie in Schritt 6. Das Minus-Rechteck links und das Plus-Rechteck rechts
sind gleich groß und gleich wahrscheinlich. Sie heben sich auf.
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“):
Jedes Datenpaar spannt mit dem Schwerpunkt
( x ˉ ∣ y ˉ ) (\bar x \mid \bar y) ( x ˉ ∣ y ˉ ) ein Rechteck auf. Die
Summe der Flächen mit Vorzeichen, geteilt durch
n − 1 n - 1 n − 1 , ist die Stichprobenkovarianz.
Hier wird statt durch
n − 1 n - 1 n − 1 zu teilen mit den Wahrscheinlichkeiten gewichtet.
v a r ( X ) = E ( X 2 ) − E ( X ) 2 = 2 3 − 0 2 = 2 3 \mathrm{var}(X) = E(X^2) - E(X)^2 = \tfrac23 - 0^2 = \tfrac23 var ( X ) = E ( X 2 ) − E ( X ) 2 = 3 2 − 0 2 = 3 2
Für die Korrelation braucht man noch die Streuung von X X X und von Y Y Y . Zuerst X X X .
Die Varianz v a r ( X ) \mathrm{var}(X) var ( X ) ist die mittlere quadratische Abweichung vom
Erwartungswert. Am schnellsten geht sie mit dem Verschiebungssatz :
v a r ( X ) = E ( X 2 ) − E ( X ) 2 \mathrm{var}(X) = E(X^2) - E(X)^2 var ( X ) = E ( X 2 ) − E ( X ) 2
E ( X 2 ) E(X^2) E ( X 2 ) ist schon bekannt: Es ist genau E ( Y ) E(Y) E ( Y ) aus Schritt 4, denn Y = X 2 Y = X^2 Y = X 2 . Also
E ( X 2 ) = 2 3 E(X^2) = \tfrac23 E ( X 2 ) = 3 2 . Mit E ( X ) = 0 E(X) = 0 E ( X ) = 0 aus Schritt 3:
v a r ( X ) = 2 3 − 0 2 = 2 3 − 0 = 2 3 ≈ 0,6667 \mathrm{var}(X) = \tfrac23 - 0^2 = \tfrac23 - 0 = \mathbf{\tfrac23} \approx 0{,}6667 var ( X ) = 3 2 − 0 2 = 3 2 − 0 = 3 2 ≈ 0 , 6667
Probe nach Definition: Die Abweichungen von E ( X ) = 0 E(X) = 0 E ( X ) = 0 sind − 1 -1 − 1 , 0 0 0 und 1 1 1 .
Quadriert 1 1 1 , 0 0 0 , 1 1 1 , gewichtet mit je 1 3 \tfrac13 3 1 : 1 3 + 0 + 1 3 = 2 3 \tfrac13 + 0 + \tfrac13 =
\tfrac23 3 1 + 0 + 3 1 = 3 2 . Dasselbe.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“): Die
Varianz ist
v a r ( X ) = E ( ( X − E ( X ) ) 2 ) \mathrm{var}(X) = E\big((X - E(X))^2\big) var ( X ) = E ( ( X − E ( X ) ) 2 ) , die mittlere quadratische
Abweichung. Der Verschiebungssatz
v a r ( X ) = E ( X 2 ) − E ( X ) 2 \mathrm{var}(X) = E(X^2) - E(X)^2 var ( X ) = E ( X 2 ) − E ( X ) 2 liefert dasselbe,
oft schneller. Die Wurzel aus der Varianz heißt Standardabweichung.
v a r ( Y ) = 2 3 − ( 2 3 ) 2 = 6 9 − 4 9 = 2 9 \mathrm{var}(Y) = \tfrac23 - \big(\tfrac23\big)^2 = \tfrac69 - \tfrac49 = \tfrac29 var ( Y ) = 3 2 − ( 3 2 ) 2 = 9 6 − 9 4 = 9 2
Jetzt dasselbe für Y Y Y : v a r ( Y ) = E ( Y 2 ) − E ( Y ) 2 \mathrm{var}(Y) = E(Y^2) - E(Y)^2 var ( Y ) = E ( Y 2 ) − E ( Y ) 2 .
Y 2 = ( X 2 ) 2 = X 4 Y^2 = (X^2)^2 = X^4 Y 2 = ( X 2 ) 2 = X 4 . Die Werte sind ( − 1 ) 4 = 1 (-1)^4 = 1 ( − 1 ) 4 = 1 , 0 4 = 0 0^4 = 0 0 4 = 0 und 1 4 = 1 1^4 = 1 1 4 = 1 . Mit der Regel
aus Schritt 4:
E ( Y 2 ) = 1 3 ⋅ 1 + 1 3 ⋅ 0 + 1 3 ⋅ 1 = 2 3 E(Y^2) = \tfrac13 \cdot 1 + \tfrac13 \cdot 0 + \tfrac13 \cdot 1 = \tfrac23 E ( Y 2 ) = 3 1 ⋅ 1 + 3 1 ⋅ 0 + 3 1 ⋅ 1 = 3 2
Das passt: Y Y Y ist immer 0 0 0 oder 1 1 1 , und 0 2 = 0 0^2 = 0 0 2 = 0 , 1 2 = 1 1^2 = 1 1 2 = 1 . Also ist Y 2 = Y Y^2 = Y Y 2 = Y und
damit E ( Y 2 ) = E ( Y ) = 2 3 E(Y^2) = E(Y) = \tfrac23 E ( Y 2 ) = E ( Y ) = 3 2 .
Eingesetzt, mit E ( Y ) = 2 3 E(Y) = \tfrac23 E ( Y ) = 3 2 aus Schritt 4:
v a r ( Y ) = 2 3 − ( 2 3 ) 2 = 2 3 − 4 9 \mathrm{var}(Y) = \tfrac23 - \big(\tfrac23\big)^2 = \tfrac23 - \tfrac49 var ( Y ) = 3 2 − ( 3 2 ) 2 = 3 2 − 9 4
Zum Abziehen brauchen beide Brüche denselben Nenner. 2 3 \tfrac23 3 2 wird mit 3 erweitert:
2 3 = 2 ⋅ 3 3 ⋅ 3 = 6 9 \tfrac23 = \tfrac{2 \cdot 3}{3 \cdot 3} = \tfrac69 3 2 = 3 ⋅ 3 2 ⋅ 3 = 9 6 . Dann:
v a r ( Y ) = 6 9 − 4 9 = 2 9 ≈ 0,2222 \mathrm{var}(Y) = \tfrac69 - \tfrac49 = \mathbf{\tfrac29} \approx 0{,}2222 var ( Y ) = 9 6 − 9 4 = 9 2 ≈ 0 , 2222
Probe nach Definition: Y = 0 Y = 0 Y = 0 weicht um 0 − 2 3 = − 2 3 0 - \tfrac23 = -\tfrac23 0 − 3 2 = − 3 2 ab, Y = 1 Y = 1 Y = 1 um
1 − 2 3 = 1 3 1 - \tfrac23 = \tfrac13 1 − 3 2 = 3 1 . Quadriert und mit P ( Y = 0 ) = 1 3 P(Y = 0) = \tfrac13 P ( Y = 0 ) = 3 1 und P ( Y = 1 ) = 2 3 P(Y = 1) =
\tfrac23 P ( Y = 1 ) = 3 2 gewichtet: 4 9 ⋅ 1 3 + 1 9 ⋅ 2 3 = 4 27 + 2 27 = 6 27 = 2 9 \tfrac49 \cdot \tfrac13 + \tfrac19 \cdot \tfrac23 = \tfrac{4}{27} +
\tfrac{2}{27} = \tfrac{6}{27} = \tfrac29 9 4 ⋅ 3 1 + 9 1 ⋅ 3 2 = 27 4 + 27 2 = 27 6 = 9 2 . Dasselbe.
Typischer Fehler: ( 2 3 ) 2 \big(\tfrac23\big)^2 ( 3 2 ) 2 als
4 3 \tfrac43 3 4 rechnen. Quadriert werden
Zähler
und Nenner:
2 2 3 2 = 4 9 \tfrac{2^2}{3^2} = \tfrac49 3 2 2 2 = 9 4 .
ρ = 0 2 / 3 ⋅ 2 / 9 = 0 0,3849 = 0 \rho = \dfrac{0}{\sqrt{2/3} \cdot \sqrt{2/9}} = \dfrac{0}{0{,}3849} = 0 ρ = 2/3 ⋅ 2/9 0 = 0 , 3849 0 = 0
Die Kovarianz hat einen Nachteil: Ihre Größe hängt von den Einheiten ab. Misst man X X X in
Zentimetern statt in Metern, wird sie hundertmal so groß. Deshalb teilt man sie durch die
beiden Standardabweichungen. Das Ergebnis ist die Korrelation ρ \rho ρ :
ρ = c o v ( X , Y ) v a r ( X ) ⋅ v a r ( Y ) \rho = \dfrac{\mathrm{cov}(X, Y)}{\sqrt{\mathrm{var}(X)} \cdot \sqrt{\mathrm{var}(Y)}} ρ = var ( X ) ⋅ var ( Y ) cov ( X , Y )
Sie liegt immer zwischen − 1 -1 − 1 und 1 1 1 und hat keine Einheit.
Zuerst der Nenner. Durch 0 darf man nicht teilen. ρ \rho ρ ist also nur erklärt, wenn
beide Varianzen größer als 0 sind. Das ist hier so: v a r ( X ) = 2 3 \mathrm{var}(X) = \tfrac23 var ( X ) = 3 2 (Schritt
8) und v a r ( Y ) = 2 9 \mathrm{var}(Y) = \tfrac29 var ( Y ) = 9 2 (Schritt 9). Beide Größen haben mehr als einen
möglichen Wert, streuen also wirklich.
2 3 ≈ 0,8165 \sqrt{\tfrac23} \approx 0{,}8165 3 2 ≈ 0 , 8165 und 2 9 ≈ 0,4714 \sqrt{\tfrac29} \approx 0{,}4714 9 2 ≈ 0 , 4714 (auf vier
Stellen gerundet). Das Produkt ist 2 3 ⋅ 2 9 = 4 27 ≈ 0,3849 \sqrt{\tfrac23 \cdot \tfrac29} = \sqrt{\tfrac{4}{27}}
\approx 0{,}3849 3 2 ⋅ 9 2 = 27 4 ≈ 0 , 3849 .
Dann der Bruch , mit c o v ( X , Y ) = 0 \mathrm{cov}(X, Y) = 0 cov ( X , Y ) = 0 aus Schritt 6:
ρ = 0 0,3849 = 0 \rho = \dfrac{0}{0{,}3849} = \mathbf{0} ρ = 0 , 3849 0 = 0
0 geteilt durch eine Zahl, die nicht 0 ist, ergibt 0. Ist die Kovarianz 0, ist also auch
die Korrelation 0 — sobald der Nenner nicht 0 ist.
In Aufgabe 1 stand an derselben Stelle die Stichprobenkorrelation ρ ^ = s X Y s X s Y \hat\rho =
\frac{s_{XY}}{s_X\,s_Y} ρ ^ = s X s Y s X Y (rechts unten): dieselbe Idee, mit den Größen aus den Daten.
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“): Die
Korrelation liegt zwischen
− 1 -1 − 1 und
1 1 1 . Nahe
1 1 1 : die Punkte liegen fast auf einer
steigenden Geraden. Nahe
− 1 -1 − 1 : fast auf einer fallenden. Nahe
0 0 0 : kaum linearer
Zusammenhang.
ρ = 0 \rho = 0 ρ = 0 ⇒
X X X und
Y Y Y sind unkorreliert
Das Skript nennt zwei Zufallsvariablen unkorreliert , wenn ihre Korrelation 0 ist.
Das Zeichen : ⟺ :\Longleftrightarrow :⟺ rechts heißt „ist definiert als“.
Hier ist ρ = 0 \rho = 0 ρ = 0 (Schritt 10). Die Antwort auf die erste Frage von (ii) lautet also:
Ja, X X X und Y Y Y sind unkorreliert.
Gleichwertig kann man sagen: c o v ( X , Y ) = 0 \mathrm{cov}(X, Y) = 0 cov ( X , Y ) = 0 . Solange beide Varianzen größer als
0 sind, ist ρ \rho ρ genau dann 0, wenn die Kovarianz 0 ist.
Das wirkt seltsam. Y Y Y ist vollständig durch X X X festgelegt: Y = X 2 Y = X^2 Y = X 2 . Enger kann
ein Zusammenhang kaum sein. Trotzdem sagt die Korrelation „kein Zusammenhang“? Die
nächsten beiden Schritte lösen das auf.
links Steigung
− 1 -1 − 1 , rechts Steigung
+ 1 +1 + 1 : im Mittel
0 0 0
Das Skript nennt zwei Größen positiv assoziiert , wenn eine Zunahme von X X X mit
einer Zunahme von Y Y Y einhergeht, und negativ assoziiert , wenn sie mit einer
Abnahme einhergeht. Die Korrelation fragt genau das: In welche Richtung bewegt sich Y Y Y im
Mittel, wenn X X X größer wird?
Im Bild sind die Punkte durch zwei Strecken verbunden:
Links (rot): Von X = − 1 X = -1 X = − 1 nach X = 0 X = 0 X = 0 wird X X X größer, aber Y Y Y fällt von 1 auf
0. Die Steigung ist die Änderung von y y y geteilt durch die Änderung von x x x :
0 − 1 0 − ( − 1 ) = − 1 \frac{0 - 1}{0 - (-1)} = -1 0 − ( − 1 ) 0 − 1 = − 1 . Hier ist der Zusammenhang negativ.
Rechts (grün): Von X = 0 X = 0 X = 0 nach X = 1 X = 1 X = 1 wird X X X größer, und Y Y Y steigt von 0 auf
1. Steigung 1 − 0 1 − 0 = + 1 \frac{1 - 0}{1 - 0} = +1 1 − 0 1 − 0 = + 1 . Hier ist der Zusammenhang positiv.
Die Punkte links und rechts haben dieselbe Wahrscheinlichkeit 1 3 \tfrac13 3 1 und liegen gleich
weit von der Mitte entfernt. Im Mittel ergibt sich ( − 1 ) + ( + 1 ) 2 = 0 \frac{(-1) + (+1)}{2} = 0 2 ( − 1 ) + ( + 1 ) = 0 : weder
steigend noch fallend. Das sind dieselben Minus- und Plus-Rechtecke aus Schritt 7, nur
anders betrachtet.
Vorsicht: Das Mitteln der beiden Steigungen ist nur ein Bild für diese Aufgabe. Es
klappt, weil die drei x x x -Werte gleich weit auseinanderliegen und gleich wahrscheinlich
sind. Allgemein rechnet man nicht mit Steigungen von Verbindungsstrecken, sondern mit der
Kovarianz (Schritt 6).
Noch deutlicher: Bei X = − 1 X = -1 X = − 1 und bei X = 1 X = 1 X = 1 hat Y Y Y denselben Wert 1. Ob X X X klein oder
groß ist, sagt nichts darüber, ob Y Y Y groß oder klein ist. Es kommt nur auf den
Abstand von X X X zur 0 an, nicht auf die Richtung.
Merke: Eine symmetrische Parabel ist links fallend und rechts steigend. Beide Teile
heben sich in der Korrelation auf.
beste Gerade
y = 2 3 + 0 ⋅ x y = \tfrac23 + 0 \cdot x y = 3 2 + 0 ⋅ x : Steigung
β 1 = c o v ( X , Y ) v a r ( X ) = 0 \beta_1 =
\dfrac{\mathrm{cov}(X,Y)}{\mathrm{var}(X)} = 0 β 1 = var ( X ) cov ( X , Y ) = 0
Zur Anschauung — die Aufgabe verlangt diesen Schritt nicht. Er zeigt, warum ρ = 0 \rho =
0 ρ = 0 herauskommt, obwohl Y Y Y ganz von X X X abhängt.
Die Korrelation misst, wie gut sich der Zusammenhang durch eine Gerade beschreiben
lässt. Man spricht von einem linearen Zusammenhang (linear = geradlinig). Welche
Gerade passt am besten zu den drei Punkten?
Eine Gerade hat die Form y = β 0 + β 1 ⋅ x y = \beta_0 + \beta_1 \cdot x y = β 0 + β 1 ⋅ x (griechisch „beta null“ und „beta
eins“, wie in Aufgabe 3). β 0 \beta_0 β 0 ist die Höhe bei x = 0 x = 0 x = 0 (Achsenabschnitt), β 1 \beta_1 β 1
die Steigung. „Am besten“ heißt: Die senkrechten Abstände der Punkte zur Geraden sollen
klein sein. Man quadriert sie, damit sich Plus und Minus nicht aufheben, und macht die
Summe der Quadrate Q Q Q so klein wie möglich. Weil alle drei Punkte dieselbe
Wahrscheinlichkeit haben, zählt jeder gleich viel.
Die Abstände (Punkt minus Gerade an derselben Stelle): 1 − β 0 + β 1 1 - \beta_0 + \beta_1 1 − β 0 + β 1 ,
− β 0 -\beta_0 − β 0 und 1 − β 0 − β 1 1 - \beta_0 - \beta_1 1 − β 0 − β 1 (rechts, zweiter Kasten).
Die Quadrate addieren. Mit der Abkürzung u = 1 − β 0 u = 1 - \beta_0 u = 1 − β 0 sind das erste und das
dritte Quadrat ( u + β 1 ) 2 (u + \beta_1)^2 ( u + β 1 ) 2 und ( u − β 1 ) 2 (u - \beta_1)^2 ( u − β 1 ) 2 . Nach den binomischen Formeln:
( u + β 1 ) 2 = u 2 + 2 u β 1 + β 1 2 (u + \beta_1)^2 = u^2 + 2u\beta_1 + \beta_1^2 ( u + β 1 ) 2 = u 2 + 2 u β 1 + β 1 2
( u − β 1 ) 2 = u 2 − 2 u β 1 + β 1 2 (u - \beta_1)^2 = u^2 - 2u\beta_1 + \beta_1^2 ( u − β 1 ) 2 = u 2 − 2 u β 1 + β 1 2
zusammen 2 u 2 + 2 β 1 2 2u^2 + 2\beta_1^2 2 u 2 + 2 β 1 2 ; die Teile + 2 u β 1 +2u\beta_1 + 2 u β 1 und − 2 u β 1 -2u\beta_1 − 2 u β 1 heben sich auf
Also ist die Quadratsumme Q = 2 ( 1 − β 0 ) 2 + β 0 2 + 2 β 1 2 Q = 2(1 - \beta_0)^2 + \beta_0^2 + 2\beta_1^2 Q = 2 ( 1 − β 0 ) 2 + β 0 2 + 2 β 1 2 .
Die Steigung: β 1 \beta_1 β 1 steckt nur im Teil 2 β 1 2 2\beta_1^2 2 β 1 2 . Ein Quadrat ist nie
negativ, am kleinsten ist es für β 1 = 0 \beta_1 = 0 β 1 = 0 .
Jede Steigung außer 0 macht die Gerade schlechter.
Die Höhe , Zeile für Zeile (rechts, vierter Kasten):
Ausmultiplizieren: 2 ( 1 − β 0 ) 2 + β 0 2 = 2 − 4 β 0 + 2 β 0 2 + β 0 2 = 3 β 0 2 − 4 β 0 + 2 2(1 - \beta_0)^2 + \beta_0^2 = 2 - 4\beta_0 + 2\beta_0^2 + \beta_0^2
= 3\beta_0^2 - 4\beta_0 + 2 2 ( 1 − β 0 ) 2 + β 0 2 = 2 − 4 β 0 + 2 β 0 2 + β 0 2 = 3 β 0 2 − 4 β 0 + 2 .
Die 3 aus den ersten beiden Teilen ausklammern: 3 ( β 0 2 − 4 3 β 0 ) + 2 3\big(\beta_0^2 - \tfrac43 \beta_0\big)
+ 2 3 ( β 0 2 − 3 4 β 0 ) + 2 .
Quadratische Ergänzung: Nach der binomischen Formel ist ( β 0 − 2 3 ) 2 = β 0 2 − 4 3 β 0 + 4 9 \big(\beta_0 - \tfrac23\big)^2
= \beta_0^2 - \tfrac43 \beta_0 + \tfrac49 ( β 0 − 3 2 ) 2 = β 0 2 − 3 4 β 0 + 9 4 . Also ist β 0 2 − 4 3 β 0 = ( β 0 − 2 3 ) 2 − 4 9 \beta_0^2 - \tfrac43 \beta_0 =
\big(\beta_0 - \tfrac23\big)^2 - \tfrac49 β 0 2 − 3 4 β 0 = ( β 0 − 3 2 ) 2 − 9 4 .
Einsetzen und die Klammer auflösen: 3 ( β 0 − 2 3 ) 2 − 4 3 + 2 = 3 ( β 0 − 2 3 ) 2 + 2 3 3\big(\beta_0 - \tfrac23\big)^2 - \tfrac43 + 2 =
3\big(\beta_0 - \tfrac23\big)^2 + \tfrac23 3 ( β 0 − 3 2 ) 2 − 3 4 + 2 = 3 ( β 0 − 3 2 ) 2 + 3 2 .
Das Quadrat ist am kleinsten, nämlich 0, für β 0 = 2 3 \beta_0 = \tfrac23 β 0 = 3 2 .
Die beste Gerade ist also y = 2 3 y = \tfrac23 y = 3 2 : waagerecht , genau auf Höhe E ( Y ) E(Y) E ( Y ) und
durch den Schwerpunkt. Die Abstände sind + 1 3 +\tfrac13 + 3 1 , − 2 3 -\tfrac23 − 3 2 , + 1 3 +\tfrac13 + 3 1 , die
Quadratsumme 1 9 + 4 9 + 1 9 = 2 3 \tfrac19 + \tfrac49 + \tfrac19 = \tfrac23 9 1 + 9 4 + 9 1 = 3 2 .
Dasselbe liefert die Formel für die Steigung aus Aufgabe 3, übertragen auf
Zufallsvariablen: β 1 = c o v ( X , Y ) v a r ( X ) = 0 2 / 3 = 0 \beta_1 = \frac{\mathrm{cov}(X, Y)}{\mathrm{var}(X)} = \frac{0}{2/3} =
0 β 1 = var ( X ) cov ( X , Y ) = 2/3 0 = 0 .
Was das heißt: Eine waagerechte Gerade sagt: „Mit größerem X X X wird Y Y Y im Mittel
weder größer noch kleiner.“ Genau das bedeutet ρ = 0 \rho = 0 ρ = 0 . Die Parabel y = x 2 y = x^2 y = x 2 trifft
dagegen alle drei Punkte exakt. Der Zusammenhang ist perfekt, aber er ist gekrümmt ,
keine Gerade. Deshalb sieht die Korrelation ihn nicht.
Merke: ρ = 0 \rho = 0 ρ = 0 heißt „kein
linearer Zusammenhang“. Es heißt nicht „kein
Zusammenhang“. Darum gilt auch die Regel aus dem Skript: Punktwolke immer ansehen, nie nur
die Korrelation.
Aus Aufgabe 3 dieses Blatts („Lineare Regression: Sauerstoff in warmem Wasser“):
Die beste Gerade
y = β 0 + β 1 x y = \beta_0 + \beta_1 x y = β 0 + β 1 x macht die Summe der quadrierten senkrechten
Abstände so klein wie möglich (Methode der kleinsten Quadrate). Aus Daten ist ihre
Steigung
β ^ 1 = s X Y s X 2 \hat\beta_1 = \frac{s_{XY}}{s_X^2} β ^ 1 = s X 2 s X Y . Hier stehen an deren Stelle
c o v ( X , Y ) \mathrm{cov}(X, Y) cov ( X , Y ) und
v a r ( X ) \mathrm{var}(X) var ( X ) .
P ( X = a , Y = b ) = P ( X = a ) ⋅ P ( Y = b ) P(X = a,\ Y = b) = P(X = a) \cdot P(Y = b) P ( X = a , Y = b ) = P ( X = a ) ⋅ P ( Y = b ) für
alle Paare
( a , b ) (a, b) ( a , b )
Jetzt die zweite Frage von (ii): Sind X X X und Y Y Y unabhängig ? Anschaulich heißt
unabhängig: Der Wert von X X X verrät nichts über den Wert von Y Y Y .
Genau: X X X und Y Y Y sind unabhängig, wenn für jedes Paar von Werten a a a (von X X X )
und b b b (von Y Y Y ) die Produktregel gilt:
P ( X = a , Y = b ) = P ( X = a ) ⋅ P ( Y = b ) P(X = a,\ Y = b) = P(X = a) \cdot P(Y = b) P ( X = a , Y = b ) = P ( X = a ) ⋅ P ( Y = b )
Das Komma links heißt „und“: P ( X = a , Y = b ) P(X = a,\ Y = b) P ( X = a , Y = b ) ist die Wahrscheinlichkeit, dass X = a X = a X = a
und zugleich Y = b Y = b Y = b ist.
Hier hat X X X drei Werte (a = − 1 , 0 , 1 a = -1, 0, 1 a = − 1 , 0 , 1 ) und Y Y Y zwei (b = 0 , 1 b = 0, 1 b = 0 , 1 ). Das Zeichen ∈ \in ∈
heißt „ist eines von“. Es gibt also 3 ⋅ 2 = 6 3 \cdot 2 = 6 3 ⋅ 2 = 6 Paare.
Wichtig für den Nachweis:
Wer Unabhängigkeit zeigen will, muss alle 6 Paare prüfen.
Wer Abhängigkeit zeigen will, braucht nur ein Paar, bei dem die Gleichung
nicht stimmt. Ein einziges Gegenbeispiel widerlegt ein „für alle“.
Das Skript schreibt die Definition für stetige Zufallsvariablen mit „≤ \le ≤ “: P ( X ≤ a , Y ≤ b ) = P ( X ≤ a ) ⋅ P ( Y ≤ b ) P(X \le a,\
Y \le b) = P(X \le a) \cdot P(Y \le b) P ( X ≤ a , Y ≤ b ) = P ( X ≤ a ) ⋅ P ( Y ≤ b ) für alle a a a , b b b . Für Zufallsvariablen mit
einzelnen Werten wie hier ist die Form mit „= = = “ gleichwertig und einfacher zu prüfen.
Aus Blatt 2, Aufgabe 2 („Stochastische Unabhängigkeit“): Zwei Ereignisse
A A A und
B B B heißen unabhängig, wenn
P ( A ∩ B ) = P ( A ) ⋅ P ( B ) P(A \cap B) = P(A) \cdot P(B) P ( A ∩ B ) = P ( A ) ⋅ P ( B ) . Stimmt die Gleichung nicht,
sind sie abhängig.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“): Bei
Zufallsvariablen muss die Produktregel für jedes Paar von Werten gelten: Das Ereignis „
X = a X
= a X = a “ ist unabhängig vom Ereignis „
Y = b Y = b Y = b “.
je Zeile genau eine Zelle
1 3 \tfrac13 3 1 , die andere
0 0 0
Für die Produktregel braucht man zuerst die linke Seite: die Wahrscheinlichkeit jedes
Paares. Alle sechs zusammen heißen gemeinsame Verteilung von X X X und Y Y Y . Man
schreibt sie als Tabelle (oben rechts): Zeilen für die Werte von X X X , Spalten für die
Werte von Y Y Y .
Weil Y = X 2 Y = X^2 Y = X 2 ist, legt jeder Wert von X X X den Wert von Y Y Y fest:
X = − 1 X = -1 X = − 1 : dann ist sicher Y = 1 Y = 1 Y = 1 . Also P ( X = − 1 , Y = 1 ) = P ( X = − 1 ) = 1 3 P(X = -1,\ Y = 1) = P(X = -1) = \tfrac13 P ( X = − 1 , Y = 1 ) = P ( X = − 1 ) = 3 1 . Das
Paar X = − 1 X = -1 X = − 1 , Y = 0 Y = 0 Y = 0 ist unmöglich, Wahrscheinlichkeit 0 0 0 .
X = 0 X = 0 X = 0 : dann ist sicher Y = 0 Y = 0 Y = 0 . Also P ( X = 0 , Y = 0 ) = 1 3 P(X = 0,\ Y = 0) = \tfrac13 P ( X = 0 , Y = 0 ) = 3 1 und P ( X = 0 , Y = 1 ) = 0 P(X = 0,\ Y =
1) = 0 P ( X = 0 , Y = 1 ) = 0 .
X = 1 X = 1 X = 1 : dann ist sicher Y = 1 Y = 1 Y = 1 . Also P ( X = 1 , Y = 1 ) = 1 3 P(X = 1,\ Y = 1) = \tfrac13 P ( X = 1 , Y = 1 ) = 3 1 und P ( X = 1 , Y = 0 ) = 0 P(X = 1,\ Y =
0) = 0 P ( X = 1 , Y = 0 ) = 0 .
In jeder Zeile steht also einmal 1 3 \tfrac13 3 1 und einmal 0 0 0 . Das sind genau die drei Punkte
aus dem Bild in (i): ( − 1 ∣ 1 ) (-1 \mid 1) ( − 1 ∣ 1 ) , ( 0 ∣ 0 ) (0 \mid 0) ( 0 ∣ 0 ) und ( 1 ∣ 1 ) (1 \mid 1) ( 1 ∣ 1 ) .
Probe: Alle sechs Zellen zusammen ergeben 3 ⋅ 1 3 + 3 ⋅ 0 = 1 3 \cdot \tfrac13 + 3 \cdot 0 = 1 3 ⋅ 3 1 + 3 ⋅ 0 = 1 . Das
muss so sein, denn eines der sechs Paare tritt sicher ein.
P ( X = a ) = 1 3 P(X = a) = \tfrac13 P ( X = a ) = 3 1 je Zeile;
P ( Y = 0 ) = 1 3 P(Y = 0) = \tfrac13 P ( Y = 0 ) = 3 1 ,
P ( Y = 1 ) = 2 3 P(Y = 1) = \tfrac23 P ( Y = 1 ) = 3 2
Jetzt die rechte Seite der Produktregel: P ( X = a ) P(X = a) P ( X = a ) und P ( Y = b ) P(Y = b) P ( Y = b ) einzeln. Sie lassen
sich an der Tabelle ablesen.
Zeilensummen. „X = − 1 X = -1 X = − 1 “ tritt genau dann ein, wenn „X = − 1 X = -1 X = − 1 und Y = 0 Y = 0 Y = 0 “ oder „X = − 1 X
= -1 X = − 1 und Y = 1 Y = 1 Y = 1 “ eintritt. Beides kann nicht zugleich passieren. Also werden die beiden
Zellen der Zeile addiert: P ( X = − 1 ) = 0 + 1 3 = 1 3 P(X = -1) = 0 + \tfrac13 = \tfrac13 P ( X = − 1 ) = 0 + 3 1 = 3 1 . Ebenso für X = 0 X = 0 X = 0 und X = 1 X
= 1 X = 1 .
Spaltensummen. Genauso ergibt die Spalte die Wahrscheinlichkeit für Y Y Y : P ( Y = 0 ) = 0 + 1 3 + 0 = 1 3 P(Y = 0)
= 0 + \tfrac13 + 0 = \tfrac13 P ( Y = 0 ) = 0 + 3 1 + 0 = 3 1 und P ( Y = 1 ) = 1 3 + 0 + 1 3 = 2 3 P(Y = 1) = \tfrac13 + 0 + \tfrac13 = \tfrac23 P ( Y = 1 ) = 3 1 + 0 + 3 1 = 3 2 .
Weil diese Summen am Rand der Tabelle stehen, heißen sie Randverteilungen .
Sie sind nichts Neues: dieselben Verteilungen von X X X und Y Y Y wie in Schritt 1. Das ist
gleich eine Probe.
P ( X = 0 , Y = 0 ) = 1 3 ≠ 1 9 = P ( X = 0 ) ⋅ P ( Y = 0 ) P(X = 0,\ Y = 0) = \tfrac13 \ne \tfrac19 = P(X = 0) \cdot P(Y = 0) P ( X = 0 , Y = 0 ) = 3 1 = 9 1 = P ( X = 0 ) ⋅ P ( Y = 0 )
Jetzt wird für ein Paar geprüft, ob die Produktregel stimmt. Nach Schritt 14 reicht ein
einziges Paar, bei dem sie nicht stimmt. Gewählt wird X = 0 X = 0 X = 0 , Y = 0 Y = 0 Y = 0 (wie in der
Musterlösung):
Links: P ( X = 0 , Y = 0 ) P(X = 0,\ Y = 0) P ( X = 0 , Y = 0 ) . Ist X = 0 X = 0 X = 0 , dann ist Y = 0 Y = 0 Y = 0 sicher. Also ist die
Wahrscheinlichkeit dieselbe wie P ( X = 0 ) = 1 3 P(X = 0) = \tfrac13 P ( X = 0 ) = 3 1 (Tabelle, Zelle markiert).
Rechts: P ( X = 0 ) ⋅ P ( Y = 0 ) = 1 3 ⋅ 1 3 P(X = 0) \cdot P(Y = 0) = \tfrac13 \cdot \tfrac13 P ( X = 0 ) ⋅ P ( Y = 0 ) = 3 1 ⋅ 3 1 . Brüche werden
multipliziert, indem man Zähler mal Zähler und Nenner mal Nenner rechnet: 1 ⋅ 1 3 ⋅ 3 = 1 9 \tfrac{1
\cdot 1}{3 \cdot 3} = \tfrac19 3 ⋅ 3 1 ⋅ 1 = 9 1 (untere Tabelle, Zelle markiert).
Vergleich: Auf den Nenner 9 gebracht ist 1 3 = 3 9 \tfrac13 = \tfrac39 3 1 = 9 3 . Und 3 9 ≠ 1 9 \tfrac39 \ne
\tfrac19 9 3 = 9 1 . Die linke Seite ist dreimal so groß wie die rechte.
Die Produktregel ist verletzt. Die Antwort auf die zweite Frage von (ii) lautet also:
Nein, X X X und Y Y Y sind nicht unabhängig, sie sind abhängig.
Merke: X X X und
Y Y Y sind
unkorreliert (Schritt 11), aber
abhängig . Das
ist der Kern dieser Aufgabe.
P ( Y = 0 ∣ X = 0 ) = 1 P(Y = 0 \mid X = 0) = 1 P ( Y = 0 ∣ X = 0 ) = 1 , aber
P ( Y = 0 ) = 1 3 P(Y = 0) = \tfrac13 P ( Y = 0 ) = 3 1
Was bedeutet die verletzte Produktregel? Ohne jedes Wissen ist Y = 0 Y = 0 Y = 0 mit
Wahrscheinlichkeit 1 3 \tfrac13 3 1 . Weiß man aber schon, dass X = 0 X = 0 X = 0 ist, dann ist Y = 0 2 = 0 Y = 0^2 =
0 Y = 0 2 = 0 sicher . Das Wissen über X X X ändert die Wahrscheinlichkeit für Y Y Y von 1 3 \tfrac13 3 1
auf 1 1 1 .
In Formeln ist das eine bedingte Wahrscheinlichkeit : die Wahrscheinlichkeit von „Y = 0 Y
= 0 Y = 0 “, wenn man schon weiß, dass „X = 0 X = 0 X = 0 “ eingetreten ist. Man schreibt P ( Y = 0 ∣ X = 0 ) P(Y = 0 \mid X =
0) P ( Y = 0 ∣ X = 0 ) ; der senkrechte Strich heißt „unter der Bedingung“. Rechts ist sie ausgerechnet:
1 / 3 1 / 3 = 1 \frac{1/3}{1/3} = 1 1/3 1/3 = 1 .
Bei Unabhängigkeit dürfte das Wissen über X X X nichts ändern. Hier ändert es alles. Deshalb
sind X X X und Y Y Y abhängig.
Ein zweites Paar zeigt dasselbe: X = 1 X = 1 X = 1 , Y = 0 Y = 0 Y = 0 ist unmöglich, also P ( X = 1 , Y = 0 ) = 0 P(X = 1,\ Y
= 0) = 0 P ( X = 1 , Y = 0 ) = 0 . Das Produkt ist aber P ( X = 1 ) ⋅ P ( Y = 0 ) = 1 3 ⋅ 1 3 = 1 9 P(X = 1) \cdot P(Y = 0) = \tfrac13 \cdot \tfrac13 =
\tfrac19 P ( X = 1 ) ⋅ P ( Y = 0 ) = 3 1 ⋅ 3 1 = 9 1 . Auch 0 ≠ 1 9 0 \ne \tfrac19 0 = 9 1 .
Vergleicht man die beiden Tabellen Zelle für Zelle, stimmt keine einzige überein:
oben steht 0 0 0 oder 1 3 \tfrac13 3 1 , unten 1 9 \tfrac19 9 1 oder 2 9 \tfrac29 9 2 .
Die kurze Begründung der Musterlösung: Y Y Y ist eine feste Funktion von X X X , ohne
weiteren Zufall („deterministisch“). Dann kann Y Y Y nicht unabhängig von X X X sein. Die
einzige Ausnahme wäre ein Y Y Y , das immer denselben Wert hat. Hier nimmt Y Y Y aber zwei
Werte an.
Aus Blatt 2, Aufgabe 3 („Bedingte Wahrscheinlichkeit“): P ( A ∣ B ) = P ( A ∩ B ) P ( B ) P(A \mid B) = \frac{P(A
\cap B)}{P(B)} P ( A ∣ B ) = P ( B ) P ( A ∩ B ) ist die Wahrscheinlichkeit von
A A A , wenn man weiß, dass
B B B eingetreten
ist. Bei unabhängigen Ereignissen ist
P ( A ∣ B ) = P ( A ) P(A \mid B) = P(A) P ( A ∣ B ) = P ( A ) .
unabhängig ⇒
E ( X Y ) = E ( X ) E ( Y ) E(XY) = E(X)\,E(Y) E ( X Y ) = E ( X ) E ( Y ) ⇒
c o v ( X , Y ) = 0 \mathrm{cov}(X, Y) = 0 cov ( X , Y ) = 0 ⇒
ρ = 0 \rho = 0 ρ = 0
Teil (iii) fragt nach dem Verhältnis der beiden Begriffe. Die erste Richtung: Folgt aus
„unabhängig“ immer „unkorreliert“? Ja. Das Zeichen ⇒ \Rightarrow ⇒ heißt „daraus
folgt“.
Sind X X X und Y Y Y unabhängig, gilt die Produktregel auch für Erwartungswerte (Skript):
E ( X Y ) = E ( X ) ⋅ E ( Y ) E(XY) = E(X) \cdot E(Y) E ( X Y ) = E ( X ) ⋅ E ( Y ) . Eingesetzt in die Rechenformel der Kovarianz aus Schritt 6:
c o v ( X , Y ) = E ( X ) ⋅ E ( Y ) − E ( X ) ⋅ E ( Y ) = 0 \mathrm{cov}(X, Y) = E(X) \cdot E(Y) - E(X) \cdot E(Y) = 0 cov ( X , Y ) = E ( X ) ⋅ E ( Y ) − E ( X ) ⋅ E ( Y ) = 0
Dann ist der Zähler der Korrelation 0 und damit ρ = 0 \rho = 0 ρ = 0 (Schritt 10). Jedes unabhängige
Paar ist also unkorreliert.
Im Bild ist das die kleine Ellipse („unabhängig“), die ganz in der großen („unkorreliert“)
liegt. Wer in der kleinen ist, ist sicher auch in der großen.
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“): Sind
U U U
und
V V V unabhängig, dann gilt
E ( U ⋅ V ) = E ( U ) ⋅ E ( V ) E(U \cdot V) = E(U) \cdot E(V) E ( U ⋅ V ) = E ( U ) ⋅ E ( V ) . Ohne Unabhängigkeit gilt
das im Allgemeinen nicht.
Hier in dieser Aufgabe gilt E ( X Y ) = E ( X ) ⋅ E ( Y ) E(XY) = E(X) \cdot E(Y) E ( X Y ) = E ( X ) ⋅ E ( Y ) übrigens auch — beide Seiten sind 0
(Schritte 3 bis 5). Die Gleichung allein beweist also keine Unabhängigkeit. Genau das
zeigt der nächste Schritt.
ρ = 0 ⇏ \rho = 0 \ \not\Rightarrow ρ = 0 ⇒ unabhängig; aber
ρ ≠ 0 ⇒ \rho \ne 0 \ \Rightarrow ρ = 0 ⇒
abhängig
Die andere Richtung: Folgt aus „unkorreliert“ auch „unabhängig“? Nein. Diese
Aufgabe ist das Gegenbeispiel: ρ = 0 \rho = 0 ρ = 0 (Schritt 10), aber X X X und Y Y Y sind abhängig
(Schritt 17). Ein einziges Gegenbeispiel genügt, um „immer“ zu widerlegen. Das
durchgestrichene Zeichen ⇏ \not\Rightarrow ⇒ heißt „daraus folgt nicht“.
Zur Logik: „Aus A folgt B“ heißt nicht „aus B folgt A“. Beispiel: Wer in
Kaiserslautern wohnt, wohnt in Rheinland-Pfalz. Aber nicht jeder, der in Rheinland-Pfalz
wohnt, wohnt in Kaiserslautern.
Was aus Schritt 19 trotzdem folgt, ist der Umkehrschluss : Wäre ein Paar unabhängig,
hätte es ρ = 0 \rho = 0 ρ = 0 . Ist also ρ ≠ 0 \rho \ne 0 ρ = 0 , kann es nicht unabhängig sein, es ist sicher
abhängig. Im Bild: Wer außerhalb der großen Ellipse liegt, liegt auch außerhalb der
kleinen.
Schlussfolgerung für (iii): Unabhängigkeit ist die stärkere Eigenschaft. Sie
verlangt die Produktregel für alle Wertepaare. Unkorreliertheit verlangt nur, dass eine
einzige Zahl 0 ist, die Kovarianz. Und die sieht nur den linearen Teil eines Zusammenhangs
(Schritt 13).
Merke: Unabhängig ⇒ unkorreliert. Unkorreliert ⇏ unabhängig. Aus
ρ = 0 \rho = 0 ρ = 0 darf
man nie auf Unabhängigkeit schließen — außer unter der Voraussetzung im nächsten Schritt.
( X , Y ) (X, Y) ( X , Y ) gemeinsam normalverteilt:
ρ = 0 ⇔ \rho = 0 \Leftrightarrow ρ = 0 ⇔ unabhängig
Es gibt eine Voraussetzung, unter der beide Begriffe dasselbe bedeuten (Skript): wenn das
Paar ( X , Y ) (X, Y) ( X , Y ) gemeinsam normalverteilt ist, auch
bivariat normalverteilt genannt (bivariat = mit zwei Variablen). Dann gilt ρ = 0 ⇔ \rho =
0 \Leftrightarrow ρ = 0 ⇔ unabhängig. Der Doppelpfeil ⇔ \Leftrightarrow ⇔ heißt „genau dann, wenn“:
Die Folgerung gilt in beide Richtungen.
Was heißt gemeinsam normalverteilt, grob gesagt? Eine einzelne normalverteilte
Größe hat eine Glockenkurve als Dichte. Bei einem gemeinsam normalverteilten Paar ist die
Dichte ein Glockenberg über der Ebene. Von oben gesehen sind die Linien gleicher
Höhe Ellipsen. Ein Streudiagramm solcher Paare sieht aus wie eine ellipsenförmige
Punktwolke.
Warum dann beides gleich ist: Ein solcher Berg kann schräg liegen und in die Länge
gezogen sein, aber er kann sich nicht krümmen wie eine Parabel. Jeder Zusammenhang
zwischen X X X und Y Y Y ist dann linear. Sieht die Korrelation keinen linearen Zusammenhang
(ρ = 0 \rho = 0 ρ = 0 ), gibt es also gar keinen: Der Berg ist gerade ausgerichtet, und X X X und Y Y Y
sind unabhängig.
Achtung: Es reicht nicht, dass X X X für sich und Y Y Y für sich normalverteilt sind.
Die Paare zusammen müssen diese Glockenform haben.
Hier ist die Voraussetzung nicht erfüllt. X X X hat nur die drei Werte − 1 -1 − 1 , 0 0 0 und
1 1 1 . Eine solche Zufallsvariable heißt diskret : Sie nimmt nur einzelne Werte an,
nichts dazwischen. Eine normalverteilte Größe ist dagegen stetig , sie kann jeden
Wert auf der Zahlengeraden annehmen. X X X ist also nicht einmal stetig und erst recht nicht
normalverteilt. Der Widerspruch zwischen ρ = 0 \rho = 0 ρ = 0 und „abhängig“ ist deshalb keiner.
Aus diesem Grund setzt der Korrelationstest nach Pearson (Aufgabe 2 dieses Blatts,
„Korrelationstest: Gewicht und Stärke von Kartoffeln“) normalverteilte Daten voraus. Genau
genommen braucht er gemeinsam normalverteilte Paare: Nur dann ist „ρ = 0 \rho = 0 ρ = 0 “ dasselbe
wie „unabhängig“.
Aus Blatt 4, Aufgabe 1 („Normalverteilung: die σ-Regeln“): Eine normalverteilte
Größe hat eine glockenförmige Dichte um ihren Erwartungswert
μ \mu μ . Werte nahe der Mitte
sind häufig, weit entfernte selten.
v a r ( X + Y ) = v a r ( X ) + v a r ( Y ) + 2 c o v ( X , Y ) \mathrm{var}(X + Y) = \mathrm{var}(X) + \mathrm{var}(Y) + 2\,\mathrm{cov}(X, Y) var ( X + Y ) = var ( X ) + var ( Y ) + 2 cov ( X , Y )
Der Zusatz fragt nach der Varianz der Summe X + Y X + Y X + Y . Dafür gibt das Skript eine
Rechenregel, die für beliebige X X X und Y Y Y gilt, abhängig oder nicht:
v a r ( X + Y ) = v a r ( X ) + v a r ( Y ) + 2 ⋅ c o v ( X , Y ) \mathrm{var}(X + Y) = \mathrm{var}(X) + \mathrm{var}(Y) + 2 \cdot \mathrm{cov}(X, Y) var ( X + Y ) = var ( X ) + var ( Y ) + 2 ⋅ cov ( X , Y )
Woher kommt der dritte Summand? Rechts steht die Herleitung in drei Zeilen:
Der Erwartungswert einer Summe ist die Summe der Erwartungswerte: E ( X + Y ) = E ( X ) + E ( Y ) E(X + Y) = E(X) +
E(Y) E ( X + Y ) = E ( X ) + E ( Y ) . Deshalb ist die Abweichung der Summe von ihrem Erwartungswert die Summe der
beiden einzelnen Abweichungen.
Die Varianz ist der Erwartungswert der quadrierten Abweichung. Das Quadrat einer
Summe zweier Teile u u u und v v v ist nach der binomischen Formel u 2 + 2 u v + v 2 u^2 + 2uv + v^2 u 2 + 2 uv + v 2 .
Den Erwartungswert Summand für Summand bilden, der Faktor 2 bleibt stehen. Der erste
Teil ist v a r ( X ) \mathrm{var}(X) var ( X ) , der letzte v a r ( Y ) \mathrm{var}(Y) var ( Y ) , und der mittlere ist genau die
Definition der Kovarianz aus Schritt 6.
Der Kovarianz-Term misst also, ob sich die Abweichungen von X X X und Y Y Y gegenseitig
verstärken (positiv) oder abschwächen (negativ).
Probe mit einem bekannten Fall: Für Y = X Y = X Y = X ist c o v ( X , X ) = v a r ( X ) \mathrm{cov}(X, X) =
\mathrm{var}(X) cov ( X , X ) = var ( X ) (Skript). Die Regel gibt v a r ( 2 X ) = v a r ( X ) + v a r ( X ) + 2 v a r ( X ) = 4 v a r ( X ) \mathrm{var}(2X) = \mathrm{var}(X) +
\mathrm{var}(X) + 2\,\mathrm{var}(X) = 4\,\mathrm{var}(X) var ( 2 X ) = var ( X ) + var ( X ) + 2 var ( X ) = 4 var ( X ) . Das passt zu v a r ( a X ) = a 2 v a r ( X ) \mathrm{var}(aX)
= a^2\,\mathrm{var}(X) var ( a X ) = a 2 var ( X ) mit a = 2 a = 2 a = 2 .
Aus Blatt 4, Aufgabe 4 („Erwartungswert und Varianz: die Rechenregeln“): Sind
X X X
und
Y Y Y unabhängig, addieren sich die Varianzen:
v a r ( X + Y ) = v a r ( X ) + v a r ( Y ) \mathrm{var}(X + Y) = \mathrm{var}(X) +
\mathrm{var}(Y) var ( X + Y ) = var ( X ) + var ( Y ) . Außerdem gilt
v a r ( a X + b ) = a 2 ⋅ v a r ( X ) \mathrm{var}(aX + b) = a^2 \cdot \mathrm{var}(X) var ( a X + b ) = a 2 ⋅ var ( X ) . Die
Regel hier ist die allgemeine Form: Bei Unabhängigkeit ist die Kovarianz 0 (Schritt 19),
und der dritte Summand fällt weg.
v a r ( X + Y ) = 2 3 + 2 9 + 2 ⋅ 0 = 6 9 + 2 9 = 8 9 ≈ 0,8889 \mathrm{var}(X + Y) = \tfrac23 + \tfrac29 + 2 \cdot 0 = \tfrac69 + \tfrac29 = \tfrac89
\approx 0{,}8889 var ( X + Y ) = 3 2 + 9 2 + 2 ⋅ 0 = 9 6 + 9 2 = 9 8 ≈ 0 , 8889
Jetzt die Vereinfachung, nach der die Aufgabe fragt. Aus (i) ist c o v ( X , Y ) = 0 \mathrm{cov}(X, Y) = 0 cov ( X , Y ) = 0
(Schritt 6). Der dritte Summand ist also 2 ⋅ 0 = 0 2 \cdot 0 = 0 2 ⋅ 0 = 0 und fällt weg:
v a r ( X + Y ) = v a r ( X ) + v a r ( Y ) \mathrm{var}(X + Y) = \mathrm{var}(X) + \mathrm{var}(Y) var ( X + Y ) = var ( X ) + var ( Y )
Die Varianzen stehen in Schritt 8 und 9: v a r ( X ) = 2 3 \mathrm{var}(X) = \tfrac23 var ( X ) = 3 2 und v a r ( Y ) = 2 9 \mathrm{var}(Y)
= \tfrac29 var ( Y ) = 9 2 . Zum Addieren auf den Nenner 9 bringen, 2 3 = 6 9 \tfrac23 = \tfrac69 3 2 = 9 6 :
v a r ( X + Y ) = 6 9 + 2 9 = 8 9 ≈ 0,8889 \mathrm{var}(X + Y) = \tfrac69 + \tfrac29 = \mathbf{\tfrac89} \approx 0{,}8889 var ( X + Y ) = 9 6 + 9 2 = 9 8 ≈ 0 , 8889 (auf vier
Stellen gerundet).
Bemerkenswert: Die Varianzen addieren sich einfach, obwohl X X X und Y Y Y
abhängig sind (Schritt 17). In Blatt 4 stand diese einfache Regel mit der
Voraussetzung „unabhängig“. Die Rechenregel aus Schritt 22 zeigt: Gebraucht wird nur, dass
der Kovarianz-Term wegfällt.
Merke: Für „Varianzen addieren sich“ genügt es, dass
X X X und
Y Y Y
unkorreliert sind. Unabhängigkeit ist dafür mehr als nötig.
E ( ( X + Y ) 2 ) − E ( X + Y ) 2 = 4 3 − 4 9 = 8 9 E\big((X+Y)^2\big) - E(X+Y)^2 = \tfrac43 - \tfrac49 = \tfrac89 E ( ( X + Y ) 2 ) − E ( X + Y ) 2 = 3 4 − 9 4 = 9 8 ✓
Die Probe rechnet v a r ( X + Y ) \mathrm{var}(X + Y) var ( X + Y ) auf einem ganz anderen Weg, ohne Rechenregel und
ohne Kovarianz: direkt aus der Verteilung der Summe. Kommt dasselbe heraus, stimmt das
Ergebnis.
Die Werte der Summe. X + Y = X + X 2 X + Y = X + X^2 X + Y = X + X 2 . Für jeden Wert von X X X :
X = − 1 X = -1 X = − 1 : − 1 + ( − 1 ) 2 = − 1 + 1 = 0 -1 + (-1)^2 = -1 + 1 = 0 − 1 + ( − 1 ) 2 = − 1 + 1 = 0
X = 0 X = 0 X = 0 : 0 + 0 2 = 0 0 + 0^2 = 0 0 + 0 2 = 0
X = 1 X = 1 X = 1 : 1 + 1 2 = 1 + 1 = 2 1 + 1^2 = 1 + 1 = 2 1 + 1 2 = 1 + 1 = 2
Die Verteilung (Säulen im Bild): Den Wert 0 gibt es auf zwei Wegen, P ( X + Y = 0 ) = 1 3 + 1 3 = 2 3 P(X + Y = 0) =
\tfrac13 + \tfrac13 = \tfrac23 P ( X + Y = 0 ) = 3 1 + 3 1 = 3 2 . Den Wert 2 nur bei X = 1 X = 1 X = 1 , P ( X + Y = 2 ) = 1 3 P(X + Y = 2) = \tfrac13 P ( X + Y = 2 ) = 3 1 .
Der Erwartungswert: E ( X + Y ) = 2 3 ⋅ 0 + 1 3 ⋅ 2 = 2 3 E(X + Y) = \tfrac23 \cdot 0 + \tfrac13 \cdot 2 = \tfrac23 E ( X + Y ) = 3 2 ⋅ 0 + 3 1 ⋅ 2 = 3 2 .
Das passt zu E ( X ) + E ( Y ) = 0 + 2 3 E(X) + E(Y) = 0 + \tfrac23 E ( X ) + E ( Y ) = 0 + 3 2 . Im Bild ist das die senkrechte Linie.
Die Varianz mit dem Verschiebungssatz: E ( ( X + Y ) 2 ) = 2 3 ⋅ 0 2 + 1 3 ⋅ 2 2 = 4 3 E\big((X + Y)^2\big) = \tfrac23 \cdot 0^2 +
\tfrac13 \cdot 2^2 = \tfrac43 E ( ( X + Y ) 2 ) = 3 2 ⋅ 0 2 + 3 1 ⋅ 2 2 = 3 4 . Dann 4 3 − ( 2 3 ) 2 = 4 3 − 4 9 \tfrac43 - \big(\tfrac23\big)^2 = \tfrac43 -
\tfrac49 3 4 − ( 3 2 ) 2 = 3 4 − 9 4 . Mit dem Nenner 9: 12 9 − 4 9 = 8 9 \tfrac{12}{9} - \tfrac49 = \mathbf{\tfrac89} 9 12 − 9 4 = 9 8 . Dasselbe wie
in Schritt 23.
Noch ein Weg, nach Definition: Die Abweichungen von 2 3 \tfrac23 3 2 sind 0 − 2 3 = − 2 3 0 - \tfrac23 =
-\tfrac23 0 − 3 2 = − 3 2 und 2 − 2 3 = 4 3 2 - \tfrac23 = \tfrac43 2 − 3 2 = 3 4 . Quadriert und gewichtet: 4 9 ⋅ 2 3 + 16 9 ⋅ 1 3 = 8 27 + 16 27 = 24 27 = 8 9 \tfrac49 \cdot
\tfrac23 + \tfrac{16}{9} \cdot \tfrac13 = \tfrac{8}{27} + \tfrac{16}{27} = \tfrac{24}{27}
= \tfrac89 9 4 ⋅ 3 2 + 9 16 ⋅ 3 1 = 27 8 + 27 16 = 27 24 = 9 8 .
Alle Wege liefern 8 9 \tfrac89 9 8 . Die Regel aus Schritt 22 mit c o v = 0 \mathrm{cov} = 0 cov = 0 war also
richtig angewandt, obwohl X X X und Y Y Y abhängig sind.
sum(x * p) =
∑ P ( X = x i ) ⋅ x i \sum P(X = x_i) \cdot x_i ∑ P ( X = x i ) ⋅ x i
Diese Ergänzung geht über die Aufgabe hinaus. Die Musterlösung rechnet hier nicht
mit R. R kann die gewichteten Summen aber schnell nachprüfen.
x <- c(-1, 0, 1) speichert die drei möglichen Werte unter
dem Namen x, p ihre
Wahrscheinlichkeiten.
x^2 quadriert jeden Wert einzeln, das ist Y Y Y .
x * p multipliziert Wert für Wert: x 1 ⋅ p 1 x_1 \cdot p_1 x 1 ⋅ p 1 , x 2 ⋅ p 2 x_2 \cdot
p_2 x 2 ⋅ p 2 , x 3 ⋅ p 3 x_3 \cdot p_3 x 3 ⋅ p 3 . sum addiert. Zusammen ist
sum(x * p) genau ∑ P ( X = x i ) ⋅ x i = E ( X ) \sum P(X = x_i) \cdot x_i = E(X) ∑ P ( X = x i ) ⋅ x i = E ( X ) .
Die Kovarianz ist E(XY) − E(X) · E(Y), die Varianzen folgen
dem Verschiebungssatz.
R schreibt einen Dezimalpunkt: 0.6666667 ist 2 3 \tfrac23 3 2 , 0.2222222 ist 2 9 \tfrac29 9 2 ,
0.8888889 ist 8 9 \tfrac89 9 8 . Alle Werte stimmen mit der Rechnung von Hand überein.
Typischer Fehler: Hier
var(x) oder
cov(x, y) benutzen. Diese Befehle behandeln
x als
Daten und teilen durch
n − 1 n - 1 n − 1 (Schritt 2).
var(c(-1, 0, 1)) gibt 1 statt
2 3 \tfrac23 3 2 . In
x stehen hier aber keine Beobachtungen, sondern die möglichen
Werte mit ihren Gewichten in
p.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Mit
x <- c(…) werden Zahlen in R eingegeben. Zahlen schreibt R
mit Dezimalpunkt statt Komma.
Größe
Weg
Wert
E ( X ) E(X) E ( X )
1 3 ( − 1 + 0 + 1 ) \tfrac13(-1 + 0 + 1) 3 1 ( − 1 + 0 + 1 )
0
E ( Y ) = E ( X 2 ) E(Y) = E(X^2) E ( Y ) = E ( X 2 )
1 3 ( 1 + 0 + 1 ) \tfrac13(1 + 0 + 1) 3 1 ( 1 + 0 + 1 )
2/3
E ( X Y ) = E ( X 3 ) E(XY) = E(X^3) E ( X Y ) = E ( X 3 )
1 3 ( − 1 + 0 + 1 ) \tfrac13(-1 + 0 + 1) 3 1 ( − 1 + 0 + 1 )
0
c o v ( X , Y ) \mathrm{cov}(X, Y) cov ( X , Y )
0 − 0 ⋅ 2 3 0 - 0 \cdot \tfrac23 0 − 0 ⋅ 3 2
0
ρ \rho ρ
0 : 0,3849 0 : 0{,}3849 0 : 0 , 3849
0
v a r ( X + Y ) \mathrm{var}(X + Y) var ( X + Y )
2 3 + 2 9 + 0 \tfrac23 + \tfrac29 + 0 3 2 + 9 2 + 0
8/9
In Worten: Y = X 2 Y = X^2 Y = X 2 hängt vollständig von X X X ab. Trotzdem ist die Korrelation 0:
Links fällt die Parabel, rechts steigt sie, und die beste Gerade durch die drei Punkte ist
waagerecht. X X X und Y Y Y sind also unkorreliert, aber abhängig . Die Varianzen addieren
sich trotzdem, weil dafür c o v = 0 \mathrm{cov} = 0 cov = 0 genügt.
Rückblick — der Weg: (1) Verteilungen von
X X X und
Y Y Y aufschreiben. (2)
Erwartungswerte als gewichtete Summen, die Kovarianz mit
E ( X Y ) − E ( X ) E ( Y ) E(XY) - E(X)E(Y) E ( X Y ) − E ( X ) E ( Y ) , die Varianzen
mit dem Verschiebungssatz, daraus
ρ \rho ρ . (3) Unabhängigkeit an der gemeinsamen Verteilung
prüfen: ein Paar, das die Produktregel verletzt, genügt. (4) Allgemein: unabhängig ⇒
unkorreliert, nicht umgekehrt; gleichwertig nur bei gemeinsamer Normalverteilung. (5)
v a r ( X + Y ) \mathrm{var}(X + Y) var ( X + Y ) mit dem Kovarianz-Term und eine Probe über die Verteilung der Summe.
Für ähnliche Aufgaben: ρ = 0 \rho = 0 ρ = 0 schließt nur einen linearen Zusammenhang aus. Ob
X X X und
Y Y Y unabhängig sind, zeigt allein die Produktregel an der gemeinsamen Verteilung.