Salta al contenuto
Note per Studenti Covarianza e coefficiente di correlazione

Covarianza e coefficiente di correlazione

In questa pagina 8

Punto 4 del programma ("covarianza e coefficiente di correlazione; indipendenza e non-correlazione"). Prerequisiti: Vettori aleatori discretiUn vettore aleatorio discreto (X, Y) è descritto dalla densità congiunta p(x, y) = P(X = x, Y = y); le marginali si ottengono sommando sull'altra variabile, X e Y sono indipendenti se p(x, y) = p_X(x) p_Y(y) per ogni coppia, e E[g(X, Y)] = Σ g(x, y) p(x, y).Vettori aleatori discreti →, Vettori aleatori assolutamente continuiUn vettore (X, Y) è assolutamente continuo se P((X, Y) ∈ A) = ∬_A f(x, y) dx dy per una densità congiunta f ≥ 0 con integrale 1; le marginali si ottengono integrando sull'altra variabile (f_X(x) = ∫ f(x, y) dy), X e Y sono indipendenti se f(x, y) = f_X(x) f_Y(y), e E[g(X, Y)] = ∬ g f. Il punto delicato degli esercizi è descrivere bene la regione dove f > 0.Vettori aleatori assolutamente continui →, Varianza e momentiI momenti E[X^k] e i momenti centrati E[(X − μ)^k] descrivono la forma di una legge; la varianza Var(X) = E[(X − μ)²] = E[X²] − E[X]² misura quanto X si disperde attorno alla media, vale Var(aX + b) = a² Var(X) e Var(X) = 0 solo se X è costante.Varianza e momenti →. Seguito: Vettori gaussianiX = (X₁, ..., Xₙ) è un vettore gaussiano N(m, Σ) se ogni combinazione lineare a·X è gaussiana (equivalentemente X = m + AZ con Z gaussiane standard indipendenti); se Σ è invertibile ha densità exp(−½(x−m)ᵀΣ⁻¹(x−m)) / √((2π)ⁿ det Σ). Proprietà chiave: AX + b ~ N(Am + b, AΣAᵀ), le marginali sono gaussiane e componenti non correlate sono indipendenti.Vettori gaussiani →.

Il problema: la varianza di una somma

Per la media di una somma vale sempre E[X+Y]=E[X]+E[Y]E[X + Y] = E[X] + E[Y]. Per la varianza no: sviluppando il quadrato, con μX=E[X]\mu_X = E[X] e μY=E[Y]\mu_Y = E[Y],

Var(X+Y)=E[((X−μX)+(Y−μY))2]=Var(X)+Var(Y)+2 E[(X−μX)(Y−μY)].\text{Var}(X + Y) = E\big[((X - \mu_X) + (Y - \mu_Y))^2\big] = \text{Var}(X) + \text{Var}(Y) + 2\,E[(X - \mu_X)(Y - \mu_Y)].

Il termine in più misura come le due v.a. si muovono insieme rispetto alle loro medie, e gli si dà un nome.

Definizione

La covarianza di XX e YY (con momento secondo finito) è Cov(X,Y):=E[(X−E[X])(Y−E[Y])].\text{Cov}(X, Y) := E\big[(X - E[X])(Y - E[Y])\big].

Significato del segno. Il prodotto (X−μX)(Y−μY)(X - \mu_X)(Y - \mu_Y) è positivo quando XX e YY stanno dalla stessa parte delle rispettive medie (entrambe sopra o entrambe sotto) e negativo quando stanno da parti opposte.

  • Cov>0\text{Cov} > 0: quando XX è grande, tende a esserlo anche YY (altezza e peso).
  • Cov<0\text{Cov} < 0: quando XX è grande, YY tende a essere piccola (estrazioni senza reinserimento: una nera alla prima rende meno probabile una nera alla seconda).
  • Cov=0\text{Cov} = 0: nessuna tendenza lineare. Si dice che XX e YY sono non correlate (o scorrelate).

Formula di calcolo

Cov(X,Y)=E[XY]−E[X] E[Y].\text{Cov}(X, Y) = E[XY] - E[X]\,E[Y].

Dimostrazione. Si sviluppa il prodotto e si usa la linearità (μX,μY\mu_X, \mu_Y sono numeri):

E[(X−μX)(Y−μY)]=E[XY]−μYE[X]−μXE[Y]+μXμY=E[XY]−μXμY−μXμY+μXμY=E[XY]−μXμY. ∎E[(X - \mu_X)(Y - \mu_Y)] = E[XY] - \mu_Y E[X] - \mu_X E[Y] + \mu_X\mu_Y = E[XY] - \mu_X\mu_Y - \mu_X\mu_Y + \mu_X\mu_Y = E[XY] - \mu_X\mu_Y. \ ∎

È l'analogo di Var(X)=E[X2]−E[X]2\text{Var}(X) = E[X^2] - E[X]^2, che si ritrova con Y=XY = X.

Esempio (urna, da Vettori aleatori discretiUn vettore aleatorio discreto (X, Y) è descritto dalla densità congiunta p(x, y) = P(X = x, Y = y); le marginali si ottengono sommando sull'altra variabile, X e Y sono indipendenti se p(x, y) = p_X(x) p_Y(y) per ogni coppia, e E[g(X, Y)] = Σ g(x, y) p(x, y).Vettori aleatori discreti →). 2 nere e 3 bianche, due estrazioni senza reinserimento, X,YX, Y indicatrici di "nera" alla prima e alla seconda: E[XY]=P(X=1,Y=1)=110E[XY] = P(X = 1, Y = 1) = \frac{1}{10}, E[X]=E[Y]=25E[X] = E[Y] = \frac25, quindi Cov(X,Y)=110−425=−350\text{Cov}(X, Y) = \frac{1}{10} - \frac{4}{25} = -\frac{3}{50}.

Proprietà

  1. Simmetria: Cov(X,Y)=Cov(Y,X)\text{Cov}(X, Y) = \text{Cov}(Y, X).
  2. Cov(X,X)=Var(X)\text{Cov}(X, X) = \text{Var}(X).
  3. Costanti: Cov(X,c)=0\text{Cov}(X, c) = 0 e Cov(X+c,Y)=Cov(X,Y)\text{Cov}(X + c, Y) = \text{Cov}(X, Y).
  4. Bilinearità: Cov(aX+bY,Z)=a Cov(X,Z)+b Cov(Y,Z)\text{Cov}(aX + bY, Z) = a\,\text{Cov}(X, Z) + b\,\text{Cov}(Y, Z), e lo stesso nel secondo argomento.
  5. Varianza di una combinazione lineare: Var(aX+bY)=a2 Var(X)+b2 Var(Y)+2ab Cov(X,Y).\text{Var}(aX + bY) = a^2\,\text{Var}(X) + b^2\,\text{Var}(Y) + 2ab\,\text{Cov}(X, Y).

Perché. 1 e 2 sono evidenti dalla definizione. 3: una costante coincide con la sua media, quindi c−E[c]=0c - E[c] = 0; e aggiungere cc a XX aggiunge cc anche alla sua media, quindi X−E[X]X - E[X] non cambia. 4: segue dalla formula E[XY]−E[X]E[Y]E[XY] - E[X]E[Y] e dalla linearità della media. 5: si usa la bilinearità su Cov(aX+bY,aX+bY)\text{Cov}(aX + bY, aX + bY), che produce i quattro termini a2Cov(X,X)+ab Cov(X,Y)+ba Cov(Y,X)+b2Cov(Y,Y)a^2\text{Cov}(X, X) + ab\,\text{Cov}(X, Y) + ba\,\text{Cov}(Y, X) + b^2\text{Cov}(Y, Y).

Come si usa la bilinearità (è lo strumento principale negli esercizi): si "moltiplica" come un prodotto, termine per termine.

Cov(X−Y,X+Y)=Cov(X,X)+Cov(X,Y)−Cov(Y,X)−Cov(Y,Y)=Var(X)−Var(Y).\text{Cov}(X - Y, X + Y) = \text{Cov}(X, X) + \text{Cov}(X, Y) - \text{Cov}(Y, X) - \text{Cov}(Y, Y) = \text{Var}(X) - \text{Var}(Y).

Se XX e YY hanno la stessa varianza, X−YX - Y e X+YX + Y sono non correlate (II parziale 15.01.2026, Esercizio 19 · differenza e somma di gaussiane standard).

Più addendi: Var(X1+⋯+Xn)=∑iVar(Xi)+2∑i<jCov(Xi,Xj)\text{Var}(X_1 + \dots + X_n) = \sum_i \text{Var}(X_i) + 2\sum_{i < j} \text{Cov}(X_i, X_j).

Indipendenza e non correlazione

Se XX e YY sono indipendenti, allora Cov(X,Y)=0\text{Cov}(X, Y) = 0, e quindi Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y).

Perché: per v.a. indipendenti E[XY]=E[X]E[Y]E[XY] = E[X]E[Y] (Vettori aleatori discretiUn vettore aleatorio discreto (X, Y) è descritto dalla densità congiunta p(x, y) = P(X = x, Y = y); le marginali si ottengono sommando sull'altra variabile, X e Y sono indipendenti se p(x, y) = p_X(x) p_Y(y) per ogni coppia, e E[g(X, Y)] = Σ g(x, y) p(x, y).Vettori aleatori discreti →, Vettori aleatori assolutamente continuiUn vettore (X, Y) è assolutamente continuo se P((X, Y) ∈ A) = ∬_A f(x, y) dx dy per una densità congiunta f ≥ 0 con integrale 1; le marginali si ottengono integrando sull'altra variabile (f_X(x) = ∫ f(x, y) dy), X e Y sono indipendenti se f(x, y) = f_X(x) f_Y(y), e E[g(X, Y)] = ∬ g f. Il punto delicato degli esercizi è descrivere bene la regione dove f > 0.Vettori aleatori assolutamente continui →).

Il viceversa è falso. Controesempio: XX uniforme su {−1,0,1}\{-1, 0, 1\} e Y=X2Y = X^2.

  • E[X]=0E[X] = 0 e E[XY]=E[X3]=−1+0+13=0E[XY] = E[X^3] = \frac{-1 + 0 + 1}{3} = 0, quindi Cov(X,Y)=0−0⋅E[Y]=0\text{Cov}(X, Y) = 0 - 0 \cdot E[Y] = 0: non correlate.
  • Ma YY è una funzione di XX: P(X=0,Y=1)=0P(X = 0, Y = 1) = 0 mentre P(X=0)P(Y=1)=13⋅23≠0P(X = 0)P(Y = 1) = \frac13 \cdot \frac23 \ne 0: non indipendenti.

La covarianza vede solo i legami lineari: qui il legame è quadratico e simmetrico, e "in media" la tendenza lineare si annulla.

Coefficiente di correlazione

La covarianza dipende dalle unità di misura (se XX si misura in centimetri invece che in metri, la covarianza si moltiplica per 100100). Per avere un numero puro si normalizza.

Se Var(X),Var(Y)>0\text{Var}(X), \text{Var}(Y) > 0, il coefficiente di correlazione è ρ(X,Y):=Cov(X,Y)Var(X) Var(Y)=Cov(X,Y)σX σY.\rho(X, Y) := \frac{\text{Cov}(X, Y)}{\sqrt{\text{Var}(X)\,\text{Var}(Y)}} = \frac{\text{Cov}(X, Y)}{\sigma_X\,\sigma_Y}.

Teorema. −1≤ρ(X,Y)≤1-1 \le \rho(X, Y) \le 1. Inoltre ∣ρ∣=1|\rho| = 1 se e solo se Y=aX+bY = aX + b (quasi certamente) per qualche a≠0a \ne 0, con ρ=1\rho = 1 se a>0a > 0 e ρ=−1\rho = -1 se a<0a < 0.

Dimostrazione. Siano X∗=X−μXσXX^* = \frac{X - \mu_X}{\sigma_X} e Y∗=Y−μYσYY^* = \frac{Y - \mu_Y}{\sigma_Y} le versioni standardizzate (media 00, varianza 11); per bilinearità Cov(X∗,Y∗)=ρ\text{Cov}(X^*, Y^*) = \rho. Una varianza non è mai negativa, quindi

0≤Var(X∗±Y∗)=1+1±2ρ=2(1±ρ).0 \le \text{Var}(X^* \pm Y^*) = 1 + 1 \pm 2\rho = 2(1 \pm \rho).

Il segno ++ dà ρ≥−1\rho \ge -1, il segno −- dà ρ≤1\rho \le 1. Se ρ=1\rho = 1, allora Var(X∗−Y∗)=0\text{Var}(X^* - Y^*) = 0, quindi X∗−Y∗X^* - Y^* è costante (uguale alla sua media, 00): Y∗=X∗Y^* = X^*, cioè YY è funzione affine crescente di XX. Analogamente per ρ=−1\rho = -1. ∎

Lettura di ρ\rho. ρ\rho vicino a ±1\pm 1: i punti (X,Y)(X, Y) si dispongono quasi su una retta. ρ\rho vicino a 00: nessuna tendenza lineare (ma potrebbe esserci un legame non lineare). ρ\rho non dipende da cambi di scala positivi: ρ(aX+b,cY+d)=ρ(X,Y)\rho(aX + b, cY + d) = \rho(X, Y) se a,c>0a, c > 0.

Esempio (urna): Var(X)=Var(Y)=25⋅35=625\text{Var}(X) = \text{Var}(Y) = \frac25 \cdot \frac35 = \frac{6}{25}, quindi ρ=−3/506/25=−14\rho = \frac{-3/50}{6/25} = -\frac14.

Matrice di covarianza

Per un vettore (X1,…,Xn)(X_1, \dots, X_n) si raccolgono tutte le covarianze in una matrice:

Σ=(Σij),Σij=Cov(Xi,Xj).\Sigma = (\Sigma_{ij}), \qquad \Sigma_{ij} = \text{Cov}(X_i, X_j).

Sulla diagonale ci sono le varianze. Per due v.a.:

Σ=(Var(X)Cov(X,Y)Cov(X,Y)Var(Y)).\Sigma = \begin{pmatrix} \text{Var}(X) & \text{Cov}(X, Y) \\ \text{Cov}(X, Y) & \text{Var}(Y) \end{pmatrix}.

Σ\Sigma è simmetrica e semidefinita positiva: per ogni vettore di numeri a=(a1,…,an)a = (a_1, \dots, a_n),

aTΣ a=∑i,jaiajCov(Xi,Xj)=Var(∑iaiXi)≥0.a^T \Sigma\, a = \sum_{i,j} a_i a_j \text{Cov}(X_i, X_j) = \text{Var}\Big(\sum_i a_i X_i\Big) \ge 0.

Combinazioni lineari. Se U=aTX=∑aiXiU = a^T X = \sum a_i X_i, allora E[U]=aTE[X]E[U] = a^T E[X] e Var(U)=aTΣa\text{Var}(U) = a^T \Sigma a. Per U=X−2YU = X - 2Y con Σ=(4222)\Sigma = \begin{pmatrix} 4 & 2 \\ 2 & 2 \end{pmatrix} (III appello 24.06.2026, Esercizio 20 · vettore gaussiano, combinazione lineare e correlazione):

Var(U)=12⋅4+(−2)2⋅2+2⋅1⋅(−2)⋅2=4+8−8=4,\text{Var}(U) = 1^2 \cdot 4 + (-2)^2 \cdot 2 + 2 \cdot 1 \cdot (-2) \cdot 2 = 4 + 8 - 8 = 4, Cov(X,U)=Cov(X,X)−2 Cov(X,Y)=4−4=0.\text{Cov}(X, U) = \text{Cov}(X, X) - 2\,\text{Cov}(X, Y) = 4 - 4 = 0.

Esempio (II parziale 15.01.2026): X,Y∼N(0,1)X, Y \sim N(0, 1) indipendenti e Z=X−YZ = X - Y. Cov(X,Z)=Var(X)−Cov(X,Y)=1−0=1\text{Cov}(X, Z) = \text{Var}(X) - \text{Cov}(X, Y) = 1 - 0 = 1 e Var(Z)=2\text{Var}(Z) = 2, quindi la matrice di covarianza di (X,Z)(X, Z) è (1112)\begin{pmatrix} 1 & 1 \\ 1 & 2 \end{pmatrix}.

Formula Note
Cov(X,Y)=E[XY]−E[X]E[Y]\text{Cov}(X, Y) = E[XY] - E[X]E[Y] formula di calcolo
Cov(X,X)=Var(X)\text{Cov}(X, X) = \text{Var}(X)
Cov(aX+bY,Z)=aCov(X,Z)+bCov(Y,Z)\text{Cov}(aX + bY, Z) = a\text{Cov}(X, Z) + b\text{Cov}(Y, Z) bilinearità
Var(aX+bY)=a2VarX+b2VarY+2ab Cov(X,Y)\text{Var}(aX + bY) = a^2\text{Var}X + b^2\text{Var}Y + 2ab\,\text{Cov}(X, Y)
ρ=Cov(X,Y)/(σXσY)∈[−1,1]\rho = \text{Cov}(X, Y) / (\sigma_X\sigma_Y) \in [-1, 1] ±1\pm 1 solo per legami lineari
indipendenti ⇒ Cov=0\text{Cov} = 0 il viceversa è falso in generale

Errori comuni

  • Dimenticare il doppio prodotto in Var(X+Y)\text{Var}(X + Y) quando le v.a. non sono indipendenti.
  • Scrivere Var(X−Y)=Var(X)−Var(Y)\text{Var}(X - Y) = \text{Var}(X) - \text{Var}(Y): il coefficiente −1-1 si eleva al quadrato; il termine che cambia segno è solo quello con la covarianza.
  • Concludere l'indipendenza da Cov=0\text{Cov} = 0 fuori dal caso gaussiano.
  • Dimenticare la radice nel denominatore di ρ\rho: si divide per le deviazioni standard, non per le varianze.

Esercizi su questo argomento

Teoria collegata