Salta al contenuto
Note per Studenti Esercizio - Correlazione di Pearson su tre e quattro osservazioni

Esercizio - Correlazione di Pearson su tre e quattro osservazioni

Questa pagina non ha ancora la versione ripasso: qui sotto c'è il testo completo.

In questa pagina 5

Testo (dalle slide sulla correlazione). Calcolare il coefficiente di correlazione di Pearson tra XX e YY nei casi:

  1. X=[1,0,2]X=[1,0,2], Y=[2,−1,5]Y=[2,-1,5];
  2. X=[0,1,2,5]X=[0,1,2,5], Y=[4,1,3,0]Y=[4,1,3,0];
  3. X=[1,2,3,4,5]X=[1,2,3,4,5], Y=X2=[1,4,9,16,25]Y=X^2=[1,4,9,16,25]: confrontare Pearson e Spearman e commentare.

Teoria usata: Correlazione e visualizzazione dei datiLa correlazione di Pearson $r=\sum(X_i-\bar X)(Y_i-\bar Y)/\big(\sqrt{\sum(X_i-\bar X)^2}\sqrt{\sum(Y_i-\bar Y)^2}\big)\in[-1,1]$ misura la relazione lineare tra due variabili (covarianza divisa per le deviazioni standard); correlazione non implica causalità. Serve a capire quali variabili contano per il target e a eliminare quelle quasi duplicate (|r| molto alto). Gli indicatori di sintesi non bastano (quartetto di Anscombe, Datasaurus): vanno affiancati ai grafici: istogramma, KDE, box plot, violin plot, heatmap di correlazione, scatter plot e matrice di scatter plot.Correlazione e visualizzazione dei dati → (Covarianza e coefficiente di correlazioneCov(X, Y) = E[(X − E X)(Y − E Y)] = E[XY] − E[X]E[Y] misura quanto X e Y variano insieme; è bilineare, Cov(X, X) = Var(X), Var(X + Y) = Var X + Var Y + 2Cov(X, Y); ρ = Cov / (σ_X σ_Y) sta in [−1, 1] e vale ±1 solo per legami lineari. Indipendenti ⇒ non correlate, ma non viceversa (tranne per i vettori gaussiani).Covarianza e coefficiente di correlazione → per la definizione probabilistica). Il significato geometrico usa Prodotto scalare, norma e angoliIl prodotto scalare aggiunge a uno spazio vettoriale lunghezze e angoli: norma, disuguaglianza di Cauchy-Schwarz, angolo tra vettori in R^n, ortogonalità, proiezione su una retta, aree e volumi con il determinante della matrice dei prodotti scalari.Prodotto scalare, norma e angoli →.

Formula

r=∑i(Xi−Xˉ)(Yi−Yˉ)∑i(Xi−Xˉ)2 ∑i(Yi−Yˉ)2.r=\frac{\sum_i(X_i-\bar X)(Y_i-\bar Y)}{\sqrt{\sum_i(X_i-\bar X)^2}\ \sqrt{\sum_i(Y_i-\bar Y)^2}}. Si procede sempre allo stesso modo: medie, scarti, somma dei prodotti degli scarti (numeratore), somme dei quadrati degli scarti (denominatore).

1. X=[1,0,2]X=[1,0,2], Y=[2,−1,5]Y=[2,-1,5]

  • Medie: Xˉ=1+0+23=1\bar X=\frac{1+0+2}3=1, Yˉ=2−1+53=2\bar Y=\frac{2-1+5}3=2.
  • Scarti: Xi−Xˉ=[0,−1,1]X_i-\bar X=[0,-1,1], Yi−Yˉ=[0,−3,3]Y_i-\bar Y=[0,-3,3].
  • Numeratore: 0⋅0+(−1)(−3)+1⋅3=0+3+3=60\cdot0+(-1)(-3)+1\cdot3=0+3+3=6.
  • Quadrati: ∑(Xi−Xˉ)2=0+1+1=2\sum(X_i-\bar X)^2=0+1+1=2, ∑(Yi−Yˉ)2=0+9+9=18\sum(Y_i-\bar Y)^2=0+9+9=18.
  • r=62 18=636=66=1r=\dfrac{6}{\sqrt2\,\sqrt{18}}=\dfrac{6}{\sqrt{36}}=\dfrac66=1.

Correlazione perfetta positiva: gli scarti di YY sono esattamente 33 volte quelli di XX ([0,−3,3]=3⋅[0,−1,1][0,-3,3]=3\cdot[0,-1,1]), cioè i punti sono su una retta crescente (Y=3X−1Y=3X-1). Geometricamente i due vettori degli scarti sono paralleli e concordi: rr è il coseno dell'angolo tra loro, quindi cos⁡0∘=1\cos0^\circ=1.

2. X=[0,1,2,5]X=[0,1,2,5], Y=[4,1,3,0]Y=[4,1,3,0]

  • Medie: Xˉ=0+1+2+54=2\bar X=\frac{0+1+2+5}4=2, Yˉ=4+1+3+04=2\bar Y=\frac{4+1+3+0}4=2.
  • Scarti: Xi−Xˉ=[−2,−1,0,3]X_i-\bar X=[-2,-1,0,3], Yi−Yˉ=[2,−1,1,−2]Y_i-\bar Y=[2,-1,1,-2].
  • Numeratore: (−2)(2)+(−1)(−1)+0⋅1+3⋅(−2)=−4+1+0−6=−9(-2)(2)+(-1)(-1)+0\cdot1+3\cdot(-2)=-4+1+0-6=-9.
  • Quadrati: 4+1+0+9=144+1+0+9=14 e 4+1+1+4=104+1+1+4=10.
  • r=−914 10=−9140=−911,832=−0,761r=\dfrac{-9}{\sqrt{14}\,\sqrt{10}}=\dfrac{-9}{\sqrt{140}}=\dfrac{-9}{11{,}832}=-0{,}761.

Correlazione negativa e abbastanza forte: all'aumentare di XX, YY tende a scendere, ma non in modo esattamente lineare. La retta dei minimi quadrati ha pendenza −914=−0,643\frac{-9}{14}=-0{,}643 e passa per (Xˉ,Yˉ)=(2,2)(\bar X,\bar Y)=(2,2): Y^=2−0,643 (X−2)=3,286−0,643X\hat Y=2-0{,}643\,(X-2)=3{,}286-0{,}643X (vedi il grafico in Correlazione e visualizzazione dei datiLa correlazione di Pearson $r=\sum(X_i-\bar X)(Y_i-\bar Y)/\big(\sqrt{\sum(X_i-\bar X)^2}\sqrt{\sum(Y_i-\bar Y)^2}\big)\in[-1,1]$ misura la relazione lineare tra due variabili (covarianza divisa per le deviazioni standard); correlazione non implica causalità. Serve a capire quali variabili contano per il target e a eliminare quelle quasi duplicate (|r| molto alto). Gli indicatori di sintesi non bastano (quartetto di Anscombe, Datasaurus): vanno affiancati ai grafici: istogramma, KDE, box plot, violin plot, heatmap di correlazione, scatter plot e matrice di scatter plot.Correlazione e visualizzazione dei dati →). Si noti che r2=81140=0,579r^2=\frac{81}{140}=0{,}579 è la frazione di varianza di YY spiegata dalla retta (Regressione lineareNell'apprendimento supervisionato si impara una funzione $F(x)$ dagli esempi $(x,y)$: regressione se $y$ è continua, classificazione se è categorica. Il modello lineare è $F_\beta(x)=\beta_0+\beta_1x_1+\dots+\beta_px_p=X\beta$ (con una colonna di uni per $\beta_0$) e i parametri si scelgono minimizzando l'errore quadratico medio $\mathrm{MSE}=\frac1n\sum_i(y_i-F_\beta(x_i))^2$, funzione convessa dei parametri. Annullando il gradiente di $J(\beta)=|y-X\beta|^2$ si ottengono le equazioni normali $X^TX\beta=X^Ty$ e la soluzione dei minimi quadrati ordinari $\beta=(X^TX)^{-1}X^Ty$. Il coefficiente di determinazione $R^2=1-SS_{res}/SS_{tot}$ misura la qualità del fit (0 = come la media, negativo = peggio della media). Un modello va valutato su un test set mai usato per addestrare: l'errore sul training è ottimistico e un polinomio di grado alto lo azzera senza generalizzare.Regressione lineare →).

3. Y=X2Y=X^2: Pearson contro Spearman

X=[1,2,3,4,5]X=[1,2,3,4,5], Xˉ=3\bar X=3, scarti [−2,−1,0,1,2][-2,-1,0,1,2]; Y=[1,4,9,16,25]Y=[1,4,9,16,25], Yˉ=11\bar Y=11, scarti [−10,−7,−2,5,14][-10,-7,-2,5,14].

  • Numeratore: (−2)(−10)+(−1)(−7)+0⋅(−2)+1⋅5+2⋅14=20+7+0+5+28=60(-2)(-10)+(-1)(-7)+0\cdot(-2)+1\cdot5+2\cdot14=20+7+0+5+28=60.
  • Quadrati: ∑(Xi−Xˉ)2=4+1+0+1+4=10\sum(X_i-\bar X)^2=4+1+0+1+4=10; ∑(Yi−Yˉ)2=100+49+4+25+196=374\sum(Y_i-\bar Y)^2=100+49+4+25+196=374.
  • r=6010 374=6061,16=0,981r=\dfrac{60}{\sqrt{10}\,\sqrt{374}}=\dfrac{60}{61{,}16}=0{,}981.

Pearson è molto alto ma non 11, perché la relazione è crescente ma non lineare. La correlazione di Spearman usa i ranghi: i ranghi di XX sono [1,2,3,4,5][1,2,3,4,5] e quelli di YY sono gli stessi [1,2,3,4,5][1,2,3,4,5] (la relazione è monotona), quindi Pearson sui ranghi vale ρ=1\rho=1.

Verifica

python
import numpy as np
from scipy.stats import spearmanr
print(np.corrcoef([1,0,2], [2,-1,5])[0,1])            # 1.0
print(np.corrcoef([0,1,2,5], [4,1,3,0])[0,1])         # -0.7606
a = np.arange(1, 6); print(np.corrcoef(a, a**2)[0,1], spearmanr(a, a**2)[0])   # 0.9811 1.0

Con np.corrcoef(X, rowvar=False) per una matrice con le osservazioni sulle righe si ottiene la matrice di correlazione di tutte le variabili.

Lezioni in cui compare

Teoria collegata