Esercizio - Correlazione di Pearson su tre e quattro osservazioni
Questa pagina non ha ancora la versione ripasso: qui sotto c'è il testo completo.
In questa pagina 5
Testo (dalle slide sulla correlazione). Calcolare il coefficiente di correlazione di Pearson tra e nei casi:
- , ;
- , ;
- , : confrontare Pearson e Spearman e commentare.
Teoria usata: Correlazione e visualizzazione dei datiLa correlazione di Pearson $r=\sum(X_i-\bar X)(Y_i-\bar Y)/\big(\sqrt{\sum(X_i-\bar X)^2}\sqrt{\sum(Y_i-\bar Y)^2}\big)\in[-1,1]$ misura la relazione lineare tra due variabili (covarianza divisa per le deviazioni standard); correlazione non implica causalità. Serve a capire quali variabili contano per il target e a eliminare quelle quasi duplicate (|r| molto alto). Gli indicatori di sintesi non bastano (quartetto di Anscombe, Datasaurus): vanno affiancati ai grafici: istogramma, KDE, box plot, violin plot, heatmap di correlazione, scatter plot e matrice di scatter plot.Correlazione e visualizzazione dei dati → (Covarianza e coefficiente di correlazioneCov(X, Y) = E[(X − E X)(Y − E Y)] = E[XY] − E[X]E[Y] misura quanto X e Y variano insieme; è bilineare, Cov(X, X) = Var(X), Var(X + Y) = Var X + Var Y + 2Cov(X, Y); ρ = Cov / (σ_X σ_Y) sta in [−1, 1] e vale ±1 solo per legami lineari. Indipendenti ⇒ non correlate, ma non viceversa (tranne per i vettori gaussiani).Covarianza e coefficiente di correlazione → per la definizione probabilistica). Il significato geometrico usa Prodotto scalare, norma e angoliIl prodotto scalare aggiunge a uno spazio vettoriale lunghezze e angoli: norma, disuguaglianza di Cauchy-Schwarz, angolo tra vettori in R^n, ortogonalità, proiezione su una retta, aree e volumi con il determinante della matrice dei prodotti scalari.Prodotto scalare, norma e angoli →.
Formula
Si procede sempre allo stesso modo: medie, scarti, somma dei prodotti degli scarti (numeratore), somme dei quadrati degli scarti (denominatore).
1. ,
- Medie: , .
- Scarti: , .
- Numeratore: .
- Quadrati: , .
- .
Correlazione perfetta positiva: gli scarti di sono esattamente volte quelli di (), cioè i punti sono su una retta crescente (). Geometricamente i due vettori degli scarti sono paralleli e concordi: è il coseno dell'angolo tra loro, quindi .
2. ,
- Medie: , .
- Scarti: , .
- Numeratore: .
- Quadrati: e .
- .
Correlazione negativa e abbastanza forte: all'aumentare di , tende a scendere, ma non in modo esattamente lineare. La retta dei minimi quadrati ha pendenza e passa per : (vedi il grafico in Correlazione e visualizzazione dei datiLa correlazione di Pearson $r=\sum(X_i-\bar X)(Y_i-\bar Y)/\big(\sqrt{\sum(X_i-\bar X)^2}\sqrt{\sum(Y_i-\bar Y)^2}\big)\in[-1,1]$ misura la relazione lineare tra due variabili (covarianza divisa per le deviazioni standard); correlazione non implica causalità. Serve a capire quali variabili contano per il target e a eliminare quelle quasi duplicate (|r| molto alto). Gli indicatori di sintesi non bastano (quartetto di Anscombe, Datasaurus): vanno affiancati ai grafici: istogramma, KDE, box plot, violin plot, heatmap di correlazione, scatter plot e matrice di scatter plot.Correlazione e visualizzazione dei dati →). Si noti che è la frazione di varianza di spiegata dalla retta (Regressione lineareNell'apprendimento supervisionato si impara una funzione $F(x)$ dagli esempi $(x,y)$: regressione se $y$ è continua, classificazione se è categorica. Il modello lineare è $F_\beta(x)=\beta_0+\beta_1x_1+\dots+\beta_px_p=X\beta$ (con una colonna di uni per $\beta_0$) e i parametri si scelgono minimizzando l'errore quadratico medio $\mathrm{MSE}=\frac1n\sum_i(y_i-F_\beta(x_i))^2$, funzione convessa dei parametri. Annullando il gradiente di $J(\beta)=|y-X\beta|^2$ si ottengono le equazioni normali $X^TX\beta=X^Ty$ e la soluzione dei minimi quadrati ordinari $\beta=(X^TX)^{-1}X^Ty$. Il coefficiente di determinazione $R^2=1-SS_{res}/SS_{tot}$ misura la qualità del fit (0 = come la media, negativo = peggio della media). Un modello va valutato su un test set mai usato per addestrare: l'errore sul training è ottimistico e un polinomio di grado alto lo azzera senza generalizzare.Regressione lineare →).
3. : Pearson contro Spearman
, , scarti ; , , scarti .
- Numeratore: .
- Quadrati: ; .
- .
Pearson è molto alto ma non , perché la relazione è crescente ma non lineare. La correlazione di Spearman usa i ranghi: i ranghi di sono e quelli di sono gli stessi (la relazione è monotona), quindi Pearson sui ranghi vale .
Verifica
import numpy as np
from scipy.stats import spearmanr
print(np.corrcoef([1,0,2], [2,-1,5])[0,1]) # 1.0
print(np.corrcoef([0,1,2,5], [4,1,3,0])[0,1]) # -0.7606
a = np.arange(1, 6); print(np.corrcoef(a, a**2)[0,1], spearmanr(a, a**2)[0]) # 0.9811 1.0Con np.corrcoef(X, rowvar=False) per una matrice con le osservazioni sulle righe si ottiene la matrice di correlazione di tutte le variabili.