Salta al contenuto
Note per Studenti Varianza e covarianza di variabili discrete

Varianza e covarianza di variabili discrete

In questa pagina 4

Lezione 6 di probabilità, Unità 3-4. Prerequisiti: Valore atteso di variabili discreteIl valore atteso di una v.a. discreta è la media dei valori pesata con le probabilità, E[X] = Σ xₖ P(X = xₖ) (se la serie converge assolutamente): il "baricentro" della distribuzione. Valori notevoli: Be(p) → p, B(n,p) → np, Po(λ) → λ, Ge(p) → 1/p. Per le composte E[g(X)] = Σ g(x) pₓ(x), senza cercare la legge di g(X); linearità E[aX + b] = aE[X] + b e E[X₁ + ⋯ + Xₘ] = Σ E[Xᵢ] sempre (anche senza indipendenza: i cappelli); E[XY] = E[X]E[Y] se X, Y sono indipendenti.Valore atteso di variabili discrete →.

Varianza e deviazione standard

Il valore atteso dice dove è "centrata" una variabile, ma non quanto i valori sono sparpagliati attorno al centro. Due variabili con media 00, una che vale sempre 00 e una che vale ±1000\pm 1000 con probabilità 12\frac12, sono molto diverse.

Definizione. Se E[X]E[X] ed E[X2]E[X^2] sono finiti, la varianza di XX è Var⁡[X]:=E[(X−μX)2],μX:=E[X]\operatorname{Var}[X] := E\left[(X - \mu_X)^2\right], \qquad \mu_X := E[X] e la deviazione standard è σX:=Var⁡[X]\sigma_X := \sqrt{\operatorname{Var}[X]}.

È la media del quadrato della distanza dalla media: sempre ≥0\ge 0, nulla solo se XX è (quasi certamente) costante. Si usa il quadrato perché i segni delle deviazioni non si compensino; σ\sigma riporta alla stessa unità di misura di XX.

Proposizione (formula alternativa). Var⁡[X]=E[X2]−μX2\operatorname{Var}[X] = E[X^2] - \mu_X^2.

Dimostrazione. Sviluppando il quadrato e usando la linearità: E[(X−μ)2]=E[X2−2μX+μ2]=E[X2]−2μ E[X]+μ2=E[X2]−μ2E[(X - \mu)^2] = E[X^2 - 2\mu X + \mu^2] = E[X^2] - 2\mu\,E[X] + \mu^2 = E[X^2] - \mu^2 ∎

Esempio del prof. X=−2X = -2 con probabilità 14\frac14, X=1X = 1 con probabilità 34\frac34.

  • E[X]=−24+34=14E[X] = -\frac24 + \frac34 = \frac14.
  • Con la definizione: Var⁡[X]=(−2−14)214+(1−14)234=8164+2764=2716\operatorname{Var}[X] = \left(-2 - \frac14\right)^2\frac14 + \left(1 - \frac14\right)^2\frac34 = \frac{81}{64} + \frac{27}{64} = \frac{27}{16}.
  • Con la formula alternativa: E[X2]=4⋅14+1⋅34=74E[X^2] = 4\cdot\frac14 + 1\cdot\frac34 = \frac74, e 74−116=2716\frac74 - \frac1{16} = \frac{27}{16} ✓.

Proposizione.

  1. Var⁡[costante]=0\operatorname{Var}[\text{costante}] = 0;
  2. Var⁡[aX+b]=a2Var⁡[X]\operatorname{Var}[aX + b] = a^2\operatorname{Var}[X];
  3. se X∼Be⁡(p)X \sim \operatorname{Be}(p): Var⁡[X]=p(1−p)\operatorname{Var}[X] = p(1 - p).

La 2: la traslazione bb sposta anche la media e non cambia la dispersione; il fattore aa dilata le distanze di ∣a∣|a| e quindi i quadrati di a2a^2. La 3: X2=XX^2 = X, quindi E[X2]=pE[X^2] = p e Var⁡[X]=p−p2\operatorname{Var}[X] = p - p^2. Quando è massima? p(1−p)p(1 - p) è una parabola con massimo in p=12p = \frac12 (valore 14\frac14): la Bernoulli più "incerta" è la moneta equilibrata; per p=0p = 0 o 11 non c'è incertezza e la varianza è nulla.

Variabile normalizzata. Se Var⁡[X]≠0\operatorname{Var}[X] \ne 0,   Y:=X−E[X]σX\;Y := \dfrac{X - E[X]}{\sigma_X} ha E[Y]=0E[Y] = 0 e Var⁡[Y]=1\operatorname{Var}[Y] = 1.

(Per la linearità e per la 2 con a=1σXa = \frac1{\sigma_X}.) Normalizzare serve a confrontare variabili diverse sulla stessa scala, e sarà essenziale per il teorema centrale del limiteSe X₁, X₂, … sono i.i.d. con media μ e varianza σ², la somma standardizzata (X₁ + ⋯ + Xₙ − nμ)/√(nσ²) tende in distribuzione a N(0,1): P(Sₙ ≤ a) ≈ Φ((a − nμ)/√(nσ²)) per n grande, qualunque sia la legge delle Xᵢ (servono indipendenza e stessa legge). Per la media campionaria: media μ, varianza σ²/n. Casi particolari: B(n,p) ≈ N(np, np(1−p)) per n grande; Po(λ) ≈ N(λ, λ) per λ ≥ 50. Per variabili a valori interi si usa la correzione di continuità: P(X ≤ k) ≈ P(Y ≤ k + 0.5), P(X = k) ≈ P(k − 0.5 ≤ Y ≤ k + 0.5).Teorema centrale del limite e correzione di continuità →.

Legge E[X]E[X] Var⁡[X]\operatorname{Var}[X]
Be⁡(p)\operatorname{Be}(p) pp p(1−p)p(1 - p)
B(n,p)B(n, p) npnp np(1−p)np(1 - p)
Po⁡(λ)\operatorname{Po}(\lambda) λ\lambda λ\lambda
Ge⁡(p)\operatorname{Ge}(p) 1p\frac1p 1−pp2\frac{1 - p}{p^2}

Per la Poisson media e varianza coincidono (per questo approssima la binomiale solo quando 1−p≈11 - p \approx 1).

Covarianza

Definizione. La covarianza di XX e YY (con varianze finite) è Cov⁡[X,Y]:=E[(X−μX)(Y−μY)]\operatorname{Cov}[X, Y] := E\left[(X - \mu_X)(Y - \mu_Y)\right] Formula alternativa: Cov⁡[X,Y]=E[XY]−μXμY\operatorname{Cov}[X, Y] = E[XY] - \mu_X\mu_Y.

È simmetrica, e Cov⁡[X,X]=Var⁡[X]\operatorname{Cov}[X, X] = \operatorname{Var}[X]. Segno: positiva se XX e YY tendono a stare insieme sopra o sotto le rispettive medie, negativa se quando una è sopra l'altra tende a stare sotto.

Esempio del prof. Due palline estratte senza reimmissione da un'urna con 33 rosse e 22 nere; X=1X = 1 se la prima è rossa, Y=1Y = 1 se la seconda è rossa. E[X]=E[Y]=35E[X] = E[Y] = \frac35; E[XY]=P(entrambe rosse)=35⋅24=310E[XY] = P(\text{entrambe rosse}) = \frac35\cdot\frac24 = \frac3{10}. Cov⁡[X,Y]=310−925=−350\operatorname{Cov}[X, Y] = \frac3{10} - \frac9{25} = -\frac{3}{50} Negativa: se la prima è rossa resta una rossa in meno, e la seconda è meno probabilmente rossa.

Indicatrici di eventi. Con 1A(ω)=1\mathbb{1}_A(\omega) = 1 se ω∈A\omega \in A e 00 altrimenti: E[1A]=P(A)E[\mathbb{1}_A] = P(A) ed E[1A1B]=E[1A∩B]=P(AB)E[\mathbb{1}_A\mathbb{1}_B] = E[\mathbb{1}_{A \cap B}] = P(AB), quindi Cov⁡[1A,1B]=P(AB)−P(A)P(B)\operatorname{Cov}[\mathbb{1}_A, \mathbb{1}_B] = P(AB) - P(A)P(B) nulla esattamente quando AA e BB sono indipendenti.

Corollario. Se XX e YY sono indipendenti, Cov⁡[X,Y]=0\operatorname{Cov}[X, Y] = 0 (perché E[XY]=E[X]E[Y]E[XY] = E[X]E[Y]).

Il viceversa è falso. Esempio del prof: XX uniforme su {−1,0,1}\{-1, 0, 1\} e Y=X2Y = X^2. Non sono indipendenti: P(X=0,Y=0)=P(X=0)=13P(X = 0, Y = 0) = P(X = 0) = \frac13, mentre P(X=0)P(Y=0)=19P(X = 0)P(Y = 0) = \frac19 (se si conosce XX si conosce YY!). Eppure Cov⁡[X,Y]=E[X3]−E[X]E[X2]=0−0⋅23=0\operatorname{Cov}[X, Y] = E[X^3] - E[X]E[X^2] = 0 - 0\cdot\frac23 = 0 (X3=XX^3 = X ha media 00). La covarianza misura solo la dipendenza lineare; qui la relazione è quadratica e simmetrica.

Varianza di una somma

Attenzione: Var⁡[X+X]=Var⁡[2X]=4Var⁡[X]≠2Var⁡[X]\operatorname{Var}[X + X] = \operatorname{Var}[2X] = 4\operatorname{Var}[X] \ne 2\operatorname{Var}[X]. Le varianze non si sommano sempre.

Proposizione. Var⁡[X+Y]=Var⁡[X]+Var⁡[Y]+2Cov⁡[X,Y]\operatorname{Var}[X + Y] = \operatorname{Var}[X] + \operatorname{Var}[Y] + 2\operatorname{Cov}[X, Y] e più in generale Var⁡[X1+⋯+Xm]=∑iVar⁡[Xi]+2∑i<jCov⁡[Xi,Xj]\operatorname{Var}[X_1 + \cdots + X_m] = \sum_i\operatorname{Var}[X_i] + 2\sum_{i<j}\operatorname{Cov}[X_i, X_j] Se le XiX_i sono indipendenti (basta a due a due), Var⁡[X1+⋯+Xm]=Var⁡[X1]+⋯+Var⁡[Xm]\operatorname{Var}[X_1 + \cdots + X_m] = \operatorname{Var}[X_1] + \cdots + \operatorname{Var}[X_m].

Dimostrazione (due variabili). Con X~=X−μX\tilde X = X - \mu_X, Y~=Y−μY\tilde Y = Y - \mu_Y: Var⁡[X+Y]=E[(X~+Y~)2]=E[X~2]+E[Y~2]+2E[X~Y~]\operatorname{Var}[X + Y] = E[(\tilde X + \tilde Y)^2] = E[\tilde X^2] + E[\tilde Y^2] + 2E[\tilde X\tilde Y] ∎.

Corollario. Se X∼B(n,p)X \sim B(n, p), Var⁡[X]=np(1−p)\operatorname{Var}[X] = np(1 - p) (somma di nn Bernoulli indipendenti, ciascuna di varianza p(1−p)p(1-p)).

Le palline, di nuovo. Il numero di rosse estratte X+YX + Y ha varianza 35⋅25⋅2+2(−350)=1225−650=925\frac35\cdot\frac25\cdot 2 + 2\left(-\frac3{50}\right) = \frac{12}{25} - \frac{6}{50} = \frac{9}{25}, minore di quella binomiale 2⋅35⋅25=12252\cdot\frac35\cdot\frac25 = \frac{12}{25} (senza reimmissione la composizione del campione è più "controllata").

I cappelli (vedi Valore atteso di variabili discreteIl valore atteso di una v.a. discreta è la media dei valori pesata con le probabilità, E[X] = Σ xₖ P(X = xₖ) (se la serie converge assolutamente): il "baricentro" della distribuzione. Valori notevoli: Be(p) → p, B(n,p) → np, Po(λ) → λ, Ge(p) → 1/p. Per le composte E[g(X)] = Σ g(x) pₓ(x), senza cercare la legge di g(X); linearità E[aX + b] = aE[X] + b e E[X₁ + ⋯ + Xₘ] = Σ E[Xᵢ] sempre (anche senza indipendenza: i cappelli); E[XY] = E[X]E[Y] se X, Y sono indipendenti.Valore atteso di variabili discrete →). Var⁡[Xi]=110⋅910=9100\operatorname{Var}[X_i] = \frac1{10}\cdot\frac9{10} = \frac9{100}. Per i≠ji \ne j: E[XiXj]=P(i e j riprendono il proprio)=110⋅19=190E[X_iX_j] = P(i \text{ e } j \text{ riprendono il proprio}) = \frac1{10}\cdot\frac19 = \frac1{90}, quindi Cov⁡[Xi,Xj]=190−1100=1900\operatorname{Cov}[X_i, X_j] = \frac1{90} - \frac1{100} = \frac1{900}. Le coppie ordinate (i,j)(i, j) con i≠ji \ne j sono 9090: Var⁡[X]=10⋅9100+90⋅1900=0.9+0.1=1\operatorname{Var}[X] = 10\cdot\frac{9}{100} + 90\cdot\frac{1}{900} = 0.9 + 0.1 = 1 Media e varianza valgono entrambe 11, come per una Po⁡(1)\operatorname{Po}(1): per nn grande il numero di persone che ritrovano il cappello è approssimativamente di Poisson di parametro 11.

Esercizi: Esercizio 51 · valori attesi, varianze e i cappelli.

Errori comuni

  • Var⁡[aX+b]=aVar⁡[X]+b\operatorname{Var}[aX + b] = a\operatorname{Var}[X] + b: sbagliato, è a2Var⁡[X]a^2\operatorname{Var}[X].
  • Sommare le varianze di variabili non indipendenti (senza le covarianze).
  • Dedurre l'indipendenza da covarianza nulla.
  • Var⁡[X−Y]=Var⁡[X]−Var⁡[Y]\operatorname{Var}[X - Y] = \operatorname{Var}[X] - \operatorname{Var}[Y]: sbagliato; per indipendenti è Var⁡[X]+Var⁡[Y]\operatorname{Var}[X] + \operatorname{Var}[Y].

Esercizi su questo argomento

Lezioni in cui compare

Teoria collegata