Salta al contenuto
Note per Studenti Varianza e momenti

Varianza e momenti

In questa pagina 8

Punto 2 del programma ("funzioni di v.a. e loro valore atteso: momenti e momenti centrati, varianza e sue proprietà"). Prerequisiti: Valore attesoIl valore atteso E[X] = Σ x p_X(x) è la media dei valori di X pesata con le loro probabilità (esiste se la serie converge assolutamente); per una funzione g vale E[g(X)] = Σ g(x) p_X(x) senza trovare la legge di g(X), ed E è lineare: E[aX + bY + c] = aE[X] + bE[Y] + c.Valore atteso →. Seguito: Disuguaglianze di Markov, Chebyshev e JensenMarkov: per X ≥ 0, P(X ≥ a) ≤ E[X]/a; Chebyshev: P(|X − μ| ≥ ε) ≤ Var(X)/ε²; Jensen: per φ convessa, φ(E[X]) ≤ E[φ(X)]. Stimano probabilità e medie conoscendo solo media e varianza.Disuguaglianze di Markov, Chebyshev e Jensen →, Covarianza e coefficiente di correlazione.

Perché la media non basta

Due giochi:

  • XX: si vince sempre 00 euro, cioè X=0X = 0 con probabilità 11;
  • YY: si vincono 1010 euro o se ne perdono 1010, con probabilità 12\frac12 ciascuno.

Entrambi hanno media 00 (E[Y]=10⋅12−10⋅12=0E[Y] = 10 \cdot \frac12 - 10 \cdot \frac12 = 0), ma sono giochi completamente diversi: il secondo è rischioso. Serve un numero che misuri quanto i valori si allontanano dalla media. L'idea naturale è la media della distanza ∣X−E[X]∣|X - E[X]|, ma il modulo è scomodo nei calcoli; si usa la media del quadrato della distanza: la varianza.

Momenti

Sia k≥1k \ge 1 intero e XX una v.a. con E[∣X∣k]<∞E[|X|^k] < \infty.

  • Il momento kk-esimo di XX è E[Xk]E[X^k].
  • Il momento centrato kk-esimo è E[(X−μ)k]E[(X - \mu)^k], con μ=E[X]\mu = E[X].

Si calcolano col teorema fondamentale del valor medioLa media di g(X) è la somma di g(x) per la densità di X; qui g(x) = x^k oppure (x − μ)^k.Valore atteso →: per XX discreta E[Xk]=∑xxkpX(x)E[X^k] = \sum_x x^k p_X(x).

  • Il momento primo è la media μ\mu. Il momento centrato primo è sempre 00: E[X−μ]=μ−μ=0E[X - \mu] = \mu - \mu = 0.
  • Il momento centrato secondo è la varianza.
  • Se esiste il momento kk-esimo, esistono tutti quelli di ordine j<kj < k: per ogni xx vale ∣x∣j≤1+∣x∣k|x|^j \le 1 + |x|^k (se ∣x∣≤1|x| \le 1 il primo membro è ≤1\le 1, se ∣x∣>1|x| > 1 è ≤∣x∣k\le |x|^k), quindi E[∣X∣j]≤1+E[∣X∣k]<∞E[|X|^j] \le 1 + E[|X|^k] < \infty.

Momenti fattoriali. Per le leggi con fattoriali (binomiale, Poisson) conviene calcolare E[X(X−1)]E[X(X - 1)], perché k(k−1)k!=1(k−2)!\frac{k(k-1)}{k!} = \frac{1}{(k-2)!} semplifica; poi E[X2]=E[X(X−1)]+E[X]E[X^2] = E[X(X - 1)] + E[X]. È il trucco usato in Bernoulli, binomiale e uniforme discretaBernoulli Be(p): un solo tentativo, vale 1 con probabilità p; binomiale Bin(n, p): numero di successi in n prove indipendenti, P(X = k) = C(n,k) p^k (1−p)^(n−k), media np e varianza np(1−p); uniforme discreta: n valori equiprobabili.Bernoulli, binomiale e uniforme discreta →, Distribuzione geometricaGeo(p) è il numero della prova in cui arriva il primo successo in prove indipendenti: P(X = n) = (1−p)^(n−1) p per n ≥ 1, P(X > n) = (1−p)^n (lunga attesa), media 1/p, varianza (1−p)/p², ed è senza memoria.Distribuzione geometrica → e Distribuzione di PoissonPoi(λ) conta eventi rari: P(X = k) = e^(−λ) λ^k / k! per k = 0, 1, 2, …, con media e varianza entrambe uguali a λ; approssima la binomiale Bin(n, p) quando n è grande e p piccolo, con λ = np.Distribuzione di Poisson →.

Varianza

Sia XX con E[X2]<∞E[X^2] < \infty e μ=E[X]\mu = E[X]. La varianza di XX è Var(X):=E[(X−μ)2]=∑x(x−μ)2 pX(x)(caso discreto).\text{Var}(X) := E[(X - \mu)^2] = \sum_x (x - \mu)^2 \, p_X(x) \quad (\text{caso discreto}). La deviazione standard è σX:=Var(X)\sigma_X := \sqrt{\text{Var}(X)}.

  • La varianza si misura in unità al quadrato (euro², metri²); la deviazione standard nelle stesse unità di XX, ed è quella che si confronta con la media.
  • Nei due giochi: Var(X)=0\text{Var}(X) = 0, Var(Y)=(10−0)2⋅12+(−10−0)2⋅12=100\text{Var}(Y) = (10 - 0)^2 \cdot \frac12 + (-10 - 0)^2 \cdot \frac12 = 100, σY=10\sigma_Y = 10 euro.

Formula di calcolo

Var(X)=E[X2]−E[X]2.\text{Var}(X) = E[X^2] - E[X]^2.

Dimostrazione. Si sviluppa il quadrato e si usa la linearità (μ\mu è un numero, quindi esce dalla media):

E[(X−μ)2]=E[X2−2μX+μ2]=E[X2]−2μE[X]+μ2=E[X2]−2μ2+μ2=E[X2]−μ2. ∎E[(X - \mu)^2] = E[X^2 - 2\mu X + \mu^2] = E[X^2] - 2\mu E[X] + \mu^2 = E[X^2] - 2\mu^2 + \mu^2 = E[X^2] - \mu^2. \ ∎

È quasi sempre la strada più rapida: si calcolano E[X]E[X] ed E[X2]E[X^2] con la stessa tabella. Conseguenza: siccome Var(X)≥0\text{Var}(X) \ge 0, vale sempre E[X2]≥E[X]2E[X^2] \ge E[X]^2.

Esempi

Dado: E[X2]=1+4+9+16+25+366=916E[X^2] = \frac{1 + 4 + 9 + 16 + 25 + 36}{6} = \frac{91}{6}, quindi Var(X)=916−494=182−14712=3512≈2,92\text{Var}(X) = \frac{91}{6} - \frac{49}{4} = \frac{182 - 147}{12} = \frac{35}{12} \approx 2{,}92 e σ≈1,71\sigma \approx 1{,}71.

Vincita all'urna (x∈{−2,1,4}x \in \{-2, 1, 4\} con probabilità 949,2449,1649\frac9{49}, \frac{24}{49}, \frac{16}{49}, media 107\frac{10}{7}):

xx −2-2 11 44
pX(x)p_X(x) 949\frac{9}{49} 2449\frac{24}{49} 1649\frac{16}{49}
x2 pX(x)x^2 \, p_X(x) 3649\frac{36}{49} 2449\frac{24}{49} 25649\frac{256}{49}

E[X2]=36+24+25649=31649,Var(X)=31649−10049=21649≈4,41.E[X^2] = \frac{36 + 24 + 256}{49} = \frac{316}{49}, \qquad \text{Var}(X) = \frac{316}{49} - \frac{100}{49} = \frac{216}{49} \approx 4{,}41.

Proprietà della varianza

  1. Var(X)≥0\text{Var}(X) \ge 0, e Var(X)=0\text{Var}(X) = 0 se e solo se X=μX = \mu con probabilità 11.
  2. Var(aX+b)=a2 Var(X)\text{Var}(aX + b) = a^2 \, \text{Var}(X) per ogni a,b∈Ra, b \in \mathbb R.
  3. Var(X+Y)=Var(X)+Var(Y)+2 Cov(X,Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y) + 2\,\text{Cov}(X, Y); se XX e YY sono indipendenti, Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y).

1. È la media di un quadrato, quindi ≥0\ge 0. Se è 00, nella somma ∑x(x−μ)2pX(x)\sum_x (x - \mu)^2 p_X(x) tutti i termini (che sono ≥0\ge 0) devono essere nulli: per ogni x≠μx \ne \mu deve essere pX(x)=0p_X(x) = 0. Quindi l'unico valore con probabilità positiva è μ\mu.

2. La media di aX+baX + b è aμ+ba\mu + b, quindi lo scarto dalla media è (aX+b)−(aμ+b)=a(X−μ)(aX + b) - (a\mu + b) = a(X - \mu): la traslazione bb sparisce. Allora

Var(aX+b)=E[a2(X−μ)2]=a2 Var(X).\text{Var}(aX + b) = E[a^2 (X - \mu)^2] = a^2 \, \text{Var}(X).

Intuizione: spostare tutti i valori di bb non cambia quanto sono sparpagliati; moltiplicarli per aa allarga le distanze di ∣a∣|a|, e i quadrati di a2a^2. Il segno di aa non conta: Var(−X)=Var(X)\text{Var}(-X) = \text{Var}(X).

3. Si vede in Covarianza e coefficiente di correlazione. Attenzione: anche per la differenza di v.a. indipendenti le varianze si sommano: Var(X−Y)=Var(X)+(−1)2Var(Y)\text{Var}(X - Y) = \text{Var}(X) + (-1)^2\text{Var}(Y).

Esempio d'esame (I parziale 17.11.2025, III appello 24.06.2026). X=3Y−2X = 3Y - 2 con Y∼Bin(2,47)Y \sim \text{Bin}(2, \frac47), Var(Y)=2⋅47⋅37=2449\text{Var}(Y) = 2 \cdot \frac47 \cdot \frac37 = \frac{24}{49}:

Var(X)=32 Var(Y)=9⋅2449=21649, come nel calcolo diretto.\text{Var}(X) = 3^2 \, \text{Var}(Y) = 9 \cdot \frac{24}{49} = \frac{216}{49}, \ \text{come nel calcolo diretto.}

La media come miglior previsione

Per ogni numero cc:

E[(X−c)2]=Var(X)+(μ−c)2.E[(X - c)^2] = \text{Var}(X) + (\mu - c)^2.

(Si scrive X−c=(X−μ)+(μ−c)X - c = (X - \mu) + (\mu - c), si sviluppa il quadrato, e il doppio prodotto ha media 2(μ−c)E[X−μ]=02(\mu - c)E[X - \mu] = 0.) Quindi l'errore quadratico medio che si commette prevedendo XX con un numero cc è minimo per c=μc = \mu, e il minimo è la varianza. È un'altra interpretazione: la varianza è l'errore quadratico medio della miglior previsione costante.

Standardizzazione

Se σX>0\sigma_X > 0, la v.a.

Z=X−μσXZ = \frac{X - \mu}{\sigma_X}

ha E[Z]=μ−μσX=0E[Z] = \frac{\mu - \mu}{\sigma_X} = 0 e Var(Z)=1σX2Var(X)=1\text{Var}(Z) = \frac{1}{\sigma_X^2}\text{Var}(X) = 1 (proprietà 2 con a=1σXa = \frac1{\sigma_X}, b=−μσXb = -\frac{\mu}{\sigma_X}). Si chiama standardizzata di XX: misura di quante deviazioni standard XX si allontana dalla media. È il passaggio chiave dell'approssimazione normale: nel I appello 15.01.2026, Y∼Bin(100,12)Y \sim \text{Bin}(100, \frac12) con media 5050 e σ=5\sigma = 5, e si scrive P(Y≤47)=P(Y−505≤−0,6)P(Y \le 47) = P\left(\frac{Y - 50}{5} \le -0{,}6\right) (Teorema del limite centrale e approssimazione normale).

Tabella delle leggi discrete notevoli

Legge E[X]E[X] Var(X)\text{Var}(X) E[X2]E[X^2]
Be(p)\text{Be}(p) pp p(1−p)p(1 - p) pp
Bin(n,p)\text{Bin}(n, p) npnp np(1−p)np(1 - p) np(1−p)+n2p2np(1-p) + n^2p^2
uniforme su {1,…,n}\{1, \dots, n\} n+12\frac{n + 1}{2} n2−112\frac{n^2 - 1}{12} (n+1)(2n+1)6\frac{(n+1)(2n+1)}{6}
Geo(p)\text{Geo}(p) 1p\frac1p 1−pp2\frac{1 - p}{p^2} 2−pp2\frac{2 - p}{p^2}
Poi(λ)\text{Poi}(\lambda) λ\lambda λ\lambda λ+λ2\lambda + \lambda^2

(La colonna E[X2]=Var(X)+E[X]2E[X^2] = \text{Var}(X) + E[X]^2 serve negli esercizi sulla convergenza in media seconda e nelle covarianze.)

Errori comuni

  • Var(aX+b)=a Var(X)+b\text{Var}(aX + b) = a\,\text{Var}(X) + b: sbagliato due volte; la costante sparisce e aa va al quadrato.
  • Var(X−Y)=Var(X)−Var(Y)\text{Var}(X - Y) = \text{Var}(X) - \text{Var}(Y): per v.a. indipendenti le varianze si sommano sempre (e una varianza negativa non esiste).
  • Confondere E[X2]E[X^2] con E[X]2E[X]^2: la loro differenza è proprio la varianza.
  • Sommare varianze di v.a. non indipendenti senza il termine di covarianza.
  • Dimenticare la radice quando si chiede la deviazione standard (serve nella standardizzazione: si divide per σ\sigma, non per σ2\sigma^2).

Teoria collegata