X: si vince sempre 0 euro, cioè X=0 con probabilità 1;
Y: si vincono 10 euro o se ne perdono 10, con probabilità 21 ciascuno.
Entrambi hanno media 0 (E[Y]=10⋅21−10⋅21=0), ma sono giochi completamente diversi: il secondo è rischioso. Serve un numero che misuri quanto i valori si allontanano dalla media. L'idea naturale è la media della distanza ∣X−E[X]∣, ma il modulo è scomodo nei calcoli; si usa la media del quadrato della distanza: la varianza.
Momenti
Sia k≥1 intero e X una v.a. con E[∣X∣k]<∞.
Il momento k-esimo di X è E[Xk].
Il momento centrato k-esimo è E[(X−μ)k], con μ=E[X].
Il momento primo è la media μ. Il momento centrato primo è sempre 0: E[X−μ]=μ−μ=0.
Il momento centrato secondo è la varianza.
Se esiste il momento k-esimo, esistono tutti quelli di ordine j<k: per ogni x vale ∣x∣j≤1+∣x∣k (se ∣x∣≤1 il primo membro è ≤1, se ∣x∣>1 è ≤∣x∣k), quindi E[∣X∣j]≤1+E[∣X∣k]<∞.
Var(X)≥0, e Var(X)=0 se e solo se X=μ con probabilità 1.
Var(aX+b)=a2Var(X) per ogni a,b∈R.
Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y); se X e Y sono indipendenti, Var(X+Y)=Var(X)+Var(Y).
1. È la media di un quadrato, quindi ≥0. Se è 0, nella somma ∑x(x−μ)2pX(x) tutti i termini (che sono ≥0) devono essere nulli: per ogni x=μ deve essere pX(x)=0. Quindi l'unico valore con probabilità positiva è μ.
2. La media di aX+b è aμ+b, quindi lo scarto dalla media è (aX+b)−(aμ+b)=a(X−μ): la traslazione bsparisce. Allora
Var(aX+b)=E[a2(X−μ)2]=a2Var(X).
Intuizione: spostare tutti i valori di b non cambia quanto sono sparpagliati; moltiplicarli per a allarga le distanze di ∣a∣, e i quadrati di a2. Il segno di a non conta: Var(−X)=Var(X).
3. Si vede in Covarianza e coefficiente di correlazione. Attenzione: anche per la differenza di v.a. indipendenti le varianze si sommano: Var(X−Y)=Var(X)+(−1)2Var(Y).
Esempio d'esame (I parziale 17.11.2025, III appello 24.06.2026). X=3Y−2 con Y∼Bin(2,74), Var(Y)=2⋅74⋅73=4924:
Var(X)=32Var(Y)=9⋅4924=49216,come nel calcolo diretto.
La media come miglior previsione
Per ogni numero c:
E[(X−c)2]=Var(X)+(μ−c)2.
(Si scrive X−c=(X−μ)+(μ−c), si sviluppa il quadrato, e il doppio prodotto ha media 2(μ−c)E[X−μ]=0.) Quindi l'errore quadratico medio che si commette prevedendo X con un numero c è minimo per c=μ, e il minimo è la varianza. È un'altra interpretazione: la varianza è l'errore quadratico medio della miglior previsione costante.
Standardizzazione
Se σX>0, la v.a.
Z=σXX−μ
ha E[Z]=σXμ−μ=0 e Var(Z)=σX21Var(X)=1 (proprietà 2 con a=σX1, b=−σXμ). Si chiama standardizzata di X: misura di quante deviazioni standard X si allontana dalla media. È il passaggio chiave dell'approssimazione normale: nel I appello 15.01.2026, Y∼Bin(100,21) con media 50 e σ=5, e si scrive P(Y≤47)=P(5Y−50≤−0,6) (Teorema del limite centrale e approssimazione normale).
Tabella delle leggi discrete notevoli
Legge
E[X]
Var(X)
E[X2]
Be(p)
p
p(1−p)
p
Bin(n,p)
np
np(1−p)
np(1−p)+n2p2
uniforme su {1,…,n}
2n+1
12n2−1
6(n+1)(2n+1)
Geo(p)
p1
p21−p
p22−p
Poi(λ)
λ
λ
λ+λ2
(La colonna E[X2]=Var(X)+E[X]2 serve negli esercizi sulla convergenza in media seconda e nelle covarianze.)
Errori comuni
Var(aX+b)=aVar(X)+b: sbagliato due volte; la costante sparisce e a va al quadrato.
Var(X−Y)=Var(X)−Var(Y): per v.a. indipendenti le varianze si sommano sempre (e una varianza negativa non esiste).
Confondere E[X2] con E[X]2: la loro differenza è proprio la varianza.
Sommare varianze di v.a. non indipendenti senza il termine di covarianza.
Dimenticare la radice quando si chiede la deviazione standard (serve nella standardizzazione: si divide per σ, non per σ2).