Salta al contenuto
Note per Studenti Teorema del limite centrale e approssimazione normale

Teorema del limite centrale e approssimazione normale

In questa pagina 7

Ultimo argomento del programma (punto 7: "teorema del limite centrale: enunciato con dimostrazione e applicazioni (approssimazione Gaussiana)"). Prerequisiti: Distribuzione gaussiana (normale)N(μ, σ²) ha densità e^(−(x−μ)²/(2σ²)) / √(2πσ²), a campana centrata in μ con larghezza σ; media μ, varianza σ²; si standardizza con Z = (X − μ)/σ ~ N(0, 1) e si calcola P(X ≤ x) = Φ((x − μ)/σ), con Φ(−z) = 1 − Φ(z); aX + b è ancora gaussiana, N(aμ + b, a²σ²).Distribuzione gaussiana (normale) →, Funzione caratteristicaLa funzione caratteristica φ_X(θ) = E[e^(iθX)] = E[cos θX] + iE[sin θX] esiste per ogni v.a. e ogni θ, vale 1 in 0, ha modulo ≤ 1, determina la legge (è la trasformata di Fourier della densità), trasforma le somme di v.a. indipendenti in prodotti e dà i momenti: E[X^k] = φ^(k)(0) / i^k. Per N(μ, σ²) vale e^(iμθ − σ²θ²/2).Funzione caratteristica →, Convergenza di successioni di variabili aleatorieQuattro modi in cui X_n → X: quasi certa (P(X_n → X) = 1), in probabilità (P(|X_n − X| > ε) → 0 per ogni ε), in media p-esima (E|X_n − X|^p → 0), in distribuzione (F_(X_n)(x) → F_X(x) nei punti di continuità di F_X). Relazioni: q.c. ⇒ prob., L^p ⇒ prob. ⇒ distr., L² ⇒ L¹; in distribuzione verso una costante ⇔ in probabilità. Teorema di Lévy: convergenza in distribuzione ⇔ convergenza puntuale delle funzioni caratteristiche.Convergenza di successioni di variabili aleatorie →, Legge dei grandi numeri e metodo Monte CarloSe X₁, X₂, ... sono i.i.d. con media μ, la media campionaria X̄ₙ = (X₁ + ... + Xₙ)/n converge a μ: in probabilità (legge debole, dimostrata con Chebyshev se la varianza è finita: P(|X̄ₙ − μ| > ε) ≤ σ²/(nε²)) e quasi certamente (legge forte). Metodo Monte Carlo: ∫ g = E[g(U)] si stima con la media di g(U₁), ..., g(Uₙ) per uniformi indipendenti.Legge dei grandi numeri e metodo Monte Carlo →.

Dalla legge dei grandi numeri al limite centrale

La legge dei grandi numeriSe X₁, X₂, ... sono i.i.d. con media μ, la media campionaria X̄ₙ = (X₁ + ... + Xₙ)/n converge a μ: in probabilità (legge debole, dimostrata con Chebyshev se la varianza è finita: P(|X̄ₙ − μ| > ε) ≤ σ²/(nε²)) e quasi certamente (legge forte). Metodo Monte Carlo: ∫ g = E[g(U)] si stima con la media di g(U₁), ..., g(Uₙ) per uniformi indipendenti.Legge dei grandi numeri e metodo Monte Carlo → dice che Xˉn→μ\bar X_n \to \mu: la media campionaria si concentra attorno a μ\mu, con fluttuazioni di ampiezza σn\frac{\sigma}{\sqrt n} che tendono a zero. Il teorema del limite centrale guarda queste fluttuazioni ingrandite di un fattore n\sqrt n e dice qual è la loro forma: gaussiana, qualunque sia la legge delle XkX_k. È il motivo per cui la gaussiana compare ovunque.

Enunciato

Siano X1,X2,…X_1, X_2, \dots i.i.d. con media μ\mu e varianza σ2∈(0,+∞)\sigma^2 \in (0, +\infty), e Sn=X1+⋯+XnS_n = X_1 + \dots + X_n. Allora E[Sn]=nμE[S_n] = n\mu, Var(Sn)=nσ2\text{Var}(S_n) = n\sigma^2, e la somma standardizzata è

Zn:=Sn−nμσn=Xˉn−μσ/n.Z_n := \frac{S_n - n\mu}{\sigma\sqrt n} = \frac{\bar X_n - \mu}{\sigma / \sqrt n}.

(Le due scritture coincidono: si divide numeratore e denominatore per nn.) ZnZ_n ha media 00 e varianza 11 per costruzione.

Teorema del limite centrale (TLC). Zn→dZ∼N(0,1)Z_n \xrightarrow{d} Z \sim N(0, 1), cioè lim⁡n→∞P(Sn−nμσn≤x)=Φ(x)per ogni x∈R.\lim_{n\to\infty} P\left(\frac{S_n - n\mu}{\sigma\sqrt n} \le x\right) = \Phi(x) \qquad \text{per ogni } x \in \mathbb R.

(La convergenza vale in ogni xx perché Φ\Phi è continua.)

Dimostrazione

Ci si riduce a μ=0\mu = 0, σ=1\sigma = 1 sostituendo XkX_k con Yk=Xk−μσY_k = \frac{X_k - \mu}{\sigma}, che sono i.i.d. con media 00 e varianza 11; allora Zn=Y1+⋯+YnnZ_n = \frac{Y_1 + \dots + Y_n}{\sqrt n}.

Passo 1: funzione caratteristica di ZnZ_n. Per l'indipendenza e la proprietà affine (Funzione caratteristicaLa funzione caratteristica φ_X(θ) = E[e^(iθX)] = E[cos θX] + iE[sin θX] esiste per ogni v.a. e ogni θ, vale 1 in 0, ha modulo ≤ 1, determina la legge (è la trasformata di Fourier della densità), trasforma le somme di v.a. indipendenti in prodotti e dà i momenti: E[X^k] = φ^(k)(0) / i^k. Per N(μ, σ²) vale e^(iμθ − σ²θ²/2).Funzione caratteristica →), con φ=φY1\varphi = \varphi_{Y_1}: φZn(θ)=E[eiθn(Y1+⋯+Yn)]=∏k=1nφ(θn)=φ(θn)n.\varphi_{Z_n}(\theta) = E\left[e^{i\frac{\theta}{\sqrt n}(Y_1 + \dots + Y_n)}\right] = \prod_{k=1}^n \varphi\left(\frac{\theta}{\sqrt n}\right) = \varphi\left(\frac{\theta}{\sqrt n}\right)^n.

Passo 2: sviluppo di Taylor. Poiché E[Y1]=0E[Y_1] = 0 ed E[Y12]=1E[Y_1^2] = 1, vicino a 00 φ(t)=1+iE[Y1]t−E[Y12]2t2+o(t2)=1−t22+o(t2).\varphi(t) = 1 + i E[Y_1] t - \frac{E[Y_1^2]}{2}t^2 + o(t^2) = 1 - \frac{t^2}{2} + o(t^2). Con t=θnt = \frac{\theta}{\sqrt n} (che tende a 00 per θ\theta fissato): φ(θn)=1−θ22n+o(1n).\varphi\left(\frac{\theta}{\sqrt n}\right) = 1 - \frac{\theta^2}{2n} + o\left(\frac1n\right).

Passo 3: limite. Usando il limite notevole (1+ann)n→ea\left(1 + \frac{a_n}{n}\right)^n \to e^a se an→aa_n \to a (che vale anche per ana_n complessi), con an=−θ22+n⋅o(1n)→−θ22a_n = -\frac{\theta^2}{2} + n \cdot o(\frac1n) \to -\frac{\theta^2}{2}: φZn(θ)=(1−θ22n+o(1n))n→n→∞e−θ2/2.\varphi_{Z_n}(\theta) = \left(1 - \frac{\theta^2}{2n} + o\left(\frac1n\right)\right)^n \xrightarrow[n\to\infty]{} e^{-\theta^2/2}.

Passo 4: Lévy. e−θ2/2e^{-\theta^2/2} è la funzione caratteristica di N(0,1)N(0, 1) (continua in 00). Per il teorema di continuità di LévyX_n converge in distribuzione a X se e solo se le funzioni caratteristiche convergono in ogni punto.Convergenza di successioni di variabili aleatorie →, Zn→dN(0,1)Z_n \xrightarrow{d} N(0, 1). ∎

Si vede perché conta solo la varianza: nello sviluppo di Taylor sopravvivono solo media e varianza, tutti gli altri dettagli della legge finiscono nell'o(t2)o(t^2) e spariscono al limite.

Approssimazione normale

In pratica il TLC si usa "a nn fissato e grande": si sostituisce la legge di SnS_n con quella gaussiana che ha la stessa media e la stessa varianza.

Per nn grande: Sn≈N(nμ,nσ2),Xˉn≈N(μ,σ2n),\quad S_n \approx N(n\mu, n\sigma^2), \qquad \bar X_n \approx N\left(\mu, \frac{\sigma^2}{n}\right), P(Sn≤x)≈Φ(x−nμσn).P(S_n \le x) \approx \Phi\left(\frac{x - n\mu}{\sigma\sqrt n}\right).

Metodo. (1) Riconoscere SnS_n come somma di nn v.a. i.i.d.; (2) calcolare E[Sn]=nμE[S_n] = n\mu e Var(Sn)=nσ2\text{Var}(S_n) = n\sigma^2; (3) standardizzare l'evento; (4) sostituire con Φ\Phi.

Caso binomiale: teorema di De Moivre-Laplace

X∼Bin(n,p)X \sim \text{Bin}(n, p) è la somma di nn Bernoulli Be(p)\text{Be}(p) i.i.d., con μ=p\mu = p e σ2=p(1−p)\sigma^2 = p(1 - p). Quindi

Bin(n,p)≈N(np, np(1−p)),P(X≤k)≈Φ(k−npnp(1−p)).\text{Bin}(n, p) \approx N\big(np, \ np(1 - p)\big), \qquad P(X \le k) \approx \Phi\left(\frac{k - np}{\sqrt{np(1 - p)}}\right).

È stata la prima versione storica del teorema. Regola pratica: l'approssimazione è buona se np≥5np \ge 5 e n(1−p)≥5n(1 - p) \ge 5 (o, più prudentemente, np(1−p)≥10np(1 - p) \ge 10). Se invece nn è grande ma npnp è piccolo, conviene l'approssimazione di PoissonPoi(λ) conta eventi rari: P(X = k) = e^(−λ) λ^k / k! per k = 0, 1, 2, …, con media e varianza entrambe uguali a λ; approssima la binomiale Bin(n, p) quando n è grande e p piccolo, con λ = np.Distribuzione di Poisson →.

Correzione di continuità

La binomiale prende solo valori interi, la gaussiana è continua. P(X≤47)P(X \le 47) e P(X<48)P(X < 48) sono la stessa probabilità binomiale, ma la gaussiana darebbe due numeri diversi. Il compromesso è tagliare a metà strada tra i due interi:

Per XX a valori interi: P(X≤k)≈Φ(k+0,5−npnp(1−p)),P(X≥k)≈1−Φ(k−0,5−npnp(1−p)).\quad P(X \le k) \approx \Phi\left(\frac{k + 0{,}5 - np}{\sqrt{np(1 - p)}}\right), \qquad P(X \ge k) \approx 1 - \Phi\left(\frac{k - 0{,}5 - np}{\sqrt{np(1 - p)}}\right).

Idea grafica: ogni valore intero jj corrisponde al rettangolo di base [j−12,j+12][j - \frac12, j + \frac12] nell'istogramma della densità; sommare i rettangoli fino a kk significa arrivare fino a k+12k + \frac12.

Esempi d'esame

Teste di due monete

(I appello 15.01.2026, Esercizio 23 · teste di due monete e approssimazione normale.) Y∼Bin(100,12)Y \sim \text{Bin}(100, \frac12): E[Y]=50E[Y] = 50, Var(Y)=25\text{Var}(Y) = 25, σY=5\sigma_Y = 5.

P(Y≤47)≈Φ(47−505)=Φ(−0,6)=1−Φ(0,6)≈0,274,P(Y \le 47) \approx \Phi\left(\frac{47 - 50}{5}\right) = \Phi(-0{,}6) = 1 - \Phi(0{,}6) \approx 0{,}274, con correzione:P(Y≤47,5)≈Φ(47,5−505)=1−Φ(0,5)≈0,309.\text{con correzione:} \quad P(Y \le 47{,}5) \approx \Phi\left(\frac{47{,}5 - 50}{5}\right) = 1 - \Phi(0{,}5) \approx 0{,}309.

Il valore esatto è 0,30860{,}3086: la correzione di continuità migliora molto il risultato.

Lotto: il numero 33

(II appello 12.02.2026, Esercizio 11 · lotto, numero 33 per 90 settimane.) X∼Bin(90,118)X \sim \text{Bin}(90, \frac1{18}), E[X]=5E[X] = 5, Var(X)=90⋅118⋅1718=8518≈4,72\text{Var}(X) = 90 \cdot \frac1{18}\cdot\frac{17}{18} = \frac{85}{18} \approx 4{,}72.

P(X>6)≈P(Z>6−585/18)=1−Φ(1885)=1−Φ(0,46)≈0,32.P(X > 6) \approx P\left(Z > \frac{6 - 5}{\sqrt{85/18}}\right) = 1 - \Phi\left(\sqrt{\tfrac{18}{85}}\right) = 1 - \Phi(0{,}46) \approx 0{,}32.

Con la correzione (X>6  ⟺  X≥7X > 6 \iff X \ge 7, si taglia a 6,56{,}5): 1−Φ(1,52,17)=1−Φ(0,69)≈0,2451 - \Phi\left(\frac{1{,}5}{2{,}17}\right) = 1 - \Phi(0{,}69) \approx 0{,}245; il valore esatto è circa 0,230{,}23. Qui np=5np = 5 è al limite della regola pratica.

Quante prove servono per stimare una probabilità

Si vuole stimare pp con la frequenza Xˉn\bar X_n, con errore al più 0,010{,}01 con probabilità 95%95\%. Per il TLC Xˉn≈N(p,p(1−p)n)\bar X_n \approx N(p, \frac{p(1 - p)}{n}), quindi P(∣Xˉn−p∣≤0,01)≈2Φ(0,01np(1−p))−1≥0,95  ⟺  0,01np(1−p)≥1,96.P(|\bar X_n - p| \le 0{,}01) \approx 2\Phi\left(\frac{0{,}01\sqrt n}{\sqrt{p(1 - p)}}\right) - 1 \ge 0{,}95 \iff \frac{0{,}01\sqrt n}{\sqrt{p(1 - p)}} \ge 1{,}96. Nel caso peggiore p(1−p)=14p(1 - p) = \frac14: n≥98\sqrt n \ge 98, cioè n≥9 604n \ge 9\,604. Chebyshev chiedeva 50 00050\,000 prove: il TLC è molto più preciso perché usa la forma della legge, non solo la varianza.

Somma di uniformi

La somma di 1212 uniformi U(0,1)U(0, 1) indipendenti ha media 66 e varianza 12⋅112=112 \cdot \frac{1}{12} = 1: S12−6S_{12} - 6 è approssimativamente N(0,1)N(0, 1). Era un vecchio metodo per generare numeri gaussiani al computer. Già con 22 addendi la densità è un triangolo (Somma di variabili aleatorie indipendentiSe X e Y sono indipendenti, la legge di Z = X + Y è la convoluzione: p_Z(n) = Σ_k p_X(k) p_Y(n − k) nel discreto, f_Z(z) = ∫ f_X(z − y) f_Y(y) dy nel continuo. Casi notevoli: Bin(n,p) + Bin(m,p) = Bin(n+m,p), Poi(λ) + Poi(μ) = Poi(λ+μ), Geo + Geo con densità (n−1)p²(1−p)^(n−2), Exp(λ) + Exp(λ) = Γ(2,λ), gaussiane indipendenti sommano medie e varianze.Somma di variabili aleatorie indipendenti →), con 33 è fatta di archi di parabola e somiglia già a una campana.

Oggetto Approssimazione per nn grande
somma SnS_n di i.i.d. N(nμ,nσ2)N(n\mu, n\sigma^2)
media Xˉn\bar X_n N(μ,σ2/n)N(\mu, \sigma^2/n)
Bin(n,p)\text{Bin}(n, p) N(np,np(1−p))N(np, np(1 - p)), con correzione ±0,5\pm 0{,}5
Poi(λ)\text{Poi}(\lambda), λ\lambda grande N(λ,λ)N(\lambda, \lambda) (somma di λ\lambda Poisson di parametro 1)
Γ(n,λ)\Gamma(n, \lambda), nn grande N(n/λ,n/λ2)N(n/\lambda, n/\lambda^2)

Errori comuni

  • Dividere per la varianza invece che per la deviazione standard: si divide per σn\sigma\sqrt n, non per σ2n\sigma^2 n.
  • Usare la varianza di una singola XkX_k invece di quella della somma (nσ2n\sigma^2).
  • Applicare la correzione di continuità nel verso sbagliato: per P(X≤k)P(X \le k) si usa k+0,5k + 0{,}5, per P(X≥k)P(X \ge k) si usa k−0,5k - 0{,}5, per P(X>k)=P(X≥k+1)P(X > k) = P(X \ge k + 1) si usa k+0,5k + 0{,}5.
  • Arrotondare risultati come 1−Φ(0,46)1 - \Phi(0{,}46) a zero: Φ(0,46)≈0,68\Phi(0{,}46) \approx 0{,}68, quindi la probabilità è circa 0,320{,}32, tutt'altro che trascurabile. Prima di approssimare, guardare quanto vale l'argomento di Φ\Phi.
  • Pensare che il TLC renda gaussiana ogni singola XkX_k: riguarda la somma (o la media) di tante.

Esercizi su questo argomento

Teoria collegata