Salta al contenuto
Note per Studenti Teorema centrale del limite e correzione di continuità

Teorema centrale del limite e correzione di continuità

In questa pagina 6

Lezione 8 di probabilità, Unità 3-5. Prerequisiti: Variabili aleatorie normali (gaussiane)Z ~ N(0,1) ha densità e^{−x²/2}/√(2π) (normalizzata grazie all'integrale di Gauss), media 0, varianza 1, funzione di distribuzione Φ tabulata per x ≥ 0, con Φ(−x) = 1 − Φ(x). X ~ N(μ, σ²) se (X − μ)/σ ~ N(0,1), cioè X = μ + σZ: media μ, varianza σ², densità e^{−(x−μ)²/(2σ²)}/√(2πσ²). Si calcola sempre standardizzando: P(X ≤ a) = Φ((a − μ)/σ). Regola 68-95-99.7: P(|X − μ| ≤ σ) ≈ 0.683, ≤ 2σ ≈ 0.954, ≤ 3σ ≈ 0.997.Variabili aleatorie normali (gaussiane) →, Varianza e covarianza di variabili discreteVar[X] = E[(X − μ)²] = E[X²] − μ² misura la dispersione attorno alla media μ = E[X]; σ = √Var è la deviazione standard. Var[aX + b] = a² Var[X]; la normalizzata (X − μ)/σ ha media 0 e varianza 1. Varianze notevoli: Be(p) → p(1−p), B(n,p) → np(1−p), Po(λ) → λ, Ge(p) → (1−p)/p². Cov[X,Y] = E[XY] − E[X]E[Y]; variabili indipendenti hanno covarianza nulla, ma non vale il viceversa (X uniforme su {−1,0,1} e X²). Var[X + Y] = Var X + Var Y + 2 Cov[X,Y]: per indipendenti le varianze si sommano.Varianza e covarianza di variabili discrete →.

Variabili i.i.d. e la somma standardizzata

Definizione. XX e YY sono identicamente distribuite se FX=FYF_X = F_Y. In tal caso hanno la stessa media e (se finita) la stessa varianza.

Se X1,X2,…X_1, X_2, \dots sono indipendenti e identicamente distribuite (i.i.d.) con E[Xi]=μE[X_i] = \mu e Var⁡[Xi]=σ2\operatorname{Var}[X_i] = \sigma^2, la somma Sn=X1+⋯+XnS_n = X_1 + \cdots + X_n ha E[Sn]=nμ,Var⁡[Sn]=nσ2 (per l’indipendenza)E[S_n] = n\mu, \qquad \operatorname{Var}[S_n] = n\sigma^2 \ (\text{per l'indipendenza}) e la sua standardizzata è Sn−nμnσ2\dfrac{S_n - n\mu}{\sqrt{n\sigma^2}} (media 00, varianza 11).

Il teorema

Teorema centrale del limite (TCL). Siano X1,X2,…X_1, X_2, \dots i.i.d. con E[Xi]=μE[X_i] = \mu e Var⁡[Xi]=σ2\operatorname{Var}[X_i] = \sigma^2 finita. Per ogni a∈Ra \in \mathbb{R}: P(X1+⋯+Xn−nμnσ2≤a)→n→+∞Φ(a)P\left(\frac{X_1 + \cdots + X_n - n\mu}{\sqrt{n\sigma^2}} \le a\right) \xrightarrow[n \to +\infty]{} \Phi(a) (convergenza in distribuzione alla normale standard).

Il fatto sorprendente: la legge delle XiX_i può essere qualsiasi (Bernoulli, uniforme, esponenziale, …): la somma di tanti contributi indipendenti, opportunamente normalizzata, ha sempre approssimativamente la stessa forma a campana. È il motivo per cui le gaussiane compaiono ovunque (errori di misura, altezze, rumore nei segnali elettronici).

Corollario (uso pratico). Per nn grande, SnS_n ha approssimativamente la legge della normale con la sua stessa media e varianza: P(X1+⋯+Xn≤a)≈P(N(nμ,nσ2)≤a)=Φ(a−nμnσ2)P(X_1 + \cdots + X_n \le a) \approx P\big(N(n\mu, n\sigma^2) \le a\big) = \Phi\left(\frac{a - n\mu}{\sqrt{n\sigma^2}}\right)

Per la media campionaria Xˉn=Snn\bar X_n = \frac{S_n}{n}: media μ\mu, varianza σ2n\frac{\sigma^2}{n}, quindi Xˉn≈N(μ,σ2n)\bar X_n \approx N\left(\mu, \frac{\sigma^2}n\right). La media di molte osservazioni è molto più concentrata della singola osservazione (deviazione standard divisa per n\sqrt n).

Le ipotesi contano. Con Xi=X∼Be⁡(12)X_i = X \sim \operatorname{Be}\left(\frac12\right) tutte uguali (non indipendenti), X1+⋯+X1000=1000XX_1 + \cdots + X_{1000} = 1000X vale 00 o 10001000 con probabilità 12\frac12: nessuna campana. Serve l'indipendenza.

Esempi del prof

I varchi aeroportuali (MOOC). Il tempo di transito di un passeggero ha media 11 minuto e varianza 1.41.4; 3030 passeggeri indipendenti. La somma ha media 3030 e varianza 4242: P(S30<15)≈Φ(15−3042)=Φ(−2.31)≈0.010P(S_{30} < 15) \approx \Phi\left(\frac{15 - 30}{\sqrt{42}}\right) = \Phi(-2.31) \approx 0.010

I lanci per arrivare a 300300 (MOOC). Servono almeno 8080 lanci di un dado perché la somma raggiunga 300300 se e solo se dopo 7979 lanci la somma è ancora <300< 300, cioè ≤299\le 299. Un lancio ha E=72E = \frac72, E[X2]=916E[X^2] = \frac{91}{6}, Var⁡=3512\operatorname{Var} = \frac{35}{12}; 7979 lanci: media 276.5276.5, varianza 79⋅3512≈230.4\frac{79\cdot 35}{12} \approx 230.4: P(S79≤299)≈Φ(299−276.515.18)=Φ(1.48)≈0.93P(S_{79} \le 299) \approx \Phi\left(\frac{299 - 276.5}{15.18}\right) = \Phi(1.48) \approx 0.93

Le telefonate (MOOC). I tempi tra una telefonata e la successiva sono Exp⁡(4)\operatorname{Exp}(4) (minuti) indipendenti: la prima arriva in media dopo 14\frac14 di minuto. La centesima arriva all'istante S100S_{100}, con media 1004=25\frac{100}{4} = 25 e varianza 10016\frac{100}{16} (deviazione standard 2.52.5): P(S100>30)≈1−Φ(2)≈0.023P(S_{100} > 30) \approx 1 - \Phi(2) \approx 0.023.

Approssimare binomiale e Poisson con la normale

Binomiale. Per nn grande, B(n,p)≈N(np,np(1−p))B(n, p) \approx N(np, np(1 - p)) in distribuzione (è la somma di nn Bernoulli indipendenti). Ragionevole nella pratica se 1n≪p≪1−1n\frac{1}{n} \ll p \ll 1 - \frac1n, cioè se npnp e n(1−p)n(1 - p) sono entrambi grandi. Poisson. Per λ≥50\lambda \ge 50, Po⁡(λ)≈N(λ,λ)\operatorname{Po}(\lambda) \approx N(\lambda, \lambda) (somma di nn Poisson Po⁡(λ/n)\operatorname{Po}(\lambda/n) indipendenti).

Quindi la binomiale con nn grande e pp piccolo si approssima con la PoissonX ~ Po(λ), λ > 0, assume i valori 0, 1, 2, … con P(X = k) = e^{−λ} λᵏ/k!; λ è il numero medio di eventi. Nasce come limite della binomiale: se Xₙ ~ B(n, λ/n) allora P(Xₙ = k) → e^{−λ}λᵏ/k!. In pratica B(n,p) ≈ Po(np) se n è grande e p piccolo (regole del corso: n ≥ 20, p ≤ 0.05, p ≤ 10/n). Modella conteggi di eventi rari in un intervallo di tempo o spazio: telefonate, arrivi, terremoti, difetti, vincite.Variabile di Poisson e approssimazione della binomiale →, con nn grande e pp "moderato" con la normale.

Esempio del prof. Un dado lanciato 12 00012\,000 volte: probabilità che il 66 esca al massimo 19501950 volte. X∼B(12 000,16)X \sim B\left(12\,000, \frac16\right) ha media 20002000 e varianza 12 000⋅16⋅56=5000312\,000\cdot\frac16\cdot\frac56 = \frac{5000}{3}: P(X≤1950)≈Φ(1950−20005000/3)=Φ(−3/2)≈1−Φ(1.22)≈0.111P(X \le 1950) \approx \Phi\left(\frac{1950 - 2000}{\sqrt{5000/3}}\right) = \Phi\left(-\sqrt{3/2}\right) \approx 1 - \Phi(1.22) \approx 0.111 Il valore esatto (calcolato al computer) è 0.11240.1124.

La correzione di continuità

Se XX assume solo valori interi, gli eventi {X≤5}\{X \le 5\}, {X<6}\{X < 6\}, {X≤5.5}\{X \le 5.5\} coincidono; ma approssimando con una continua YY danno probabilità diverse. La scelta migliore è il punto di mezzo:

Correzione di continuità. Per XX a valori interi approssimata con una normale YY: P(X≤k)≈P(Y≤k+0.5),P(X=k)≈P(k−0.5≤Y≤k+0.5)P(X \le k) \approx P(Y \le k + 0.5), \qquad P(X = k) \approx P(k - 0.5 \le Y \le k + 0.5) e in generale P(a≤X≤b)≈P(a−0.5≤Y≤b+0.5)P(a \le X \le b) \approx P(a - 0.5 \le Y \le b + 0.5) per a,ba, b interi.

Perché: si pensa a ogni valore intero kk come al rettangolino di base [k−0.5,k+0.5][k - 0.5, k + 0.5] e altezza P(X=k)P(X = k) (l'istogramma); la curva gaussiana approssima l'istogramma, quindi la probabilità di {X=k}\{X = k\} va confrontata con l'area sotto la curva su tutto il rettangolino.

Esempi del prof (valori esatti calcolati con Python):

  • 508508 teste su 10001000 lanci. Esatto: (1000508)2−1000≈0.0222\binom{1000}{508}2^{-1000} \approx 0.0222. Con Y∼N(500,250)Y \sim N(500, 250): P(507.5≤Y≤508.5)=Φ(8.5250)−Φ(7.5250)≈Φ(0.54)−Φ(0.47)P(507.5 \le Y \le 508.5) = \Phi\left(\frac{8.5}{\sqrt{250}}\right) - \Phi\left(\frac{7.5}{\sqrt{250}}\right) \approx \Phi(0.54) - \Phi(0.47), che con la tabella dà ≈0.0245\approx 0.0245 (con valori più precisi di Φ\Phi, 0.02220.0222). Senza correzione la "probabilità di un punto" sarebbe 00.
  • Il 66 tra 19981998 e 20052005 volte su 12 00012\,000 lanci: esatto ≈0.0780\approx 0.0780; normale senza correzione Φ(5σ)−Φ(−2σ)≈0.068\Phi\left(\frac{5}{\sigma}\right) - \Phi\left(\frac{-2}{\sigma}\right) \approx 0.068; con correzione Φ(5.5σ)−Φ(−2.5σ)≈0.0780\Phi\left(\frac{5.5}\sigma\right) - \Phi\left(\frac{-2.5}\sigma\right) \approx 0.0780 (σ=5000/3≈40.8\sigma = \sqrt{5000/3} \approx 40.8). La correzione fa una grande differenza quando l'intervallo è stretto.
  • La biblioteca (Po⁡(80)\operatorname{Po}(80) richieste all'ora), tra 7070 e 9090 richieste: esatto ≈0.760\approx 0.760; normale N(80,80)N(80, 80) senza correzione ≈0.736\approx 0.736, con correzione P(69.5≤Y≤90.5)≈0.760P(69.5 \le Y \le 90.5) \approx 0.760.
  • Il parcheggio (Po⁡(50)\operatorname{Po}(50) auto all'ora), tra 5454 e 6262: esatto ≈0.262\approx 0.262; con correzione ≈0.272\approx 0.272; senza ≈0.241\approx 0.241.
  • Un milione di lanci di moneta, esattamente 500 000500\,000 teste: P(499 999.5≤Y≤500 000.5)=2Φ(0.5500)−1≈0.0008P(499\,999.5 \le Y \le 500\,000.5) = 2\Phi\left(\frac{0.5}{500}\right) - 1 \approx 0.0008 (con σ=500\sigma = 500): l'esito "più probabile" ha probabilità meno di uno su mille.

Esercizi: Esercizio 55 · somme di variabili indipendenti e teorema centrale del limite, Esercizio 56 · approssimazione normale di binomiali e Poisson.

Errori comuni

  • Usare la varianza della singola XiX_i invece di quella della somma (nσ2n\sigma^2) o della media (σ2n\frac{\sigma^2}n).
  • Applicare il TCL a variabili non indipendenti.
  • Dimenticare la correzione di continuità per variabili intere, soprattutto per probabilità di singoli valori o intervalli stretti.
  • Approssimare con la normale una binomiale con npnp piccolo (meglio la Poisson).

Esercizi su questo argomento

Lezioni in cui compare

Teoria collegata