Salta al contenuto
Note per Studenti Disuguaglianza di Chebyshev e legge dei grandi numeri

Disuguaglianza di Chebyshev e legge dei grandi numeri

In questa pagina 5

Lezione 10 di probabilità. Prerequisiti: Varianza e covarianza di variabili discreteVar[X] = E[(X − μ)²] = E[X²] − μ² misura la dispersione attorno alla media μ = E[X]; σ = √Var è la deviazione standard. Var[aX + b] = a² Var[X]; la normalizzata (X − μ)/σ ha media 0 e varianza 1. Varianze notevoli: Be(p) → p(1−p), B(n,p) → np(1−p), Po(λ) → λ, Ge(p) → (1−p)/p². Cov[X,Y] = E[XY] − E[X]E[Y]; variabili indipendenti hanno covarianza nulla, ma non vale il viceversa (X uniforme su {−1,0,1} e X²). Var[X + Y] = Var X + Var Y + 2 Cov[X,Y]: per indipendenti le varianze si sommano.Varianza e covarianza di variabili discrete →, Valore atteso e varianza di variabili continuePer X continua con densità fₓ: E[X] = ∫ x fₓ(x) dx (se |x| fₓ è integrabile in senso generalizzato), il baricentro della densità; E[g(X)] = ∫ g(x) fₓ(x) dx; Var[X] = E[X²] − E[X]². Valgono monotonia, linearità, Var[aX + b] = a² Var X, e Var[X + Y] = Var X + Var Y per indipendenti. U(a,b): media (a+b)/2, varianza (b−a)²/12. Exp(λ): media 1/λ, varianza 1/λ² (deviazione standard = media); la mediana ln2/λ è minore della media.Valore atteso e varianza di variabili continue →, Teorema centrale del limite e correzione di continuitàSe X₁, X₂, … sono i.i.d. con media μ e varianza σ², la somma standardizzata (X₁ + ⋯ + Xₙ − nμ)/√(nσ²) tende in distribuzione a N(0,1): P(Sₙ ≤ a) ≈ Φ((a − nμ)/√(nσ²)) per n grande, qualunque sia la legge delle Xᵢ (servono indipendenza e stessa legge). Per la media campionaria: media μ, varianza σ²/n. Casi particolari: B(n,p) ≈ N(np, np(1−p)) per n grande; Po(λ) ≈ N(λ, λ) per λ ≥ 50. Per variabili a valori interi si usa la correzione di continuità: P(X ≤ k) ≈ P(Y ≤ k + 0.5), P(X = k) ≈ P(k − 0.5 ≤ Y ≤ k + 0.5).Teorema centrale del limite e correzione di continuità →.

La domanda di partenza

Come si stima la probabilità pp che una moneta dia testa? L'idea naturale è lanciarla nn volte e calcolare la frequenza pn=numero di teste in n lancinp_n = \frac{\text{numero di teste in } n \text{ lanci}}{n} sperando che si "stabilizzi" per nn grande. Ma esiste davvero il limite? All'inizio del corso la definizione assiomaticaUna probabilità su Ω è P : eventi → [0,1] con P(∅) = 0, P(Ω) = 1 e σ-additività: P(⋃Aᵢ) = Σ P(Aᵢ) per eventi a due a due disgiunti (anche infiniti numerabili). Ne seguono additività finita, monotonia (E ⊆ F ⇒ P(E) ≤ P(F)), P(F∖E) = P(F) − P(E) e inclusione-esclusione. Esempi: pesi pₖ ≥ 0 con Σpₖ = 1 su spazi finiti o numerabili; la lunghezza su [0,1] e l'area sul quadrato; infiniti lanci di moneta. Continuità: per eventi crescenti P(⋃Eᵢ) = lim P(Eᵢ), per decrescenti P(⋂Eᵢ) = lim P(Eᵢ).Definizione assiomatica e continuità della probabilità → ha evitato la questione; ora la si risolve come teorema. Con Xi=1X_i = 1 se il lancio ii dà testa (Xi∼Be⁡(p)X_i \sim \operatorname{Be}(p) indipendenti), la frequenza è la media campionaria Xˉn=X1+⋯+Xnn\bar X_n = \frac{X_1 + \cdots + X_n}{n}

La disuguaglianza di Markov

Proposizione (Markov). Se X≥0X \ge 0 ha valore atteso finito, per ogni a>0a > 0: P(X≥a)≤E[X]aP(X \ge a) \le \frac{E[X]}{a}

Dimostrazione. Sia 1{X≥a}\mathbb{1}_{\{X \ge a\}} l'indicatrice dell'evento. Siccome X≥0X \ge 0, vale X≥a 1{X≥a}X \ge a\,\mathbb{1}_{\{X \ge a\}} (se X≥aX \ge a il secondo membro è a≤Xa \le X, altrimenti è 0≤X0 \le X). Per la monotonia del valore atteso: E[X]≥a P(X≥a)E[X] \ge a\,P(X \ge a) ∎.

Significato: una variabile positiva non può assumere spesso valori molto più grandi della sua media. Per esempio, se lo stipendio medio è 20002000 euro, al più un quarto delle persone guadagna almeno 80008000 euro.

La disuguaglianza di Chebyshev

Proposizione (Chebyshev). Se XX ha media μ\mu e varianza finita, per ogni ε>0\varepsilon > 0: P(∣X−μ∣≥ε)≤Var⁡[X]ε2P(|X - \mu| \ge \varepsilon) \le \frac{\operatorname{Var}[X]}{\varepsilon^2}

Dimostrazione. Si applica Markov alla variabile positiva (X−μ)2(X - \mu)^2 con a=ε2a = \varepsilon^2: P(∣X−μ∣≥ε)=P((X−μ)2≥ε2)≤E[(X−μ)2]ε2P(|X - \mu| \ge \varepsilon) = P((X - \mu)^2 \ge \varepsilon^2) \le \frac{E[(X - \mu)^2]}{\varepsilon^2} ∎.

Con ε=kσ\varepsilon = k\sigma: P(∣X−μ∣≥kσ)≤1k2P(|X - \mu| \ge k\sigma) \le \frac{1}{k^2}. Per qualsiasi legge una variabile sta entro due deviazioni standard dalla media almeno nel 75%75\% dei casi, entro tre almeno nell'89%89\%. Per una gaussiana le percentuali vere sono 95%95\% e 99.7%99.7\%: Chebyshev è una stima grossolana, ma vale sempre, anche quando non si conosce la legge.

La legge dei grandi numeri

Legge debole dei grandi numeri. Siano X1,X2,…X_1, X_2, \dots i.i.d. con media μ\mu e varianza σ2\sigma^2 finita. Per ogni ε>0\varepsilon > 0: P(∣Xˉn−μ∣≥ε)≤σ2nε2→n→∞0P\left(|\bar X_n - \mu| \ge \varepsilon\right) \le \frac{\sigma^2}{n\varepsilon^2} \xrightarrow[n \to \infty]{} 0

Dimostrazione. E[Xˉn]=μE[\bar X_n] = \mu e Var⁡[Xˉn]=nσ2n2=σ2n\operatorname{Var}[\bar X_n] = \frac{n\sigma^2}{n^2} = \frac{\sigma^2}n (per l'indipendenza); si applica Chebyshev ∎.

Legge forte dei grandi numeri. Siano X1,X2,…X_1, X_2, \dots i.i.d. con E[X1]=μE[X_1] = \mu. Allora P(lim⁡n→∞X1+⋯+Xnn=μ)=1P\left(\lim_{n \to \infty}\frac{X_1 + \cdots + X_n}{n} = \mu\right) = 1

Significato: per ogni esito ω\omega (una sequenza infinita di lanci) la successione numerica X1(ω)+⋯+Xn(ω)n\frac{X_1(\omega) + \cdots + X_n(\omega)}{n} può avere limite oppure no; l'insieme degli ω\omega per cui il limite esiste e vale μ\mu ha probabilità 11. Esempio del prof: in lanci indipendenti di una moneta con P(testa)=pP(\text{testa}) = p, con probabilità 11 la frequenza delle teste converge a pp. Sequenze "anomale" (come "sempre testa") esistono, ma hanno probabilità 00.

Legge dei grandi numeri e TCL. La legge dei grandi numeri dice che Xˉn→μ\bar X_n \to \mu; il TCLSe X₁, X₂, … sono i.i.d. con media μ e varianza σ², la somma standardizzata (X₁ + ⋯ + Xₙ − nμ)/√(nσ²) tende in distribuzione a N(0,1): P(Sₙ ≤ a) ≈ Φ((a − nμ)/√(nσ²)) per n grande, qualunque sia la legge delle Xᵢ (servono indipendenza e stessa legge). Per la media campionaria: media μ, varianza σ²/n. Casi particolari: B(n,p) ≈ N(np, np(1−p)) per n grande; Po(λ) ≈ N(λ, λ) per λ ≥ 50. Per variabili a valori interi si usa la correzione di continuità: P(X ≤ k) ≈ P(Y ≤ k + 0.5), P(X = k) ≈ P(k − 0.5 ≤ Y ≤ k + 0.5).Teorema centrale del limite e correzione di continuità → dice quanto velocemente: le fluttuazioni di Xˉn\bar X_n attorno a μ\mu sono dell'ordine di σn\frac{\sigma}{\sqrt n} e hanno forma gaussiana. Per stimare pp con un errore di 0.010.01 servono quindi migliaia di lanci (vedi l'esercizio).

Esercizi: Esercizio 61 · Markov, Chebyshev e stima di una frequenza.

Errori comuni

  • Applicare Markov a variabili che possono essere negative.
  • Confondere la stima di Chebyshev con il valore esatto: è solo una maggiorazione.
  • Interpretare la legge dei grandi numeri come "compensazione": dopo molte teste la croce non diventa più probabile (i lanci sono indipendenti); è la media che si stabilizza, perché i primi lanci pesano sempre meno.

Esercizi su questo argomento

Lezioni in cui compare

Teoria collegata