Salta al contenuto
Note per Studenti Disuguaglianze di Markov, Chebyshev e Jensen

Disuguaglianze di Markov, Chebyshev e Jensen

In questa pagina 6

Punto 2 del programma ("disuguaglianze di probabilità"). Prerequisiti: Valore attesoIl valore atteso E[X] = Σ x p_X(x) è la media dei valori di X pesata con le loro probabilità (esiste se la serie converge assolutamente); per una funzione g vale E[g(X)] = Σ g(x) p_X(x) senza trovare la legge di g(X), ed E è lineare: E[aX + bY + c] = aE[X] + bE[Y] + c.Valore atteso →, Varianza e momentiI momenti E[X^k] e i momenti centrati E[(X − μ)^k] descrivono la forma di una legge; la varianza Var(X) = E[(X − μ)²] = E[X²] − E[X]² misura quanto X si disperde attorno alla media, vale Var(aX + b) = a² Var(X) e Var(X) = 0 solo se X è costante.Varianza e momenti →. Valgono identiche per le v.a. continue (Variabili aleatorie assolutamente continue) e servono a dimostrare la legge dei grandi numeri.

A cosa servono

Spesso di una v.a. si conoscono solo la media e la varianza, non la legge intera. Queste disuguaglianze danno comunque limitazioni garantite su probabilità come "XX è molto grande" o "XX è lontana dalla media", valide per qualunque legge. Il prezzo è che sono stime grossolane: dicono "al massimo tanto", non "circa tanto".

Disuguaglianza di Markov

Sia X≥0X \ge 0 una v.a. con media finita. Per ogni a>0a > 0: P(X≥a)≤E[X]a.P(X \ge a) \le \frac{E[X]}{a}.

Dimostrazione. Si confrontano due v.a.: XX e a 1{X≥a}a \, \mathbb 1_{\{X \ge a\}} (vale aa se X≥aX \ge a, 00 altrimenti). Per ogni esito:

  • se X(ω)≥aX(\omega) \ge a: a 1{X≥a}(ω)=a≤X(ω)a \, \mathbb 1_{\{X \ge a\}}(\omega) = a \le X(\omega);
  • se X(ω)<aX(\omega) < a: a 1{X≥a}(ω)=0≤X(ω)a \, \mathbb 1_{\{X \ge a\}}(\omega) = 0 \le X(\omega), perché X≥0X \ge 0 (qui serve l'ipotesi).

Quindi a 1{X≥a}≤Xa \, \mathbb 1_{\{X \ge a\}} \le X. Per la monotonia e linearità della mediaSe Y ≤ X allora la media di Y è al più quella di X; le costanti escono dalla media; la media di un'indicatrice è la probabilità dell'evento.Valore atteso →:

a P(X≥a)=E[a 1{X≥a}]≤E[X]⇒P(X≥a)≤E[X]a. ∎a \, P(X \ge a) = E[a \, \mathbb 1_{\{X \ge a\}}] \le E[X] \quad \Rightarrow \quad P(X \ge a) \le \frac{E[X]}{a}. \ ∎

Significato. Una v.a. positiva non può essere spesso molto più grande della sua media: la probabilità di superare kk volte la media è al massimo 1k\frac1k. Se il tempo medio di attesa a uno sportello è 10 minuti, la probabilità di aspettare almeno un'ora è ≤1060=16\le \frac{10}{60} = \frac16, qualunque sia la legge del tempo d'attesa.

Esempio numerico. X∼Geo(12)X \sim \text{Geo}(\frac12), E[X]=2E[X] = 2. Markov: P(X≥4)≤24=0,5P(X \ge 4) \le \frac24 = 0{,}5. Valore vero: P(X≥4)=P(X>3)=(12)3=0,125P(X \ge 4) = P(X > 3) = \left(\frac12\right)^3 = 0{,}125 (Distribuzione geometricaGeo(p) è il numero della prova in cui arriva il primo successo in prove indipendenti: P(X = n) = (1−p)^(n−1) p per n ≥ 1, P(X > n) = (1−p)^n (lunga attesa), media 1/p, varianza (1−p)/p², ed è senza memoria.Distribuzione geometrica →). La stima è corretta ma larga.

Senza X≥0X \ge 0 è falsa. X=−100X = -100 con probabilità 12\frac12 e X=100X = 100 con probabilità 12\frac12: E[X]=0E[X] = 0, ma P(X≥1)=12P(X \ge 1) = \frac12, mentre Markov darebbe P(X≥1)≤E[X]1=0P(X \ge 1) \le \frac{E[X]}{1} = 0. Il passaggio della dimostrazione che salta è "0≤X(ω)0 \le X(\omega)" quando X(ω)<aX(\omega) < a.

Variante con i momenti. Applicando Markov alla v.a. positiva ∣X∣k|X|^k e osservando che {∣X∣≥a}={∣X∣k≥ak}\{|X| \ge a\} = \{|X|^k \ge a^k\}:

P(∣X∣≥a)≤E[∣X∣k]ak.P(|X| \ge a) \le \frac{E[|X|^k]}{a^k}.

Disuguaglianza di Chebyshev

Sia XX con E[X2]<∞E[X^2] < \infty, μ=E[X]\mu = E[X]. Per ogni ε>0\varepsilon > 0: P(∣X−μ∣≥ε)≤Var(X)ε2.P(|X - \mu| \ge \varepsilon) \le \frac{\text{Var}(X)}{\varepsilon^2}.

Dimostrazione. ∣X−μ∣≥ε|X - \mu| \ge \varepsilon se e solo se (X−μ)2≥ε2(X - \mu)^2 \ge \varepsilon^2 (entrambi i membri sono positivi, e il quadrato è crescente sui positivi). La v.a. (X−μ)2(X - \mu)^2 è ≥0\ge 0: si applica Markov con a=ε2a = \varepsilon^2:

P(∣X−μ∣≥ε)=P((X−μ)2≥ε2)≤E[(X−μ)2]ε2=Var(X)ε2. ∎P(|X - \mu| \ge \varepsilon) = P\big((X - \mu)^2 \ge \varepsilon^2\big) \le \frac{E[(X - \mu)^2]}{\varepsilon^2} = \frac{\text{Var}(X)}{\varepsilon^2}. \ ∎

Forma con le deviazioni standard. Con ε=kσ\varepsilon = k\sigma (σ=Var(X)\sigma = \sqrt{\text{Var}(X)}, k>0k > 0):

P(∣X−μ∣≥kσ)≤1k2,P(∣X−μ∣<kσ)≥1−1k2.P(|X - \mu| \ge k\sigma) \le \frac{1}{k^2}, \qquad P(|X - \mu| < k\sigma) \ge 1 - \frac{1}{k^2}.

kk 11 22 33 44 1010
almeno questa probabilità entro kσk\sigma dalla media 00 (nessuna informazione) 75%75\% ≈88,9%\approx 88{,}9\% 93,75%93{,}75\% 99%99\%

Per qualunque v.a. con varianza finita, almeno il 75% della probabilità sta entro 2 deviazioni standard dalla media.

Esempio numerico. X∼Bin(100,12)X \sim \text{Bin}(100, \frac12): μ=50\mu = 50, Var(X)=25\text{Var}(X) = 25. Chebyshev:

P(∣X−50∣≥10)≤25100=0,25.P(|X - 50| \ge 10) \le \frac{25}{100} = 0{,}25.

Valore vero (calcolato in Python sommando la densità binomiale): ≈0,0569\approx 0{,}0569. Di nuovo corretto ma largo: Chebyshev usa solo media e varianza.

Esempio: quante prove servono. Si lancia nn volte una moneta equa e si guarda la frequenza di teste Xˉn=Xn\bar X_n = \frac{X}{n}, con X∼Bin(n,12)X \sim \text{Bin}(n, \frac12). Si ha E[Xˉn]=12E[\bar X_n] = \frac12 e Var(Xˉn)=1n2⋅n4=14n\text{Var}(\bar X_n) = \frac{1}{n^2} \cdot \frac n4 = \frac{1}{4n}. Per avere la frequenza entro 0,050{,}05 da 12\frac12 con probabilità almeno 95%95\% basta che

P(∣Xˉn−12∣≥0,05)≤1/(4n)0,052=100n≤0,05  ⟺  n≥2000.P\left(\left|\bar X_n - \tfrac12\right| \ge 0{,}05\right) \le \frac{1/(4n)}{0{,}05^2} = \frac{100}{n} \le 0{,}05 \iff n \ge 2000.

Il bound Varε2=14nε2\frac{\text{Var}}{\varepsilon^2} = \frac{1}{4n\varepsilon^2} tende a 00 per n→∞n \to \infty: è esattamente la dimostrazione della legge debole dei grandi numeri.

Disuguaglianza di Jensen

Sia φ:R→R\varphi : \mathbb R \to \mathbb R convessa e XX tale che XX e φ(X)\varphi(X) abbiano media finita. Allora φ(E[X])≤E[φ(X)].\varphi(E[X]) \le E[\varphi(X)]. Se φ\varphi è concava la disuguaglianza si rovescia: φ(E[X])≥E[φ(X)]\varphi(E[X]) \ge E[\varphi(X)].

Dimostrazione. Una funzione convessa sta sopra ogni sua retta di appoggioUna retta che tocca il grafico di una funzione convessa in un punto e resta tutta sotto il grafico; se la funzione è derivabile è la retta tangente.: posto μ=E[X]\mu = E[X], esiste m∈Rm \in \mathbb R (se φ\varphi è derivabile, m=φ′(μ)m = \varphi'(\mu)) tale che

φ(x)≥φ(μ)+m(x−μ)per ogni x.\varphi(x) \ge \varphi(\mu) + m(x - \mu) \qquad \text{per ogni } x.

Si sostituisce xx con XX e si prende la media (monotonia e linearità):

E[φ(X)]≥φ(μ)+m E[X−μ]=φ(μ)+m⋅0=φ(E[X]). ∎E[\varphi(X)] \ge \varphi(\mu) + m \, E[X - \mu] = \varphi(\mu) + m \cdot 0 = \varphi(E[X]). \ ∎

Per φ\varphi concava, −φ-\varphi è convessa e si applica il caso precedente.

Esempi.

φ\varphi tipo Jensen dice
x2x^2 convessa E[X]2≤E[X2]E[X]^2 \le E[X^2] (cioè Var(X)≥0\text{Var}(X) \ge 0)
∣x∣\lvert x \rvert convessa ∣E[X]∣≤E[∣X∣]\lvert E[X] \rvert \le E[\lvert X \rvert]
exe^{x} convessa eE[X]≤E[eX]e^{E[X]} \le E[e^X]
1x\frac1x su (0,∞)(0, \infty) convessa 1E[X]≤E[1X]\frac{1}{E[X]} \le E\left[\frac1X\right] per X>0X > 0
log⁡x\log x su (0,∞)(0, \infty) concava E[log⁡X]≤log⁡E[X]E[\log X] \le \log E[X] per X>0X > 0

(Per φ\varphi definita solo su un intervallo, come 1x\frac1x e log⁡x\log x, il teorema vale purché XX prenda valori in quell'intervallo.)

Controllo su un esercizio d'esame. Nel III appello 24.06.2026, X∼Geo(12)X \sim \text{Geo}(\frac12) e W=(32)XW = \left(\frac32\right)^X, con E[W]=3E[W] = 3. La funzione φ(x)=(32)x\varphi(x) = \left(\frac32\right)^x è convessa (esponenziale), quindi deve valere E[W]≥(32)E[X]=(32)2=2,25E[W] \ge \left(\frac32\right)^{E[X]} = \left(\frac32\right)^2 = 2{,}25: infatti 3≥2,253 \ge 2{,}25 ✓. Se un calcolo desse E[W]<2,25E[W] < 2{,}25, ci sarebbe sicuramente un errore.

Quando vale l'uguaglianza. Se φ\varphi è affine (allora è la linearità della media) oppure se XX è costante. Per φ\varphi strettamente convessa e XX non costante la disuguaglianza è stretta.

Disuguaglianza Ipotesi Enunciato Si usa per
Markov X≥0X \ge 0, a>0a > 0 P(X≥a)≤E[X]aP(X \ge a) \le \frac{E[X]}{a} code di v.a. positive
Chebyshev varianza finita, ε>0\varepsilon > 0 P(∣X−μ∣≥ε)≤Var(X)ε2P(\lvert X - \mu \rvert \ge \varepsilon) \le \frac{\text{Var}(X)}{\varepsilon^2} scostamenti dalla media, legge dei grandi numeri
Jensen φ\varphi convessa φ(E[X])≤E[φ(X)]\varphi(E[X]) \le E[\varphi(X)] confrontare E[φ(X)]E[\varphi(X)] con φ(E[X])\varphi(E[X])

Errori comuni

  • Usare Markov su una v.a. che può essere negativa: l'ipotesi X≥0X \ge 0 è essenziale.
  • Scambiare le stime per approssimazioni: 0,250{,}25 è un limite superiore, la probabilità vera può essere molto più piccola (0,0570{,}057 nell'esempio).
  • Chebyshev con ε≤σ\varepsilon \le \sigma: il secondo membro è ≥1\ge 1 e la disuguaglianza non dice nulla.
  • Verso di Jensen: per le convesse la media "esterna" è più piccola, φ(E[X])≤E[φ(X)]\varphi(E[X]) \le E[\varphi(X)]; un modo per ricordarlo è φ(x)=x2\varphi(x) = x^2, che dà Var(X)≥0\text{Var}(X) \ge 0.

Teoria collegata