Spesso di una v.a. si conoscono solo la media e la varianza, non la legge intera. Queste disuguaglianze danno comunque limitazioni garantite su probabilità come "X è molto grande" o "X è lontana dalla media", valide per qualunque legge. Il prezzo è che sono stime grossolane: dicono "al massimo tanto", non "circa tanto".
Disuguaglianza di Markov
Sia X≥0 una v.a. con media finita. Per ogni a>0:
P(X≥a)≤aE[X].
Dimostrazione. Si confrontano due v.a.: X e a1{X≥a} (vale a se X≥a, 0 altrimenti). Per ogni esito:
se X(ω)≥a: a1{X≥a}(ω)=a≤X(ω);
se X(ω)<a: a1{X≥a}(ω)=0≤X(ω), perché X≥0 (qui serve l'ipotesi).
Significato. Una v.a. positiva non può essere spesso molto più grande della sua media: la probabilità di superare k volte la media è al massimo k1. Se il tempo medio di attesa a uno sportello è 10 minuti, la probabilità di aspettare almeno un'ora è ≤6010=61, qualunque sia la legge del tempo d'attesa.
Senza X≥0 è falsa.X=−100 con probabilità 21 e X=100 con probabilità 21: E[X]=0, ma P(X≥1)=21, mentre Markov darebbe P(X≥1)≤1E[X]=0. Il passaggio della dimostrazione che salta è "0≤X(ω)" quando X(ω)<a.
Variante con i momenti. Applicando Markov alla v.a. positiva ∣X∣k e osservando che {∣X∣≥a}={∣X∣k≥ak}:
P(∣X∣≥a)≤akE[∣X∣k].
Disuguaglianza di Chebyshev
Sia X con E[X2]<∞, μ=E[X]. Per ogni ε>0:
P(∣X−μ∣≥ε)≤ε2Var(X).
Dimostrazione.∣X−μ∣≥ε se e solo se (X−μ)2≥ε2 (entrambi i membri sono positivi, e il quadrato è crescente sui positivi). La v.a. (X−μ)2 è ≥0: si applica Markov con a=ε2:
P(∣X−μ∣≥ε)=P((X−μ)2≥ε2)≤ε2E[(X−μ)2]=ε2Var(X).∎
Forma con le deviazioni standard. Con ε=kσ (σ=Var(X), k>0):
P(∣X−μ∣≥kσ)≤k21,P(∣X−μ∣<kσ)≥1−k21.
k
1
2
3
4
10
almeno questa probabilità entro kσ dalla media
0 (nessuna informazione)
75%
≈88,9%
93,75%
99%
Per qualunque v.a. con varianza finita, almeno il 75% della probabilità sta entro 2 deviazioni standard dalla media.
Esempio numerico.X∼Bin(100,21): μ=50, Var(X)=25. Chebyshev:
P(∣X−50∣≥10)≤10025=0,25.
Valore vero (calcolato in Python sommando la densità binomiale): ≈0,0569. Di nuovo corretto ma largo: Chebyshev usa solo media e varianza.
Esempio: quante prove servono. Si lancia n volte una moneta equa e si guarda la frequenza di teste Xˉn=nX, con X∼Bin(n,21). Si ha E[Xˉn]=21 e Var(Xˉn)=n21⋅4n=4n1. Per avere la frequenza entro 0,05 da 21 con probabilità almeno 95% basta che
Il bound ε2Var=4nε21 tende a 0 per n→∞: è esattamente la dimostrazione della legge debole dei grandi numeri.
Disuguaglianza di Jensen
Sia φ:R→Rconvessa e X tale che X e φ(X) abbiano media finita. Allora
φ(E[X])≤E[φ(X)].
Se φ è concava la disuguaglianza si rovescia: φ(E[X])≥E[φ(X)].
Dimostrazione. Una funzione convessa sta sopra ogni sua retta di appoggioUna retta che tocca il grafico di una funzione convessa in un punto e resta tutta sotto il grafico; se la funzione è derivabile è la retta tangente.: posto μ=E[X], esiste m∈R (se φ è derivabile, m=φ′(μ)) tale che
φ(x)≥φ(μ)+m(x−μ)per ogni x.
Si sostituisce x con X e si prende la media (monotonia e linearità):
E[φ(X)]≥φ(μ)+mE[X−μ]=φ(μ)+m⋅0=φ(E[X]).∎
Per φ concava, −φ è convessa e si applica il caso precedente.
Esempi.
φ
tipo
Jensen dice
x2
convessa
E[X]2≤E[X2] (cioè Var(X)≥0)
∣x∣
convessa
∣E[X]∣≤E[∣X∣]
ex
convessa
eE[X]≤E[eX]
x1 su (0,∞)
convessa
E[X]1≤E[X1] per X>0
logx su (0,∞)
concava
E[logX]≤logE[X] per X>0
(Per φ definita solo su un intervallo, come x1 e logx, il teorema vale purché X prenda valori in quell'intervallo.)
Controllo su un esercizio d'esame. Nel III appello 24.06.2026, X∼Geo(21) e W=(23)X, con E[W]=3. La funzione φ(x)=(23)x è convessa (esponenziale), quindi deve valere E[W]≥(23)E[X]=(23)2=2,25: infatti 3≥2,25 ✓. Se un calcolo desse E[W]<2,25, ci sarebbe sicuramente un errore.
Quando vale l'uguaglianza. Se φ è affine (allora è la linearità della media) oppure se X è costante. Per φ strettamente convessa e X non costante la disuguaglianza è stretta.
Riepilogo
Disuguaglianza
Ipotesi
Enunciato
Si usa per
Markov
X≥0, a>0
P(X≥a)≤aE[X]
code di v.a. positive
Chebyshev
varianza finita, ε>0
P(∣X−μ∣≥ε)≤ε2Var(X)
scostamenti dalla media, legge dei grandi numeri
Jensen
φ convessa
φ(E[X])≤E[φ(X)]
confrontare E[φ(X)] con φ(E[X])
Errori comuni
Usare Markov su una v.a. che può essere negativa: l'ipotesi X≥0 è essenziale.
Scambiare le stime per approssimazioni: 0,25 è un limite superiore, la probabilità vera può essere molto più piccola (0,057 nell'esempio).
Chebyshev con ε≤σ: il secondo membro è ≥1 e la disuguaglianza non dice nulla.
Verso di Jensen: per le convesse la media "esterna" è più piccola, φ(E[X])≤E[φ(X)]; un modo per ricordarlo è φ(x)=x2, che dà Var(X)≥0.