Salta al contenuto
Note per Studenti Valore atteso

Valore atteso

In questa pagina 7

Punto 2 del programma ("valore medio: definizione e interpretazione; teorema fondamentale del valor medio e sue proprietà"). Prerequisiti: Variabili aleatorie discrete e densità discretaUna variabile aleatoria discreta è una funzione X da Ω in R che assume un insieme finito o numerabile di valori (l'alfabeto); la sua densità discreta p_X(x) = P(X = x) basta a calcolare la probabilità di ogni evento che riguarda X.Variabili aleatorie discrete e densità discreta →. Seguito: Varianza e momentiI momenti E[X^k] e i momenti centrati E[(X − μ)^k] descrivono la forma di una legge; la varianza Var(X) = E[(X − μ)²] = E[X²] − E[X]² misura quanto X si disperde attorno alla media, vale Var(aX + b) = a² Var(X) e Var(X) = 0 solo se X è costante.Varianza e momenti →. Per le v.a. continue la somma diventa un integrale: Variabili aleatorie assolutamente continue.

L'idea: la media su tante ripetizioni

Si gioca molte volte al gioco dell'urna (2 estrazioni con reinserimento da 8 nere e 6 bianche, +2 euro per nera, −1 per bianca). Dopo NN partite si calcola la vincita media:

somma delle vinciteN=∑xx⋅#{partite con vincita x}N.\frac{\text{somma delle vincite}}{N} = \sum_{x} x \cdot \frac{\#\{\text{partite con vincita } x\}}{N}.

La frazione #{partite con vincita x}N\frac{\#\{\text{partite con vincita } x\}}{N} è la frequenza relativa del valore xx, e per NN grande si avvicina a pX(x)p_X(x) (lo dimostra la legge dei grandi numeri). La vincita media si avvicina quindi a ∑xx pX(x)\sum_x x \, p_X(x): è questo numero che si chiama valore atteso. Risponde alla domanda "quanto vinco in media a partita, nel lungo periodo?".

Un'immagine fisica: si mettono masse pX(x)p_X(x) nei punti xx della retta; E[X]E[X] è il baricentro, il punto in cui la retta resta in equilibrio.

Definizione

Sia XX una v.a. discreta con densità pXp_X. Se ∑x∈XX∣x∣ pX(x)<+∞,\sum_{x \in \mathcal X_X} |x| \, p_X(x) < +\infty, si dice che XX ha valore atteso (o media, o speranza matematica) finito, e si pone E[X]:=∑x∈XXx pX(x).E[X] := \sum_{x \in \mathcal X_X} x \, p_X(x).

Perché la convergenza assoluta. Se l'alfabeto è infinito, la somma è una serie e i suoi termini non hanno un ordine naturale (l'alfabeto è un insieme, non una lista). Una serie assolutamente convergenteUna serie la cui serie dei moduli converge: la sua somma non dipende dall'ordine in cui si sommano i termini. dà lo stesso risultato in qualunque ordine si sommino i termini; senza convergenza assoluta riordinando si potrebbero ottenere risultati diversi, e "la media" non sarebbe ben definita.

  • Se l'alfabeto è finito la condizione è sempre vera: ogni v.a. discreta finita ha media.
  • Se X≥0X \ge 0 la somma ha senso sempre, eventualmente +∞+\infty: si scrive E[X]=+∞E[X] = +\infty.
  • E[X]E[X] non è necessariamente un valore di XX: per il dado E[X]=3,5E[X] = 3{,}5.

Esempi

  1. Bernoulli Be(p)\text{Be}(p): E[X]=0⋅(1−p)+1⋅p=pE[X] = 0 \cdot (1 - p) + 1 \cdot p = p. In particolare, per un evento AA, E[1A]=P(A)E[\mathbb 1_A] = P(A): la probabilità è un caso particolare di media.
  2. Dado: E[X]=1+2+⋯+66=216=3,5E[X] = \frac{1 + 2 + \dots + 6}{6} = \frac{21}{6} = 3{,}5.
  3. Vincita all'urna (pX(−2)=949p_X(-2) = \frac9{49}, pX(1)=2449p_X(1) = \frac{24}{49}, pX(4)=1649p_X(4) = \frac{16}{49}, vedi Variabili aleatorie discrete e densità discretaUna variabile aleatoria discreta è una funzione X da Ω in R che assume un insieme finito o numerabile di valori (l'alfabeto); la sua densità discreta p_X(x) = P(X = x) basta a calcolare la probabilità di ogni evento che riguarda X.Variabili aleatorie discrete e densità discreta →): E[X]=−2⋅949+1⋅2449+4⋅1649=−18+24+6449=7049=107≈1,43 euro.E[X] = -2 \cdot \frac{9}{49} + 1 \cdot \frac{24}{49} + 4 \cdot \frac{16}{49} = \frac{-18 + 24 + 64}{49} = \frac{70}{49} = \frac{10}{7} \approx 1{,}43 \text{ euro}. Il gioco è favorevole: in media si guadagnano circa 1,43 euro a partita.
  4. Una media infinita. pX(n)=1n(n+1)p_X(n) = \frac{1}{n(n + 1)} per n≥1n \ge 1 è una densità: 1n(n+1)=1n−1n+1\frac{1}{n(n+1)} = \frac1n - \frac1{n + 1} e la somma è telescopicaNella somma dei termini (1/n − 1/(n+1)) quasi tutti si cancellano a due a due e resta 1 − 1/(N+1), che tende a 1. e vale 11. Ma ∑n=1∞n⋅1n(n+1)=∑n=1∞1n+1=+∞\sum_{n = 1}^\infty n \cdot \frac{1}{n(n + 1)} = \sum_{n = 1}^\infty \frac{1}{n + 1} = +\infty (serie armonica). XX assume valori finiti, ma la sua media è +∞+\infty: i valori grandi sono abbastanza probabili da far divergere la media.

Teorema fondamentale del valor medio

Spesso serve la media di una funzione di XX: E[X2]E[X^2], E[(3/2)X]E[(3/2)^X], E[eiθX]E[e^{i\theta X}]… Si potrebbe prima trovare la densità di Y=g(X)Y = g(X) e poi applicare la definizione, ma non serve:

Teorema. Sia XX discreta e g:R→Rg : \mathbb R \to \mathbb R. Allora Y=g(X)Y = g(X) ha media finita se e solo se ∑x∣g(x)∣ pX(x)<∞\sum_x |g(x)| \, p_X(x) < \infty, e in tal caso E[g(X)]=∑x∈XXg(x) pX(x).E[g(X)] = \sum_{x \in \mathcal X_X} g(x) \, p_X(x).

Dimostrazione. La densità di YY è pY(y)=∑x:g(x)=ypX(x)p_Y(y) = \sum_{x : g(x) = y} p_X(x) (densità di una funzione di v.a.Una variabile aleatoria discreta è una funzione X da Ω in R che assume un insieme finito o numerabile di valori (l'alfabeto); la sua densità discreta p_X(x) = P(X = x) basta a calcolare la probabilità di ogni evento che riguarda X.Variabili aleatorie discrete e densità discreta →). Allora

E[Y]=∑yy pY(y)=∑yy∑x:g(x)=ypX(x)=∑y∑x:g(x)=yg(x) pX(x)=∑xg(x) pX(x).E[Y] = \sum_y y \, p_Y(y) = \sum_y y \sum_{x : g(x) = y} p_X(x) = \sum_y \sum_{x : g(x) = y} g(x) \, p_X(x) = \sum_x g(x) \, p_X(x).

Nel terzo passaggio si è sostituito yy con g(x)g(x) (sono uguali in ogni termine della somma interna); nell'ultimo si è osservato che raggruppare gli xx secondo il valore di g(x)g(x) e poi sommare sui gruppi equivale a sommare su tutti gli xx (lecito grazie alla convergenza assoluta, che permette di riordinare). ∎

In parole: si pesa ogni valore g(x)g(x) con la probabilità di xx, senza calcolare la legge di g(X)g(X).

Esempio (III appello 24.06.2026). X∼Geo(12)X \sim \text{Geo}(\frac12), cioè pX(n)=12np_X(n) = \frac1{2^n} per n≥1n \ge 1, e W=(32)XW = \left(\frac32\right)^X:

E[W]=∑n=1∞(32)n12n=∑n=1∞(34)n=3/41−3/4=3.E[W] = \sum_{n = 1}^\infty \left(\frac32\right)^n \frac{1}{2^n} = \sum_{n = 1}^\infty \left(\frac34\right)^n = \frac{3/4}{1 - 3/4} = 3.

Attenzione: in generale E[g(X)]≠g(E[X])E[g(X)] \ne g(E[X]). Nell'esempio E[X]=2E[X] = 2 e g(E[X])=(32)2=2,25≠3g(E[X]) = \left(\frac32\right)^2 = 2{,}25 \ne 3. L'uguaglianza vale per gg affine (proprietà sotto); per gg convessa vale la disuguaglianza di JensenMarkov: per X ≥ 0, P(X ≥ a) ≤ E[X]/a; Chebyshev: P(|X − μ| ≥ ε) ≤ Var(X)/ε²; Jensen: per φ convessa, φ(E[X]) ≤ E[φ(X)]. Stimano probabilità e medie conoscendo solo media e varianza.Disuguaglianze di Markov, Chebyshev e Jensen → g(E[X])≤E[g(X)]g(E[X]) \le E[g(X)].

Versione sugli esiti. Se Ω\Omega è discreto, lo stesso ragionamento (raggruppare gli esiti secondo il valore di XX) dà E[X]=∑ω∈ΩX(ω) P({ω}),E[X] = \sum_{\omega \in \Omega} X(\omega) \, P(\{\omega\}), utile per dimostrare le proprietà.

Proprietà

  1. Costanti: E[c]=cE[c] = c.
  2. Linearità: E[aX+b]=aE[X]+bE[aX + b] = aE[X] + b, e più in generale E[aX+bY]=aE[X]+bE[Y]E[aX + bY] = aE[X] + bE[Y] per v.a. X,YX, Y con media finita (definite sullo stesso spazio), anche non indipendenti.
  3. Positività e monotonia: se X≥0X \ge 0 allora E[X]≥0E[X] \ge 0; se X≤YX \le Y allora E[X]≤E[Y]E[X] \le E[Y].
  4. Indicatrici: E[1A]=P(A)E[\mathbb 1_A] = P(A).

Dimostrazioni (caso Ω\Omega discreto, con la versione sugli esiti):

  • E[aX+bY]=∑ω(aX(ω)+bY(ω))P({ω})=a∑ωX(ω)P({ω})+b∑ωY(ω)P({ω})=aE[X]+bE[Y]E[aX + bY] = \sum_\omega (aX(\omega) + bY(\omega)) P(\{\omega\}) = a \sum_\omega X(\omega)P(\{\omega\}) + b\sum_\omega Y(\omega) P(\{\omega\}) = aE[X] + bE[Y]: è la linearità della somma (la convergenza assoluta permette di spezzarla). Con Y=1Y = 1 (costante) si ottiene E[aX+b]=aE[X]+bE[aX + b] = aE[X] + b.
  • Se X≥0X \ge 0, tutti i termini X(ω)P({ω})X(\omega)P(\{\omega\}) sono ≥0\ge 0 e la somma pure. Se X≤YX \le Y, applicando questo a Y−X≥0Y - X \ge 0 e usando la linearità: E[Y]−E[X]=E[Y−X]≥0E[Y] - E[X] = E[Y - X] \ge 0.

Esempio d'esame. (I parziale 17.11.2025.) Vincita X=3Y−2X = 3Y - 2 con Y∼Bin(2,47)Y \sim \text{Bin}(2, \frac47), E[Y]=2⋅47=87E[Y] = 2 \cdot \frac47 = \frac87. Per linearità, senza ricalcolare nulla:

E[X]=3E[Y]−2=247−2=107, come nel calcolo diretto.E[X] = 3 E[Y] - 2 = \frac{24}{7} - 2 = \frac{10}{7}, \ \text{come nel calcolo diretto.}

La linearità rende facili medie difficili. Numero medio di 6 in 10 lanci di un dado: X=1A1+⋯+1A10X = \mathbb 1_{A_1} + \dots + \mathbb 1_{A_{10}} con Ai=A_i = "il lancio ii dà 6", quindi E[X]=10⋅16=53E[X] = 10 \cdot \frac16 = \frac53. Non serve né la densità di XX né l'indipendenza dei lanci (è la stessa idea della media della binomialeBernoulli Be(p): un solo tentativo, vale 1 con probabilità p; binomiale Bin(n, p): numero di successi in n prove indipendenti, P(X = k) = C(n,k) p^k (1−p)^(n−k), media np e varianza np(1−p); uniforme discreta: n valori equiprobabili.Bernoulli, binomiale e uniforme discreta →).

Prodotto. In generale E[XY]≠E[X]E[Y]E[XY] \ne E[X]E[Y]; l'uguaglianza vale se XX e YY sono indipendenti (Vettori aleatori discreti, Covarianza e coefficiente di correlazione).

Formula delle code (v.a. a valori interi non negativi)

Se XX assume valori in {0,1,2,… }\{0, 1, 2, \dots\}: E[X]=∑n=0∞P(X>n).E[X] = \sum_{n = 0}^\infty P(X > n).

Perché. Si scrive k=∑n=0k−11k = \sum_{n = 0}^{k - 1} 1 (il numero kk è la somma di kk uni) e si scambiano le somme (termini positivi, lecito):

E[X]=∑k=1∞k pX(k)=∑k=1∞∑n=0k−1pX(k)=∑n=0∞∑k=n+1∞pX(k)=∑n=0∞P(X>n).E[X] = \sum_{k = 1}^\infty k \, p_X(k) = \sum_{k = 1}^\infty \sum_{n = 0}^{k - 1} p_X(k) = \sum_{n = 0}^\infty \sum_{k = n + 1}^\infty p_X(k) = \sum_{n = 0}^\infty P(X > n).

Esempio: per X∼Geo(p)X \sim \text{Geo}(p), P(X>n)=(1−p)nP(X > n) = (1 - p)^n e quindi E[X]=∑n≥0(1−p)n=1pE[X] = \sum_{n \ge 0} (1 - p)^n = \frac1p, senza derivare serie (Distribuzione geometricaGeo(p) è il numero della prova in cui arriva il primo successo in prove indipendenti: P(X = n) = (1−p)^(n−1) p per n ≥ 1, P(X > n) = (1−p)^n (lunga attesa), media 1/p, varianza (1−p)/p², ed è senza memoria.Distribuzione geometrica →).

Cosa Formula
definizione E[X]=∑xx pX(x)E[X] = \sum_x x \, p_X(x), se ∑x∣x∣pX(x)<∞\sum_x \lvert x \rvert p_X(x) < \infty
funzione di XX E[g(X)]=∑xg(x) pX(x)E[g(X)] = \sum_x g(x) \, p_X(x)
linearità E[aX+bY+c]=aE[X]+bE[Y]+cE[aX + bY + c] = aE[X] + bE[Y] + c
indicatrice E[1A]=P(A)E[\mathbb 1_A] = P(A)
code E[X]=∑n≥0P(X>n)E[X] = \sum_{n \ge 0} P(X > n) per X∈NX \in \mathbb N
medie notevoli Be(p)\text{Be}(p): pp; Bin(n,p)\text{Bin}(n,p): npnp; Geo(p)\text{Geo}(p): 1p\frac1p; Poi(λ)\text{Poi}(\lambda): λ\lambda

Errori comuni

  • E[g(X)]=g(E[X])E[g(X)] = g(E[X]): falso in generale (E[X2]≠E[X]2E[X^2] \ne E[X]^2, E[1/X]≠1/E[X]E[1/X] \ne 1/E[X]); vale solo per gg affine.
  • Credere che la linearità richieda l'indipendenza: E[X+Y]=E[X]+E[Y]E[X + Y] = E[X] + E[Y] vale sempre; è E[XY]=E[X]E[Y]E[XY] = E[X]E[Y] che la richiede.
  • Calcolare la densità di g(X)g(X) quando non serve: per la media basta il teorema fondamentale.
  • Dimenticare di controllare la convergenza con alfabeti infiniti: la media può essere infinita.

Teoria collegata