Salta al contenuto
Note per Studenti Valore atteso di variabili discrete

Valore atteso di variabili discrete

In questa pagina 6

Lezione 6 di probabilità, Unità 1-2. Prerequisiti: Variabili binomiale e geometricaIn n prove di Bernoulli indipendenti con successo di probabilità p, il numero di successi X ~ B(n,p) ha P(X = k) = C(n,k) pᵏ(1−p)ⁿ⁻ᵏ, k = 0,…,n; equivalentemente X è somma di n Bernoulli Be(p) indipendenti. Senza indipendenza (estrazioni senza reimmissione) la somma non è binomiale (legge ipergeometrica). Il numero di prove fino al primo successo X ~ Ge(p) ha P(X = k) = p(1−p)ᵏ⁻¹, k ≥ 1, e P(X > k) = (1−p)ᵏ; è senza memoria: P(X > k+m | X > k) = P(X > m) (i numeri ritardatari del lotto non sono "più probabili").Variabili binomiale e geometrica →, Variabile di Poisson e approssimazione della binomialeX ~ Po(λ), λ > 0, assume i valori 0, 1, 2, … con P(X = k) = e^{−λ} λᵏ/k!; λ è il numero medio di eventi. Nasce come limite della binomiale: se Xₙ ~ B(n, λ/n) allora P(Xₙ = k) → e^{−λ}λᵏ/k!. In pratica B(n,p) ≈ Po(np) se n è grande e p piccolo (regole del corso: n ≥ 20, p ≤ 0.05, p ≤ 10/n). Modella conteggi di eventi rari in un intervallo di tempo o spazio: telefonate, arrivi, terremoti, difetti, vincite.Variabile di Poisson e approssimazione della binomiale →.

La media pesata

Esempio del prof. Uno studente ha k1k_1 voti uguali a x1x_1, …, kmk_m voti uguali a xmx_m (k1+⋯+km=nk_1 + \cdots + k_m = n voti in tutto). La media è xˉ=k1x1+⋯+kmxmn=x1k1n+⋯+xmkmn\bar x = \frac{k_1x_1 + \cdots + k_mx_m}{n} = x_1\frac{k_1}{n} + \cdots + x_m\frac{k_m}n cioè la somma dei voti, ciascuno moltiplicato per la sua frequenza. Se XX è il voto di un esame scelto a caso, la frequenza di xix_i è P(X=xi)P(X = x_i), e xˉ=∑ixiP(X=xi)\bar x = \sum_i x_iP(X = x_i).

Definizione. Se XX è discreta con valori {xi:i∈I}\{x_i : i \in I\} (II finito o N\mathbb{N}), XX ha valore atteso finito se ∑i∣xi∣ pX(xi)<+∞\sum_i|x_i|\,p_X(x_i) < +\infty, e in tal caso il valore atteso (o media, o speranza) è E[X]:=∑i∈Ixi pX(xi)=∑ixi P(X=xi)E[X] := \sum_{i \in I}x_i\,p_X(x_i) = \sum_i x_i\,P(X = x_i)

Interpretazione fisica: se si mettono masse pX(xi)p_X(x_i) (di somma 11) nei punti xix_i della retta, E[X]E[X] è il baricentro. Dipende solo dai valori e dalla densità discreta, non dallo spazio Ω\Omega. La condizione di convergenza assoluta serve per i valori infiniti: garantisce che la somma non dipenda dall'ordine.

Esempio del prof. XX con valori −1,0,1-1, 0, 1 e probabilità 13,16,12\frac13, \frac16, \frac12: E[X]=−1⋅13+0⋅16+1⋅12=16E[X] = -1\cdot\frac13 + 0\cdot\frac16 + 1\cdot\frac12 = \frac16 Il valore atteso può non essere uno dei valori assunti.

I valori attesi delle variabili notevoli

Legge E[X]E[X]
Be⁡(p)\operatorname{Be}(p) pp
B(n,p)B(n, p) npnp
Po⁡(λ)\operatorname{Po}(\lambda) λ\lambda
Ge⁡(p)\operatorname{Ge}(p) 1p\frac1p
  • Bernoulli: E[X]=0⋅(1−p)+1⋅p=pE[X] = 0\cdot(1 - p) + 1\cdot p = p.
  • Poisson: il termine k=0k = 0 è nullo, e semplificando kk!=1(k−1)!\frac{k}{k!} = \frac{1}{(k-1)!}: E[X]=∑k≥1k e−λλkk!=λ e−λ∑k≥1λk−1(k−1)!=λ e−λeλ=λE[X] = \sum_{k \ge 1}k\,e^{-\lambda}\frac{\lambda^k}{k!} = \lambda\,e^{-\lambda}\sum_{k \ge 1}\frac{\lambda^{k-1}}{(k-1)!} = \lambda\,e^{-\lambda}e^{\lambda} = \lambda Il parametro della Poisson è proprio il numero medio di eventi.
  • Geometrica: E[X]=∑k≥1k p(1−p)k−1=p∑k≥1k qk−1E[X] = \sum_{k \ge 1}k\,p(1 - p)^{k-1} = p\sum_{k \ge 1}k\,q^{k-1} con q=1−pq = 1 - p, e ∑k≥1kqk−1=ddq∑k≥0qk=ddq11−q=1(1−q)2\sum_{k \ge 1}kq^{k-1} = \frac{d}{dq}\sum_{k \ge 0}q^k = \frac{d}{dq}\frac{1}{1 - q} = \frac{1}{(1 - q)^2} (si deriva la serie geometrica termine a termine, lecito per ∣q∣<1|q| < 1). Quindi E[X]=pp2=1pE[X] = \frac{p}{p^2} = \frac1p. Esempio del prof: per veder comparire il 55 lanciando un dado servono in media 11/6=6\frac{1}{1/6} = 6 lanci.
  • Binomiale: npnp, con la linearità (sotto).

Valore atteso di una funzione di XX

Proposizione. Se XX è discreta e g:R→Rg : \mathbb{R} \to \mathbb{R}, allora g(X)=g∘Xg(X) = g \circ X è una v.a. discreta e, se ∑x∣g(x)∣pX(x)<+∞\sum_x|g(x)|p_X(x) < +\infty, E[g(X)]=∑x∈Im⁡Xg(x) pX(x)E[g(X)] = \sum_{x \in \operatorname{Im}X}g(x)\,p_X(x)

Perché è comodo: non serve calcolare la densità di g(X)g(X); si pesano i valori g(x)g(x) con le probabilità dei valori xx di XX. (La dimostrazione raggruppa gli xx che hanno lo stesso g(x)g(x).)

Esempio del prof. Con la XX di prima, E[X2]E[X^2]:

  • con la definizione: X2X^2 vale 11 (se X=±1X = \pm1, probabilità 13+12=56\frac13 + \frac12 = \frac56) o 00 (probabilità 16\frac16), quindi E[X2]=56E[X^2] = \frac56;
  • con la proposizione: (−1)213+0216+1212=56(-1)^2\frac13 + 0^2\frac16 + 1^2\frac12 = \frac56 ✓.

Attenzione: E[X2]=56≠(E[X])2=136E[X^2] = \frac56 \ne (E[X])^2 = \frac1{36}. In generale E[g(X)]≠g(E[X])E[g(X)] \ne g(E[X]).

Corollario (linearità per le funzioni affini). E[aX+b]=a E[X]+bE[aX + b] = a\,E[X] + b.

Esempio del prof (l'assicurazione). Una compagnia incassa il premio cc e paga ss euro se un evento EE (di probabilità pp) si verifica entro l'anno. Con X=1X = 1 se EE si verifica (X∼Be⁡(p)X \sim \operatorname{Be}(p)), il profitto è c−sXc - sX, e E[profitto]=c−s pE[\text{profitto}] = c - s\,p Perché il profitto atteso sia il 10%10\% di ss: c−sp=0.1 sc - sp = 0.1\,s, cioè c=s(p+0.1)c = s(p + 0.1).

Valore atteso di una somma

Proposizione. Se X1,…,XmX_1, \dots, X_m hanno valore atteso finito, E[X1+⋯+Xm]=E[X1]+⋯+E[Xm]E[X_1 + \cdots + X_m] = E[X_1] + \cdots + E[X_m] senza bisogno di indipendenza.

Corollario. Se X∼B(n,p)X \sim B(n, p), E[X]=npE[X] = np.

Dimostrazione. XX ha la stessa legge di X1+⋯+XnX_1 + \cdots + X_n con Xi∼Be⁡(p)X_i \sim \operatorname{Be}(p), quindi E[X]=∑E[Xi]=npE[X] = \sum E[X_i] = np ∎ (il valore atteso dipende solo dalla legge).

I cappelli

Esempio del prof. 1010 persone lasciano il cappello all'ingresso; all'uscita ognuno ne prende uno a caso. Numero medio di persone che riprendono il proprio?

Sia Xi=1X_i = 1 se la persona ii riprende il suo cappello. Il cappello preso da ii è uniforme tra i 1010, quindi Xi∼Be⁡(110)X_i \sim \operatorname{Be}\left(\frac1{10}\right). Il numero di "fortunati" è X=X1+⋯+X10X = X_1 + \cdots + X_{10} e E[X]=10⋅110=1E[X] = 10\cdot\frac1{10} = 1 Le XiX_i non sono indipendenti (se 99 persone hanno il proprio cappello, anche la decima ce l'ha), ma per il valore atteso della somma non importa. Il risultato non dipende dal numero di persone: con nn persone è sempre n⋅1n=1n\cdot\frac1n = 1. Calcolare la legge di XX sarebbe molto più difficile.

Valore atteso di funzioni di più variabili e del prodotto

Proposizione. Se XX, YY sono discrete e g:R2→Rg : \mathbb{R}^2 \to \mathbb{R} (con la serie assolutamente convergente), E[g(X,Y)]=∑x,yg(x,y) P(X=x,Y=y)E[g(X, Y)] = \sum_{x, y}g(x, y)\,P(X = x, Y = y) In particolare E[XY]=∑x,yxy P(X=x,Y=y)E[XY] = \sum_{x, y}xy\,P(X = x, Y = y), e se XX, YY sono indipendenti E[XY]=E[X] E[Y]E[XY] = E[X]\,E[Y].

Dimostrazione del caso indipendente. P(X=x,Y=y)=P(X=x)P(Y=y)P(X = x, Y = y) = P(X = x)P(Y = y), e la somma doppia si fattorizza: ∑xx pX(x)⋅∑yy pY(y)\sum_x x\,p_X(x)\cdot\sum_y y\,p_Y(y) ∎.

L'indipendenza è essenziale. Con X=Y∼Be⁡(p)X = Y \sim \operatorname{Be}(p): E[XY]=E[X2]=E[X]=pE[XY] = E[X^2] = E[X] = p (perché X2=XX^2 = X per una variabile che vale 00 o 11), mentre E[X]E[Y]=p2≠pE[X]E[Y] = p^2 \ne p per p∈ ]0,1[p \in\, ]0, 1[.

Il seguito (varianza e covarianza) è in Varianza e covarianza di variabili discreteVar[X] = E[(X − μ)²] = E[X²] − μ² misura la dispersione attorno alla media μ = E[X]; σ = √Var è la deviazione standard. Var[aX + b] = a² Var[X]; la normalizzata (X − μ)/σ ha media 0 e varianza 1. Varianze notevoli: Be(p) → p(1−p), B(n,p) → np(1−p), Po(λ) → λ, Ge(p) → (1−p)/p². Cov[X,Y] = E[XY] − E[X]E[Y]; variabili indipendenti hanno covarianza nulla, ma non vale il viceversa (X uniforme su {−1,0,1} e X²). Var[X + Y] = Var X + Var Y + 2 Cov[X,Y]: per indipendenti le varianze si sommano.Varianza e covarianza di variabili discrete →. Esercizi: Esercizio 51 · valori attesi, varianze e i cappelli.

Errori comuni

  • Scrivere E[g(X)]=g(E[X])E[g(X)] = g(E[X]): vale solo per gg affine.
  • Pensare che la linearità richieda l'indipendenza: E[X+Y]=E[X]+E[Y]E[X + Y] = E[X] + E[Y] sempre; è E[XY]=E[X]E[Y]E[XY] = E[X]E[Y] che la richiede.
  • Confondere il valore atteso con il valore più probabile.

Esercizi su questo argomento

Lezioni in cui compare

Teoria collegata