Salta al contenuto
Note per Studenti Densità e media condizionata

Densità e media condizionata

In questa pagina 9

Punto 5 del programma ("densità e media condizionata di v.a. discrete e assolutamente continue; condizionamento rispetto a un evento e rispetto al valore di una v.a.; vettore gaussiano condizionato"). Prerequisiti: Probabilità condizionataLa probabilità di A sapendo che si è verificato B è P(A ∣ B) = P(A ∩ B) / P(B), con P(B) > 0; è una nuova misura di probabilità, e da essa seguono la regola del prodotto e la regola della catena.Probabilità condizionata →, Vettori aleatori discretiUn vettore aleatorio discreto (X, Y) è descritto dalla densità congiunta p(x, y) = P(X = x, Y = y); le marginali si ottengono sommando sull'altra variabile, X e Y sono indipendenti se p(x, y) = p_X(x) p_Y(y) per ogni coppia, e E[g(X, Y)] = Σ g(x, y) p(x, y).Vettori aleatori discreti →, Vettori aleatori assolutamente continuiUn vettore (X, Y) è assolutamente continuo se P((X, Y) ∈ A) = ∬_A f(x, y) dx dy per una densità congiunta f ≥ 0 con integrale 1; le marginali si ottengono integrando sull'altra variabile (f_X(x) = ∫ f(x, y) dy), X e Y sono indipendenti se f(x, y) = f_X(x) f_Y(y), e E[g(X, Y)] = ∬ g f. Il punto delicato degli esercizi è descrivere bene la regione dove f > 0.Vettori aleatori assolutamente continui →, Vettori gaussianiX = (X₁, ..., Xₙ) è un vettore gaussiano N(m, Σ) se ogni combinazione lineare a·X è gaussiana (equivalentemente X = m + AZ con Z gaussiane standard indipendenti); se Σ è invertibile ha densità exp(−½(x−m)ᵀΣ⁻¹(x−m)) / √((2π)ⁿ det Σ). Proprietà chiave: AX + b ~ N(Am + b, AΣAᵀ), le marginali sono gaussiane e componenti non correlate sono indipendenti.Vettori gaussiani →.

L'idea

La Probabilità condizionataLa probabilità di A sapendo che si è verificato B è P(A ∣ B) = P(A ∩ B) / P(B), con P(B) > 0; è una nuova misura di probabilità, e da essa seguono la regola del prodotto e la regola della catena.Probabilità condizionata → P(A∣B)P(A \mid B) aggiorna le probabilità quando si sa che è successo BB. Qui si fa lo stesso con una v.a.: si osserva il valore di YY e ci si chiede come cambia la legge di XX. Esempi: sapendo che il canale è in stato "disturbato" (Y=1Y = 1), qual è la legge del numero di errori XX? Sapendo che un sistema ha lavorato per T=nT = n cicli, quanti successi ci si aspetta?

Condizionamento rispetto a un evento

Se BB è un evento con P(B)>0P(B) > 0, la densità di XX condizionata a BB è pX∣B(x):=P(X=x∣B)=P({X=x}∩B)P(B),p_{X \mid B}(x) := P(X = x \mid B) = \frac{P(\{X = x\} \cap B)}{P(B)}, e la media condizionata è E[X∣B]=∑xx pX∣B(x)E[X \mid B] = \sum_x x \, p_{X \mid B}(x).

È una densità discreta a tutti gli effetti (non negativa, somma 11), perché P(⋅∣B)P(\cdot \mid B) è una probabilità.

Esempio (dado): XX = risultato di un dado, BB = "esce pari". pX∣B(x)=13p_{X \mid B}(x) = \frac13 per x∈{2,4,6}x \in \{2, 4, 6\} e 00 altrove, quindi E[X∣B]=4E[X \mid B] = 4.

Esempio (assenza di memoria): X∼Geo(p)X \sim \text{Geo}(p), B={X>n}B = \{X > n\}: X−nX - n condizionata a BB è ancora Geo(p)\text{Geo}(p) (Distribuzione geometricaGeo(p) è il numero della prova in cui arriva il primo successo in prove indipendenti: P(X = n) = (1−p)^(n−1) p per n ≥ 1, P(X > n) = (1−p)^n (lunga attesa), media 1/p, varianza (1−p)/p², ed è senza memoria.Distribuzione geometrica →), quindi E[X∣X>n]=n+1pE[X \mid X > n] = n + \frac1p.

Formula delle medie totali. Se B1,…,BkB_1, \dots, B_k è una partizione di Ω\Omega con P(Bi)>0P(B_i) > 0: E[X]=∑iE[X∣Bi] P(Bi).E[X] = \sum_i E[X \mid B_i] \, P(B_i). È la formula delle probabilità totaliSe (A_i) è una partizione di Ω, P(B) = Σ P(B ∣ A_i) P(A_i) (probabilità totali); la formula di Bayes inverte il condizionamento: P(A_k ∣ B) = P(B ∣ A_k) P(A_k) / P(B).Formula delle probabilità totali e formula di Bayes → applicata alle medie.

Condizionamento al valore di una v.a. discreta

Siano X,YX, Y discrete. Per ogni yy con pY(y)>0p_Y(y) > 0, la densità di XX condizionata a Y=yY = y è pX∣Y(x∣y):=P(X=x∣Y=y)=pX,Y(x,y)pY(y),p_{X \mid Y}(x \mid y) := P(X = x \mid Y = y) = \frac{p_{X,Y}(x, y)}{p_Y(y)}, e la media condizionata è E[X∣Y=y]:=∑xx pX∣Y(x∣y)E[X \mid Y = y] := \sum_x x \, p_{X \mid Y}(x \mid y).

Nella tabella della congiunta: si prende la colonna Y=yY = y e la si divide per la sua somma, cioè per la marginale pY(y)p_Y(y), in modo che sommi a 11.

Esempio (urna): 2 nere e 3 bianche, due estrazioni senza reinserimento (Vettori aleatori discretiUn vettore aleatorio discreto (X, Y) è descritto dalla densità congiunta p(x, y) = P(X = x, Y = y); le marginali si ottengono sommando sull'altra variabile, X e Y sono indipendenti se p(x, y) = p_X(x) p_Y(y) per ogni coppia, e E[g(X, Y)] = Σ g(x, y) p(x, y).Vettori aleatori discreti →). Dato Y=1Y = 1 (seconda nera), la colonna è (310,110)(\frac{3}{10}, \frac{1}{10}) con somma 410\frac{4}{10}, quindi P(X=1∣Y=1)=14P(X = 1 \mid Y = 1) = \frac14 e E[X∣Y=1]=14E[X \mid Y = 1] = \frac14.

Regola del prodotto rovesciata: pX,Y(x,y)=pX∣Y(x∣y) pY(y)p_{X,Y}(x, y) = p_{X \mid Y}(x \mid y) \, p_Y(y). Molti esercizi danno la legge di YY e la legge condizionata di XX, e la congiunta si costruisce così.

Indipendenza: XX e YY sono indipendenti se e solo se pX∣Y(x∣y)=pX(x)p_{X \mid Y}(x \mid y) = p_X(x) per ogni yy: conoscere YY non cambia la legge di XX.

Esempio d'esame: somma di un numero aleatorio di Bernoulli

(II parziale 15.01.2026, Esercizio 22 · somma di un numero geometrico di Bernoulli.) X1,X2,⋯∼Be(p)X_1, X_2, \dots \sim \text{Be}(p) indipendenti, T∼Geo(q)T \sim \text{Geo}(q) indipendente da esse, Y=X1+⋯+XTY = X_1 + \dots + X_T (si fa un numero aleatorio TT di prove e si contano i successi).

Dato T=nT = n, YY è la somma di nn Bernoulli indipendenti (l'indipendenza di TT dalle XkX_k permette di sostituire TT con nn senza cambiare la loro legge):

P(Y=j∣T=n)=P(X1+⋯+Xn=j)=(nj)pj(1−p)n−j,j=0,…,n.P(Y = j \mid T = n) = P(X_1 + \dots + X_n = j) = \binom nj p^j (1 - p)^{n - j}, \qquad j = 0, \dots, n.

Cioè Y∣T=n∼Bin(n,p)Y \mid T = n \sim \text{Bin}(n, p), e quindi E[Y∣T=n]=npE[Y \mid T = n] = np.

Condizionamento al valore di una v.a. continua

Se YY è continua, P(Y=y)=0P(Y = y) = 0 e la definizione elementare non si può usare. Si definisce per analogia, con le densità al posto delle probabilità.

Sia (X,Y)(X, Y) assolutamente continuo. Per ogni yy con fY(y)>0f_Y(y) > 0, la densità di XX condizionata a Y=yY = y è fX∣Y(x∣y):=fX,Y(x,y)fY(y),f_{X \mid Y}(x \mid y) := \frac{f_{X,Y}(x, y)}{f_Y(y)}, e E[X∣Y=y]:=∫x fX∣Y(x∣y) dxE[X \mid Y = y] := \int x \, f_{X \mid Y}(x \mid y) \, dx.

Perché ha senso. Si condiziona a {y≤Y≤y+h}\{y \le Y \le y + h\}, che ha probabilità positiva, e si manda h→0h \to 0: P(X≤x∣y≤Y≤y+h)≈∫−∞xfX,Y(s,y)h dsfY(y)hP(X \le x \mid y \le Y \le y + h) \approx \frac{\int_{-\infty}^x f_{X,Y}(s, y) h \, ds}{f_Y(y) h}, e le hh si semplificano.

Geometricamente: si taglia la superficie z=fX,Y(x,y)z = f_{X,Y}(x, y) con il piano verticale "Y=yY = y" e si rinormalizza il profilo ottenuto perché abbia area 11.

Esempio (II parziale 15.01.2026, Esercizio 17 · densità congiunta c(x+y) sul quadrato): f(x,y)=x+y27f(x, y) = \frac{x + y}{27} su [0,3]2[0, 3]^2, fY(y)=y9+16=2y+318f_Y(y) = \frac y9 + \frac16 = \frac{2y + 3}{18}. Per y∈[0,3]y \in [0, 3]:

fX∣Y(x∣y)=(x+y)/27(2y+3)/18=2(x+y)3(2y+3)=2x+2y6y+9,x∈[0,3].f_{X \mid Y}(x \mid y) = \frac{(x + y)/27}{(2y + 3)/18} = \frac{2(x + y)}{3(2y + 3)} = \frac{2x + 2y}{6y + 9}, \qquad x \in [0, 3].

Controllo: ∫032x+2y6y+9dx=9+6y6y+9=1\int_0^3 \frac{2x + 2y}{6y + 9} dx = \frac{9 + 6y}{6y + 9} = 1 ✓. La densità condizionata dipende da yy: altra conferma che XX e YY non sono indipendenti.

Costruire la congiunta dalla condizionata: fX,Y(x,y)=fX∣Y(x∣y) fY(y)f_{X,Y}(x, y) = f_{X \mid Y}(x \mid y) \, f_Y(y).

Esempio (II appello 12.02.2026, Esercizio 21 · densità condizionata e proprietà della torre): YY ha densità 3y23y^2 su [0,1][0, 1] e, dato Y=yY = y, XX è uniforme su [0,y][0, y]: fX∣Y(x∣y)=1y1[0,y](x)f_{X \mid Y}(x \mid y) = \frac1y \mathbb 1_{[0, y]}(x). Allora fX,Y(x,y)=1y⋅3y2=3ysul triangolo {0≤x≤y≤1}.f_{X,Y}(x, y) = \frac1y \cdot 3y^2 = 3y \quad \text{sul triangolo } \{0 \le x \le y \le 1\}.

La media condizionata come variabile aleatoria

E[X∣Y=y]E[X \mid Y = y] è un numero che dipende da yy: chiamiamolo h(y)h(y). Sostituendo yy con la v.a. YY si ottiene una nuova v.a.:

E[X∣Y]:=h(Y),dove h(y)=E[X∣Y=y].E[X \mid Y] := h(Y), \qquad \text{dove } h(y) = E[X \mid Y = y].

È la migliore previsione di XX che si può fare conoscendo YY. Esempi: se X∣Y=y∼U(0,y)X \mid Y = y \sim U(0, y), allora h(y)=y2h(y) = \frac y2 e E[X∣Y]=Y2E[X \mid Y] = \frac Y2; se Y∣T=n∼Bin(n,p)Y \mid T = n \sim \text{Bin}(n, p), allora E[Y∣T]=pTE[Y \mid T] = pT.

Proprietà della torre

Proprietà della torre (o della media iterata): E[E[X∣Y]]=E[X].E\big[E[X \mid Y]\big] = E[X]. Nel continuo: E[X]=∫E[X∣Y=y] fY(y) dyE[X] = \int E[X \mid Y = y] \, f_Y(y) \, dy; nel discreto: E[X]=∑yE[X∣Y=y] pY(y)E[X] = \sum_y E[X \mid Y = y] \, p_Y(y).

Dimostrazione (caso continuo). ∫E[X∣Y=y]fY(y) dy=∫(∫xfX,Y(x,y)fY(y)dx)fY(y) dy=∬xfX,Y(x,y) dx dy=E[X]. ∎\int E[X \mid Y = y] f_Y(y) \, dy = \int \left(\int x \frac{f_{X,Y}(x, y)}{f_Y(y)} dx\right) f_Y(y) \, dy = \iint x f_{X,Y}(x, y) \, dx \, dy = E[X]. \ ∎

È la formula delle medie totali con infinite "cause" {Y=y}\{Y = y\}: si calcola la media in ogni scenario e poi si fa la media degli scenari, pesata con la loro probabilità.

Perché è utile: spesso E[X∣Y]E[X \mid Y] è immediata (la legge condizionata è nota) mentre la legge di XX è complicata.

Esempio 1 (II appello 12.02.2026): E[X∣Y]=Y2E[X \mid Y] = \frac Y2 e E[Y]=∫01y⋅3y2dy=34E[Y] = \int_0^1 y \cdot 3y^2 dy = \frac34, quindi E[X]=E[Y2]=12⋅34=38,E[X] = E\left[\frac Y2\right] = \frac12 \cdot \frac34 = \frac38, senza calcolare la marginale di XX (che è 32(1−x2)\frac32(1 - x^2) e dà lo stesso risultato, controllo ✓).

Esempio 2 (II parziale 15.01.2026): E[Y∣T]=pTE[Y \mid T] = pT e E[T]=1qE[T] = \frac1q, quindi E[Y]=pE[T]=pqE[Y] = pE[T] = \frac pq. Si fanno in media 1q\frac1q prove e ognuna ha successo con probabilità pp.

Versione generale. Per ogni funzione gg: E[g(X)]=E[E[g(X)∣Y]]E[g(X)] = E\big[E[g(X) \mid Y]\big]. Con g(x)=eiθxg(x) = e^{i\theta x} si calcola la Funzione caratteristicaLa funzione caratteristica φ_X(θ) = E[e^(iθX)] = E[cos θX] + iE[sin θX] esiste per ogni v.a. e ogni θ, vale 1 in 0, ha modulo ≤ 1, determina la legge (è la trasformata di Fourier della densità), trasforma le somme di v.a. indipendenti in prodotti e dà i momenti: E[X^k] = φ^(k)(0) / i^k. Per N(μ, σ²) vale e^(iμθ − σ²θ²/2).Funzione caratteristica → di somme aleatorie: nell'esempio 2, E[eiθY∣T=n]=anE[e^{i\theta Y} \mid T = n] = a^n con a=peiθ+1−pa = pe^{i\theta} + 1 - p, quindi φY(θ)=E[aT]\varphi_Y(\theta) = E[a^T], una serie geometrica.

Proprietà utili (dalla definizione): E[g(Y)X∣Y]=g(Y)E[X∣Y]E[g(Y) X \mid Y] = g(Y) E[X \mid Y] ("ciò che è noto esce dalla media condizionata"); se XX e YY sono indipendenti, E[X∣Y]=E[X]E[X \mid Y] = E[X].

Vettore gaussiano condizionato

Se (X,Y)(X, Y) è un vettore gaussiano con medie m1,m2m_1, m_2, varianze σ12,σ22>0\sigma_1^2, \sigma_2^2 > 0 e correlazione ρ\rho, allora, dato Y=yY = y, X∣Y=y ∼ N(m1+ρσ1σ2(y−m2),  σ12(1−ρ2)).X \mid Y = y \ \sim \ N\left(m_1 + \rho\frac{\sigma_1}{\sigma_2}(y - m_2), \ \ \sigma_1^2(1 - \rho^2)\right). Equivalentemente E[X∣Y]=m1+Cov(X,Y)Var(Y)(Y−m2)E[X \mid Y] = m_1 + \frac{\text{Cov}(X, Y)}{\text{Var}(Y)}(Y - m_2).

Perché (idea). Si scrive X=m1+c(Y−m2)+WX = m_1 + c(Y - m_2) + W scegliendo c=Cov(X,Y)Var(Y)c = \frac{\text{Cov}(X, Y)}{\text{Var}(Y)} in modo che WW abbia covarianza nulla con YY: infatti Cov(W,Y)=Cov(X,Y)−c Var(Y)=0\text{Cov}(W, Y) = \text{Cov}(X, Y) - c\,\text{Var}(Y) = 0. (W,Y)(W, Y) è gaussiano (trasformazione lineare di (X,Y)(X, Y)), quindi WW e YY non correlate sono indipendenti. Dato Y=yY = y, la parte m1+c(y−m2)m_1 + c(y - m_2) è fissata e resta WW, gaussiana con media 00 e varianza Var(W)=Var(X)−c2Var(Y)=σ12−ρ2σ12σ22σ22=σ12(1−ρ2).\text{Var}(W) = \text{Var}(X) - c^2\text{Var}(Y) = \sigma_1^2 - \frac{\rho^2\sigma_1^2\sigma_2^2}{\sigma_2^2} = \sigma_1^2(1 - \rho^2).

Tre osservazioni.

Esempio. Σ=(4222)\Sigma = \begin{pmatrix} 4 & 2 \\ 2 & 2 \end{pmatrix}, m=(1,−1)m = (1, -1): c=22=1c = \frac22 = 1, quindi X∣Y=y∼N(1+(y+1), 4−12⋅2)=N(y+2, 2)X \mid Y = y \sim N(1 + (y + 1), \ 4 - 1^2 \cdot 2) = N(y + 2, \ 2).

Oggetto Discreto Continuo
condizionata pX∣Y(x∣y)=p(x,y)pY(y)p_{X\mid Y}(x \mid y) = \frac{p(x, y)}{p_Y(y)} fX∣Y(x∣y)=f(x,y)fY(y)f_{X\mid Y}(x \mid y) = \frac{f(x, y)}{f_Y(y)}
media condizionata ∑xx pX∣Y(x∣y)\sum_x x\, p_{X\mid Y}(x \mid y) ∫x fX∣Y(x∣y) dx\int x\, f_{X\mid Y}(x \mid y)\, dx
congiunta pX∣Y⋅pYp_{X\mid Y} \cdot p_Y fX∣Y⋅fYf_{X\mid Y} \cdot f_Y
torre E[X]=∑yE[X∣Y=y]pY(y)E[X] = \sum_y E[X \mid Y = y] p_Y(y) E[X]=∫E[X∣Y=y]fY(y)dyE[X] = \int E[X \mid Y = y] f_Y(y) dy

Errori comuni

  • Dividere per la marginale sbagliata: per condizionare a Y=yY = y si divide per fY(y)f_Y(y), non per fX(x)f_X(x).
  • Dimenticare il supporto della condizionata: fX∣Y(x∣y)=1yf_{X \mid Y}(x \mid y) = \frac1y vale solo per 0≤x≤y0 \le x \le y.
  • Trattare E[X∣Y]E[X \mid Y] come un numero: è una v.a. (funzione di YY); è E[X∣Y=y]E[X \mid Y = y] a essere un numero.
  • Applicare la torre al contrario: E[E[X∣Y]]E[E[X \mid Y]] dà E[X]E[X], non E[Y]E[Y].

Esercizi su questo argomento

Teoria collegata