Salta al contenuto
Note per Studenti Vettori aleatori discreti

Vettori aleatori discreti

In questa pagina 9

Punto 4 del programma ("caso discreto: densità congiunta e marginale; indipendenza di v.a. discrete; valore medio di funzioni scalari di un vettore aleatorio"). Prerequisiti: Variabili aleatorie discrete e densità discretaUna variabile aleatoria discreta è una funzione X da Ω in R che assume un insieme finito o numerabile di valori (l'alfabeto); la sua densità discreta p_X(x) = P(X = x) basta a calcolare la probabilità di ogni evento che riguarda X.Variabili aleatorie discrete e densità discreta →, Valore attesoIl valore atteso E[X] = Σ x p_X(x) è la media dei valori di X pesata con le loro probabilità (esiste se la serie converge assolutamente); per una funzione g vale E[g(X)] = Σ g(x) p_X(x) senza trovare la legge di g(X), ed E è lineare: E[aX + bY + c] = aE[X] + bE[Y] + c.Valore atteso →. Seguito: Somma di variabili aleatorie indipendentiSe X e Y sono indipendenti, la legge di Z = X + Y è la convoluzione: p_Z(n) = Σ_k p_X(k) p_Y(n − k) nel discreto, f_Z(z) = ∫ f_X(z − y) f_Y(y) dy nel continuo. Casi notevoli: Bin(n,p) + Bin(m,p) = Bin(n+m,p), Poi(λ) + Poi(μ) = Poi(λ+μ), Geo + Geo con densità (n−1)p²(1−p)^(n−2), Exp(λ) + Exp(λ) = Γ(2,λ), gaussiane indipendenti sommano medie e varianze.Somma di variabili aleatorie indipendenti →, Covarianza e coefficiente di correlazioneCov(X, Y) = E[(X − E X)(Y − E Y)] = E[XY] − E[X]E[Y] misura quanto X e Y variano insieme; è bilineare, Cov(X, X) = Var(X), Var(X + Y) = Var X + Var Y + 2Cov(X, Y); ρ = Cov / (σ_X σ_Y) sta in [−1, 1] e vale ±1 solo per legami lineari. Indipendenti ⇒ non correlate, ma non viceversa (tranne per i vettori gaussiani).Covarianza e coefficiente di correlazione →; il caso continuo è in Vettori aleatori assolutamente continuiUn vettore (X, Y) è assolutamente continuo se P((X, Y) ∈ A) = ∬_A f(x, y) dx dy per una densità congiunta f ≥ 0 con integrale 1; le marginali si ottengono integrando sull'altra variabile (f_X(x) = ∫ f(x, y) dy), X e Y sono indipendenti se f(x, y) = f_X(x) f_Y(y), e E[g(X, Y)] = ∬ g f. Il punto delicato degli esercizi è descrivere bene la regione dove f > 0.Vettori aleatori assolutamente continui →.

Perché servono

Negli esercizi compaiono quasi sempre più variabili aleatorie definite sullo stesso esperimento: i risultati di due dadi, il numero di teste di due monete, il tempo TT e la somma Y=X1+⋯+XTY = X_1 + \dots + X_T. Conoscere separatamente la legge di XX e quella di YY non basta per calcolare P(X=Y)P(X = Y), P(X+Y=5)P(X + Y = 5) o E[XY]E[XY]: serve sapere come XX e YY si comportano insieme.

Definizione

Un vettore aleatorio discreto è una coppia (o in generale una nn-upla) (X,Y)(X, Y) di v.a. discrete definite sullo stesso spazio (Ω,F,P)(\Omega, \mathcal F, P). La sua densità congiunta è pX,Y(x,y):=P(X=x,Y=y),(x,y)∈R2,p_{X,Y}(x, y) := P(X = x, Y = y), \qquad (x, y) \in \mathbb R^2, dove la virgola significa "e": {X=x,Y=y}={X=x}∩{Y=y}\{X = x, Y = y\} = \{X = x\} \cap \{Y = y\}.

Proprietà (stesse della densità discreta di una v.a.):

  • pX,Y(x,y)≥0p_{X,Y}(x, y) \ge 0, ed è diversa da zero solo per (x,y)(x, y) nell'alfabeto XX×XY\mathcal X_X \times \mathcal X_Y (al più numerabile);
  • ∑x∑ypX,Y(x,y)=1\sum_{x} \sum_{y} p_{X,Y}(x, y) = 1;
  • per ogni insieme A⊆R2A \subseteq \mathbb R^2: P((X,Y)∈A)=∑(x,y)∈ApX,Y(x,y)P((X, Y) \in A) = \sum_{(x, y) \in A} p_{X,Y}(x, y).

Per un numero finito di valori la densità congiunta si scrive comodamente come tabella: righe per i valori di XX, colonne per quelli di YY.

Esempio guida: due estrazioni senza reinserimento

Un'urna contiene 2 palline nere e 3 bianche; se ne estraggono 2 senza reinserimento. Sia X=1X = 1 se la prima pallina è nera (00 altrimenti) e Y=1Y = 1 se la seconda è nera. Con la regola del prodottoP(A ∩ B) = P(A) P(B ∣ A): probabilità della prima estrazione per quella della seconda sapendo com'è andata la prima.Probabilità condizionata →:

  • p(1,1)=25⋅14=110p(1, 1) = \frac25 \cdot \frac14 = \frac{1}{10} (dopo una nera resta 1 nera su 4);
  • p(1,0)=25⋅34=310p(1, 0) = \frac25 \cdot \frac34 = \frac{3}{10};
  • p(0,1)=35⋅24=310p(0, 1) = \frac35 \cdot \frac24 = \frac{3}{10};
  • p(0,0)=35⋅24=310p(0, 0) = \frac35 \cdot \frac24 = \frac{3}{10}.
Y=0Y = 0 Y=1Y = 1 pXp_X
X=0X = 0 3/103/10 3/103/10 6/106/10
X=1X = 1 3/103/10 1/101/10 4/104/10
pYp_Y 6/106/10 4/104/10 11

Controllo: 3+3+3+110=1\frac{3 + 3 + 3 + 1}{10} = 1 ✓.

Densità marginali

Dalla congiunta si ricavano le leggi di XX e di YY da sole, dette marginali:

pX(x)=∑ypX,Y(x,y),pY(y)=∑xpX,Y(x,y).p_X(x) = \sum_{y} p_{X,Y}(x, y), \qquad p_Y(y) = \sum_{x} p_{X,Y}(x, y).

Perché: gli eventi {Y=y}\{Y = y\}, al variare di y∈XYy \in \mathcal X_Y, formano una partizioneEventi disgiunti la cui unione è Ω: ogni esito sta in uno solo di essi.Spazio campionario ed eventi → di Ω\Omega. Quindi {X=x}\{X = x\} è l'unione disgiunta dei pezzi {X=x,Y=y}\{X = x, Y = y\} e per σ-additività P(X=x)=∑yP(X=x,Y=y)P(X = x) = \sum_y P(X = x, Y = y).

Nella tabella: le marginali sono le somme di riga e di colonna, scritte "a margine" (da qui il nome). Nell'esempio pX(1)=310+110=25p_X(1) = \frac{3}{10} + \frac{1}{10} = \frac25: la prima pallina è nera con probabilità 25\frac25, come deve essere. Anche pY(1)=25p_Y(1) = \frac25: senza sapere com'è andata la prima estrazione, la seconda pallina è nera con la stessa probabilità della prima (per simmetria).

Attenzione: dalla congiunta si ricavano le marginali, non viceversa. Due vettori diversi possono avere le stesse marginali: con estrazioni con reinserimento le marginali sono ancora Be(25)\text{Be}(\frac25), ma p(1,1)=425≠110p(1, 1) = \frac{4}{25} \neq \frac{1}{10}.

Indipendenza di variabili aleatorie discrete

Le v.a. XX e YY sono indipendenti se gli eventi {X∈A}\{X \in A\} e {Y∈B}\{Y \in B\} sono indipendenti per ogni scelta di A,B⊆RA, B \subseteq \mathbb R. Nel caso discreto questo equivale a pX,Y(x,y)=pX(x) pY(y)per ogni (x,y).p_{X,Y}(x, y) = p_X(x) \, p_Y(y) \qquad \text{per ogni } (x, y).

Perché basta la condizione sui singoli valori: se vale, sommando su x∈Ax \in A e y∈By \in B si ottiene P(X∈A,Y∈B)=∑x∈A∑y∈BpX(x)pY(y)=P(X∈A)P(Y∈B)P(X \in A, Y \in B) = \sum_{x \in A} \sum_{y \in B} p_X(x) p_Y(y) = P(X \in A) P(Y \in B). Il viceversa è il caso A={x}A = \{x\}, B={y}B = \{y\}.

Come si verifica in pratica.

  • Per dimostrare l'indipendenza bisogna controllare tutte le caselle della tabella: ognuna deve essere il prodotto della sua marginale di riga per quella di colonna.
  • Per dimostrare la non indipendenza basta una casella sbagliata. Nell'esempio: p(1,1)=110p(1, 1) = \frac1{10} mentre pX(1)pY(1)=25⋅25=425p_X(1) p_Y(1) = \frac25 \cdot \frac25 = \frac{4}{25}: XX e YY non sono indipendenti (si capisce: se la prima è nera, la seconda lo è meno probabilmente).
  • Un controllo rapido: se nella tabella c'è uno zero in una casella la cui riga e colonna hanno marginali positive, le v.a. non sono indipendenti (0≠0 \neq prodotto di due numeri positivi).
  • Se la congiunta si fattorizza come p(x,y)=g(x)h(y)p(x, y) = g(x) h(y) su un alfabeto "rettangolare" XX×XY\mathcal X_X \times \mathcal X_Y, allora XX e YY sono indipendenti (le costanti si sistemano normalizzando).

Più v.a. X1,…,XnX_1, \dots, X_n sono indipendenti se P(X1=x1,…,Xn=xn)=∏iP(Xi=xi)P(X_1 = x_1, \dots, X_n = x_n) = \prod_i P(X_i = x_i) per ogni scelta dei valori. Le prove ripetute del modello binomialen prove indipendenti con la stessa probabilità di successo p.Prove ripetute e modello binomiale → sono l'esempio tipico: le Xi∼Be(p)X_i \sim \text{Be}(p) che indicano il successo alla prova ii sono indipendenti.

Costruire v.a. indipendenti. Quando un testo dice "XX e YY indipendenti con X∼Geo(12)X \sim \text{Geo}(\frac12), Y∼Geo(12)Y \sim \text{Geo}(\frac12)" (II appello, esercizio 4), la congiunta è data dal prodotto: pX,Y(j,k)=12j⋅12k=12j+kp_{X,Y}(j, k) = \frac{1}{2^j} \cdot \frac{1}{2^k} = \frac{1}{2^{j + k}} per j,k≥1j, k \ge 1.

Funzioni di v.a. indipendenti sono indipendenti: se XX e YY sono indipendenti, lo sono anche g(X)g(X) e h(Y)h(Y) per ogni g,hg, h (ad esempio X2X^2 e eYe^Y). Infatti {g(X)∈A}={X∈g−1(A)}\{g(X) \in A\} = \{X \in g^{-1}(A)\}.

Valore medio di una funzione del vettore

Teorema fondamentale (caso vettoriale). Per g:R2→Rg : \mathbb R^2 \to \mathbb R, se la serie converge assolutamente, E[g(X,Y)]=∑x∑yg(x,y) pX,Y(x,y).E[g(X, Y)] = \sum_{x} \sum_{y} g(x, y) \, p_{X,Y}(x, y).

È la stessa idea del teorema fondamentale del valor medioLa media di g(X) si calcola pesando ogni valore g(x) con la probabilità di x, senza trovare la legge di g(X).Valore atteso →: non serve trovare la legge di g(X,Y)g(X, Y).

Conseguenze.

  1. Linearità: con g(x,y)=ax+byg(x, y) = ax + by si ottiene E[aX+bY]=aE[X]+bE[Y]E[aX + bY] = aE[X] + bE[Y] (separando la somma e usando le marginali). Vale sempre, anche senza indipendenza.
  2. Prodotto di indipendenti: se XX e YY sono indipendenti (e hanno media finita) E[XY]=∑x∑yxy pX(x)pY(y)=(∑xx pX(x))(∑yy pY(y))=E[X] E[Y].E[XY] = \sum_x \sum_y xy \, p_X(x) p_Y(y) = \Big(\sum_x x \, p_X(x)\Big)\Big(\sum_y y \, p_Y(y)\Big) = E[X] \, E[Y]. Più in generale E[g(X)h(Y)]=E[g(X)] E[h(Y)]E[g(X) h(Y)] = E[g(X)] \, E[h(Y)]. È la proprietà che rende le funzioni caratteristiche così utili per le somme (Funzione caratteristicaLa funzione caratteristica φ_X(θ) = E[e^(iθX)] = E[cos θX] + iE[sin θX] esiste per ogni v.a. e ogni θ, vale 1 in 0, ha modulo ≤ 1, determina la legge (è la trasformata di Fourier della densità), trasforma le somme di v.a. indipendenti in prodotti e dà i momenti: E[X^k] = φ^(k)(0) / i^k. Per N(μ, σ²) vale e^(iμθ − σ²θ²/2).Funzione caratteristica →).

Nell'esempio dell'urna: E[XY]=1⋅1⋅110=110E[XY] = 1 \cdot 1 \cdot \frac1{10} = \frac1{10}, mentre E[X]E[Y]=425E[X] E[Y] = \frac{4}{25}: diversi, come ci si aspetta per v.a. non indipendenti. La differenza E[XY]−E[X]E[Y]=110−425=−350E[XY] - E[X]E[Y] = \frac1{10} - \frac4{25} = -\frac{3}{50} è la covarianza, negativa perché una nera alla prima rende meno probabile una nera alla seconda (Covarianza e coefficiente di correlazioneCov(X, Y) = E[(X − E X)(Y − E Y)] = E[XY] − E[X]E[Y] misura quanto X e Y variano insieme; è bilineare, Cov(X, X) = Var(X), Var(X + Y) = Var X + Var Y + 2Cov(X, Y); ρ = Cov / (σ_X σ_Y) sta in [−1, 1] e vale ±1 solo per legami lineari. Indipendenti ⇒ non correlate, ma non viceversa (tranne per i vettori gaussiani).Covarianza e coefficiente di correlazione →).

Legge di una funzione del vettore

Per trovare la densità di Z=g(X,Y)Z = g(X, Y) si raccolgono le coppie che danno lo stesso valore:

pZ(z)=∑(x,y) : g(x,y)=zpX,Y(x,y).p_Z(z) = \sum_{(x, y) \,:\, g(x, y) = z} p_{X,Y}(x, y).

Esempio (urna): Z=X+YZ = X + Y = numero di nere estratte. pZ(0)=310p_Z(0) = \frac{3}{10}, pZ(1)=p(1,0)+p(0,1)=610p_Z(1) = p(1, 0) + p(0, 1) = \frac{6}{10}, pZ(2)=110p_Z(2) = \frac{1}{10}. È una legge ipergeometricaEstrazioni senza reinserimento: P(k nere) = C(M,k) C(N−M,n−k) / C(N,n).Calcolo combinatorio per la probabilità →: ad esempio pZ(2)=(22)(30)/(52)=110p_Z(2) = \binom22 \binom30 / \binom52 = \frac{1}{10} ✓.

Il caso più importante, Z=X+YZ = X + Y con X,YX, Y indipendenti, ha una formula dedicata (convoluzione): Somma di variabili aleatorie indipendentiSe X e Y sono indipendenti, la legge di Z = X + Y è la convoluzione: p_Z(n) = Σ_k p_X(k) p_Y(n − k) nel discreto, f_Z(z) = ∫ f_X(z − y) f_Y(y) dy nel continuo. Casi notevoli: Bin(n,p) + Bin(m,p) = Bin(n+m,p), Poi(λ) + Poi(μ) = Poi(λ+μ), Geo + Geo con densità (n−1)p²(1−p)^(n−2), Exp(λ) + Exp(λ) = Γ(2,λ), gaussiane indipendenti sommano medie e varianze.Somma di variabili aleatorie indipendenti →.

Oggetto Formula
densità congiunta pX,Y(x,y)=P(X=x,Y=y)p_{X,Y}(x, y) = P(X = x, Y = y)
marginale di XX pX(x)=∑ypX,Y(x,y)p_X(x) = \sum_y p_{X,Y}(x, y) (somma di riga)
indipendenza pX,Y(x,y)=pX(x)pY(y)p_{X,Y}(x, y) = p_X(x) p_Y(y) per ogni (x,y)(x, y)
media di g(X,Y)g(X, Y) ∑x,yg(x,y)pX,Y(x,y)\sum_{x, y} g(x, y) p_{X,Y}(x, y)
linearità E[aX+bY]=aE[X]+bE[Y]E[aX + bY] = aE[X] + bE[Y], sempre
prodotto E[XY]=E[X]E[Y]E[XY] = E[X]E[Y] se indipendenti

Errori comuni

Esercizi su questo argomento

Teoria collegata