Salta al contenuto
Note per Studenti Funzione generatrice dei momenti

Funzione generatrice dei momenti

In questa pagina 8

Punto 6 del programma ("funzione generatrice dei momenti: definizione, proprietà e relazione con i momenti"). Prerequisiti: Valore attesoIl valore atteso E[X] = Σ x p_X(x) è la media dei valori di X pesata con le loro probabilità (esiste se la serie converge assolutamente); per una funzione g vale E[g(X)] = Σ g(x) p_X(x) senza trovare la legge di g(X), ed E è lineare: E[aX + bY + c] = aE[X] + bE[Y] + c.Valore atteso →, Variabili aleatorie assolutamente continueX è assolutamente continua se F_X(x) = ∫ da −∞ a x di f_X(t) dt per una densità f_X ≥ 0 con integrale 1; allora P(a < X ≤ b) = ∫ da a a b di f_X, P(X = x) = 0 per ogni x, f_X = F_X' dove F_X è derivabile, E[g(X)] = ∫ g(x) f_X(x) dx, e varianza, momenti e disuguaglianze funzionano come nel caso discreto con gli integrali al posto delle somme.Variabili aleatorie assolutamente continue →, Somma di variabili aleatorie indipendentiSe X e Y sono indipendenti, la legge di Z = X + Y è la convoluzione: p_Z(n) = Σ_k p_X(k) p_Y(n − k) nel discreto, f_Z(z) = ∫ f_X(z − y) f_Y(y) dy nel continuo. Casi notevoli: Bin(n,p) + Bin(m,p) = Bin(n+m,p), Poi(λ) + Poi(μ) = Poi(λ+μ), Geo + Geo con densità (n−1)p²(1−p)^(n−2), Exp(λ) + Exp(λ) = Γ(2,λ), gaussiane indipendenti sommano medie e varianze.Somma di variabili aleatorie indipendenti →. Seguito: Funzione caratteristicaLa funzione caratteristica φ_X(θ) = E[e^(iθX)] = E[cos θX] + iE[sin θX] esiste per ogni v.a. e ogni θ, vale 1 in 0, ha modulo ≤ 1, determina la legge (è la trasformata di Fourier della densità), trasforma le somme di v.a. indipendenti in prodotti e dà i momenti: E[X^k] = φ^(k)(0) / i^k. Per N(μ, σ²) vale e^(iμθ − σ²θ²/2).Funzione caratteristica →.

L'idea

Calcolare E[X]E[X], E[X2]E[X^2], E[X3]E[X^3] uno per uno richiede ogni volta una serie o un integrale. E la legge di una somma di v.a. indipendenti richiede una convoluzione. La funzione generatrice raccoglie tutti i momenti in una sola funzione e trasforma la convoluzione in un prodotto. È lo stesso trucco della trasformata di Laplace nei circuiti.

Definizione

La funzione generatrice dei momenti (f.g.m.) di una v.a. XX è MX(t):=E[etX],t∈R,M_X(t) := E\big[e^{tX}\big], \qquad t \in \mathbb R, definita per i tt per cui il valore atteso è finito.

Per il teorema fondamentale del valor medio:

MX(t)=∑xetxpX(x) (discreta),MX(t)=∫etxfX(x) dx (a.c.).M_X(t) = \sum_x e^{tx} p_X(x) \ \text{(discreta)}, \qquad M_X(t) = \int e^{tx} f_X(x) \, dx \ \text{(a.c.)}.

Osservazioni.

  • MX(0)=E[1]=1M_X(0) = E[1] = 1 sempre.
  • etX>0e^{tX} > 0, quindi MX(t)∈(0,+∞]M_X(t) \in (0, +\infty]: il valore +∞+\infty è possibile, e allora MX(t)M_X(t) "non esiste" in quel tt.
  • L'insieme dei tt con MX(t)<∞M_X(t) < \infty è un intervallo che contiene 00. La f.g.m. è utile quando questo intervallo contiene un intorno di 00, cioè (−δ,δ)(-\delta, \delta) per qualche δ>0\delta > 0.

Esempi

Bernoulli Be(p)\text{Be}(p): M(t)=(1−p)e0+pet=1−p+petM(t) = (1 - p) e^{0} + p e^{t} = 1 - p + pe^t.

Binomiale Bin(n,p)\text{Bin}(n, p): con il binomio di Newton, M(t)=∑k=0netk(nk)pk(1−p)n−k=∑k(nk)(pet)k(1−p)n−k=(1−p+pet)n.M(t) = \sum_{k=0}^n e^{tk} \binom nk p^k (1 - p)^{n-k} = \sum_k \binom nk (pe^t)^k (1 - p)^{n-k} = (1 - p + pe^t)^n. È la potenza nn-esima della f.g.m. della Bernoulli: non a caso, perché la binomiale è somma di nn Bernoulli indipendenti (vedi la proprietà delle somme sotto).

Poisson Poi(λ)\text{Poi}(\lambda): con la serie dell'esponenziale, M(t)=∑k≥0etke−λλkk!=e−λ∑k(λet)kk!=e−λeλet=eλ(et−1).M(t) = \sum_{k \ge 0} e^{tk} e^{-\lambda}\frac{\lambda^k}{k!} = e^{-\lambda}\sum_k \frac{(\lambda e^t)^k}{k!} = e^{-\lambda} e^{\lambda e^t} = e^{\lambda(e^t - 1)}.

Geometrica Geo(p)\text{Geo}(p): serie geometrica di ragione (1−p)et(1 - p)e^t, M(t)=∑n≥1etn(1−p)n−1p=pet1−(1−p)et,per (1−p)et<1, cioeˋ t<−ln⁡(1−p).M(t) = \sum_{n \ge 1} e^{tn} (1 - p)^{n-1} p = \frac{pe^t}{1 - (1 - p)e^t}, \qquad \text{per } (1 - p)e^t < 1, \text{ cioè } t < -\ln(1 - p).

Esponenziale Exp(λ)\text{Exp}(\lambda): M(t)=∫0∞etxλe−λxdx=λ∫0∞e−(λ−t)xdx=λλ−t,t<λ.M(t) = \int_0^\infty e^{tx}\lambda e^{-\lambda x} dx = \lambda\int_0^\infty e^{-(\lambda - t)x} dx = \frac{\lambda}{\lambda - t}, \qquad t < \lambda. Per t≥λt \ge \lambda l'integrando non tende a zero e l'integrale vale +∞+\infty.

Gamma Γ(α,λ)\Gamma(\alpha, \lambda): con ∫0∞xα−1e−(λ−t)xdx=Γ(α)(λ−t)α\int_0^\infty x^{\alpha-1}e^{-(\lambda - t)x}dx = \frac{\Gamma(\alpha)}{(\lambda - t)^\alpha} (Distribuzione gammaΓ(α, λ) ha densità λ^α x^(α−1) e^(−λx) / Γ(α) per x > 0, dove Γ(α) = ∫ x^(α−1) e^(−x) dx è la funzione Gamma (Γ(n) = (n − 1)!, Γ(1/2) = √π); media α/λ, varianza α/λ²; Γ(1, λ) = Exp(λ), e la somma di n esponenziali Exp(λ) indipendenti è Γ(n, λ), il tempo d'attesa dell'n-esimo evento.Distribuzione gamma →), M(t)=(λλ−t)α,t<λ.M(t) = \left(\frac{\lambda}{\lambda - t}\right)^\alpha, \qquad t < \lambda.

Gaussiana N(μ,σ2)N(\mu, \sigma^2): M(t)=eμt+12σ2t2,t∈R.M(t) = e^{\mu t + \frac12\sigma^2 t^2}, \qquad t \in \mathbb R. Calcolo per N(0,1)N(0, 1), completando il quadrato tz−z22=−(z−t)22+t22tz - \frac{z^2}{2} = -\frac{(z - t)^2}{2} + \frac{t^2}{2}: MZ(t)=∫12πetz−z2/2dz=et2/2∫12πe−(z−t)2/2dz=et2/2,M_Z(t) = \int \frac{1}{\sqrt{2\pi}} e^{tz - z^2/2} dz = e^{t^2/2}\int \frac{1}{\sqrt{2\pi}}e^{-(z - t)^2/2} dz = e^{t^2/2}, perché l'ultimo integrale è quello di una densità N(t,1)N(t, 1), cioè 11. Per X=μ+σZX = \mu + \sigma Z si usa la proprietà affine qui sotto.

Uniforme U(a,b)U(a, b): M(t)=etb−etat(b−a)M(t) = \frac{e^{tb} - e^{ta}}{t(b - a)} per t≠0t \ne 0, M(0)=1M(0) = 1.

Proprietà

1. I momenti si ottengono derivando

Se MXM_X è finita in un intorno di 00, allora XX ha tutti i momenti finiti e E[Xk]=MX(k)(0),k=1,2,…E[X^k] = M_X^{(k)}(0), \qquad k = 1, 2, \dots

Perché. Sviluppando l'esponenziale in serie e scambiando (lecito sotto questa ipotesi) serie e valore atteso: MX(t)=E[∑k≥0tkXkk!]=∑k≥0E[Xk]k!tk.M_X(t) = E\left[\sum_{k \ge 0} \frac{t^k X^k}{k!}\right] = \sum_{k \ge 0} \frac{E[X^k]}{k!} t^k. È la serie di Taylor di MXM_X in 00, e il coefficiente di tkt^k in una serie di Taylor è MX(k)(0)k!\frac{M_X^{(k)}(0)}{k!}: confrontando si ottiene la formula. Da qui il nome "generatrice dei momenti". In alternativa: derivare sotto il segno di media, dkdtketX=XketX\frac{d^k}{dt^k} e^{tX} = X^k e^{tX}, e porre t=0t = 0.

Esempio (esponenziale): M(t)=λ(λ−t)−1M(t) = \lambda(\lambda - t)^{-1}, M′(t)=λ(λ−t)−2M'(t) = \lambda(\lambda - t)^{-2}, M′′(t)=2λ(λ−t)−3M''(t) = 2\lambda(\lambda - t)^{-3}. In 00: E[X]=1λE[X] = \frac1\lambda, E[X2]=2λ2E[X^2] = \frac{2}{\lambda^2}, Var(X)=1λ2\text{Var}(X) = \frac{1}{\lambda^2} ✓. In generale M(k)(0)=k!λkM^{(k)}(0) = \frac{k!}{\lambda^k}.

Esempio (Poisson): M(t)=eλ(et−1)M(t) = e^{\lambda(e^t - 1)}, M′(t)=λetM(t)M'(t) = \lambda e^t M(t), M′′(t)=λetM(t)+(λet)2M(t)M''(t) = \lambda e^t M(t) + (\lambda e^t)^2 M(t). In 00: E[X]=λE[X] = \lambda, E[X2]=λ+λ2E[X^2] = \lambda + \lambda^2, Var(X)=λ\text{Var}(X) = \lambda ✓.

Esempio (gaussiana standard): et2/2=∑mt2m2mm!e^{t^2/2} = \sum_m \frac{t^{2m}}{2^m m!}: i momenti dispari sono nulli e E[Z2m]=(2m)!2mm!E[Z^{2m}] = \frac{(2m)!}{2^m m!}, cioè E[Z2]=1E[Z^2] = 1, E[Z4]=3E[Z^4] = 3, E[Z6]=15E[Z^6] = 15.

2. Trasformazioni affini

MaX+b(t)=ebtMX(at).M_{aX + b}(t) = e^{bt} M_X(at).

Perché: E[et(aX+b)]=ebtE[e(at)X]E[e^{t(aX + b)}] = e^{bt}E[e^{(at)X}]. Esempio: X=μ+σZX = \mu + \sigma Z ha MX(t)=eμtMZ(σt)=eμt+σ2t2/2M_X(t) = e^{\mu t}M_Z(\sigma t) = e^{\mu t + \sigma^2 t^2/2}.

3. Somme di v.a. indipendenti

Se XX e YY sono indipendenti, MX+Y(t)=MX(t) MY(t).M_{X + Y}(t) = M_X(t) \, M_Y(t).

Perché: et(X+Y)=etXetYe^{t(X + Y)} = e^{tX} e^{tY}, e per v.a. indipendenti la media del prodotto di funzioni di ciascuna è il prodotto delle medie. Più in generale, MX1+⋯+Xn=∏iMXiM_{X_1 + \dots + X_n} = \prod_i M_{X_i}. La convoluzione (un integrale) diventa un prodotto (un'operazione elementare).

4. La f.g.m. determina la legge

Teorema di unicità. Se MX(t)=MY(t)<∞M_X(t) = M_Y(t) < \infty per ogni tt in un intorno di 00, allora XX e YY hanno la stessa legge.

Dimostrazione non in programma. Combinato con la proprietà 3, dà un metodo rapido per trovare leggi di somme: si moltiplicano le f.g.m. e si riconosce il risultato nella tabella.

Applicazioni: somme notevoli in una riga

  • Poi(λ)+Poi(μ)\text{Poi}(\lambda) + \text{Poi}(\mu) indipendenti: eλ(et−1)eμ(et−1)=e(λ+μ)(et−1)e^{\lambda(e^t - 1)}e^{\mu(e^t - 1)} = e^{(\lambda + \mu)(e^t - 1)}, quindi Poi(λ+μ)\text{Poi}(\lambda + \mu).
  • Bin(n,p)+Bin(m,p)\text{Bin}(n, p) + \text{Bin}(m, p): (1−p+pet)n+m(1 - p + pe^t)^{n + m}, quindi Bin(n+m,p)\text{Bin}(n + m, p).
  • nn esponenziali Exp(λ)\text{Exp}(\lambda) indipendenti: (λλ−t)n\left(\frac{\lambda}{\lambda - t}\right)^n, quindi Γ(n,λ)\Gamma(n, \lambda).
  • N(μ1,σ12)+N(μ2,σ22)N(\mu_1, \sigma_1^2) + N(\mu_2, \sigma_2^2) indipendenti: eμ1t+σ12t2/2eμ2t+σ22t2/2=e(μ1+μ2)t+(σ12+σ22)t2/2e^{\mu_1 t + \sigma_1^2 t^2/2}e^{\mu_2 t + \sigma_2^2 t^2/2} = e^{(\mu_1 + \mu_2)t + (\sigma_1^2 + \sigma_2^2)t^2/2}, quindi N(μ1+μ2,σ12+σ22)N(\mu_1 + \mu_2, \sigma_1^2 + \sigma_2^2).

Confronta con i calcoli di convoluzione in Somma di variabili aleatorie indipendentiSe X e Y sono indipendenti, la legge di Z = X + Y è la convoluzione: p_Z(n) = Σ_k p_X(k) p_Y(n − k) nel discreto, f_Z(z) = ∫ f_X(z − y) f_Y(y) dy nel continuo. Casi notevoli: Bin(n,p) + Bin(m,p) = Bin(n+m,p), Poi(λ) + Poi(μ) = Poi(λ+μ), Geo + Geo con densità (n−1)p²(1−p)^(n−2), Exp(λ) + Exp(λ) = Γ(2,λ), gaussiane indipendenti sommano medie e varianze.Somma di variabili aleatorie indipendenti →: qui non c'è nessun integrale.

Limiti: quando la f.g.m. non esiste

Se XX ha code "pesanti", MX(t)=+∞M_X(t) = +\infty per ogni t≠0t \ne 0. Esempio: la densità di Cauchy 1π(1+x2)\frac{1}{\pi(1 + x^2)}, per cui etxe^{tx} cresce esponenzialmente mentre la densità decresce solo come 1x2\frac{1}{x^2}. Per v.a. di questo tipo la f.g.m. è inutile; la Funzione caratteristicaLa funzione caratteristica φ_X(θ) = E[e^(iθX)] = E[cos θX] + iE[sin θX] esiste per ogni v.a. e ogni θ, vale 1 in 0, ha modulo ≤ 1, determina la legge (è la trasformata di Fourier della densità), trasforma le somme di v.a. indipendenti in prodotti e dà i momenti: E[X^k] = φ^(k)(0) / i^k. Per N(μ, σ²) vale e^(iμθ − σ²θ²/2).Funzione caratteristica → invece esiste sempre, perché ∣eiθX∣=1|e^{i\theta X}| = 1. È il motivo per cui nella teoria si preferisce la funzione caratteristica.

Tabella

Legge MX(t)M_X(t) dove è finita
Be(p)\text{Be}(p) 1−p+pet1 - p + pe^t R\mathbb R
Bin(n,p)\text{Bin}(n, p) (1−p+pet)n(1 - p + pe^t)^n R\mathbb R
Geo(p)\text{Geo}(p) pet1−(1−p)et\frac{pe^t}{1 - (1 - p)e^t} t<−ln⁡(1−p)t < -\ln(1 - p)
Poi(λ)\text{Poi}(\lambda) eλ(et−1)e^{\lambda(e^t - 1)} R\mathbb R
U(a,b)U(a, b) etb−etat(b−a)\frac{e^{tb} - e^{ta}}{t(b - a)} R\mathbb R
Exp(λ)\text{Exp}(\lambda) λλ−t\frac{\lambda}{\lambda - t} t<λt < \lambda
Γ(α,λ)\Gamma(\alpha, \lambda) (λλ−t)α\left(\frac{\lambda}{\lambda - t}\right)^\alpha t<λt < \lambda
N(μ,σ2)N(\mu, \sigma^2) eμt+σ2t2/2e^{\mu t + \sigma^2 t^2/2} R\mathbb R

Errori comuni

  • Dimenticare il dominio: λλ−t\frac{\lambda}{\lambda - t} vale solo per t<λt < \lambda; per t≥λt \ge \lambda la f.g.m. è +∞+\infty, non un numero negativo.
  • Moltiplicare le f.g.m. senza indipendenza.
  • Derivare e non valutare in 00: E[Xk]E[X^k] è la derivata calcolata in t=0t = 0.
  • Confondere MaX(t)=MX(at)M_{aX}(t) = M_X(at) con aMX(t)aM_X(t).

Teoria collegata