Salta al contenuto
Note per Studenti Formulario - calcolo delle probabilità

Formulario - calcolo delle probabilità

In questa pagina 8

Spazio di probabilità

Note: Spazio campionario ed eventiUno spazio di probabilità è la terna (Ω, F, P); Ω raccoglie gli esiti possibili dell'esperimento, un evento è un sottoinsieme di Ω, e le operazioni logiche tra eventi sono unione, intersezione e complementare.Spazio campionario ed eventi → · Sigma-algebre di eventiUna σ-algebra è una famiglia di eventi che contiene ∅ ed è chiusa per complementare e unioni numerabili; è la famiglia degli eventi a cui si assegna una probabilità. Nel caso discreto si prende tutto 𝒫(Ω).Sigma-algebre di eventi → · Misura di probabilità e sue proprietàUna misura di probabilità è una funzione P: F → [0,1] con P(Ω) = 1 e σ-additiva; ne seguono P(Aᶜ) = 1 − P(A), P(∅) = 0, monotonia, P(A ∪ B) = P(A) + P(B) − P(A ∩ B) e la formula di inclusione-esclusione.Misura di probabilità e sue proprietà → · Spazi di probabilità discreti e uniformiIn uno spazio discreto la probabilità è determinata dalla densità discreta p(ω) = P({ω}), con somma 1, e P(A) è la somma di p(ω) sugli esiti di A; negli spazi uniformi (esiti equiprobabili) P(A) = |A| / |Ω|, casi favorevoli su casi possibili.Spazi di probabilità discreti e uniformi → · Calcolo combinatorio per la probabilitàNegli spazi uniformi bisogna contare: principio di moltiplicazione, disposizioni con ripetizione n^k, disposizioni semplici n!/(n−k)!, permutazioni n!, combinazioni (n su k); estrazioni con e senza reinserimento e distribuzione ipergeometrica.Calcolo combinatorio per la probabilità →

  • PartizioneFamiglia di eventi a due a due disgiunti la cui unione è tutto Ω: ogni esito sta in uno e un solo evento. di Ω\Omega: eventi AiA_i a due a due disgiunti con ⋃Ai=Ω\bigcup A_i=\Omega. σ\sigma-algebra F\mathcal F: ∅∈F\emptyset\in\mathcal F, chiusa per complementare e unioni numerabili (nel caso discreto F=P(Ω)\mathcal F=\mathcal P(\Omega)).
  • Misura di probabilità P:F→[0,1]P:\mathcal F\to[0,1]: P(Ω)=1P(\Omega)=1 e σ\sigma-additività P(⋃An)=∑P(An)P(\bigcup A_n)=\sum P(A_n) per AnA_n a due a due disgiunti. Ne seguono P(∅)=0P(\emptyset)=0, P(Ac)=1−P(A)P(A^c)=1-P(A), monotonia, P(A∪B)=P(A)+P(B)−P(A∩B)P(A\cup B)=P(A)+P(B)-P(A\cap B) e l'inclusione-esclusione.
  • Spazio discreto: P(A)=∑ω∈Ap(ω)P(A)=\sum_{\omega\in A}p(\omega) con p(ω)=P({ω})≥0p(\omega)=P(\{\omega\})\ge0 e ∑ωp(ω)=1\sum_\omega p(\omega)=1. Uniforme: p(ω)=1∣Ω∣p(\omega)=\frac1{|\Omega|}, P(A)=∣A∣∣Ω∣P(A)=\frac{|A|}{|\Omega|} (casi favorevoli su casi possibili).
  • Conteggio: principio di moltiplicazione n1⋯nkn_1\cdots n_k; disposizioni con ripetizione nkn^k; senza ripetizione n!(n−k)!\frac{n!}{(n-k)!}; permutazioni n!n!; combinazioni (nk)=n!k!(n−k)!\binom nk=\frac{n!}{k!(n-k)!}. Estrazioni di nn palline da NN con MM nere: con reinserimento (nk)(MN)k(1−MN)n−k\binom nk\big(\frac MN\big)^k\big(1-\frac MN\big)^{n-k}; senza reinserimento (ipergeometrica) (Mk)(N−Mn−k)(Nn)\displaystyle\frac{\binom Mk\binom{N-M}{n-k}}{\binom Nn}.

Grafico interattivo: Densità discreta p(n) = (1/2)^n, n = 1, 2, ...: i valori sommano a 1

Probabilità condizionata e indipendenza

Note: Probabilità condizionataLa probabilità di A sapendo che si è verificato B è P(A ∣ B) = P(A ∩ B) / P(B), con P(B) > 0; è una nuova misura di probabilità, e da essa seguono la regola del prodotto e la regola della catena.Probabilità condizionata → · Formula delle probabilità totali e formula di BayesSe (A_i) è una partizione di Ω, P(B) = Σ P(B ∣ A_i) P(A_i) (probabilità totali); la formula di Bayes inverte il condizionamento: P(A_k ∣ B) = P(B ∣ A_k) P(A_k) / P(B).Formula delle probabilità totali e formula di Bayes → · Indipendenza di eventiA e B sono indipendenti se P(A ∩ B) = P(A) P(B), cioè se sapere che uno si è verificato non cambia la probabilità dell'altro; l'indipendenza passa ai complementari, non va confusa con l'incompatibilità, e per più eventi va richiesta su ogni sottofamiglia.Indipendenza di eventi → · Prove ripetute e modello binomialen prove indipendenti, ciascuna con probabilità di successo p: una sequenza con k successi ha probabilità p^k (1−p)^(n−k), e la probabilità di esattamente k successi è (n su k) p^k (1−p)^(n−k) (modello binomiale); il primo successo alla prova k ha probabilità (1−p)^(k−1) p.Prove ripetute e modello binomiale →

  • P(B)>0P(B)>0: P(A∣B)=P(A∩B)P(B)\displaystyle P(A\mid B)=\frac{P(A\cap B)}{P(B)}; A↦P(A∣B)A\mapsto P(A\mid B) è una misura di probabilità; regola del prodotto P(A∩B)=P(A∣B)P(B)P(A\cap B)=P(A\mid B)P(B).
  • Partizione (Ai)(A_i) con P(Ai)>0P(A_i)>0: probabilità totali P(B)=∑iP(B∣Ai)P(Ai)\displaystyle P(B)=\sum_iP(B\mid A_i)P(A_i); Bayes (se P(B)>0P(B)>0) P(Ak∣B)=P(B∣Ak)P(Ak)∑iP(B∣Ai)P(Ai)\displaystyle P(A_k\mid B)=\frac{P(B\mid A_k)P(A_k)}{\sum_iP(B\mid A_i)P(A_i)}.
  • A,BA,B indipendenti se P(A∩B)=P(A)P(B)P(A\cap B)=P(A)P(B) (allora lo sono anche A,BcA,B^c e le altre coppie); A1,…,AnA_1,\dots,A_n mutuamente indipendenti se P(⋂i∈IAi)=∏i∈IP(Ai)P(\bigcap_{i\in I}A_i)=\prod_{i\in I}P(A_i) per ogni sottofamiglia II con almeno due elementi. Indipendenza non è incompatibilità.
  • nn prove indipendenti con successo pp: P(k successi)=(nk)pk(1−p)n−kP(k\text{ successi})=\binom nkp^k(1-p)^{n-k}; primo successo alla prova kk: (1−p)k−1p(1-p)^{k-1}p.

Grafico interattivo: Modello binomiale con n = 10, p = 0,3: probabilità di k successi (massima per k = 3 = n·p)

Variabili aleatorie discrete

Note: Variabili aleatorie discrete e densità discretaUna variabile aleatoria discreta è una funzione X da Ω in R che assume un insieme finito o numerabile di valori (l'alfabeto); la sua densità discreta p_X(x) = P(X = x) basta a calcolare la probabilità di ogni evento che riguarda X.Variabili aleatorie discrete e densità discreta → · Funzione di distribuzioneLa funzione di distribuzione (FdD) F_X(x) = P(X ≤ x) è definita per ogni v.a., è crescente, continua a destra, va da 0 a 1 e determina la legge; per una v.a. discreta è a gradini, con salti in corrispondenza dei valori e di altezza pari alla densità.Funzione di distribuzione → · Bernoulli, binomiale e uniforme discretaBernoulli Be(p): un solo tentativo, vale 1 con probabilità p; binomiale Bin(n, p): numero di successi in n prove indipendenti, P(X = k) = C(n,k) p^k (1−p)^(n−k), media np e varianza np(1−p); uniforme discreta: n valori equiprobabili.Bernoulli, binomiale e uniforme discreta → · Distribuzione geometricaGeo(p) è il numero della prova in cui arriva il primo successo in prove indipendenti: P(X = n) = (1−p)^(n−1) p per n ≥ 1, P(X > n) = (1−p)^n (lunga attesa), media 1/p, varianza (1−p)/p², ed è senza memoria.Distribuzione geometrica → · Distribuzione di PoissonPoi(λ) conta eventi rari: P(X = k) = e^(−λ) λ^k / k! per k = 0, 1, 2, …, con media e varianza entrambe uguali a λ; approssima la binomiale Bin(n, p) quando n è grande e p piccolo, con λ = np.Distribuzione di Poisson → · Valore attesoIl valore atteso E[X] = Σ x p_X(x) è la media dei valori di X pesata con le loro probabilità (esiste se la serie converge assolutamente); per una funzione g vale E[g(X)] = Σ g(x) p_X(x) senza trovare la legge di g(X), ed E è lineare: E[aX + bY + c] = aE[X] + bE[Y] + c.Valore atteso → · Varianza e momentiI momenti E[X^k] e i momenti centrati E[(X − μ)^k] descrivono la forma di una legge; la varianza Var(X) = E[(X − μ)²] = E[X²] − E[X]² misura quanto X si disperde attorno alla media, vale Var(aX + b) = a² Var(X) e Var(X) = 0 solo se X è costante.Varianza e momenti → · Disuguaglianze di Markov, Chebyshev e JensenMarkov: per X ≥ 0, P(X ≥ a) ≤ E[X]/a; Chebyshev: P(|X − μ| ≥ ε) ≤ Var(X)/ε²; Jensen: per φ convessa, φ(E[X]) ≤ E[φ(X)]. Stimano probabilità e medie conoscendo solo media e varianza.Disuguaglianze di Markov, Chebyshev e Jensen →

  • V.a. discreta X:Ω→RX:\Omega\to\mathbb R con alfabeto finito o numerabile; densità pX(x)=P(X=x)p_X(x)=P(X=x). FdD FX(x)=P(X≤x)F_X(x)=P(X\le x): crescente, limiti 00 e 11, continua a destra; discreta = a gradini con salti pX(x)p_X(x).
  • Leggi: Be(p)(p): pX(1)=pp_X(1)=p, pX(0)=1−pp_X(0)=1-p. Bin(n,p)(n,p): (nk)pk(1−p)n−k\binom nkp^k(1-p)^{n-k}, k=0,…,nk=0,\dots,n. Geo(p)(p): (1−p)n−1p(1-p)^{n-1}p, n≥1n\ge1, P(X>n)=(1−p)nP(X>n)=(1-p)^n, senza memoria P(X>n+m∣X>n)=P(X>m)P(X>n+m\mid X>n)=P(X>m). Poi(λ)(\lambda): e−λλkk!e^{-\lambda}\frac{\lambda^k}{k!}, k≥0k\ge0; se Xn∼Bin(n,λn)X_n\sim\mathrm{Bin}(n,\frac\lambda n) allora P(Xn=k)→e−λλkk!P(X_n=k)\to e^{-\lambda}\frac{\lambda^k}{k!}. Uniforme discreta: pX(xi)=1np_X(x_i)=\frac1n.
  • E[X]=∑x pX(x)E[X]=\sum x\,p_X(x) (se ∑∣x∣pX(x)<∞\sum|x|p_X(x)<\infty); E[g(X)]=∑g(x)pX(x)E[g(X)]=\sum g(x)p_X(x); E[aX+bY+c]=aE[X]+bE[Y]+cE[aX+bY+c]=aE[X]+bE[Y]+c anche senza indipendenza; E[1A]=P(A)E[\mathbb 1_A]=P(A); per valori in N\mathbb N: E[X]=∑n≥0P(X>n)E[X]=\sum_{n\ge0}P(X>n).
  • MomentoIl momento k-esimo di X è il valore atteso di X elevato alla k. kk-esimo E[Xk]E[X^k]; Var(X)=E[(X−μ)2]=E[X2]−E[X]2\mathrm{Var}(X)=E[(X-\mu)^2]=E[X^2]-E[X]^2, σ=Var\sigma=\sqrt{\mathrm{Var}}; Var(aX+b)=a2Var(X)\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X); Var(X)=0  ⟺  X=μ\mathrm{Var}(X)=0\iff X=\mu quasi certamente.
  • Markov (X≥0X\ge0, a>0a>0): P(X≥a)≤E[X]a\displaystyle P(X\ge a)\le\frac{E[X]}a. Chebyshev: P(∣X−μ∣≥ε)≤Var(X)ε2\displaystyle P(|X-\mu|\ge\varepsilon)\le\frac{\mathrm{Var}(X)}{\varepsilon^2}. Jensen: φ\varphi convessa ⇒φ(E[X])≤E[φ(X)]\Rightarrow\varphi(E[X])\le E[\varphi(X)] (concava: verso opposto).
Legge E[X]E[X] Var(X)\mathrm{Var}(X)
Bin(n,p)(n,p) npnp np(1−p)np(1-p)
Geo(p)(p) 1p\frac1p 1−pp2\frac{1-p}{p^2}
Poi(λ)(\lambda) λ\lambda λ\lambda

Grafico interattivo: FdD del dado: gradini di altezza 1/6 nei punti 1, 2, …, 6 (i tratti verticali sono solo il disegno dei salti)

Grafico interattivo: Densità di Bin(10; 0,3): massima in k = 3 (valore ≈ 0,267), praticamente nulla oltre k = 7

Grafico interattivo: Densità di Geo(1/2): P(X = n) = (1/2)^n, si dimezza a ogni passo

Grafico interattivo: Densità di Poi(5): massima in k = 4 e k = 5, centrata attorno alla media λ = 5

Variabili aleatorie assolutamente continue

Note: Spazi di probabilità generali e sigma-algebra di BorelNegli spazi non discreti la probabilità non si ricava più dai singoli esiti: si usa la σ-algebra di Borel (generata dagli intervalli), la continuità della probabilità lungo successioni monotone di eventi e la definizione generale di v.a. come funzione X con {X ≤ x} evento per ogni x.Spazi di probabilità generali e sigma-algebra di Borel → · Variabili aleatorie assolutamente continueX è assolutamente continua se F_X(x) = ∫ da −∞ a x di f_X(t) dt per una densità f_X ≥ 0 con integrale 1; allora P(a < X ≤ b) = ∫ da a a b di f_X, P(X = x) = 0 per ogni x, f_X = F_X' dove F_X è derivabile, E[g(X)] = ∫ g(x) f_X(x) dx, e varianza, momenti e disuguaglianze funzionano come nel caso discreto con gli integrali al posto delle somme.Variabili aleatorie assolutamente continue → · Distribuzioni uniforme continua ed esponenzialeU(a, b) ha densità costante 1/(b − a) su [a, b], media (a + b)/2 e varianza (b − a)²/12; Exp(λ) ha densità λe^(−λx) per x ≥ 0, FdD 1 − e^(−λx), P(X > t) = e^(−λt), media 1/λ, varianza 1/λ², ed è l'unica legge continua senza memoria (versione continua della geometrica).Distribuzioni uniforme continua ed esponenziale → · Distribuzione gammaΓ(α, λ) ha densità λ^α x^(α−1) e^(−λx) / Γ(α) per x > 0, dove Γ(α) = ∫ x^(α−1) e^(−x) dx è la funzione Gamma (Γ(n) = (n − 1)!, Γ(1/2) = √π); media α/λ, varianza α/λ²; Γ(1, λ) = Exp(λ), e la somma di n esponenziali Exp(λ) indipendenti è Γ(n, λ), il tempo d'attesa dell'n-esimo evento.Distribuzione gamma → · Distribuzione gaussiana (normale)N(μ, σ²) ha densità e^(−(x−μ)²/(2σ²)) / √(2πσ²), a campana centrata in μ con larghezza σ; media μ, varianza σ²; si standardizza con Z = (X − μ)/σ ~ N(0, 1) e si calcola P(X ≤ x) = Φ((x − μ)/σ), con Φ(−z) = 1 − Φ(z); aX + b è ancora gaussiana, N(aμ + b, a²σ²).Distribuzione gaussiana (normale) → · Funzioni di una variabile aleatoriaPer trovare la legge di Y = g(X) si calcola la FdD: F_Y(y) = P(g(X) ≤ y) = P(X ∈ g⁻¹((−∞, y])), poi si deriva; se g è strettamente monotona e derivabile vale la formula f_Y(y) = f_X(g⁻¹(y)) · |(g⁻¹)'(y)|; se g è costante a tratti Y è discreta; se g non è iniettiva (es. X²) si spezza l'evento.Funzioni di una variabile aleatoria → · Variabili aleatorie misteUna v.a. mista ha una FdD con salti (parte discreta, masse p_i nei punti x_i) e tratti crescenti continui (parte con densità f): E[g(X)] = Σ g(x_i) p_i + ∫ g(x) f(x) dx, con Σ p_i + ∫ f = 1; varianza come sempre E[X²] − E[X]².Variabili aleatorie miste →

  • Continuità della probabilità: An↑⇒P(⋃An)=lim⁡P(An)A_n\uparrow\Rightarrow P(\bigcup A_n)=\lim P(A_n); An↓⇒P(⋂An)=lim⁡P(An)A_n\downarrow\Rightarrow P(\bigcap A_n)=\lim P(A_n). Borel B(R)\mathcal B(\mathbb R) = σ\sigma-algebra generata dagli intervalli (a,b](a,b].
  • XX assolutamente continua: FX(x)=∫−∞xfXF_X(x)=\int_{-\infty}^xf_X con fX≥0f_X\ge0, ∫RfX=1\int_{\mathbb R}f_X=1; P(a<X≤b)=∫abfXP(a<X\le b)=\int_a^bf_X, P(X=x)=0P(X=x)=0, fX=FX′f_X=F_X' dove esiste; E[g(X)]=∫g(x)fX(x) dxE[g(X)]=\int g(x)f_X(x)\,dx (se ∫∣g∣fX<∞\int|g|f_X<\infty).
  • U(a,b)U(a,b): f=1b−a1[a,b]f=\frac1{b-a}\mathbb 1_{[a,b]}, F=x−ab−aF=\frac{x-a}{b-a} su [a,b][a,b]. Exp(λ)(\lambda): f=λe−λxf=\lambda e^{-\lambda x} (x≥0x\ge0), F=1−e−λxF=1-e^{-\lambda x}, P(X>t)=e−λtP(X>t)=e^{-\lambda t}, senza memoria P(X>s+t∣X>s)=P(X>t)P(X>s+t\mid X>s)=P(X>t).
  • Gamma: Γ(α)=∫0+∞xα−1e−xdx\Gamma(\alpha)=\int_0^{+\infty}x^{\alpha-1}e^{-x}dx (Γ(n)=(n−1)!\Gamma(n)=(n-1)!); Γ(α,λ)\Gamma(\alpha,\lambda): f=λαΓ(α)xα−1e−λx\displaystyle f=\frac{\lambda^\alpha}{\Gamma(\alpha)}x^{\alpha-1}e^{-\lambda x} (x>0x>0); Γ(1,λ)=Exp(λ)\Gamma(1,\lambda)=\mathrm{Exp}(\lambda); X∼Γ(α,λ)X\sim\Gamma(\alpha,\lambda), Y∼Γ(β,λ)Y\sim\Gamma(\beta,\lambda) indipendenti ⇒X+Y∼Γ(α+β,λ)\Rightarrow X+Y\sim\Gamma(\alpha+\beta,\lambda).
  • Normale: Z∼N(0,1)Z\sim N(0,1), φ(z)=12πe−z2/2\varphi(z)=\frac1{\sqrt{2\pi}}e^{-z^2/2}, Φ(z)=∫−∞zφ\Phi(z)=\int_{-\infty}^z\varphi, Φ(−z)=1−Φ(z)\Phi(-z)=1-\Phi(z). X∼N(μ,σ2)X\sim N(\mu,\sigma^2): f=12πσ2e−(x−μ)22σ2f=\frac1{\sqrt{2\pi\sigma^2}}e^{-\frac{(x-\mu)^2}{2\sigma^2}}; P(X≤x)=Φ(x−μσ)P(X\le x)=\Phi\big(\frac{x-\mu}\sigma\big); aX+b∼N(aμ+b,a2σ2)aX+b\sim N(a\mu+b,a^2\sigma^2); X,YX,Y indipendenti ⇒X+Y∼N(μ1+μ2,σ12+σ22)\Rightarrow X+Y\sim N(\mu_1+\mu_2,\sigma_1^2+\sigma_2^2).
  • Y=g(X)Y=g(X): FY(y)=P(g(X)≤y)=P(X∈g−1((−∞,y]))F_Y(y)=P(g(X)\le y)=P(X\in g^{-1}((-\infty,y])), poi si deriva; gg strettamente monotona e derivabile con inversa hh: fY(y)=fX(h(y)) ∣h′(y)∣f_Y(y)=f_X(h(y))\,|h'(y)|. Se FYF_Y è a gradini YY è discreta.
  • Mista: FX(x)=∑xi≤xpi+∫−∞xf\displaystyle F_X(x)=\sum_{x_i\le x}p_i+\int_{-\infty}^xf, con ∑pi+∫f=1\sum p_i+\int f=1; E[g(X)]=∑g(xi)pi+∫g f dxE[g(X)]=\sum g(x_i)p_i+\int g\,f\,dx.
Legge E[X]E[X] Var(X)\mathrm{Var}(X)
U(a,b)U(a,b) a+b2\frac{a+b}2 (b−a)212\frac{(b-a)^2}{12}
Exp(λ)(\lambda) 1λ\frac1\lambda 1λ2\frac1{\lambda^2}
Γ(α,λ)\Gamma(\alpha,\lambda) αλ\frac\alpha\lambda αλ2\frac\alpha{\lambda^2}
N(μ,σ2)N(\mu,\sigma^2) μ\mu σ2\sigma^2

Grafico interattivo: Densità di Exp(2): parte da λ = 2 in x = 0 e decresce esponenzialmente

Grafico interattivo: Densità di Γ(α, 1) al variare della forma α: per α < 1 esplode in 0, per α = 1 è l'esponenziale, per α > 1 parte da 0 e ha il massimo in α − 1; per α = 5 è già quasi simmetrica

Grafico interattivo: Densità della gaussiana standard: campana simmetrica, flessi in ±1

Grafico interattivo: Densità della gaussiana standard: l'area tra −1 e 1 vale 2Φ(1) − 1 ≈ 0,683, il primo livello della regola 68-95-99,7

Grafico interattivo: FdD della v.a. mista: salto di 0,3 in x = 0, poi crescita continua

Vettori aleatori

Note: Vettori aleatori discretiUn vettore aleatorio discreto (X, Y) è descritto dalla densità congiunta p(x, y) = P(X = x, Y = y); le marginali si ottengono sommando sull'altra variabile, X e Y sono indipendenti se p(x, y) = p_X(x) p_Y(y) per ogni coppia, e E[g(X, Y)] = Σ g(x, y) p(x, y).Vettori aleatori discreti → · Vettori aleatori assolutamente continuiUn vettore (X, Y) è assolutamente continuo se P((X, Y) ∈ A) = ∬_A f(x, y) dx dy per una densità congiunta f ≥ 0 con integrale 1; le marginali si ottengono integrando sull'altra variabile (f_X(x) = ∫ f(x, y) dy), X e Y sono indipendenti se f(x, y) = f_X(x) f_Y(y), e E[g(X, Y)] = ∬ g f. Il punto delicato degli esercizi è descrivere bene la regione dove f > 0.Vettori aleatori assolutamente continui → · Somma di variabili aleatorie indipendentiSe X e Y sono indipendenti, la legge di Z = X + Y è la convoluzione: p_Z(n) = Σ_k p_X(k) p_Y(n − k) nel discreto, f_Z(z) = ∫ f_X(z − y) f_Y(y) dy nel continuo. Casi notevoli: Bin(n,p) + Bin(m,p) = Bin(n+m,p), Poi(λ) + Poi(μ) = Poi(λ+μ), Geo + Geo con densità (n−1)p²(1−p)^(n−2), Exp(λ) + Exp(λ) = Γ(2,λ), gaussiane indipendenti sommano medie e varianze.Somma di variabili aleatorie indipendenti → · Covarianza e coefficiente di correlazioneCov(X, Y) = E[(X − E X)(Y − E Y)] = E[XY] − E[X]E[Y] misura quanto X e Y variano insieme; è bilineare, Cov(X, X) = Var(X), Var(X + Y) = Var X + Var Y + 2Cov(X, Y); ρ = Cov / (σ_X σ_Y) sta in [−1, 1] e vale ±1 solo per legami lineari. Indipendenti ⇒ non correlate, ma non viceversa (tranne per i vettori gaussiani).Covarianza e coefficiente di correlazione → · Vettori gaussianiX = (X₁, ..., Xₙ) è un vettore gaussiano N(m, Σ) se ogni combinazione lineare a·X è gaussiana (equivalentemente X = m + AZ con Z gaussiane standard indipendenti); se Σ è invertibile ha densità exp(−½(x−m)ᵀΣ⁻¹(x−m)) / √((2π)ⁿ det Σ). Proprietà chiave: AX + b ~ N(Am + b, AΣAᵀ), le marginali sono gaussiane e componenti non correlate sono indipendenti.Vettori gaussiani →

  • Discreti: pX,Y(x,y)=P(X=x,Y=y)p_{X,Y}(x,y)=P(X=x,Y=y); marginali pX(x)=∑ypX,Y(x,y)p_X(x)=\sum_yp_{X,Y}(x,y), pY(y)=∑xpX,Y(x,y)p_Y(y)=\sum_xp_{X,Y}(x,y); indipendenti   ⟺  pX,Y=pXpY\iff p_{X,Y}=p_Xp_Y; E[g(X,Y)]=∑x,yg(x,y)pX,Y(x,y)E[g(X,Y)]=\sum_{x,y}g(x,y)p_{X,Y}(x,y).
  • Assolutamente continui: P((X,Y)∈A)=∬AfX,YP((X,Y)\in A)=\iint_Af_{X,Y}, ∬fX,Y=1\iint f_{X,Y}=1, FdR FX,Y(x,y)=P(X≤x,Y≤y)F_{X,Y}(x,y)=P(X\le x,Y\le y); marginali fX(x)=∫fX,Y(x,y) dyf_X(x)=\int f_{X,Y}(x,y)\,dy; indipendenti   ⟺  fX,Y=fXfY\iff f_{X,Y}=f_Xf_Y (  ⟺  FX,Y=FXFY\iff F_{X,Y}=F_XF_Y); E[g(X,Y)]=∬g fX,YE[g(X,Y)]=\iint g\,f_{X,Y}.
  • Somma di indipendenti (convoluzione): pZ(n)=∑kpX(k)pY(n−k)p_Z(n)=\sum_kp_X(k)p_Y(n-k); fZ(z)=∫fX(z−y)fY(y) dy\displaystyle f_Z(z)=\int f_X(z-y)f_Y(y)\,dy. Bin(n,p)+(n,p)+Bin(m,p)=(m,p)=Bin(n+m,p)(n+m,p); Poi(λ)+(\lambda)+Poi(μ)=(\mu)=Poi(λ+μ)(\lambda+\mu); Exp(λ)+(\lambda)+Exp(λ)=Γ(2,λ)(\lambda)=\Gamma(2,\lambda).
  • Cov(X,Y)=E[(X−EX)(Y−EY)]=E[XY]−E[X]E[Y]\mathrm{Cov}(X,Y)=E[(X-E X)(Y-E Y)]=E[XY]-E[X]E[Y]; bilineare, Cov(X,X)=Var(X)\mathrm{Cov}(X,X)=\mathrm{Var}(X); Var(aX+bY)=a2VarX+b2VarY+2ab Cov(X,Y)\mathrm{Var}(aX+bY)=a^2\mathrm{Var}X+b^2\mathrm{Var}Y+2ab\,\mathrm{Cov}(X,Y). Indipendenti ⇒Cov=0\Rightarrow\mathrm{Cov}=0 (non viceversa). ρ=Cov(X,Y)σXσY∈[−1,1]\rho=\frac{\mathrm{Cov}(X,Y)}{\sigma_X\sigma_Y}\in[-1,1], ∣ρ∣=1  ⟺  Y=aX+b|\rho|=1\iff Y=aX+b. Matrice di covarianza Σij=Cov(Xi,Xj)\Sigma_{ij}=\mathrm{Cov}(X_i,X_j) simmetrica e semidefinita positiva.
  • Vettore gaussiano X∼N(m,Σ)X\sim N(m,\Sigma): ogni combinazione lineare è gaussiana (  ⟺  X=m+AZ\iff X=m+AZ, AAT=ΣAA^T=\Sigma). Se det⁡Σ>0\det\Sigma>0: fX(x)=e−12(x−m)TΣ−1(x−m)(2π)ndet⁡Σ\displaystyle f_X(x)=\frac{e^{-\frac12(x-m)^T\Sigma^{-1}(x-m)}}{\sqrt{(2\pi)^n\det\Sigma}}. BX+b∼N(Bm+b,BΣBT)BX+b\sim N(Bm+b,B\Sigma B^T). Nei vettori gaussiani componenti non correlate sono indipendenti (Σ\Sigma diagonale).

Grafico interattivo: Densità della somma di due U(0, 1) indipendenti: triangolo con vertice in z = 1

Grafico interattivo: Curve di livello della densità dell'esempio (m = (1, −1), Σ con varianze 4 e 2, covarianza 2): ellissi centrate in m, inclinate verso l'alto a destra perché la covarianza è positiva (ρ = 2/√8 ≈ 0,71)

Densità e media condizionata

Note: Densità e media condizionataLa densità condizionata di X dato Y = y è p(x, y)/p_Y(y) nel discreto e f(x, y)/f_Y(y) nel continuo; la sua media è E[X | Y = y], e E[X | Y] è la v.a. che si ottiene sostituendo y con Y. Proprietà della torre: E[E[X | Y]] = E[X]. Per un vettore gaussiano, X dato Y = y è gaussiana con media m₁ + (Cov/Var Y)(y − m₂) e varianza σ₁²(1 − ρ²).Densità e media condizionata →

  • Discreto: pX∣Y(x∣y)=pX,Y(x,y)pY(y)p_{X\mid Y}(x\mid y)=\frac{p_{X,Y}(x,y)}{p_Y(y)}, E[X∣Y=y]=∑xx pX∣Y(x∣y)E[X\mid Y=y]=\sum_xx\,p_{X\mid Y}(x\mid y). Continuo: fX∣Y(x∣y)=fX,Y(x,y)fY(y)f_{X\mid Y}(x\mid y)=\frac{f_{X,Y}(x,y)}{f_Y(y)}, E[X∣Y=y]=∫x fX∣Y(x∣y) dxE[X\mid Y=y]=\int x\,f_{X\mid Y}(x\mid y)\,dx. E[X∣Y]=h(Y)E[X\mid Y]=h(Y) con h(y)=E[X∣Y=y]h(y)=E[X\mid Y=y].
  • Torre: E[E[X∣Y]]=E[X]E\big[E[X\mid Y]\big]=E[X], cioè E[X]=∫E[X∣Y=y]fY(y) dyE[X]=\int E[X\mid Y=y]f_Y(y)\,dy (o ∑yE[X∣Y=y]pY(y)\sum_yE[X\mid Y=y]p_Y(y)).
  • Gaussiano: X∣Y=y∼N(m1+ρσ1σ2(y−m2), σ12(1−ρ2))X\mid Y=y\sim N\Big(m_1+\rho\frac{\sigma_1}{\sigma_2}(y-m_2),\ \sigma_1^2(1-\rho^2)\Big), quindi E[X∣Y]=m1+Cov(X,Y)Var(Y)(Y−m2)E[X\mid Y]=m_1+\frac{\mathrm{Cov}(X,Y)}{\mathrm{Var}(Y)}(Y-m_2).

Grafico interattivo: Dato Y = y, X è uniforme su [0, y]: per y = 0,8 sta sul segmento orizzontale e la sua media è 0,4. Al variare di y le medie condizionate stanno sulla retta x = y/2, cioè E[X | Y] = Y/2

Funzioni generatrici

Note: Funzione generatrice dei momentiLa funzione generatrice dei momenti M_X(t) = E[e^(tX)] (quando è finita vicino a 0) produce i momenti per derivazione, E[X^k] = M_X^(k)(0); trasforma le somme di v.a. indipendenti in prodotti, M_(X+Y) = M_X M_Y, e se finita in un intorno di 0 determina la legge.Funzione generatrice dei momenti → · Funzione caratteristicaLa funzione caratteristica φ_X(θ) = E[e^(iθX)] = E[cos θX] + iE[sin θX] esiste per ogni v.a. e ogni θ, vale 1 in 0, ha modulo ≤ 1, determina la legge (è la trasformata di Fourier della densità), trasforma le somme di v.a. indipendenti in prodotti e dà i momenti: E[X^k] = φ^(k)(0) / i^k. Per N(μ, σ²) vale e^(iμθ − σ²θ²/2).Funzione caratteristica →

  • MX(t)=E[etX]M_X(t)=E[e^{tX}] (finita in un intorno di 00): E[Xk]=MX(k)(0)E[X^k]=M_X^{(k)}(0); MaX+b(t)=ebtMX(at)M_{aX+b}(t)=e^{bt}M_X(at); indipendenti: MX+Y=MXMYM_{X+Y}=M_XM_Y; due v.a. con la stessa MM vicino a 00 hanno la stessa legge. Esempio: Exp(1)(1) ha M(t)=11−tM(t)=\frac1{1-t} per t<1t<1.
  • φX(θ)=E[eiθX]\varphi_X(\theta)=E[e^{i\theta X}] esiste sempre: φX(0)=1\varphi_X(0)=1, ∣φX∣≤1|\varphi_X|\le1, φX(−θ)=φX(θ)‾\varphi_X(-\theta)=\overline{\varphi_X(\theta)}, uniformemente continua, φaX+b(θ)=eibθφX(aθ)\varphi_{aX+b}(\theta)=e^{ib\theta}\varphi_X(a\theta); XX simmetrica ⇒φX\Rightarrow\varphi_X reale e pari.
  • E[Xk]=φX(k)(0)ikE[X^k]=\frac{\varphi_X^{(k)}(0)}{i^k}; indipendenti: φX+Y=φXφY\varphi_{X+Y}=\varphi_X\varphi_Y; unicità: stessa φ\varphi ⇒\Rightarrow stessa legge. Inversione (se ∫∣φX∣<∞\int|\varphi_X|<\infty): fX(x)=12π∫e−iθxφX(θ) dθ\displaystyle f_X(x)=\frac1{2\pi}\int e^{-i\theta x}\varphi_X(\theta)\,d\theta. N(μ,σ2)N(\mu,\sigma^2): eiμθ−σ2θ2/2e^{i\mu\theta-\sigma^2\theta^2/2}. Bochner: φ\varphi è caratteristica   ⟺  φ(0)=1\iff\varphi(0)=1, continua e definita positiva.

Grafico interattivo: Funzione caratteristica di U(−1, 1): φ(θ) = sin θ / θ, reale perché la legge è simmetrica; vale 1 in θ = 0 e tende a 0 oscillando

Convergenze e teoremi limite

Note: Convergenza di successioni di variabili aleatorieQuattro modi in cui X_n → X: quasi certa (P(X_n → X) = 1), in probabilità (P(|X_n − X| > ε) → 0 per ogni ε), in media p-esima (E|X_n − X|^p → 0), in distribuzione (F_(X_n)(x) → F_X(x) nei punti di continuità di F_X). Relazioni: q.c. ⇒ prob., L^p ⇒ prob. ⇒ distr., L² ⇒ L¹; in distribuzione verso una costante ⇔ in probabilità. Teorema di Lévy: convergenza in distribuzione ⇔ convergenza puntuale delle funzioni caratteristiche.Convergenza di successioni di variabili aleatorie → · Legge dei grandi numeri e metodo Monte CarloSe X₁, X₂, ... sono i.i.d. con media μ, la media campionaria X̄ₙ = (X₁ + ... + Xₙ)/n converge a μ: in probabilità (legge debole, dimostrata con Chebyshev se la varianza è finita: P(|X̄ₙ − μ| > ε) ≤ σ²/(nε²)) e quasi certamente (legge forte). Metodo Monte Carlo: ∫ g = E[g(U)] si stima con la media di g(U₁), ..., g(Uₙ) per uniformi indipendenti.Legge dei grandi numeri e metodo Monte Carlo → · Teorema del limite centrale e approssimazione normaleSe X₁, X₂, ... sono i.i.d. con media μ e varianza σ² ∈ (0, ∞), la somma standardizzata (Sₙ − nμ)/(σ√n) converge in distribuzione a N(0, 1): per n grande P(Sₙ ≤ x) ≈ Φ((x − nμ)/(σ√n)). Caso binomiale (De Moivre-Laplace): Bin(n, p) ≈ N(np, np(1 − p)), con correzione di continuità ±0,5. Si dimostra con le funzioni caratteristiche e il teorema di Lévy.Teorema del limite centrale e approssimazione normale →

  • Xn→XX_n\to X: quasi certamenteCon probabilità 1: l'insieme degli esiti in cui la convergenza non vale ha probabilità zero. se P(Xn→X)=1P(X_n\to X)=1; in probabilità se P(∣Xn−X∣>ε)→0P(|X_n-X|>\varepsilon)\to0 ∀ε>0\forall\varepsilon>0; in LpL^p se E[∣Xn−X∣p]→0E[|X_n-X|^p]\to0; in distribuzione se FXn(x)→FX(x)F_{X_n}(x)\to F_X(x) nei punti di continuità di FXF_X.
  • Implicazioni: q.c. ⇒\Rightarrow prob.; Lp⇒L^p\Rightarrow prob. ⇒\Rightarrow distr.; Lq⇒LpL^q\Rightarrow L^p se q≥pq\ge p; in distribuzione verso una costante   ⟺  \iff in probabilità. Lévy: Xn→dX  ⟺  φXn(θ)→φX(θ)X_n\xrightarrow{d}X\iff\varphi_{X_n}(\theta)\to\varphi_X(\theta) ∀θ\forall\theta (limite continuo in 00).
  • Legge debole (XiX_i i.i.d.Indipendenti e identicamente distribuite: indipendenti tra loro e con la stessa legge., media μ\mu, varianza σ2\sigma^2): P(∣Xˉn−μ∣>ε)≤σ2nε2→0\displaystyle P(|\bar X_n-\mu|>\varepsilon)\le\frac{\sigma^2}{n\varepsilon^2}\to0. Legge forte (Kolmogorov, E∣X1∣<∞E|X_1|<\infty): Xˉn→μ\bar X_n\to\mu quasi certamente. Monte Carlo: 1n∑g(Uk)→∫01g\frac1n\sum g(U_k)\to\int_0^1g con UkU_k uniformi indipendenti.
  • TLC: P(Sn−nμσn≤x)→Φ(x)\displaystyle P\Big(\frac{S_n-n\mu}{\sigma\sqrt n}\le x\Big)\to\Phi(x) (σ2∈(0,∞)\sigma^2\in(0,\infty)); per nn grande Sn≈N(nμ,nσ2)S_n\approx N(n\mu,n\sigma^2), Xˉn≈N(μ,σ2n)\bar X_n\approx N(\mu,\frac{\sigma^2}n), P(Sn≤x)≈Φ(x−nμσn)P(S_n\le x)\approx\Phi\big(\frac{x-n\mu}{\sigma\sqrt n}\big).
  • De Moivre-Laplace: Bin(n,p)≈N(np,np(1−p))(n,p)\approx N(np,np(1-p)); con correzione di continuità (valori interi) P(X≤k)≈Φ(k+0,5−npnp(1−p))\displaystyle P(X\le k)\approx\Phi\Big(\frac{k+0{,}5-np}{\sqrt{np(1-p)}}\Big), P(X≥k)≈1−Φ(k−0,5−npnp(1−p))\displaystyle P(X\ge k)\approx1-\Phi\Big(\frac{k-0{,}5-np}{\sqrt{np(1-p)}}\Big).

Grafico interattivo: Maggiorazione di Chebyshev 1/(4nε²) con ε = 0,1, in funzione del numero di prove n: scende sotto 0,05 solo da n = 500 in poi

Grafico interattivo: Y ~ Bin(100, 1/2) ≈ N(50, 25): P(Y ≤ 47) = P(Y ≤ 47,5) è l'area a sinistra di 47,5, cioè Φ(−0,5) ≈ 0,309

Versione ripasso