Salta al contenuto
Note per Studenti Formulario · Calcolo delle Probabilità

FormularioCalcolo delle Probabilità: definizioni, teoremi e formule delle note, in ordine di capitolo

In questa pagina 8

1. Spazio di probabilità

Spazio campionario ed eventi

Legge (De Morgan). (A∪B)c=Ac∩Bc(A∩B)c=Ac∪Bc(A \cup B)^c = A^c \cap B^c \qquad\qquad (A \cap B)^c = A^c \cup B^c

Esempio. Dado, A={2,4,6}A = \{2,4,6\} e B={4,5,6}B = \{4,5,6\}: (A∪B)c={1,3}(A \cup B)^c = \{1,3\} e Ac∩Bc={1,3,5}∩{1,2,3}={1,3}A^c \cap B^c = \{1,3,5\} \cap \{1,2,3\} = \{1,3\}.

Definizione (partizione). Una partizione di Ω\Omega è una famiglia di eventi (Ai)i∈I(A_i)_{i \in I} tale che

  1. Ai∩Aj=∅A_i \cap A_j = \emptyset per ogni i≠ji \ne j (sono a due a due disgiunti);
  2. ⋃i∈IAi=Ω\bigcup_{i \in I} A_i = \Omega (ricoprono tutto Ω\Omega).

Esempio. Con il dado, A1={1,2}A_1 = \{1,2\}, A2={3,4}A_2 = \{3,4\}, A3={5,6}A_3 = \{5,6\} sono una partizione di Ω={1,…,6}\Omega = \{1, \dots, 6\}; lo sono anche "pari" e "dispari".

Formula (decomposizione di un evento con una partizione). B=⋃i∈I(B∩Ai)B = \bigcup_{i \in I} (B \cap A_i)

Esempio. Dado, partizione A1={1,2}A_1 = \{1, 2\}, A2={3,4}A_2 = \{3, 4\}, A3={5,6}A_3 = \{5, 6\}, evento B=B = "pari" ={2,4,6}= \{2, 4, 6\}: le fette sono B∩A1={2}B \cap A_1 = \{2\}, B∩A2={4}B \cap A_2 = \{4\}, B∩A3={6}B \cap A_3 = \{6\}, e la loro unione è proprio BB.

Sigma-algebre di eventi

Definizione (σ-algebra). Una famiglia di eventi F⊆P(Ω)\mathcal{F} \subseteq \mathcal{P}(\Omega) è una σ-algebra su Ω\Omega se:

  1. ∅∈F\emptyset \in \mathcal{F};
  2. se A∈FA \in \mathcal{F} allora Ac∈FA^c \in \mathcal{F} (chiusura rispetto al complementare);
  3. se (An)n≥1(A_n)_{n \ge 1} sono tutti in F\mathcal{F}, allora ⋃n≥1An∈F\bigcup_{n \ge 1} A_n \in \mathcal{F} (chiusura rispetto alle unioni numerabili).

Esempio. Su Ω={1,…,6}\Omega = \{1, \dots, 6\} la famiglia {∅,{2,4,6},{1,3,5},Ω}\{\emptyset, \{2,4,6\}, \{1,3,5\}, \Omega\} è una σ-algebra; {∅,{1},Ω}\{\emptyset, \{1\}, \Omega\} non lo è, perché manca il complementare {2,…,6}\{2, \dots, 6\}.

Definizione (σ-algebra generata). σ(A):=⋂i∈IFi,dove (Fi)i∈I sono tutte le \sigma-algebre che contengono A\sigma(\mathcal{A}) := \bigcap_{i \in I} \mathcal{F}_i, \qquad \text{dove } (\mathcal{F}_i)_{i \in I} \text{ sono tutte le \sigma -algebre che contengono } \mathcal{A}

Esempio: σ({A})={∅,A,Ac,Ω}\sigma(\{A\}) = \{\emptyset, A, A^c, \Omega\}, la σ-algebra generata da un solo evento vista sopra. Nella pratica, per trovare σ(A)\sigma(\mathcal{A}) su un Ω\Omega finito si aggiungono ad A\mathcal{A} complementari, unioni e intersezioni finché la famiglia non si "chiude" (vedi l'esercizio 1).

Proprietà (σ-algebra degli spazi discreti). Se Ω\Omega è discreto (finito o numerabile) si prende sempre F=P(Ω)\mathcal{F} = \mathcal{P}(\Omega).

Esempio. Per il dado F=P(Ω)\mathcal{F} = \mathcal{P}(\Omega) contiene tutti i 26=642^6 = 64 sottoinsiemi di Ω\Omega.

Misura di probabilità e sue proprietà

Definizione (misura di probabilità, assiomi di Kolmogorov). Una misura di probabilità su (Ω,F)(\Omega, \mathcal{F}) è una funzione P:F→[0,1],A↦P(A) (probabilitaˋ dell’evento A)\mathbb{P} : \mathcal{F} \to [0, 1], \qquad A \mapsto \mathbb{P}(A) \ \text{(probabilità dell'evento } A\text{)} tale che:

  1. P(Ω)=1\mathbb{P}(\Omega) = 1 (normalizzazione);
  2. se (An)n≥1(A_n)_{n \ge 1} sono eventi di F\mathcal{F} a due a due disgiunti (Ai∩Aj=∅A_i \cap A_j = \emptyset per i≠ji \ne j), allora P(⋃n≥1An)=∑n≥1P(An)(σ-additivitaˋ)\mathbb{P}\Big(\bigcup_{n \ge 1} A_n\Big) = \sum_{n \ge 1} \mathbb{P}(A_n) \qquad \text{(}\boldsymbol{\sigma}\textbf{-additività}\text{)}

Esempio. Dado equo: P({k})=16\mathbb{P}(\{k\}) = \frac16 per k=1,…,6k = 1, \dots, 6. Gli eventi {2},{4},{6}\{2\}, \{4\}, \{6\} sono disgiunti, quindi P(pari)=P({2})+P({4})+P({6})=36=12\mathbb{P}(\text{pari}) = \mathbb{P}(\{2\}) + \mathbb{P}(\{4\}) + \mathbb{P}(\{6\}) = \frac36 = \frac12.

Proprietà (probabilità del complementare). P(Ac)=1−P(A)\boxed{\mathbb{P}(A^c) = 1 - \mathbb{P}(A)}

Esempio. Dado equo: P(non esce 6)=1−16=56\mathbb{P}(\text{non esce } 6) = 1 - \frac{1}{6} = \frac{5}{6}.

Proprietà (monotonia). A⊆B  ⟹  P(A)≤P(B)\boxed{A \subseteq B \implies \mathbb{P}(A) \le \mathbb{P}(B)}

Esempio. Dado equo: {6}⊆{4,5,6}\{6\} \subseteq \{4,5,6\} e infatti P({6})=16≤36=P({4,5,6})\mathbb{P}(\{6\}) = \frac{1}{6} \le \frac{3}{6} = \mathbb{P}(\{4,5,6\}).

Formula (probabilità dell'unione). P(A∪B)=P(A)+P(B)−P(A∩B)per A,B qualsiasi\boxed{\mathbb{P}(A \cup B) = \mathbb{P}(A) + \mathbb{P}(B) - \mathbb{P}(A \cap B)} \qquad \text{per } A, B \text{ qualsiasi}

Esempio. Dado equo, A=A = "pari" ={2,4,6}= \{2, 4, 6\}, B=B = "almeno 4" ={4,5,6}= \{4, 5, 6\}: P(A∪B)=36+36−26=46\mathbb{P}(A \cup B) = \frac36 + \frac36 - \frac26 = \frac46. Controllo diretto: A∪B={2,4,5,6}A \cup B = \{2, 4, 5, 6\} ha 4 esiti su 6 ✓.

Formula (inclusione-esclusione). P(⋃k=1nAk)=∑ℓ=1n(−1)ℓ−1∑I⊆{1,…,n}∣I∣=ℓP(⋂i∈IAi)\mathbb{P}\Big(\bigcup_{k=1}^n A_k\Big) = \sum_{\ell = 1}^{n} (-1)^{\ell - 1} \sum_{\substack{I \subseteq \{1, \dots, n\} \\ |I| = \ell}} \mathbb{P}\Big(\bigcap_{i \in I} A_i\Big)

Esempio numerico. Si lancia un dado equo 3 volte; Ak=A_k = "al lancio kk esce 6". Con i 216 esiti equiprobabili: P(Ak)=36216=16\mathbb{P}(A_k) = \frac{36}{216} = \frac16, P(Aj∩Ak)=6216=136\mathbb{P}(A_j \cap A_k) = \frac{6}{216} = \frac1{36}, P(A1∩A2∩A3)=1216\mathbb{P}(A_1 \cap A_2 \cap A_3) = \frac1{216}. Allora

Spazi di probabilità discreti e uniformi

Proprietà (la probabilità discreta è determinata dai singoletti). Nel caso discreto una misura P\mathbb{P} è determinata unicamente dai suoi valori sui singoletti {ω}\{\omega\}, ω∈Ω\omega \in \Omega.

Esempio. Dado equo: P({k})=16\mathbb{P}(\{k\}) = \frac{1}{6} per ogni kk, quindi P({1,2})=16+16=13\mathbb{P}(\{1,2\}) = \frac{1}{6} + \frac{1}{6} = \frac{1}{3}.

Definizione (densità di probabilità discreta). p(ω)≥0∀ω∈Ω,∑ω∈Ωp(ω)=1\boxed{p(\omega) \ge 0 \quad \forall \omega \in \Omega, \qquad \sum_{\omega \in \Omega} p(\omega) = 1}

Esempio (dado truccato). Ω={1,…,6}\Omega = \{1, \dots, 6\} con p(6)=12p(6) = \frac12 e p(1)=⋯=p(5)=110p(1) = \dots = p(5) = \frac1{10}. È una densità: valori ≥0\ge 0 e 5⋅110+12=15 \cdot \frac1{10} + \frac12 = 1 ✓. Allora P(pari)=p(2)+p(4)+p(6)=110+110+12=710\mathbb{P}(\text{pari}) = p(2) + p(4) + p(6) = \frac1{10} + \frac1{10} + \frac12 = \frac7{10}.

Grafico interattivo: Densità discreta p(n) = (1/2)^n, n = 1, 2, ...: i valori sommano a 1

Formula (probabilità uniforme: casi favorevoli su casi possibili). P(A)=∑ω∈A1∣Ω∣=∣A∣∣Ω∣=# casi favorevoli# casi possibili\boxed{\mathbb{P}(A) = \sum_{\omega \in A} \frac1{|\Omega|} = \frac{|A|}{|\Omega|} = \frac{\#\,\text{casi favorevoli}}{\#\,\text{casi possibili}}}

Esempio. Dado equo: P(pari)=∣{2,4,6}∣6=12\mathbb{P}(\text{pari}) = \frac{|\{2,4,6\}|}{6} = \frac{1}{2}.

Calcolo combinatorio per la probabilità

Principio (di moltiplicazione). Se una scelta si fa in kk passi successivi, e al passo ii ci sono nin_i possibilità qualunque siano le scelte fatte prima, il numero totale di scelte è n1⋅n2⋯nkn_1 \cdot n_2 \cdots n_k

Esempio. Un menù con 3 primi, 4 secondi e 2 dolci permette 3⋅4⋅2=243 \cdot 4 \cdot 2 = 24 pasti diversi. Una targa con 2 lettere (26 possibili) e 3 cifre: 262⋅103=676 00026^2 \cdot 10^3 = 676\,000.

Formula (disposizioni semplici). n(n−1)⋯(n−k+1)=n!(n−k)!n (n-1) \cdots (n - k + 1) = \frac{n!}{(n-k)!}

Esempio: podio (oro, argento, bronzo) tra 10 atleti: 10⋅9⋅8=72010 \cdot 9 \cdot 8 = 720.

Formula (combinazioni). (nk)=n!k! (n−k)!\binom{n}{k} = \frac{n!}{k!\,(n-k)!}

Esempio. Mani di 5 carte da un mazzo di 52: (525)=2 598 960\binom{52}{5} = 2\,598\,960.

Formula (estrazioni con reinserimento). P(k nere)=(nk)(MN)k(1−MN)n−k\mathbb{P}(k \text{ nere}) = \binom{n}{k} \left(\frac{M}{N}\right)^k \left(1 - \frac{M}{N}\right)^{n-k}

Esempio. Urna con M=8M = 8 nere su N=14N = 14, 33 estrazioni con reinserimento: P(2 nere)=(32)(47)237=144343≈0,420\mathbb{P}(2 \text{ nere}) = \binom{3}{2} \left(\frac{4}{7}\right)^2 \frac{3}{7} = \frac{144}{343} \approx 0{,}420.

Formula (estrazioni senza reinserimento, distribuzione ipergeometrica). P(k nere)=(Mk)(N−Mn−k)(Nn)(distribuzione ipergeometrica)\boxed{\mathbb{P}(k \text{ nere}) = \frac{\binom{M}{k} \binom{N - M}{n - k}}{\binom{N}{n}}} \qquad \text{(distribuzione ipergeometrica)}

Esempio. Stessa urna (88 nere, 66 bianche), 33 estrazioni senza reinserimento: P(2 nere)=(82)(61)(143)=28⋅6364=613≈0,462\mathbb{P}(2 \text{ nere}) = \frac{\binom{8}{2}\binom{6}{1}}{\binom{14}{3}} = \frac{28 \cdot 6}{364} = \frac{6}{13} \approx 0{,}462.

2. Probabilità condizionata e indipendenza

Probabilità condizionata

Definizione (probabilità condizionata). Siano A,BA, B eventi con P(B)>0\mathbb{P}(B) > 0. La probabilità di AA condizionata a BB (o "di AA dato BB") è P(A∣B)=P(A∩B)P(B)\boxed{\mathbb{P}(A \mid B) = \frac{\mathbb{P}(A \cap B)}{\mathbb{P}(B)}}

Esempio con due dadi. Sapendo che la somma è 77, probabilità che il primo dado abbia dato 11? B={(1,6),(2,5),(3,4),(4,3),(5,2),(6,1)}B = \{(1,6), (2,5), (3,4), (4,3), (5,2), (6,1)\}, A∩B={(1,6)}A \cap B = \{(1, 6)\}: P(A∣B)=16\mathbb{P}(A \mid B) = \frac16. (Senza informazione era anche 16\frac16: questo caso particolare si chiama indipendenzaA e B sono indipendenti se P(A ∣ B) = P(A), cioè se sapere B non cambia la probabilità di A.Indipendenza di eventi →.)

Proprietà (la condizionata è una misura di probabilità). Fissato BB con P(B)>0\mathbb{P}(B) > 0, la funzione A↦P(A∣B)A \mapsto \mathbb{P}(A \mid B) è una misura di probabilità su (Ω,F)(\Omega, \mathcal{F}).

Esempio. Dado e B={2,4,6}B = \{2,4,6\}: P({2}∣B)=P({4}∣B)=P({6}∣B)=13\mathbb{P}(\{2\} \mid B) = \mathbb{P}(\{4\} \mid B) = \mathbb{P}(\{6\} \mid B) = \frac{1}{3}, P({1}∣B)=0\mathbb{P}(\{1\} \mid B) = 0, e le probabilità sommano a 11.

Formula (regola del prodotto). P(A∩B)=P(A∣B) P(B)=P(B∣A) P(A)\boxed{\mathbb{P}(A \cap B) = \mathbb{P}(A \mid B)\, \mathbb{P}(B) = \mathbb{P}(B \mid A)\, \mathbb{P}(A)}

Esempio (estrazioni senza reinserimento). Urna con 8 nere e 6 bianche, due estrazioni senza reinserimento. Ni=N_i = "nera all'estrazione ii":

Formula (regola della catena). P(A1∩A2∩⋯∩An)=P(A1) P(A2∣A1) P(A3∣A1∩A2)⋯P(An∣A1∩⋯∩An−1)\mathbb{P}(A_1 \cap A_2 \cap \dots \cap A_n) = \mathbb{P}(A_1)\, \mathbb{P}(A_2 \mid A_1)\, \mathbb{P}(A_3 \mid A_1 \cap A_2) \cdots \mathbb{P}(A_n \mid A_1 \cap \dots \cap A_{n-1})

Esempio: probabilità di pescare 3 assi di fila da un mazzo di 40 carte (4 assi), senza reinserimento: 440⋅339⋅238=2459 280≈0,000405\frac4{40} \cdot \frac3{39} \cdot \frac2{38} = \frac{24}{59\,280} \approx 0{,}000405.

Formula delle probabilità totali e formula di Bayes

Teorema (formula delle probabilità totali). Sia (Ai)i∈I(A_i)_{i \in I} una partizioneFamiglia di eventi a due a due disgiunti la cui unione è Ω: ogni esito sta in uno e un solo A_i.Spazio campionario ed eventi → di Ω\Omega (finita o numerabile) con P(Ai)>0\mathbb{P}(A_i) > 0 per ogni ii. Allora per ogni evento BB P(B)=∑i∈IP(B∣Ai) P(Ai)\boxed{\mathbb{P}(B) = \sum_{i \in I} \mathbb{P}(B \mid A_i)\, \mathbb{P}(A_i)}

Esempio. Due urne equiprobabili, la prima con il 30%30\% di palline nere e la seconda con il 60%60\%: P(nera)=0,3⋅0,5+0,6⋅0,5=0,45\mathbb{P}(\text{nera}) = 0{,}3 \cdot 0{,}5 + 0{,}6 \cdot 0{,}5 = 0{,}45.

Teorema (formula di Bayes). Nelle stesse ipotesi, se P(B)>0\mathbb{P}(B) > 0, per ogni kk P(Ak∣B)=P(B∣Ak) P(Ak)P(B)=P(B∣Ak) P(Ak)∑iP(B∣Ai) P(Ai)\boxed{\mathbb{P}(A_k \mid B) = \frac{\mathbb{P}(B \mid A_k)\, \mathbb{P}(A_k)}{\mathbb{P}(B)} = \frac{\mathbb{P}(B \mid A_k)\, \mathbb{P}(A_k)}{\sum_{i} \mathbb{P}(B \mid A_i)\, \mathbb{P}(A_i)}}

Esempio. Con le due urne: P(urna 1∣nera)=0,3⋅0,50,45=13\mathbb{P}(\text{urna } 1 \mid \text{nera}) = \frac{0{,}3 \cdot 0{,}5}{0{,}45} = \frac{1}{3}.

Indipendenza di eventi

Definizione (eventi indipendenti). Due eventi AA e BB sono indipendenti se P(A∩B)=P(A) P(B)\boxed{\mathbb{P}(A \cap B) = \mathbb{P}(A)\, \mathbb{P}(B)}

Esempio (due dadi). A=A = "il primo dado dà 1", B=B = "la somma è 7". P(A)=636=16\mathbb{P}(A) = \frac6{36} = \frac16, P(B)=636=16\mathbb{P}(B) = \frac6{36} = \frac16, A∩B={(1,6)}A \cap B = \{(1, 6)\} quindi P(A∩B)=136=16⋅16\mathbb{P}(A \cap B) = \frac1{36} = \frac16 \cdot \frac16: indipendenti. Invece con C=C = "la somma è 12" ={(6,6)}= \{(6,6)\}: P(A∩C)=0≠16⋅136\mathbb{P}(A \cap C) = 0 \ne \frac16 \cdot \frac1{36}: non indipendenti (se il primo dado dà 1 la somma 12 è impossibile).

Proprietà (l'indipendenza passa ai complementari). Se AA e BB sono indipendenti, allora sono indipendenti anche AA e BcB^c, AcA^c e BB, AcA^c e BcB^c.

Esempio. Se AA e BB sono indipendenti con P(A)=12\mathbb{P}(A) = \frac{1}{2} e P(B)=13\mathbb{P}(B) = \frac{1}{3}: P(A∩Bc)=12⋅23=13\mathbb{P}(A \cap B^c) = \frac{1}{2} \cdot \frac{2}{3} = \frac{1}{3}.

Definizione (eventi mutuamente indipendenti). Gli eventi A1,…,AnA_1, \dots, A_n sono (mutuamente) indipendenti se per ogni sottofamiglia di indici I⊆{1,…,n}I \subseteq \{1, \dots, n\} con almeno due elementi P(⋂i∈IAi)=∏i∈IP(Ai)\mathbb{P}\Big(\bigcap_{i \in I} A_i\Big) = \prod_{i \in I} \mathbb{P}(A_i)

Esempio: un sistema con 3 componenti in parallelo, ciascuno guasto con probabilità 0,10{,}1 indipendentemente, funziona se almeno uno funziona: 1−0,13=0,9991 - 0{,}1^3 = 0{,}999.

Prove ripetute e modello binomiale

Formula (probabilità di una sequenza di prove). p(ω)=pk(1−p)n−k,k=∑i=1nxi\boxed{p(\omega) = p^{k} (1 - p)^{n - k}, \qquad k = \sum_{i=1}^n x_i}

Esempio: n=4n = 4, ω=(1,0,1,1)\omega = (1, 0, 1, 1): p⋅(1−p)⋅p⋅p=p3(1−p)p \cdot (1-p) \cdot p \cdot p = p^3 (1 - p).

Formula (esattamente k successi in n prove). P(Ak)=(nk)pk(1−p)n−k,k=0,1,…,n\boxed{\mathbb{P}(A_k) = \binom{n}{k} p^k (1 - p)^{n - k}, \qquad k = 0, 1, \dots, n}

Esempio (dado). 10 lanci di un dado equo, probabilità di ottenere esattamente due 6: n=10n = 10, k=2k = 2, p=16p = \frac16:

Grafico interattivo: Modello binomiale con n = 10, p = 0,3: probabilità di k successi (massima per k = 3 = n·p)

Formula (tempo del primo successo). P(primo successo alla prova k)=(1−p)k−1p,k=1,2,…\mathbb{P}(\text{primo successo alla prova } k) = (1 - p)^{k - 1} p, \qquad k = 1, 2, \dots

Esempio: con un dado, probabilità che il primo 6 arrivi al terzo lancio: (56)216=25216≈0,116\left(\frac56\right)^2 \frac16 = \frac{25}{216} \approx 0{,}116; probabilità di non vedere nessun 6 nei primi 3 lanci: (56)3≈0,579\left(\frac56\right)^3 \approx 0{,}579.

3. Variabili aleatorie discrete

Variabili aleatorie discrete e densità discreta

Definizione (variabile aleatoria discreta). Sia (Ω,F,P)(\Omega, \mathcal F, P) uno spazio di probabilità. Una variabile aleatoria (v.a.) discreta è una funzione X:Ω→RX : \Omega \to \mathbb R tale che l'insieme dei valori assunti X(Ω)={X(ω):ω∈Ω}X(\Omega) = \{X(\omega) : \omega \in \Omega\} è finito o numerabile, e tale che per ogni x∈Rx \in \mathbb R l'insieme {ω∈Ω:X(ω)=x}\{\omega \in \Omega : X(\omega) = x\} è un evento (cioè sta in F\mathcal F).

Esempio. Nel lancio di due dadi, S(ω1,ω2)=ω1+ω2S(\omega_1, \omega_2) = \omega_1 + \omega_2 è una v.a. discreta con alfabeto {2,3,…,12}\{2, 3, \dots, 12\}.

Definizione (densità discreta). La densità discreta (o funzione di massa) di una v.a. discreta XX è la funzione pX:R→[0,1],pX(x):=P(X=x).p_X : \mathbb R \to [0, 1], \qquad p_X(x) := P(X = x).

Esempio. Dado equo: pX(k)=16p_X(k) = \frac{1}{6} per k=1,…,6k = 1, \dots, 6 e pX(x)=0p_X(x) = 0 altrimenti.

Formula (probabilità di un evento tramite la densità).   P(X∈B)=∑x∈B∩XXpX(x)  \boxed{\;P(X \in B) = \sum_{x \in B \cap \mathcal X_X} p_X(x)\;}

Esempio. Dado equo: P(X∈{2,4,6})=16+16+16=12P(X \in \{2,4,6\}) = \frac{1}{6} + \frac{1}{6} + \frac{1}{6} = \frac{1}{2}.

Formula (densità di una funzione di una v.a. discreta). pY(y)=P(g(X)=y)=∑x∈XX: g(x)=ypX(x).p_Y(y) = P(g(X) = y) = \sum_{x \in \mathcal X_X : \, g(x) = y} p_X(x).

Esempio. XX uniforme su {−1,0,1}\{-1, 0, 1\} (ogni valore con probabilità 13\frac13) e Y=X2Y = X^2. L'alfabeto di YY è {0,1}\{0, 1\}; Y=1Y = 1 sia per x=−1x = -1 sia per x=1x = 1, quindi

Funzione di distribuzione

Definizione (funzione di distribuzione). Sia XX una v.a. (qualsiasi: discreta, continua o mista). La funzione di distribuzione (FdD, o funzione di ripartizione) di XX è FX:R→[0,1],FX(x):=P(X≤x).F_X : \mathbb R \to [0, 1], \qquad F_X(x) := P(X \le x).

Esempio. Dado equo: FX(3,5)=P(X≤3,5)=P(X∈{1,2,3})=36=12F_X(3{,}5) = P(X \le 3{,}5) = P(X \in \{1,2,3\}) = \frac{3}{6} = \frac{1}{2}.

Proprietà (della funzione di distribuzione). (F1) FXF_X è crescente (debolmente): x<y⇒FX(x)≤FX(y)x < y \Rightarrow F_X(x) \le F_X(y).

(F2) lim⁡x→−∞FX(x)=0\displaystyle\lim_{x \to -\infty} F_X(x) = 0 e lim⁡x→+∞FX(x)=1\displaystyle\lim_{x \to +\infty} F_X(x) = 1.

(F3) FXF_X è continua a destra: lim⁡y→x+FX(y)=FX(x)\displaystyle\lim_{y \to x^+} F_X(y) = F_X(x) per ogni xx.

Esempio. Dado equo: FXF_X vale 00 per x<1x < 1 e 11 per x≥6x \ge 6, è crescente e continua a destra nei salti (per esempio FX(3)=36F_X(3) = \frac{3}{6}).

Bernoulli, binomiale e uniforme discreta

Definizione (distribuzione di Bernoulli). X∼Be(p)X \sim \text{Be}(p), con p∈[0,1]p \in [0, 1], se XX ha alfabeto {0,1}\{0, 1\} e pX(1)=p,pX(0)=1−p.p_X(1) = p, \qquad p_X(0) = 1 - p.

Esempio. Lancio di una moneta equa (testa =1= 1): X∼Be(12)X \sim \text{Be}(\frac{1}{2}), con P(X=1)=P(X=0)=12P(X = 1) = P(X = 0) = \frac{1}{2}.

Definizione (distribuzione binomiale). X∼Bin(n,p)X \sim \text{Bin}(n, p), con n∈N∗n \in \mathbb N^* e p∈[0,1]p \in [0, 1], se XX ha alfabeto {0,1,…,n}\{0, 1, \dots, n\} e pX(k)=(nk)pk(1−p)n−k,k=0,1,…,n.p_X(k) = \binom nk p^k (1 - p)^{n - k}, \qquad k = 0, 1, \dots, n.

Esempio. X∼Bin(3,12)X \sim \text{Bin}(3, \frac{1}{2}): P(X=2)=(32)⋅18=38P(X = 2) = \binom{3}{2} \cdot \frac{1}{8} = \frac{3}{8}.

Proprietà (media e varianza della binomiale). Se X∼Bin(n,p)X \sim \text{Bin}(n, p): E[X]=np,Var(X)=np(1−p).\quad E[X] = np, \qquad \text{Var}(X) = np(1 - p).

Esempio. X∼Bin(100,12)X \sim \text{Bin}(100, \frac{1}{2}): E[X]=100⋅12=50E[X] = 100 \cdot \frac{1}{2} = 50 e Var(X)=100⋅12⋅12=25\text{Var}(X) = 100 \cdot \frac{1}{2} \cdot \frac{1}{2} = 25.

Definizione (uniforme discreta). XX è uniforme discreta su {x1,…,xn}\{x_1, \dots, x_n\} (valori distinti) se pX(xi)=1np_X(x_i) = \frac1n per ogni ii.

Esempio. Dado equo: XX è uniforme su {1,…,6}\{1, \dots, 6\}, con E[X]=n+12=72E[X] = \frac{n+1}{2} = \frac{7}{2} e Var(X)=n2−112=3512\text{Var}(X) = \frac{n^2 - 1}{12} = \frac{35}{12}.

Grafico interattivo: Densità uniforme sulle facce del dado: sei valori alla stessa altezza 1/6

Distribuzione geometrica

Definizione (distribuzione geometrica). X∼Geo(p)X \sim \text{Geo}(p) se ha alfabeto N∗={1,2,3,… }\mathbb N^* = \{1, 2, 3, \dots\} e pX(n)=(1−p)n−1p,n=1,2,…p_X(n) = (1 - p)^{n - 1} p, \qquad n = 1, 2, \dots

Esempio. Lanciare un dado fino al primo 66: X∼Geo(16)X \sim \text{Geo}(\frac{1}{6}) e P(X=3)=(56)216=25216P(X = 3) = \left(\frac{5}{6}\right)^2 \frac{1}{6} = \frac{25}{216}.

Grafico interattivo: Densità di Geo(1/2): P(X = n) = (1/2)^n, si dimezza a ogni passo

Proprietà (probabilità di lunga attesa). P(X>n)=(1−p)n,n=0,1,2,…P(X > n) = (1 - p)^n, \qquad n = 0, 1, 2, \dots

Esempio. X∼Geo(12)X \sim \text{Geo}(\frac{1}{2}): P(X>3)=(12)3=18P(X > 3) = \left(\frac{1}{2}\right)^3 = \frac{1}{8}.

Proprietà (assenza di memoria). Per ogni n,m≥0n, m \ge 0 interi: P(X>n+m∣X>n)=P(X>m).P(X > n + m \mid X > n) = P(X > m).

Esempio. X∼Geo(12)X \sim \text{Geo}(\frac{1}{2}): P(X>5∣X>2)=P(X>3)=18P(X > 5 \mid X > 2) = P(X > 3) = \frac{1}{8}.

Proprietà (media e varianza della geometrica). Se X∼Geo(p)X \sim \text{Geo}(p): E[X]=1p,Var(X)=1−pp2.\quad E[X] = \dfrac1p, \qquad \text{Var}(X) = \dfrac{1 - p}{p^2}.

Esempio. X∼Geo(16)X \sim \text{Geo}(\frac{1}{6}): E[X]=6E[X] = 6 e Var(X)=5/61/36=30\text{Var}(X) = \frac{5/6}{1/36} = 30.

Distribuzione di Poisson

Definizione (distribuzione di Poisson). X∼Poi(λ)X \sim \text{Poi}(\lambda), con λ>0\lambda > 0, se XX ha alfabeto N={0,1,2,… }\mathbb N = \{0, 1, 2, \dots\} e pX(k)=e−λλkk!,k=0,1,2,…p_X(k) = e^{-\lambda} \frac{\lambda^k}{k!}, \qquad k = 0, 1, 2, \dots

Esempio. X∼Poi(2)X \sim \text{Poi}(2): P(X=0)=e−2≈0,135P(X = 0) = e^{-2} \approx 0{,}135 e P(X=1)=2e−2≈0,271P(X = 1) = 2e^{-2} \approx 0{,}271.

Proprietà (media e varianza della Poisson). Se X∼Poi(λ)X \sim \text{Poi}(\lambda): E[X]=λ,Var(X)=λ.\quad E[X] = \lambda, \qquad \text{Var}(X) = \lambda.

Esempio. X∼Poi(3)X \sim \text{Poi}(3) ha E[X]=Var(X)=3E[X] = \text{Var}(X) = 3.

Teorema. Sia λ>0\lambda > 0 e Xn∼Bin(n,λn)X_n \sim \text{Bin}(n, \frac\lambda n). Allora per ogni k∈Nk \in \mathbb N fissato lim⁡n→∞P(Xn=k)=e−λλkk!.\lim_{n \to \infty} P(X_n = k) = e^{-\lambda}\frac{\lambda^k}{k!}.

Esempio. X∼Bin(100,0,02)X \sim \text{Bin}(100, 0{,}02) ha λ=np=2\lambda = np = 2: P(X=3)≈e−2233!≈0,180P(X = 3) \approx e^{-2}\frac{2^3}{3!} \approx 0{,}180 (il valore esatto è 0,1820{,}182).

Valore atteso

Definizione (valore atteso). Sia XX una v.a. discreta con densità pXp_X. Se ∑x∈XX∣x∣ pX(x)<+∞,\sum_{x \in \mathcal X_X} |x| \, p_X(x) < +\infty, si dice che XX ha valore atteso (o media, o speranza matematica) finito, e si pone E[X]:=∑x∈XXx pX(x).E[X] := \sum_{x \in \mathcal X_X} x \, p_X(x).

Esempio. Dado equo: E[X]=1+2+3+4+5+66=72E[X] = \frac{1 + 2 + 3 + 4 + 5 + 6}{6} = \frac{7}{2}.

Teorema (fondamentale del valore atteso). Sia XX discreta e g:R→Rg : \mathbb R \to \mathbb R. Allora Y=g(X)Y = g(X) ha media finita se e solo se ∑x∣g(x)∣ pX(x)<∞\sum_x |g(x)| \, p_X(x) < \infty, e in tal caso E[g(X)]=∑x∈XXg(x) pX(x).E[g(X)] = \sum_{x \in \mathcal X_X} g(x) \, p_X(x).

Esempio (III appello 24.06.2026). X∼Geo(12)X \sim \text{Geo}(\frac12), cioè pX(n)=12np_X(n) = \frac1{2^n} per n≥1n \ge 1, e W=(32)XW = \left(\frac32\right)^X:

Proprietà (del valore atteso).

  1. Costanti: E[c]=cE[c] = c.
  2. Linearità: E[aX+b]=aE[X]+bE[aX + b] = aE[X] + b, e più in generale E[aX+bY]=aE[X]+bE[Y]E[aX + bY] = aE[X] + bE[Y] per v.a. X,YX, Y con media finita (definite sullo stesso spazio), anche non indipendenti.
  3. Positività e monotonia: se X≥0X \ge 0 allora E[X]≥0E[X] \ge 0; se X≤YX \le Y allora E[X]≤E[Y]E[X] \le E[Y].
  4. Indicatrici: E[1A]=P(A)E[\mathbb 1_A] = P(A).

Esempio d'esame. (I parziale 17.11.2025.) Vincita X=3Y−2X = 3Y - 2 con Y∼Bin(2,47)Y \sim \text{Bin}(2, \frac47), E[Y]=2⋅47=87E[Y] = 2 \cdot \frac47 = \frac87. Per linearità, senza ricalcolare nulla:

Formula (delle code). Se XX assume valori in {0,1,2,… }\{0, 1, 2, \dots\}: E[X]=∑n=0∞P(X>n).E[X] = \sum_{n = 0}^\infty P(X > n).

Esempio: per X∼Geo(p)X \sim \text{Geo}(p), P(X>n)=(1−p)nP(X > n) = (1 - p)^n e quindi E[X]=∑n≥0(1−p)n=1pE[X] = \sum_{n \ge 0} (1 - p)^n = \frac1p, senza derivare serie (Distribuzione geometricaGeo(p) è il numero della prova in cui arriva il primo successo in prove indipendenti: P(X = n) = (1−p)^(n−1) p per n ≥ 1, P(X > n) = (1−p)^n (lunga attesa), media 1/p, varianza (1−p)/p², ed è senza memoria.Distribuzione geometrica →).

Varianza e momenti

Definizione (momenti). Sia k≥1k \ge 1 intero e XX una v.a. con E[∣X∣k]<∞E[|X|^k] < \infty.

  • Il momento kk-esimo di XX è E[Xk]E[X^k].
  • Il momento centrato kk-esimo è E[(X−μ)k]E[(X - \mu)^k], con μ=E[X]\mu = E[X].

Esempio. Dado equo: E[X]=72E[X] = \frac{7}{2} e il momento secondo è E[X2]=1+4+9+16+25+366=916E[X^2] = \frac{1 + 4 + 9 + 16 + 25 + 36}{6} = \frac{91}{6}.

Definizione (varianza e deviazione standard). Sia XX con E[X2]<∞E[X^2] < \infty e μ=E[X]\mu = E[X]. La varianza di XX è Var(X):=E[(X−μ)2]=∑x(x−μ)2 pX(x)(caso discreto).\text{Var}(X) := E[(X - \mu)^2] = \sum_x (x - \mu)^2 \, p_X(x) \quad (\text{caso discreto}). La deviazione standard è σX:=Var(X)\sigma_X := \sqrt{\text{Var}(X)}.

Esempio. Dado equo: Var(X)=E[X2]−E[X]2=916−494=3512≈2,92\text{Var}(X) = E[X^2] - E[X]^2 = \frac{91}{6} - \frac{49}{4} = \frac{35}{12} \approx 2{,}92.

Formula (di calcolo della varianza). Var(X)=E[X2]−E[X]2.\text{Var}(X) = E[X^2] - E[X]^2.

Esempio. X∼Be(p)X \sim \text{Be}(p): E[X2]=pE[X^2] = p e E[X]=pE[X] = p, quindi Var(X)=p−p2=p(1−p)\text{Var}(X) = p - p^2 = p(1 - p).

Proprietà (della varianza).

  1. Var(X)≥0\text{Var}(X) \ge 0, e Var(X)=0\text{Var}(X) = 0 se e solo se X=μX = \mu con probabilità 11.
  2. Var(aX+b)=a2 Var(X)\text{Var}(aX + b) = a^2 \, \text{Var}(X) per ogni a,b∈Ra, b \in \mathbb R.
  3. Var(X+Y)=Var(X)+Var(Y)+2 Cov(X,Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y) + 2\,\text{Cov}(X, Y); se XX e YY sono indipendenti, Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y).

Esempio d'esame (I parziale 17.11.2025, III appello 24.06.2026). X=3Y−2X = 3Y - 2 con Y∼Bin(2,47)Y \sim \text{Bin}(2, \frac47), Var(Y)=2⋅47⋅37=2449\text{Var}(Y) = 2 \cdot \frac47 \cdot \frac37 = \frac{24}{49}:

Disuguaglianze di Markov, Chebyshev e Jensen

Teorema (disuguaglianza di Markov). Sia X≥0X \ge 0 una v.a. con media finita. Per ogni a>0a > 0: P(X≥a)≤E[X]a.P(X \ge a) \le \frac{E[X]}{a}.

Esempio numerico. X∼Geo(12)X \sim \text{Geo}(\frac12), E[X]=2E[X] = 2. Markov: P(X≥4)≤24=0,5P(X \ge 4) \le \frac24 = 0{,}5. Valore vero: P(X≥4)=P(X>3)=(12)3=0,125P(X \ge 4) = P(X > 3) = \left(\frac12\right)^3 = 0{,}125 (Distribuzione geometricaGeo(p) è il numero della prova in cui arriva il primo successo in prove indipendenti: P(X = n) = (1−p)^(n−1) p per n ≥ 1, P(X > n) = (1−p)^n (lunga attesa), media 1/p, varianza (1−p)/p², ed è senza memoria.Distribuzione geometrica →). La stima è corretta ma larga.

Grafico interattivo: Geo(1/2), E[X] = 2: la probabilità vera P(X ≥ a) = (1/2)^(⌈a⌉−1) (linea continua a gradini) sta sempre sotto la maggiorazione di Markov 2/a (tratteggiata); in a = 4 vale 0,125 contro 0,5

Teorema (disuguaglianza di Chebyshev). Sia XX con E[X2]<∞E[X^2] < \infty, μ=E[X]\mu = E[X]. Per ogni ε>0\varepsilon > 0: P(∣X−μ∣≥ε)≤Var(X)ε2.P(|X - \mu| \ge \varepsilon) \le \frac{\text{Var}(X)}{\varepsilon^2}.

Esempio numerico. X∼Bin(100,12)X \sim \text{Bin}(100, \frac12): μ=50\mu = 50, Var(X)=25\text{Var}(X) = 25. Chebyshev:

Grafico interattivo: Chebyshev 1/k² contro il valore vero per una gaussiana, 2(1 − Φ(k)) = 0,317; 0,046; 0,0027 per k = 1, 2, 3: la maggiorazione vale per ogni legge, quindi è larga per quasi tutte

Teorema (disuguaglianza di Jensen). Sia φ:R→R\varphi : \mathbb R \to \mathbb R convessa e XX tale che XX e φ(X)\varphi(X) abbiano media finita. Allora φ(E[X])≤E[φ(X)].\varphi(E[X]) \le E[\varphi(X)]. Se φ\varphi è concava la disuguaglianza si rovescia: φ(E[X])≥E[φ(X)]\varphi(E[X]) \ge E[\varphi(X)].

Esempio. φ(x)=x2\varphi(x) = x^2 è convessa, quindi E[X]2≤E[X2]E[X]^2 \le E[X^2], cioè Var(X)≥0\text{Var}(X) \ge 0.

4. Variabili aleatorie assolutamente continue

Spazi di probabilità generali e sigma-algebra di Borel

Definizione (σ-algebra di Borel). La σ-algebra di Borel su R\mathbb R, indicata con B(R)\mathcal B(\mathbb R), è la σ-algebra generataLa più piccola σ-algebra che contiene una famiglia data: l'intersezione di tutte le σ-algebre che la contengono.Sigma-algebre di eventi → dagli intervalli: B(R):=σ({(a,b]:a<b}).\mathcal B(\mathbb R) := \sigma\big(\{(a, b] : a < b\}\big). I suoi elementi si chiamano boreliani.

Esempio. Intervalli, punti e aperti di R\mathbb{R} sono boreliani; per esempio [a,b]=⋂n≥1(a−1n,b][a, b] = \bigcap_{n \ge 1} \left(a - \frac{1}{n}, b\right].

Teorema (continuità della probabilità). Sia (An)n≥1(A_n)_{n \ge 1} una successione di eventi.

  1. Dal basso: se A1⊆A2⊆…A_1 \subseteq A_2 \subseteq \dots (crescente), allora P(⋃nAn)=lim⁡n→∞P(An)\displaystyle P\Big(\bigcup_{n} A_n\Big) = \lim_{n \to \infty} P(A_n).
  2. Dall'alto: se A1⊇A2⊇…A_1 \supseteq A_2 \supseteq \dots (decrescente), allora P(⋂nAn)=lim⁡n→∞P(An)\displaystyle P\Big(\bigcap_{n} A_n\Big) = \lim_{n \to \infty} P(A_n).

Esempio 1: prima o poi esce testa. Si lancia all'infinito una moneta equa. An=A_n = "nessuna testa nei primi nn lanci" è una successione decrescente (se non è uscita testa nei primi n+1n+1 lanci, non è uscita nei primi nn), con P(An)=2−nP(A_n) = 2^{-n}. L'intersezione ⋂nAn\bigcap_n A_n è "non esce mai testa", quindi

Definizione (variabile aleatoria). Una variabile aleatoria su (Ω,F,P)(\Omega, \mathcal F, P) è una funzione X:Ω→RX : \Omega \to \mathbb R tale che {X≤x}={ω∈Ω:X(ω)≤x}∈Fper ogni x∈R.\{X \le x\} = \{\omega \in \Omega : X(\omega) \le x\} \in \mathcal F \qquad \text{per ogni } x \in \mathbb R.

Esempio. Su Ω={1,…,6}\Omega = \{1, \dots, 6\} con F=P(Ω)\mathcal{F} = \mathcal{P}(\Omega), X(ω)=ω2X(\omega) = \omega^2 è una v.a.: ogni {X≤x}\{X \le x\} è un sottoinsieme di Ω\Omega, cioè un evento.

Variabili aleatorie assolutamente continue

Definizione (variabile aleatoria assolutamente continua e densità). Una v.a. XX si dice assolutamente continua (a.c.) se esiste una funzione fX:R→[0,+∞)f_X : \mathbb R \to [0, +\infty) integrabile tale che FX(x)=P(X≤x)=∫−∞xfX(t) dtper ogni x∈R.F_X(x) = P(X \le x) = \int_{-\infty}^x f_X(t) \, dt \qquad \text{per ogni } x \in \mathbb R. La funzione fXf_X si chiama densità (di probabilità) di XX.

Esempio. fX(x)=2xf_X(x) = 2x su [0,1][0,1] (e 00 altrove) è una densità, perché ∫012x dx=1\int_0^1 2x\,dx = 1; la FdD è FX(x)=x2F_X(x) = x^2 per x∈[0,1]x \in [0,1].

Proprietà (della densità). (D1) fX(x)≥0f_X(x) \ge 0 per ogni xx.

(D2) ∫−∞+∞fX(x) dx=1\displaystyle\int_{-\infty}^{+\infty} f_X(x) \, dx = 1.

Esempio. f(x)=3x2f(x) = 3x^2 su [0,1][0,1] ha f≥0f \ge 0 e ∫013x2 dx=1\int_0^1 3x^2\,dx = 1: è una densità.

Definizione (valore atteso di una variabile aleatoria assolutamente continua). Se ∫R∣x∣fX(x) dx<+∞\int_{\mathbb R} |x| f_X(x) \, dx < +\infty, il valore atteso di XX è E[X]:=∫−∞+∞x fX(x) dx.E[X] := \int_{-\infty}^{+\infty} x \, f_X(x) \, dx.

Esempio senza media. La densità di Cauchyf(x) = 1 / (π(1 + x²)): ha una forma a campana, ma code così pesanti che l'integrale del modulo di x per f(x) diverge. f(x)=1π(1+x2)f(x) = \frac{1}{\pi(1 + x^2)} ha ∫∣x∣f(x) dx=+∞\int |x| f(x) \, dx = +\infty (l'integranda si comporta come 1π∣x∣\frac1{\pi |x|} all'infinito): E[X]E[X] non esiste, anche se la densità è simmetrica rispetto a 00.

Teorema (fondamentale del valor medio, caso continuo). Se g:R→Rg : \mathbb R \to \mathbb R è una funzione (continua a tratti) e ∫∣g(x)∣fX(x) dx<+∞\int |g(x)| f_X(x) \, dx < +\infty, allora E[g(X)]=∫−∞+∞g(x) fX(x) dx.E[g(X)] = \int_{-\infty}^{+\infty} g(x) \, f_X(x) \, dx.

Esempio. X∼U(0,1)X \sim U(0,1): E[X2]=∫01x2 dx=13E[X^2] = \int_0^1 x^2\,dx = \frac{1}{3}.

Distribuzioni uniforme continua ed esponenziale

Definizione (uniforme continua). X∼U(a,b)X \sim U(a, b), con a<ba < b, se fX(x)=1b−a 1[a,b](x),FX(x)={0x<ax−ab−aa≤x<b1x≥b.f_X(x) = \frac{1}{b - a} \, \mathbb 1_{[a, b]}(x), \qquad F_X(x) = \begin{cases} 0 & x < a \\ \dfrac{x - a}{b - a} & a \le x < b \\ 1 & x \ge b. \end{cases}

Esempio. X∼U(0,4)X \sim U(0,4) ha fX=14f_X = \frac{1}{4} su [0,4][0,4] e P(1≤X≤3)=3−14=12P(1 \le X \le 3) = \frac{3 - 1}{4} = \frac{1}{2}.

Grafico interattivo: FdD di U(0, 1): cresce linearmente da 0 a 1 sull'intervallo

Proprietà (media e varianza dell'uniforme continua). E[X]=a+b2,Var(X)=(b−a)212.E[X] = \frac{a + b}{2}, \qquad \text{Var}(X) = \frac{(b - a)^2}{12}.

Esempio. L'errore di arrotondamento E∼U(−12,12)E \sim U(-\frac12, \frac12) ha media 00 e deviazione standard 1/12≈0,289\sqrt{1/12} \approx 0{,}289.

Definizione (distribuzione esponenziale). X∼Exp(λ)X \sim \text{Exp}(\lambda), con λ>0\lambda > 0, se fX(x)=λe−λx 1[0,+∞)(x),FX(x)={0x<01−e−λxx≥0.f_X(x) = \lambda e^{-\lambda x} \, \mathbb 1_{[0, +\infty)}(x), \qquad F_X(x) = \begin{cases} 0 & x < 0 \\ 1 - e^{-\lambda x} & x \ge 0. \end{cases}

Esempio. X∼Exp(2)X \sim \text{Exp}(2) ha fX(x)=2e−2xf_X(x) = 2e^{-2x} per x≥0x \ge 0 e P(X≤1)=1−e−2≈0,865P(X \le 1) = 1 - e^{-2} \approx 0{,}865.

Proprietà (probabilità di sopravvivenza dell'esponenziale). P(X>t)=e−λt,t≥0.P(X > t) = e^{-\lambda t}, \qquad t \ge 0.

Esempio. X∼Exp(12)X \sim \text{Exp}(\frac{1}{2}): P(X>4)=e−2≈0,135P(X > 4) = e^{-2} \approx 0{,}135.

Grafico interattivo: Exp(1): la probabilità di sopravvivenza P(X > 1) = e⁻¹ ≈ 0,368 è l'area della coda a destra di t = 1

Proprietà (media e varianza dell'esponenziale). E[X]=1λ,Var(X)=1λ2.E[X] = \frac1\lambda, \qquad \text{Var}(X) = \frac{1}{\lambda^2}.

Esempio. X∼Exp(2)X \sim \text{Exp}(2): E[X]=12E[X] = \frac{1}{2} e Var(X)=14\text{Var}(X) = \frac{1}{4}.

Proprietà (assenza di memoria dell'esponenziale). Per ogni s,t≥0s, t \ge 0: P(X>s+t∣X>s)=P(X>t).P(X > s + t \mid X > s) = P(X > t).

Esempio. X∼Exp(λ)X \sim \text{Exp}(\lambda): P(X>5∣X>2)=P(X>3)=e−3λP(X > 5 \mid X > 2) = P(X > 3) = e^{-3\lambda}.

Distribuzione gamma

Definizione (funzione Gamma). Per α>0\alpha > 0, la funzione Gamma di Eulero è Γ(α):=∫0+∞xα−1e−x dx.\Gamma(\alpha) := \int_0^{+\infty} x^{\alpha - 1} e^{-x} \, dx.

Esempio. Γ(1)=∫0∞e−x dx=1\Gamma(1) = \int_0^\infty e^{-x}\,dx = 1 e Γ(n)=(n−1)!\Gamma(n) = (n-1)!: Γ(4)=3!=6\Gamma(4) = 3! = 6.

Definizione (distribuzione gamma). X∼Γ(α,λ)X \sim \Gamma(\alpha, \lambda), con forma α>0\alpha > 0 e tasso λ>0\lambda > 0, se fX(x)=λαΓ(α) xα−1e−λx 1(0,+∞)(x).f_X(x) = \frac{\lambda^\alpha}{\Gamma(\alpha)} \, x^{\alpha - 1} e^{-\lambda x} \, \mathbb 1_{(0, +\infty)}(x).

Esempio. X∼Γ(2,2)X \sim \Gamma(2, 2) ha densità fX(x)=22Γ(2) xe−2x=4xe−2xf_X(x) = \frac{2^2}{\Gamma(2)}\,x e^{-2x} = 4x e^{-2x} per x>0x > 0.

Grafico interattivo: Densità di Γ(α, 1) al variare della forma α: per α < 1 esplode in 0, per α = 1 è l'esponenziale, per α > 1 parte da 0 e ha il massimo in α − 1; per α = 5 è già quasi simmetrica

Proprietà (media e varianza della gamma). Se X∼Γ(α,λ)X \sim \Gamma(\alpha, \lambda): E[X]=αλ,Var(X)=αλ2.\quad E[X] = \dfrac\alpha\lambda, \qquad \text{Var}(X) = \dfrac{\alpha}{\lambda^2}.

Esempio. X∼Γ(3,2)X \sim \Gamma(3, 2): E[X]=32E[X] = \frac{3}{2} e Var(X)=34\text{Var}(X) = \frac{3}{4}.

Teorema (somma di gamma indipendenti). Se X∼Γ(α,λ)X \sim \Gamma(\alpha, \lambda) e Y∼Γ(β,λ)Y \sim \Gamma(\beta, \lambda) sono indipendenti (stesso tasso λ\lambda), allora X+Y∼Γ(α+β,λ).X + Y \sim \Gamma(\alpha + \beta, \lambda).

Esempio d'esame (I appello 15.01.2026, Esercizio 16 · due esponenziali indipendenti, quadrato e somma): X,Y∼Exp(2)X, Y \sim \text{Exp}(2) indipendenti, Z=X+Y∼Γ(2,2)Z = X + Y \sim \Gamma(2, 2), cioè

Distribuzione gaussiana (normale)

Definizione (gaussiana standard). Z∼N(0,1)Z \sim N(0, 1) se ha densità φ(z)=12πe−z2/2,z∈R.\varphi(z) = \frac{1}{\sqrt{2\pi}} e^{-z^2/2}, \qquad z \in \mathbb R. La sua FdD si indica con Φ(z)=∫−∞zφ(t) dt\Phi(z) = \displaystyle\int_{-\infty}^z \varphi(t) \, dt.

Esempio. Z∼N(0,1)Z \sim N(0,1): φ(0)=12π≈0,399\varphi(0) = \frac{1}{\sqrt{2\pi}} \approx 0{,}399 e P(Z≤0)=Φ(0)=12P(Z \le 0) = \Phi(0) = \frac{1}{2}.

Grafico interattivo: Densità della gaussiana standard: campana simmetrica, flessi in ±1

Definizione (gaussiana generale). X∼N(μ,σ2)X \sim N(\mu, \sigma^2), con μ∈R\mu \in \mathbb R e σ>0\sigma > 0, se fX(x)=12πσ2exp⁡(−(x−μ)22σ2),x∈R.f_X(x) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x - \mu)^2}{2\sigma^2}\right), \qquad x \in \mathbb R. Allora E[X]=μE[X] = \mu e Var(X)=σ2\text{Var}(X) = \sigma^2.

Esempio. X∼N(3,4)X \sim N(3, 4) ha media 33, varianza 44 e deviazione standard σ=2\sigma = 2.

Grafico interattivo: Effetto dei parametri: N(2, 1) è la standard traslata di 2 (μ sposta), N(0, 4) ha lo stesso centro ma σ = 2, quindi è più larga e bassa (σ allarga)

Teorema (trasformazioni affini di una gaussiana). Se X∼N(μ,σ2)X \sim N(\mu, \sigma^2) e a≠0a \ne 0, b∈Rb \in \mathbb R, allora aX+b∼N(aμ+b, a2σ2).aX + b \sim N(a\mu + b, \ a^2\sigma^2).

Esempio. X∼N(1,4)X \sim N(1, 4): 3X−2∼N(3⋅1−2, 9⋅4)=N(1,36)3X - 2 \sim N(3 \cdot 1 - 2,\ 9 \cdot 4) = N(1, 36).

Formula (standardizzazione di una gaussiana). P(X≤x)=P(X−μσ≤x−μσ)=Φ(x−μσ).P(X \le x) = P\left(\frac{X - \mu}{\sigma} \le \frac{x - \mu}{\sigma}\right) = \Phi\left(\frac{x - \mu}{\sigma}\right).

Esempio. X∼N(3,4)X \sim N(3, 4): P(X≤5)=Φ(5−32)=Φ(1)≈0,841P(X \le 5) = \Phi\left(\frac{5 - 3}{2}\right) = \Phi(1) \approx 0{,}841.

Teorema (somma di gaussiane indipendenti). Se X∼N(μ1,σ12)X \sim N(\mu_1, \sigma_1^2) e Y∼N(μ2,σ22)Y \sim N(\mu_2, \sigma_2^2) sono indipendenti, allora X+Y∼N(μ1+μ2, σ12+σ22),aX+bY∼N(aμ1+bμ2, a2σ12+b2σ22).X + Y \sim N(\mu_1 + \mu_2, \ \sigma_1^2 + \sigma_2^2), \qquad aX + bY \sim N(a\mu_1 + b\mu_2, \ a^2\sigma_1^2 + b^2\sigma_2^2).

Esempio. X∼N(1,4)X \sim N(1, 4) e Y∼N(2,5)Y \sim N(2, 5) indipendenti: X+Y∼N(3,9)X + Y \sim N(3, 9).

Funzioni di una variabile aleatoria

Principio (metodo generale: passare per la funzione di distribuzione).

  1. Scrivere FY(y)=P(Y≤y)=P(g(X)≤y)F_Y(y) = P(Y \le y) = P(g(X) \le y).
  2. Per ogni yy, trovare l'insieme Ay={x:g(x)≤y}=g−1((−∞,y])A_y = \{x : g(x) \le y\} = g^{-1}((-\infty, y]) dei valori di XX che rendono vero l'evento. Aiutarsi col grafico di gg: si traccia la retta orizzontale di altezza yy e si guarda dove il grafico sta sotto.
  3. Calcolare FY(y)=P(X∈Ay)F_Y(y) = P(X \in A_y) con la FdD o la densità di XX.
  4. Guardare FYF_Y: se è continua e derivabile a tratti, fY=FY′f_Y = F_Y'; se è a gradini, YY è discreta; se ha salti e tratti crescenti, è mistaUna v.a. mista ha una FdD con salti (parte discreta, masse p_i nei punti x_i) e tratti crescenti continui (parte con densità f): E[g(X)] = Σ g(x_i) p_i + ∫ g(x) f(x) dx, con Σ p_i + ∫ f = 1; varianza come sempre E[X²] − E[X]².Variabili aleatorie miste →.

Esempio. X∼U(0,1)X \sim U(0,1) e Y=X2Y = X^2: FY(y)=P(X2≤y)=P(X≤y)=yF_Y(y) = P(X^2 \le y) = P(X \le \sqrt{y}) = \sqrt{y} per y∈[0,1]y \in [0,1], quindi fY(y)=12yf_Y(y) = \frac{1}{2\sqrt{y}}.

Teorema (densità di g(X) per g strettamente monotona). Sia XX a.c. con densità fXf_X, e sia gg strettamente monotona e derivabile sull'insieme dove fX>0f_X > 0, con inversa h=g−1h = g^{-1} derivabile. Allora Y=g(X)Y = g(X) è a.c. con densità fY(y)=fX(h(y)) ∣h′(y)∣per y nell’immagine di g,f_Y(y) = f_X(h(y)) \, |h'(y)| \qquad \text{per } y \text{ nell'immagine di } g, e fY(y)=0f_Y(y) = 0 fuori dall'immagine.

Esempio: trasformazione affine. Y=aX+bY = aX + b, h(y)=y−bah(y) = \frac{y - b}{a}, ∣h′(y)∣=1∣a∣|h'(y)| = \frac{1}{|a|}: fY(y)=1∣a∣fX(y−ba)f_Y(y) = \frac{1}{|a|} f_X\left(\frac{y - b}{a}\right). Da qui viene che una gaussiana trasformata in modo affine resta gaussiana (Distribuzione gaussiana (normale)N(μ, σ²) ha densità e^(−(x−μ)²/(2σ²)) / √(2πσ²), a campana centrata in μ con larghezza σ; media μ, varianza σ²; si standardizza con Z = (X − μ)/σ ~ N(0, 1) e si calcola P(X ≤ x) = Φ((x − μ)/σ), con Φ(−z) = 1 − Φ(z); aX + b è ancora gaussiana, N(aμ + b, a²σ²).Distribuzione gaussiana (normale) →).

Variabili aleatorie miste

Definizione (variabile aleatoria mista). Una v.a. XX è mista se la sua FdD si scrive come FX(x)=∑i : xi≤xpi+∫−∞xf(t) dt,F_X(x) = \sum_{i \,:\, x_i \le x} p_i + \int_{-\infty}^x f(t) \, dt, dove x1,x2,…x_1, x_2, \dots sono i punti di salto, pi=P(X=xi)>0p_i = P(X = x_i) > 0 le altezze dei salti, f≥0f \ge 0 una funzione (la "densità della parte continua"), con ∑ipi+∫−∞+∞f(t) dt=1.\sum_i p_i + \int_{-\infty}^{+\infty} f(t) \, dt = 1.

Esempio. FX(x)=0,3+0,7(1−e−2x)F_X(x) = 0{,}3 + 0{,}7(1 - e^{-2x}) per x≥0x \ge 0 (e 00 per x<0x < 0): c'è un salto p0=0,3p_0 = 0{,}3 in x=0x = 0 e una parte continua di massa 0,70{,}7.

Formula (valore atteso di una variabile mista). E[g(X)]=∑ig(xi) pi+∫−∞+∞g(x)f(x) dxE[g(X)] = \sum_i g(x_i) \, p_i + \int_{-\infty}^{+\infty} g(x) f(x) \, dx (se la somma e l'integrale convergono assolutamente). In particolare E[X]=∑ixipi+∫xf(x) dx,Var(X)=E[X2]−E[X]2.E[X] = \sum_i x_i p_i + \int x f(x) \, dx, \qquad \text{Var}(X) = E[X^2] - E[X]^2.

Esempio. Con salto 0,30{,}3 in 00 e parte continua 1,4e−2x1{,}4e^{-2x} per x≥0x \ge 0: E[X]=0⋅0,3+0,7⋅12=0,35E[X] = 0 \cdot 0{,}3 + 0{,}7 \cdot \frac{1}{2} = 0{,}35.

5. Vettori aleatori

Vettori aleatori discreti

Definizione (vettore aleatorio discreto e densità congiunta). Un vettore aleatorio discreto è una coppia (o in generale una nn-upla) (X,Y)(X, Y) di v.a. discrete definite sullo stesso spazio (Ω,F,P)(\Omega, \mathcal F, P). La sua densità congiunta è pX,Y(x,y):=P(X=x,Y=y),(x,y)∈R2,p_{X,Y}(x, y) := P(X = x, Y = y), \qquad (x, y) \in \mathbb R^2, dove la virgola significa "e": {X=x,Y=y}={X=x}∩{Y=y}\{X = x, Y = y\} = \{X = x\} \cap \{Y = y\}.

Esempio. Due lanci indipendenti di una moneta equa, X,Y∈{0,1}X, Y \in \{0,1\}: pX,Y(x,y)=14p_{X,Y}(x,y) = \frac{1}{4} per ogni coppia (x,y)∈{0,1}2(x,y) \in \{0,1\}^2.

Formula (densità marginali). pX(x)=∑ypX,Y(x,y),pY(y)=∑xpX,Y(x,y).p_X(x) = \sum_{y} p_{X,Y}(x, y), \qquad p_Y(y) = \sum_{x} p_{X,Y}(x, y).

Esempio. Se pX,Y≡14p_{X,Y} \equiv \frac{1}{4} su {0,1}2\{0,1\}^2: pX(0)=pX,Y(0,0)+pX,Y(0,1)=12p_X(0) = p_{X,Y}(0,0) + p_{X,Y}(0,1) = \frac{1}{2}.

Definizione (indipendenza di variabili aleatorie discrete). Le v.a. XX e YY sono indipendenti se gli eventi {X∈A}\{X \in A\} e {Y∈B}\{Y \in B\} sono indipendenti per ogni scelta di A,B⊆RA, B \subseteq \mathbb R. Nel caso discreto questo equivale a pX,Y(x,y)=pX(x) pY(y)per ogni (x,y).p_{X,Y}(x, y) = p_X(x) \, p_Y(y) \qquad \text{per ogni } (x, y).

Esempio. Con pX,Y≡14p_{X,Y} \equiv \frac{1}{4} si ha pX=pY=12p_X = p_Y = \frac{1}{2} e pX(x) pY(y)=14=pX,Y(x,y)p_X(x)\,p_Y(y) = \frac{1}{4} = p_{X,Y}(x,y): XX e YY sono indipendenti.

Teorema fondamentale (caso vettoriale). Per g:R2→Rg : \mathbb R^2 \to \mathbb R, se la serie converge assolutamente, E[g(X,Y)]=∑x∑yg(x,y) pX,Y(x,y).E[g(X, Y)] = \sum_{x} \sum_{y} g(x, y) \, p_{X,Y}(x, y).

Esempio. Con pX,Y≡14p_{X,Y} \equiv \frac{1}{4} su {0,1}2\{0,1\}^2: E[X+Y]=0+1+1+24=1E[X + Y] = \frac{0 + 1 + 1 + 2}{4} = 1.

Vettori aleatori assolutamente continui

Definizione (funzione di ripartizione congiunta). La funzione di ripartizione congiunta (FdR) di un vettore (X,Y)(X, Y) è FX,Y(x,y):=P(X≤x,Y≤y),(x,y)∈R2.F_{X,Y}(x, y) := P(X \le x, Y \le y), \qquad (x, y) \in \mathbb R^2.

Esempio. (X,Y)(X, Y) uniforme su [0,1]2[0,1]^2: FX,Y(x,y)=xyF_{X,Y}(x, y) = xy per x,y∈[0,1]x, y \in [0,1].

Definizione (densità congiunta). Il vettore (X,Y)(X, Y) è assolutamente continuo se esiste fX,Y:R2→[0,+∞)f_{X,Y} : \mathbb R^2 \to [0, +\infty) tale che P((X,Y)∈A)=∬AfX,Y(x,y) dx dyper ogni A⊆R2 boreliano.P((X, Y) \in A) = \iint_A f_{X,Y}(x, y) \, dx \, dy \qquad \text{per ogni } A \subseteq \mathbb R^2 \text{ boreliano}. In particolare ∬R2fX,Y=1\iint_{\mathbb R^2} f_{X,Y} = 1 e FX,Y(x,y)=∫−∞x∫−∞yfX,Y(s,t) dt dsF_{X,Y}(x, y) = \int_{-\infty}^x \int_{-\infty}^y f_{X,Y}(s, t) \, dt \, ds.

Esempio. fX,Y=1f_{X,Y} = 1 su [0,1]2[0,1]^2 (e 00 altrove) è una densità congiunta: ∬fX,Y=1\iint f_{X,Y} = 1.

Formula (densità marginali di un vettore continuo). Se (X,Y)(X, Y) è a.c., allora XX e YY sono a.c. con densità fX(x)=∫−∞+∞fX,Y(x,y) dy,fY(y)=∫−∞+∞fX,Y(x,y) dx.f_X(x) = \int_{-\infty}^{+\infty} f_{X,Y}(x, y) \, dy, \qquad f_Y(y) = \int_{-\infty}^{+\infty} f_{X,Y}(x, y) \, dx.

Esempio. fX,Y(x,y)=x+yf_{X,Y}(x,y) = x + y su [0,1]2[0,1]^2: fX(x)=∫01(x+y) dy=x+12f_X(x) = \int_0^1 (x + y)\,dy = x + \frac{1}{2}.

Definizione (indipendenza di variabili assolutamente continue). XX e YY (con (X,Y)(X, Y) a.c.) sono indipendenti se e solo se fX,Y(x,y)=fX(x) fY(y)per (quasi) ogni (x,y).f_{X,Y}(x, y) = f_X(x) \, f_Y(y) \qquad \text{per (quasi) ogni } (x, y). Equivalentemente, FX,Y(x,y)=FX(x)FY(y)F_{X,Y}(x, y) = F_X(x) F_Y(y) per ogni (x,y)(x, y).

Esempio. fX,Y(x,y)=4xyf_{X,Y}(x,y) = 4xy su [0,1]2[0,1]^2 è il prodotto di fX(x)=2xf_X(x) = 2x e fY(y)=2yf_Y(y) = 2y: XX e YY sono indipendenti.

Formula (valore medio di una funzione del vettore). E[g(X,Y)]=∬R2g(x,y) fX,Y(x,y) dx dy.E[g(X, Y)] = \iint_{\mathbb R^2} g(x, y) \, f_{X,Y}(x, y) \, dx \, dy.

Esempio. fX,Y=1f_{X,Y} = 1 su [0,1]2[0,1]^2: E[XY]=∫01∫01xy dx dy=14E[XY] = \int_0^1 \int_0^1 xy\,dx\,dy = \frac{1}{4}.

Somma di variabili aleatorie indipendenti

Formula (convoluzione discreta). Se XX e YY sono indipendenti a valori interi, Z=X+YZ = X + Y ha densità pZ(n)=∑kpX(k) pY(n−k).p_Z(n) = \sum_{k} p_X(k) \, p_Y(n - k).

Esempio. Due dadi: pZ(7)=∑k=1616⋅16=636=16p_Z(7) = \sum_{k=1}^{6} \frac{1}{6} \cdot \frac{1}{6} = \frac{6}{36} = \frac{1}{6}.

Formula (convoluzione continua). Se XX e YY sono indipendenti e a.c., Z=X+YZ = X + Y è a.c. con densità fZ(z)=∫−∞+∞fX(z−y) fY(y) dy=∫−∞+∞fX(x) fY(z−x) dx.f_Z(z) = \int_{-\infty}^{+\infty} f_X(z - y) \, f_Y(y) \, dy = \int_{-\infty}^{+\infty} f_X(x) \, f_Y(z - x) \, dx. Si scrive fZ=fX∗fYf_Z = f_X * f_Y (convoluzione).

Esempio. X,Y∼U(0,1)X, Y \sim U(0,1) indipendenti: per 0≤z≤10 \le z \le 1, fZ(z)=∫0z1 dy=zf_Z(z) = \int_0^z 1\,dy = z (la densità triangolare).

Proprietà (somma di esponenziali e di gamma). Exp(λ)+Exp(λ)=Γ(2,λ)\text{Exp}(\lambda) + \text{Exp}(\lambda) = \Gamma(2, \lambda), e più in generale Γ(α,λ)+Γ(β,λ)=Γ(α+β,λ)\Gamma(\alpha, \lambda) + \Gamma(\beta, \lambda) = \Gamma(\alpha + \beta, \lambda) (indipendenti, stesso tasso).

Esempio. X,Y∼Exp(2)X, Y \sim \text{Exp}(2) indipendenti: X+Y∼Γ(2,2)X + Y \sim \Gamma(2, 2), con densità 4z e−2z4z\,e^{-2z} per z>0z > 0.

Covarianza e coefficiente di correlazione

Definizione (covarianza). La covarianza di XX e YY (con momento secondo finito) è Cov(X,Y):=E[(X−E[X])(Y−E[Y])].\text{Cov}(X, Y) := E\big[(X - E[X])(Y - E[Y])\big].

Esempio. X,Y∈{0,1}X, Y \in \{0,1\} con p(0,0)=p(1,1)=12p(0,0) = p(1,1) = \frac{1}{2}: E[XY]=12E[XY] = \frac{1}{2} e E[X]=E[Y]=12E[X] = E[Y] = \frac{1}{2}, quindi Cov(X,Y)=12−14=14\text{Cov}(X,Y) = \frac{1}{2} - \frac{1}{4} = \frac{1}{4}.

Formula (di calcolo della covarianza). Cov(X,Y)=E[XY]−E[X] E[Y].\text{Cov}(X, Y) = E[XY] - E[X]\,E[Y].

Esempio. X∼U(0,1)X \sim U(0,1) e Y=X2Y = X^2: Cov(X,Y)=E[X3]−E[X]E[X2]=14−12⋅13=112\text{Cov}(X,Y) = E[X^3] - E[X]E[X^2] = \frac{1}{4} - \frac{1}{2} \cdot \frac{1}{3} = \frac{1}{12}.

Proprietà (della covarianza).

  1. Simmetria: Cov(X,Y)=Cov(Y,X)\text{Cov}(X, Y) = \text{Cov}(Y, X).
  2. Cov(X,X)=Var(X)\text{Cov}(X, X) = \text{Var}(X).
  3. Costanti: Cov(X,c)=0\text{Cov}(X, c) = 0 e Cov(X+c,Y)=Cov(X,Y)\text{Cov}(X + c, Y) = \text{Cov}(X, Y).
  4. Bilinearità: Cov(aX+bY,Z)=a Cov(X,Z)+b Cov(Y,Z)\text{Cov}(aX + bY, Z) = a\,\text{Cov}(X, Z) + b\,\text{Cov}(Y, Z), e lo stesso nel secondo argomento.
  5. Varianza di una combinazione lineare: Var(aX+bY)=a2 Var(X)+b2 Var(Y)+2ab Cov(X,Y).\text{Var}(aX + bY) = a^2\,\text{Var}(X) + b^2\,\text{Var}(Y) + 2ab\,\text{Cov}(X, Y).

Esempio. Con Var(X)=Var(Y)=1\text{Var}(X) = \text{Var}(Y) = 1 e Cov(X,Y)=12\text{Cov}(X,Y) = \frac{1}{2}: Var(X+Y)=1+1+2⋅12=3\text{Var}(X + Y) = 1 + 1 + 2 \cdot \frac{1}{2} = 3.

Teorema (indipendenti implica non correlate). Se XX e YY sono indipendenti, allora Cov(X,Y)=0\text{Cov}(X, Y) = 0, e quindi Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y).

Esempio. Due dadi indipendenti: Cov=0\text{Cov} = 0 e Var(X+Y)=2⋅3512=356\text{Var}(X + Y) = 2 \cdot \frac{35}{12} = \frac{35}{6}.

Definizione (coefficiente di correlazione). Se Var(X),Var(Y)>0\text{Var}(X), \text{Var}(Y) > 0, il coefficiente di correlazione è ρ(X,Y):=Cov(X,Y)Var(X) Var(Y)=Cov(X,Y)σX σY.\rho(X, Y) := \frac{\text{Cov}(X, Y)}{\sqrt{\text{Var}(X)\,\text{Var}(Y)}} = \frac{\text{Cov}(X, Y)}{\sigma_X\,\sigma_Y}.

Esempio. Con Cov(X,Y)=14\text{Cov}(X,Y) = \frac{1}{4} e Var(X)=Var(Y)=14\text{Var}(X) = \text{Var}(Y) = \frac{1}{4}: ρ=1/41/16=1\rho = \frac{1/4}{\sqrt{1/16}} = 1 (è il caso Y=XY = X).

Teorema (limiti del coefficiente di correlazione). −1≤ρ(X,Y)≤1-1 \le \rho(X, Y) \le 1. Inoltre ∣ρ∣=1|\rho| = 1 se e solo se Y=aX+bY = aX + b (quasi certamente) per qualche a≠0a \ne 0, con ρ=1\rho = 1 se a>0a > 0 e ρ=−1\rho = -1 se a<0a < 0.

Esempio. Y=−3X+1Y = -3X + 1 ha ρ(X,Y)=−1\rho(X,Y) = -1; due variabili indipendenti hanno ρ=0\rho = 0.

Definizione (matrice di covarianza). Σ=(Σij),Σij=Cov(Xi,Xj).\Sigma = (\Sigma_{ij}), \qquad \Sigma_{ij} = \text{Cov}(X_i, X_j).

Esempio. Se Var(X)=4\text{Var}(X) = 4, Var(Y)=1\text{Var}(Y) = 1 e Cov(X,Y)=1\text{Cov}(X,Y) = 1: Σ=(4111)\Sigma = \begin{pmatrix} 4 & 1 \\ 1 & 1 \end{pmatrix}.

Vettori gaussiani

Definizione (vettore gaussiano). Un vettore aleatorio X=(X1,…,Xn)X = (X_1, \dots, X_n) è gaussiano se ogni combinazione lineare delle sue componenti a1X1+⋯+anXn,a1,…,an∈R,a_1 X_1 + \dots + a_n X_n, \qquad a_1, \dots, a_n \in \mathbb R, è una v.a. gaussiana (le costanti contano come gaussiane degeneri, con varianza 00).

Se m=E[X]m = E[X] è il vettore delle medie e Σ\Sigma la matrice di covarianzaLa matrice n × n con le varianze sulla diagonale e Cov(X_i, X_j) fuori diagonale: simmetrica e semidefinita positiva.Covarianza e coefficiente di correlazione →, si scrive X∼N(m,Σ)X \sim N(m, \Sigma).

Esempio. (Z1,Z2)(Z_1, Z_2) con Zi∼N(0,1)Z_i \sim N(0,1) indipendenti è gaussiano: aZ1+bZ2∼N(0,a2+b2)aZ_1 + bZ_2 \sim N(0, a^2 + b^2).

Teorema (caratterizzazioni equivalenti dei vettori gaussiani). Per un vettore XX con media mm e covarianza Σ\Sigma sono equivalenti:

  1. ogni combinazione lineare aTXa^T X è gaussiana;
  2. X=m+AZX = m + AZ, dove Z=(Z1,…,Zk)Z = (Z_1, \dots, Z_k) ha componenti N(0,1)N(0, 1) indipendenti e AA è una matrice n×kn \times k con AAT=ΣAA^T = \Sigma;
  3. la funzione caratteristica è φX(θ)=E[eiθTX]=exp⁡(iθTm−12θTΣθ)\varphi_X(\theta) = E[e^{i\theta^T X}] = \exp\left(i\theta^T m - \frac12 \theta^T \Sigma \theta\right) per ogni θ∈Rn\theta \in \mathbb R^n;
  4. (se det⁡Σ>0\det \Sigma > 0) XX ha densità fX(x)=1(2π)ndet⁡Σexp⁡(−12(x−m)TΣ−1(x−m)),x∈Rn.f_X(x) = \frac{1}{\sqrt{(2\pi)^n \det\Sigma}} \exp\left(-\frac12 (x - m)^T \Sigma^{-1} (x - m)\right), \qquad x \in \mathbb R^n.

Esempio. X=m+AZX = m + AZ con A=(1011)A = \begin{pmatrix} 1 & 0 \\ 1 & 1 \end{pmatrix} e ZZ standard: Σ=AAT=(1112)\Sigma = AA^T = \begin{pmatrix} 1 & 1 \\ 1 & 2 \end{pmatrix}.

Teorema (trasformazioni affini di un vettore gaussiano). Se X∼N(m,Σ)X \sim N(m, \Sigma) in Rn\mathbb R^n, BB è una matrice k×nk \times n e b∈Rkb \in \mathbb R^k, allora Y=BX+b∼N(Bm+b, BΣBT).Y = BX + b \sim N(Bm + b, \ B\Sigma B^T).

Esempio. (X,Y)(X, Y) standard indipendenti e B=(1  1)B = (1 \ \ 1): X+Y=B (X,Y)T∼N(0,BBT)=N(0,2)X + Y = B\,(X,Y)^T \sim N(0, BB^T) = N(0, 2).

Teorema (non correlazione e indipendenza per vettori gaussiani). Se (X,Y)(X, Y) è un vettore gaussiano, allora XX e YY sono indipendenti se e solo se Cov(X,Y)=0\text{Cov}(X, Y) = 0. Più in generale, le componenti di un vettore gaussiano sono indipendenti se e solo se Σ\Sigma è diagonale.

Esempio. Se (X,Y)(X,Y) è gaussiano con Cov(X,Y)=0\text{Cov}(X,Y) = 0, allora XX e YY sono indipendenti; per v.a. non congiuntamente gaussiane questo può essere falso.

Grafico interattivo: Curve di livello (distanza 1 dal centro) di vettori gaussiani con varianze 1: ρ = 0 dà una circonferenza (assi indipendenti), ρ = 0,8 un'ellisse lungo la diagonale crescente, ρ = −0,8 lungo quella decrescente

6. Densità e media condizionata

Densità e media condizionata

Definizione (densità e media condizionate a un evento). Se BB è un evento con P(B)>0P(B) > 0, la densità di XX condizionata a BB è pX∣B(x):=P(X=x∣B)=P({X=x}∩B)P(B),p_{X \mid B}(x) := P(X = x \mid B) = \frac{P(\{X = x\} \cap B)}{P(B)}, e la media condizionata è E[X∣B]=∑xx pX∣B(x)E[X \mid B] = \sum_x x \, p_{X \mid B}(x).

Esempio (dado): XX = risultato di un dado, BB = "esce pari". pX∣B(x)=13p_{X \mid B}(x) = \frac13 per x∈{2,4,6}x \in \{2, 4, 6\} e 00 altrove, quindi E[X∣B]=4E[X \mid B] = 4.

Definizione (densità e media condizionate a una v.a. discreta). Siano X,YX, Y discrete. Per ogni yy con pY(y)>0p_Y(y) > 0, la densità di XX condizionata a Y=yY = y è pX∣Y(x∣y):=P(X=x∣Y=y)=pX,Y(x,y)pY(y),p_{X \mid Y}(x \mid y) := P(X = x \mid Y = y) = \frac{p_{X,Y}(x, y)}{p_Y(y)}, e la media condizionata è E[X∣Y=y]:=∑xx pX∣Y(x∣y)E[X \mid Y = y] := \sum_x x \, p_{X \mid Y}(x \mid y).

Esempio. Con pX,Y≡14p_{X,Y} \equiv \frac{1}{4} su {0,1}2\{0,1\}^2: pX∣Y(x∣1)=1/41/2=12p_{X \mid Y}(x \mid 1) = \frac{1/4}{1/2} = \frac{1}{2} e E[X∣Y=1]=12E[X \mid Y = 1] = \frac{1}{2}.

Definizione (densità e media condizionate a una v.a. continua). Sia (X,Y)(X, Y) assolutamente continuo. Per ogni yy con fY(y)>0f_Y(y) > 0, la densità di XX condizionata a Y=yY = y è fX∣Y(x∣y):=fX,Y(x,y)fY(y),f_{X \mid Y}(x \mid y) := \frac{f_{X,Y}(x, y)}{f_Y(y)}, e E[X∣Y=y]:=∫x fX∣Y(x∣y) dxE[X \mid Y = y] := \int x \, f_{X \mid Y}(x \mid y) \, dx.

Esempio. fX,Y=1f_{X,Y} = 1 sul quadrato [0,1]2[0,1]^2: fX∣Y(x∣y)=1f_{X \mid Y}(x \mid y) = 1 per x∈[0,1]x \in [0,1], cioè X∣Y=y∼U(0,1)X \mid Y = y \sim U(0,1) e E[X∣Y=y]=12E[X \mid Y = y] = \frac{1}{2}.

Grafico interattivo: Densità di X condizionata a Y = y per f = (x + y)/27 sul quadrato [0, 3]²: (2x + 2y)/(6y + 9) cambia con y (più pendente per y = 0 che per y = 3), ma ha sempre area 1

Definizione (media condizionata come variabile aleatoria). E[X∣Y]:=h(Y),dove h(y)=E[X∣Y=y].E[X \mid Y] := h(Y), \qquad \text{dove } h(y) = E[X \mid Y = y].

Esempio. Se E[X∣Y=y]=y2E[X \mid Y = y] = \frac{y}{2}, allora E[X∣Y]=Y2E[X \mid Y] = \frac{Y}{2}, una v.a. funzione di YY.

Grafico interattivo: Dato Y = y, X è uniforme su [0, y]: per y = 0,8 sta sul segmento orizzontale e la sua media è 0,4. Al variare di y le medie condizionate stanno sulla retta x = y/2, cioè E[X | Y] = Y/2

Proprietà della torre (o della media iterata): E[E[X∣Y]]=E[X].E\big[E[X \mid Y]\big] = E[X]. Nel continuo: E[X]=∫E[X∣Y=y] fY(y) dyE[X] = \int E[X \mid Y = y] \, f_Y(y) \, dy; nel discreto: E[X]=∑yE[X∣Y=y] pY(y)E[X] = \sum_y E[X \mid Y = y] \, p_Y(y).

Esempio. Y∼U(0,1)Y \sim U(0,1) e E[X∣Y]=Y2E[X \mid Y] = \frac{Y}{2}: E[X]=E[Y2]=14E[X] = E\left[\frac{Y}{2}\right] = \frac{1}{4}.

Teorema (vettore gaussiano condizionato). Se (X,Y)(X, Y) è un vettore gaussiano con medie m1,m2m_1, m_2, varianze σ12,σ22>0\sigma_1^2, \sigma_2^2 > 0 e correlazione ρ\rho, allora, dato Y=yY = y, X∣Y=y ∼ N(m1+ρσ1σ2(y−m2),  σ12(1−ρ2)).X \mid Y = y \ \sim \ N\left(m_1 + \rho\frac{\sigma_1}{\sigma_2}(y - m_2), \ \ \sigma_1^2(1 - \rho^2)\right). Equivalentemente E[X∣Y]=m1+Cov(X,Y)Var(Y)(Y−m2)E[X \mid Y] = m_1 + \frac{\text{Cov}(X, Y)}{\text{Var}(Y)}(Y - m_2).

Esempio. (X,Y)(X,Y) gaussiano centrato con σ1=σ2=1\sigma_1 = \sigma_2 = 1 e ρ=12\rho = \frac{1}{2}: dato Y=2Y = 2, X∼N(12⋅2, 1−14)=N(1,34)X \sim N\left(\frac{1}{2} \cdot 2,\ 1 - \frac{1}{4}\right) = N\left(1, \frac{3}{4}\right).

7. Funzioni generatrici

Funzione generatrice dei momenti

Definizione (funzione generatrice dei momenti). La funzione generatrice dei momenti (f.g.m.) di una v.a. XX è MX(t):=E[etX],t∈R,M_X(t) := E\big[e^{tX}\big], \qquad t \in \mathbb R, definita per i tt per cui il valore atteso è finito.

Esempio. X∼Be(p)X \sim \text{Be}(p): MX(t)=E[etX]=1−p+p etM_X(t) = E[e^{tX}] = 1 - p + p\,e^t.

Proprietà (momenti dalla f.g.m.). Se MXM_X è finita in un intorno di 00, allora XX ha tutti i momenti finiti e E[Xk]=MX(k)(0),k=1,2,…E[X^k] = M_X^{(k)}(0), \qquad k = 1, 2, \dots

Esempio. MX(t)=1−p+p etM_X(t) = 1 - p + p\,e^t ha MX′(0)=p=E[X]M_X'(0) = p = E[X] e MX′′(0)=p=E[X2]M_X''(0) = p = E[X^2].

Proprietà (trasformazioni affini della f.g.m.). MaX+b(t)=ebtMX(at).M_{aX + b}(t) = e^{bt} M_X(at).

Esempio. M2X+1(t)=etMX(2t)M_{2X + 1}(t) = e^{t} M_X(2t).

Proprietà (f.g.m. di una somma di indipendenti). Se XX e YY sono indipendenti, MX+Y(t)=MX(t) MY(t).M_{X + Y}(t) = M_X(t) \, M_Y(t).

Esempio. Due Be(p)\text{Be}(p) indipendenti: MX+Y(t)=(1−p+p et)2M_{X+Y}(t) = (1 - p + p\,e^t)^2, la f.g.m. di Bin(2,p)\text{Bin}(2, p).

Teorema di unicità. Se MX(t)=MY(t)<∞M_X(t) = M_Y(t) < \infty per ogni tt in un intorno di 00, allora XX e YY hanno la stessa legge.

Esempio. Se MX(t)=et2/2M_X(t) = e^{t^2/2} in un intorno di 00, allora X∼N(0,1)X \sim N(0,1), perché è la f.g.m. di quella legge.

Funzione caratteristica

Definizione (funzione caratteristica). La funzione caratteristica di una v.a. XX è φX(θ):=E[eiθX]=E[cos⁡(θX)]+i E[sin⁡(θX)],θ∈R.\varphi_X(\theta) := E\big[e^{i\theta X}\big] = E[\cos(\theta X)] + i\,E[\sin(\theta X)], \qquad \theta \in \mathbb R.

Esempio. X∼Be(p)X \sim \text{Be}(p): φX(θ)=(1−p)+p eiθ\varphi_X(\theta) = (1 - p) + p\,e^{i\theta}.

Proprietà (elementari della funzione caratteristica).

  1. φX(0)=1\varphi_X(0) = 1.
  2. ∣φX(θ)∣≤1|\varphi_X(\theta)| \le 1 per ogni θ\theta.
  3. φX(−θ)=φX(θ)‾\varphi_X(-\theta) = \overline{\varphi_X(\theta)} (coniugato).
  4. φX\varphi_X è (uniformemente) continua.
  5. Affinità: φaX+b(θ)=eibθφX(aθ)\varphi_{aX + b}(\theta) = e^{ib\theta}\varphi_X(a\theta).
  6. Se XX è simmetrica (XX e −X-X hanno la stessa legge), φX\varphi_X è reale e pari.

Esempio. φ2X+1(θ)=eiθφX(2θ)\varphi_{2X + 1}(\theta) = e^{i\theta}\varphi_X(2\theta).

Teorema (momenti dalla funzione caratteristica). Se E[∣X∣k]<∞E[|X|^k] < \infty, allora φX\varphi_X è derivabile kk volte e φX(k)(0)=ikE[Xk],cioeˋE[Xk]=φX(k)(0)ik.\varphi_X^{(k)}(0) = i^k E[X^k], \qquad \text{cioè} \quad E[X^k] = \frac{\varphi_X^{(k)}(0)}{i^k}.

Esempio. X∼Be(p)X \sim \text{Be}(p): φX′(0)=ip\varphi_X'(0) = i p, quindi E[X]=φX′(0)i=pE[X] = \frac{\varphi_X'(0)}{i} = p.

Proprietà (funzione caratteristica di una somma di indipendenti). Se XX e YY sono indipendenti: φX+Y(θ)=φX(θ) φY(θ)\quad \varphi_{X + Y}(\theta) = \varphi_X(\theta)\,\varphi_Y(\theta).

Esempio. X,Y∼Be(p)X, Y \sim \text{Be}(p) indipendenti: φX+Y(θ)=(1−p+p eiθ)2\varphi_{X+Y}(\theta) = \big(1 - p + p\,e^{i\theta}\big)^2, la funzione caratteristica di Bin(2,p)\text{Bin}(2, p).

Teorema (di unicità). Unicità. Due v.a. con la stessa funzione caratteristica hanno la stessa legge.

Esempio. Se φX(θ)=1−p+p eiθ\varphi_X(\theta) = 1 - p + p\,e^{i\theta} allora X∼Be(p)X \sim \text{Be}(p).

Teorema (di inversione). Inversione. Se ∫R∣φX(θ)∣ dθ<∞\int_{\mathbb R} |\varphi_X(\theta)| \, d\theta < \infty, allora XX è a.c. con densità fX(x)=12π∫Re−iθxφX(θ) dθ.f_X(x) = \frac{1}{2\pi}\int_{\mathbb R} e^{-i\theta x}\varphi_X(\theta) \, d\theta.

Esempio. φ(θ)=e−θ2/2\varphi(\theta) = e^{-\theta^2/2} è integrabile e l'inversione restituisce f(x)=12πe−x2/2f(x) = \frac{1}{\sqrt{2\pi}} e^{-x^2/2}, la densità di N(0,1)N(0,1).

Teorema di Bochner. Una funzione φ:R→C\varphi : \mathbb R \to \mathbb C è la funzione caratteristica di qualche v.a. se e solo se φ(0)=1\varphi(0) = 1, φ\varphi è continua e φ\varphi è definita positiva: per ogni scelta di θ1,…,θn∈R\theta_1, \dots, \theta_n \in \mathbb R e c1,…,cn∈Cc_1, \dots, c_n \in \mathbb C, ∑j,kcjck‾ φ(θj−θk)≥0.\sum_{j,k} c_j \overline{c_k}\,\varphi(\theta_j - \theta_k) \ge 0.

Esempio. φ(θ)=e−θ2/2\varphi(\theta) = e^{-\theta^2/2}, funzione caratteristica di N(0,1)N(0,1), soddisfa φ(0)=1\varphi(0) = 1, è continua ed è definita positiva.

8. Convergenze e teoremi limite

Convergenza di successioni di variabili aleatorie

Definizione (quattro tipi di convergenza). Quasi certa (Xn→q.c.XX_n \xrightarrow{q.c.} X): P({ω:lim⁡n→∞Xn(ω)=X(ω)})=1.P\left(\left\{\omega : \lim_{n\to\infty} X_n(\omega) = X(\omega)\right\}\right) = 1.

In probabilità (Xn→pXX_n \xrightarrow{p} X): per ogni ε>0\varepsilon > 0 lim⁡n→∞P(∣Xn−X∣>ε)=0.\lim_{n\to\infty} P(|X_n - X| > \varepsilon) = 0.

In media pp-esima, o in LpL^p, con p≥1p \ge 1 (Xn→LpXX_n \xrightarrow{L^p} X): lim⁡n→∞E[∣Xn−X∣p]=0.\lim_{n\to\infty} E\big[|X_n - X|^p\big] = 0. Per p=1p = 1 si dice in media, per p=2p = 2 in media quadratica (o media seconda).

In distribuzione (o in legge, Xn→dXX_n \xrightarrow{d} X): lim⁡n→∞FXn(x)=FX(x)per ogni x in cui FX eˋ continua.\lim_{n\to\infty} F_{X_n}(x) = F_X(x) \qquad \text{per ogni } x \text{ in cui } F_X \text{ è continua}.

Esempio. La successione deterministica Xn=1nX_n = \frac{1}{n} converge a 00 in tutti e quattro i sensi: ∣Xn−0∣=1n→0|X_n - 0| = \frac{1}{n} \to 0.

Proprietà (relazioni tra i tipi di convergenza).

  1. q.c. ⇒ in probabilità.
  2. LpL^p ⇒ in probabilità.
  3. In probabilità ⇒ in distribuzione.
  4. LqL^q ⇒ LpL^p se q≥pq \ge p (in particolare L2L^2 ⇒ L1L^1).
  5. In distribuzione verso una costante cc ⇒ in probabilità verso cc.

Esempio. Se Xn→XX_n \to X in L2L^2, allora Xn→XX_n \to X anche in L1L^1, in probabilità e in distribuzione.

Teorema (di continuità di Lévy). Xn→dXX_n \xrightarrow{d} X se e solo se φXn(θ)→φX(θ)\varphi_{X_n}(\theta) \to \varphi_X(\theta) per ogni θ∈R\theta \in \mathbb R.

Più precisamente: se φXn(θ)→φ(θ)\varphi_{X_n}(\theta) \to \varphi(\theta) per ogni θ\theta e il limite φ\varphi è continuo in 00, allora φ\varphi è la funzione caratteristica di una v.a. XX e Xn→dXX_n \xrightarrow{d} X.

Esempio. Xn∼Bin(n,λn)X_n \sim \text{Bin}(n, \frac{\lambda}{n}) ha φXn(θ)=(1+λ(eiθ−1)n)n→eλ(eiθ−1)\varphi_{X_n}(\theta) = \left(1 + \frac{\lambda(e^{i\theta} - 1)}{n}\right)^n \to e^{\lambda(e^{i\theta} - 1)}, la funzione caratteristica di Poi(λ)\text{Poi}(\lambda).

Legge dei grandi numeri e metodo Monte Carlo

Teorema (legge debole). Siano X1,X2,…X_1, X_2, \dots i.i.d. con media μ\mu e varianza σ2\sigma^2 finita. Allora per ogni ε>0\varepsilon > 0 P(∣Xˉn−μ∣>ε)≤σ2nε2→n→∞0,P\big(|\bar X_n - \mu| > \varepsilon\big) \le \frac{\sigma^2}{n\varepsilon^2} \xrightarrow[n\to\infty]{} 0, cioè Xˉn→pμ\bar X_n \xrightarrow{p} \mu.

Esempio. Lanci di una moneta equa: P(∣Xˉn−12∣>0,1)≤1/4n⋅0,01=25nP\left(\left|\bar{X}_n - \frac{1}{2}\right| > 0{,}1\right) \le \frac{1/4}{n \cdot 0{,}01} = \frac{25}{n}, che per n=1000n = 1000 vale 0,0250{,}025.

Grafico interattivo: Maggiorazione di Chebyshev 1/(4nε²) con ε = 0,1, in funzione del numero di prove n: scende sotto 0,05 solo da n = 500 in poi

Teorema (legge forte, Kolmogorov). Siano X1,X2,…X_1, X_2, \dots i.i.d. con E[∣X1∣]<∞E[|X_1|] < \infty e media μ\mu. Allora Xˉn→q.c.μ,cioeˋP(lim⁡n→∞Xˉn=μ)=1.\bar X_n \xrightarrow{q.c.} \mu, \qquad \text{cioè} \quad P\left(\lim_{n\to\infty}\bar X_n = \mu\right) = 1.

Esempio. Lanci di una moneta equa: la frequenza di teste Xˉn\bar{X}_n tende a 12\frac{1}{2} quasi certamente.

Formula (stima Monte Carlo di un integrale). I^n:=1n∑k=1ng(Uk)→n→∞∫01g(u) du(q.c. e in probabilitaˋ).\hat I_n := \frac{1}{n}\sum_{k=1}^n g(U_k) \xrightarrow[n\to\infty]{} \int_0^1 g(u) \, du \quad \text{(q.c. e in probabilità)}.

Esempio. Con g(u)=u2g(u) = u^2 e Uk∼U(0,1)U_k \sim U(0,1) indipendenti, 1n∑k=1nUk2→∫01u2 du=13\frac{1}{n}\sum_{k=1}^n U_k^2 \to \int_0^1 u^2\,du = \frac{1}{3}.

Teorema del limite centrale e approssimazione normale

Teorema del limite centrale (TLC). Zn→dZ∼N(0,1)Z_n \xrightarrow{d} Z \sim N(0, 1), cioè lim⁡n→∞P(Sn−nμσn≤x)=Φ(x)per ogni x∈R.\lim_{n\to\infty} P\left(\frac{S_n - n\mu}{\sigma\sqrt n} \le x\right) = \Phi(x) \qquad \text{per ogni } x \in \mathbb R.

Esempio. S100S_{100} = numero di teste in 100100 lanci di una moneta equa (nμ=50n\mu = 50, σn=12⋅10=5\sigma\sqrt{n} = \frac{1}{2} \cdot 10 = 5): P(S100≤55)≈Φ(55−505)=Φ(1)≈0,841P(S_{100} \le 55) \approx \Phi\left(\frac{55 - 50}{5}\right) = \Phi(1) \approx 0{,}841.

Proprietà (approssimazione normale della somma). Per nn grande: Sn≈N(nμ,nσ2),Xˉn≈N(μ,σ2n),\quad S_n \approx N(n\mu, n\sigma^2), \qquad \bar X_n \approx N\left(\mu, \frac{\sigma^2}{n}\right), P(Sn≤x)≈Φ(x−nμσn).P(S_n \le x) \approx \Phi\left(\frac{x - n\mu}{\sigma\sqrt n}\right).

Esempio. S100S_{100} = somma di 100100 lanci di dado (μ=72\mu = \frac{7}{2}, σ2=3512\sigma^2 = \frac{35}{12}): S100≈N(350,350012)S_{100} \approx N\left(350, \frac{3500}{12}\right), con varianza ≈291,7\approx 291{,}7.

Grafico interattivo: X̄ₙ ≈ N(μ, σ²/n) per la frequenza di teste di una moneta equa (μ = 1/2, σ² = 1/4): al crescere di n la campana resta centrata in 1/2 ma si restringe, con scarto σ/√n = 0,05; 0,025; 0,0125

Formula (approssimazione normale della binomiale, De Moivre-Laplace). Bin(n,p)≈N(np, np(1−p)),P(X≤k)≈Φ(k−npnp(1−p)).\text{Bin}(n, p) \approx N\big(np, \ np(1 - p)\big), \qquad P(X \le k) \approx \Phi\left(\frac{k - np}{\sqrt{np(1 - p)}}\right).

Esempio. X∼Bin(100,12)X \sim \text{Bin}(100, \frac{1}{2}): X≈N(50,25)X \approx N(50, 25) e P(X≤55)≈Φ(55−505)=Φ(1)≈0,841P(X \le 55) \approx \Phi\left(\frac{55 - 50}{5}\right) = \Phi(1) \approx 0{,}841.

Formula (correzione di continuità). Per XX a valori interi: P(X≤k)≈Φ(k+0,5−npnp(1−p)),P(X≥k)≈1−Φ(k−0,5−npnp(1−p)).\quad P(X \le k) \approx \Phi\left(\frac{k + 0{,}5 - np}{\sqrt{np(1 - p)}}\right), \qquad P(X \ge k) \approx 1 - \Phi\left(\frac{k - 0{,}5 - np}{\sqrt{np(1 - p)}}\right).

Esempio. X∼Bin(100,12)X \sim \text{Bin}(100, \frac{1}{2}): P(X≤55)≈Φ(55,5−505)=Φ(1,1)≈0,864P(X \le 55) \approx \Phi\left(\frac{55{,}5 - 50}{5}\right) = \Phi(1{,}1) \approx 0{,}864.

Grafico interattivo: Y ~ Bin(100, 1/2) ≈ N(50, 25): P(Y ≤ 47) = P(Y ≤ 47,5) è l'area a sinistra di 47,5, cioè Φ(−0,5) ≈ 0,309