Salta al contenuto
Note per Studenti Spazi di probabilità generali e sigma-algebra di Borel

Spazi di probabilità generali e sigma-algebra di Borel

In questa pagina 5

Inizio del punto 3 del programma. Prerequisiti: Sigma-algebre di eventiUna σ-algebra è una famiglia di eventi che contiene ∅ ed è chiusa per complementare e unioni numerabili; è la famiglia degli eventi a cui si assegna una probabilità. Nel caso discreto si prende tutto 𝒫(Ω).Sigma-algebre di eventi →, Misura di probabilità e sue proprietàUna misura di probabilità è una funzione P: F → [0,1] con P(Ω) = 1 e σ-additiva; ne seguono P(Aᶜ) = 1 − P(A), P(∅) = 0, monotonia, P(A ∪ B) = P(A) + P(B) − P(A ∩ B) e la formula di inclusione-esclusione.Misura di probabilità e sue proprietà →, Variabili aleatorie discrete e densità discretaUna variabile aleatoria discreta è una funzione X da Ω in R che assume un insieme finito o numerabile di valori (l'alfabeto); la sua densità discreta p_X(x) = P(X = x) basta a calcolare la probabilità di ogni evento che riguarda X.Variabili aleatorie discrete e densità discreta →. Seguito: Variabili aleatorie assolutamente continueX è assolutamente continua se F_X(x) = ∫ da −∞ a x di f_X(t) dt per una densità f_X ≥ 0 con integrale 1; allora P(a < X ≤ b) = ∫ da a a b di f_X, P(X = x) = 0 per ogni x, f_X = F_X' dove F_X è derivabile, E[g(X)] = ∫ g(x) f_X(x) dx, e varianza, momenti e disuguaglianze funzionano come nel caso discreto con gli integrali al posto delle somme.Variabili aleatorie assolutamente continue →.

Perché il caso discreto non basta più

Negli spazi discretiΩ finito o numerabile, F = 𝒫(Ω), e P(A) è la somma delle probabilità dei singoli esiti di A.Spazi di probabilità discreti e uniformi → tutto si costruiva a partire dai singoli esiti: P(A)=∑ω∈Ap(ω)P(A) = \sum_{\omega \in A} p(\omega). Ora si vogliono descrivere esperimenti come

  • scegliere un punto "a caso" nell'intervallo [0,1][0, 1];
  • misurare un tempo di attesa, una tensione di rumore, la durata di un componente.

Qui Ω\Omega è non numerabile e il metodo discreto si rompe per due motivi.

1. Ogni singolo esito ha probabilità zero. Se il punto è scelto a caso in [0,1][0, 1], la probabilità di cadere in [a,b][a, b] dovrebbe essere la lunghezza b−ab - a. Allora per ogni xx, dato che {x}⊆[x−ε,x+ε]\{x\} \subseteq [x - \varepsilon, x + \varepsilon] per ogni ε>0\varepsilon > 0, per monotonia

P({x})≤2ε∀ε>0  ⟹  P({x})=0.P(\{x\}) \le 2\varepsilon \quad \forall \varepsilon > 0 \implies P(\{x\}) = 0.

Sommare le probabilità dei singoli esiti darebbe sempre 00: non si può più ricostruire PP dai singoletti (la σ-additività vale solo per unioni numerabili, e [0,1][0, 1] non è un'unione numerabile di punti).

2. P(Ω)\mathcal P(\Omega) è troppo grande. Si dimostra (teorema di Vitali, non in programma) che non esiste nessuna probabilità definita su tutti i sottoinsiemi di [0,1][0, 1] che dia agli intervalli la loro lunghezza. Bisogna quindi rinunciare ad alcuni sottoinsiemi "patologici" e scegliere una σ-algebra più piccola: è la situazione anticipata in Sigma-algebre di eventiUna σ-algebra è una famiglia di eventi che contiene ∅ ed è chiusa per complementare e unioni numerabili; è la famiglia degli eventi a cui si assegna una probabilità. Nel caso discreto si prende tutto 𝒫(Ω).Sigma-algebre di eventi →.

La σ-algebra di Borel

La σ-algebra di Borel su R\mathbb R, indicata con B(R)\mathcal B(\mathbb R), è la σ-algebra generataLa più piccola σ-algebra che contiene una famiglia data: l'intersezione di tutte le σ-algebre che la contengono.Sigma-algebre di eventi → dagli intervalli: B(R):=σ({(a,b]:a<b}).\mathcal B(\mathbb R) := \sigma\big(\{(a, b] : a < b\}\big). I suoi elementi si chiamano boreliani.

Si può partire indifferentemente da intervalli aperti, chiusi, semirette (−∞,x](-\infty, x]: si ottiene sempre la stessa σ-algebra, perché ogni tipo di intervallo si scrive con unioni/intersezioni numerabili degli altri. Ad esempio

[a,b]=⋂n≥1(a−1n,b],(a,b)=⋃n≥1(a,b−1n].[a, b] = \bigcap_{n \ge 1} \left(a - \tfrac1n, b\right], \qquad (a, b) = \bigcup_{n \ge 1} \left(a, b - \tfrac1n\right].

Cosa contiene (tutto quello che serve in pratica):

Insieme Perché è boreliano
ogni intervallo (aperto, chiuso, semiretta) per costruzione o per le formule sopra
ogni singoletto {x}\{x\} {x}=⋂n(x−1n,x]\{x\} = \bigcap_n (x - \frac1n, x]
ogni insieme numerabile, es. N\mathbb N, Q\mathbb Q unione numerabile di singoletti
ogni aperto e ogni chiuso di R\mathbb R un aperto è unione numerabile di intervalli aperti
{x:g(x)≤c}\{x : g(x) \le c\} per gg continua è un chiuso

Gli insiemi non boreliani esistono, ma per costruirli serve l'assioma della scelta: negli esercizi non compaiono mai. In Rn\mathbb R^n si definisce allo stesso modo B(Rn)\mathcal B(\mathbb R^n), generata dai rettangoli.

Il punto scelto a caso in [0,1][0, 1]. Si prende Ω=[0,1]\Omega = [0, 1], F=\mathcal F = boreliani contenuti in [0,1][0, 1], e PP = "lunghezza" (la misura di Lebesgue): P([a,b])=b−aP([a, b]) = b - a. Allora

  • P({x})=0P(\{x\}) = 0 per ogni xx;
  • P(Q∩[0,1])=0P(\mathbb Q \cap [0, 1]) = 0: è un'unione numerabile di singoletti, ciascuno di probabilità 00, e per σ-additività la somma è 00. Il punto scelto è quasi certamente irrazionale, anche se i razionali sono "densi";
  • P([0,12))=P([0,12])=12P([0, \frac12)) = P([0, \frac12]) = \frac12: aggiungere o togliere un punto non cambia nulla.

Continuità della probabilità

Negli spazi generali si usano spesso limiti di eventi. La proprietà chiave è questa.

Teorema (continuità della probabilità). Sia (An)n≥1(A_n)_{n \ge 1} una successione di eventi.

  1. Dal basso: se A1⊆A2⊆…A_1 \subseteq A_2 \subseteq \dots (crescente), allora P(⋃nAn)=lim⁡n→∞P(An)\displaystyle P\Big(\bigcup_{n} A_n\Big) = \lim_{n \to \infty} P(A_n).
  2. Dall'alto: se A1⊇A2⊇…A_1 \supseteq A_2 \supseteq \dots (decrescente), allora P(⋂nAn)=lim⁡n→∞P(An)\displaystyle P\Big(\bigcap_{n} A_n\Big) = \lim_{n \to \infty} P(A_n).

I limiti esistono perché P(An)P(A_n) è monotona (crescente nel caso 1, decrescente nel caso 2) e limitata tra 00 e 11.

Dimostrazione di 1. L'idea è trasformare l'unione crescente in un'unione disgiunta, per poter usare la σ-additività. Si definiscono gli "anelli"

B1=A1,Bn=An∖An−1 (n≥2),B_1 = A_1, \qquad B_n = A_n \setminus A_{n-1} \ (n \ge 2),

cioè BnB_n contiene ciò che si aggiunge al passo nn. I BnB_n sono a due a due disgiunti, An=B1∪⋯∪BnA_n = B_1 \cup \dots \cup B_n e ⋃nAn=⋃nBn\bigcup_n A_n = \bigcup_n B_n. Allora

P(⋃nAn)=P(⋃nBn)=σ-add.∑n=1∞P(Bn)=lim⁡N→∞∑n=1NP(Bn)=lim⁡N→∞P(AN).P\Big(\bigcup_n A_n\Big) = P\Big(\bigcup_n B_n\Big) \overset{\sigma\text{-add.}}{=} \sum_{n=1}^\infty P(B_n) = \lim_{N \to \infty} \sum_{n=1}^N P(B_n) = \lim_{N \to \infty} P(A_N).

Il terzo passaggio è la definizione di somma di una serie (limite delle somme parziali); il quarto usa l'additività finita, perché ANA_N è unione disgiunta di B1,…,BNB_1, \dots, B_N. ∎

Dimostrazione di 2. Si passa ai complementari: se gli AnA_n decrescono, gli AncA_n^c crescono, e per De Morgan (⋂nAn)c=⋃nAnc\big(\bigcap_n A_n\big)^c = \bigcup_n A_n^c. Per il punto 1:

P(⋂nAn)=1−P(⋃nAnc)=1−lim⁡nP(Anc)=lim⁡n(1−P(Anc))=lim⁡nP(An).∎P\Big(\bigcap_n A_n\Big) = 1 - P\Big(\bigcup_n A_n^c\Big) = 1 - \lim_n P(A_n^c) = \lim_n \big(1 - P(A_n^c)\big) = \lim_n P(A_n). \quad ∎

Esempio 1: prima o poi esce testa. Si lancia all'infinito una moneta equa. An=A_n = "nessuna testa nei primi nn lanci" è una successione decrescente (se non è uscita testa nei primi n+1n+1 lanci, non è uscita nei primi nn), con P(An)=2−nP(A_n) = 2^{-n}. L'intersezione ⋂nAn\bigcap_n A_n è "non esce mai testa", quindi

P(mai testa)=lim⁡n2−n=0,P(prima o poi testa)=1.P(\text{mai testa}) = \lim_n 2^{-n} = 0, \qquad P(\text{prima o poi testa}) = 1.

Esempio 2: la funzione di distribuzione. La continuità della probabilità è esattamente ciò che serve per dimostrare che ogni funzione di distribuzioneF_X(x) = P(X ≤ x): crescente, continua a destra, con limiti 0 e 1.Funzione di distribuzione → è continua a destra e ha limiti 00 e 11 (eventi {X≤x+1n}\{X \le x + \frac1n\} decrescenti verso {X≤x}\{X \le x\}, ecc.).

Esempio 3: σ-subadditività. Per eventi qualsiasi (non disgiunti) vale P(⋃nAn)≤∑nP(An)P\big(\bigcup_n A_n\big) \le \sum_n P(A_n): si applica la continuità dal basso agli eventi crescenti A1∪⋯∪ANA_1 \cup \dots \cup A_N e la subadditività finita.

Variabili aleatorie in generale

Nel caso discreto ogni funzione X:Ω→RX : \Omega \to \mathbb R andava bene, perché tutti i sottoinsiemi erano eventi. Ora bisogna chiedere che gli insiemi che ci interessano siano eventi, cioè stiano in F\mathcal F.

Una variabile aleatoria su (Ω,F,P)(\Omega, \mathcal F, P) è una funzione X:Ω→RX : \Omega \to \mathbb R tale che {X≤x}={ω∈Ω:X(ω)≤x}∈Fper ogni x∈R.\{X \le x\} = \{\omega \in \Omega : X(\omega) \le x\} \in \mathcal F \qquad \text{per ogni } x \in \mathbb R.

Da questa condizione segue (perché le semirette generano B(R)\mathcal B(\mathbb R)) che {X∈B}∈F\{X \in B\} \in \mathcal F per ogni boreliano BB: si possono calcolare P(a<X≤b)P(a < X \le b), P(X=c)P(X = c), P(X∈Q)P(X \in \mathbb Q), P(∣X∣>2)P(|X| > 2), eccetera.

Legge di XX. La funzione PX(B):=P(X∈B)P_X(B) := P(X \in B), per B∈B(R)B \in \mathcal B(\mathbb R), è una misura di probabilità su (R,B(R))(\mathbb R, \mathcal B(\mathbb R)): è lo spazio indotto dalla v.a., come nel caso discreto. Per descriverla basta la funzione di distribuzione FX(x)=P(X≤x)F_X(x) = P(X \le x), che determina PXP_X su tutti i boreliani.

I tre tipi di v.a. (classificati guardando FXF_X):

Errori comuni

  • Pensare che P({x})=0P(\{x\}) = 0 significhi "impossibile": nel punto scelto a caso in [0,1][0,1] ogni valore ha probabilità 00, eppure uno di essi si realizza.
  • Applicare la σ-additività a unioni non numerabili ("[0,1][0,1] è unione dei suoi punti, quindi P([0,1])=∑P({x})=0P([0,1]) = \sum P(\{x\}) = 0"): la σ-additività vale solo per famiglie numerabili.
  • Usare la continuità della probabilità con successioni non monotone: per eventi qualsiasi P(⋃An)P(\bigcup A_n) non è il limite di P(An)P(A_n).

Teoria collegata