Salta al contenuto
Note per Studenti Esercizio - il meteorologo, entropia e informazione mutua

Esercizio - il meteorologo, entropia e informazione mutua

Questa pagina non ha ancora la versione ripasso: qui sotto c'è il testo completo.

In questa pagina 4

Testo (esercizio del meteorologo). Uno studente annota per un anno intero le previsioni del tempo e le confronta con il tempo reale. Per semplicità la condizione è binaria, sole/pioggia. Nell'anno (approssimato con 360360 giorni): per 180180 giorni c'era sole e la previsione l'aveva predetto correttamente; per altri 9090 giorni c'era ancora sole ma la previsione aveva detto pioggia; per i restanti 9090 giorni pioveva, e la previsione era corretta o sbagliata (pioggia/sole) in misura 50/5050/50. Si indichi con XX il tempo reale e con YY la previsione (variabili aleatorie sull'alfabeto binario A={sole,pioggia}\mathcal A=\{\text{sole},\text{pioggia}\}). Si trovino le probabilità marginali pX,pYp_X,p_Y e la congiunta pXYp_{XY}; si calcolino H(X)H(X), H(Y)H(Y), H(X,Y)H(X,Y) verificandone i limiti notevoli; si calcoli pX∣Yp_{X|Y}, quindi H(X∣Y)H(X|Y), se ne verifichino i limiti e se ne chiarisca il significato fisico. Infine: lo studente pensa di proporsi come meteorologo sostenendo di fare previsioni più accurate di quelle attuali; in realtà prevede soltanto sole per tutti i 360360 giorni. Si può verificare che questo aumenta P(X=Y)P(X=Y), cioè la probabilità che la previsione coincida con il tempo reale. Che cosa si deve rispondere alla proposta?

Teoria usata: Informazione, entropia e informazione mutuaL'informazione di un evento di probabilità $P$ è $i=\log_2\frac1P$ bit; l'entropia $H(x)=\sum p\log_2\frac1p$ è l'informazione media e misura l'incertezza: $0\le H\le\log_2M$, massimo se i simboli sono equiprobabili. Per due variabili: $\max{H(x),H(y)}\le H(x,y)\le H(x)+H(y)$, $H(x|y)=H(x,y)-H(y)$ e l'informazione mutua $I(x;y)=H(x)-H(x|y)=H(x)+H(y)-H(x,y)\ge0$ (zero se e solo se indipendenti). Per una sorgente di $F_s$ simboli/s: rate di informazione $F_sH_s$, rate nominale $F_s\log_2M$, efficienza $\eta=\frac{H_s}{\log_2M}$.Informazione, entropia e informazione mutua →, Formula delle probabilità totali e formula di BayesSe (A_i) è una partizione di Ω, P(B) = Σ P(B ∣ A_i) P(A_i) (probabilità totali); la formula di Bayes inverte il condizionamento: P(A_k ∣ B) = P(B ∣ A_k) P(A_k) / P(B).Formula delle probabilità totali e formula di Bayes →, Probabilità condizionataLa probabilità di A sapendo che si è verificato B è P(A ∣ B) = P(A ∩ B) / P(B), con P(B) > 0; è una nuova misura di probabilità, e da essa seguono la regola del prodotto e la regola della catena.Probabilità condizionata →.

Probabilità congiunta e marginali

Si dividono i conteggi per 360360 (sole =S=S, pioggia =R=R; prima lettera XX, seconda YY):

(X,Y)(X,Y) giorni pXYp_{XY}
(S,S)(S,S) 180180 12\frac12
(S,R)(S,R) 9090 14\frac14
(R,S)(R,S) 4545 18\frac18
(R,R)(R,R) 4545 18\frac18

(I 9090 giorni di pioggia sono divisi 45/4545/45.) Marginali, sommando sull'altra variabile: pX(S)=12+14=34, pX(R)=14;pY(S)=12+18=58, pY(R)=14+18=38.p_X(S)=\tfrac12+\tfrac14=\tfrac34,\ p_X(R)=\tfrac14;\qquad p_Y(S)=\tfrac12+\tfrac18=\tfrac58,\ p_Y(R)=\tfrac14+\tfrac18=\tfrac38. Le variabili non sono indipendenti: per esempio pX(S)pY(S)=34⋅58=1532≠12=pXY(S,S)p_X(S)p_Y(S)=\frac34\cdot\frac58=\frac{15}{32}\neq\frac12=p_{XY}(S,S).

Entropie

H(X)=34log⁡243+14log⁡24=0,3113+0,5=0,811 bit,H(X)=\tfrac34\log_2\tfrac43+\tfrac14\log_24=0{,}3113+0{,}5=0{,}811\ \text{bit}, H(Y)=58log⁡285+38log⁡283=0,4238+0,5306=0,954 bit,H(Y)=\tfrac58\log_2\tfrac85+\tfrac38\log_2\tfrac83=0{,}4238+0{,}5306=0{,}954\ \text{bit}, H(X,Y)=12log⁡22+14log⁡24+2⋅18log⁡28=0,5+0,5+0,75=1,75 bit.H(X,Y)=\tfrac12\log_22+\tfrac14\log_24+2\cdot\tfrac18\log_28=0{,}5+0{,}5+0{,}75=1{,}75\ \text{bit}. Limiti notevoli: max⁡{H(X),H(Y)}≤H(X,Y)≤H(X)+H(Y)\max\{H(X),H(Y)\}\le H(X,Y)\le H(X)+H(Y) diventa 0,954≤1,75≤1,7650{,}954\le1{,}75\le1{,}765 ✓; la seconda disuguaglianza è stretta (1,75<1,7651{,}75<1{,}765) perché XX e YY non sono indipendenti, ma è quasi un'uguaglianza: sono "quasi indipendenti". Inoltre 0≤H≤log⁡22=10\le H\le\log_22=1 per ciascuna variabile binaria ✓.

Probabilità condizionata ed entropia condizionata

Con Bayes, pX∣Y(x∣y)=pXY(x,y)pY(y)p_{X|Y}(x|y)=\frac{p_{XY}(x,y)}{p_Y(y)}:

Y=SY=S Y=RY=R
X=SX=S 1/25/8=45\frac{1/2}{5/8}=\frac45 1/43/8=23\frac{1/4}{3/8}=\frac23
X=RX=R 1/85/8=15\frac{1/8}{5/8}=\frac15 1/83/8=13\frac{1/8}{3/8}=\frac13

(le colonne sommano a 11.) L'entropia condizionata H(X∣Y)=∑pXYlog⁡21pX∣YH(X|Y)=\sum p_{XY}\log_2\frac1{p_{X|Y}} si calcola con la tabella, oppure con H(X∣Y)=H(X,Y)−H(Y)H(X|Y)=H(X,Y)-H(Y) (Informazione, entropia e informazione mutuaL'informazione di un evento di probabilità $P$ è $i=\log_2\frac1P$ bit; l'entropia $H(x)=\sum p\log_2\frac1p$ è l'informazione media e misura l'incertezza: $0\le H\le\log_2M$, massimo se i simboli sono equiprobabili. Per due variabili: $\max{H(x),H(y)}\le H(x,y)\le H(x)+H(y)$, $H(x|y)=H(x,y)-H(y)$ e l'informazione mutua $I(x;y)=H(x)-H(x|y)=H(x)+H(y)-H(x,y)\ge0$ (zero se e solo se indipendenti). Per una sorgente di $F_s$ simboli/s: rate di informazione $F_sH_s$, rate nominale $F_s\log_2M$, efficienza $\eta=\frac{H_s}{\log_2M}$.Informazione, entropia e informazione mutua →, §4): H(X∣Y)=1,75−0,954=0,796 bit.H(X|Y)=1{,}75-0{,}954=0{,}796\ \text{bit}. Verifica diretta: 12log⁡254+14log⁡232+18log⁡25+18log⁡23=0,161+0,146+0,290+0,198=0,796\frac12\log_2\frac54+\frac14\log_2\frac32+\frac18\log_25+\frac18\log_23=0{,}161+0{,}146+0{,}290+0{,}198=0{,}796 ✓. Limiti: 0≤H(X∣Y)≤H(X)0\le H(X|Y)\le H(X): 0≤0,796≤0,8110\le0{,}796\le0{,}811 ✓. Il valore è quasi H(X)H(X).

Significato fisico. H(X∣Y)H(X|Y) è l'incertezza che rimane sul tempo reale dopo aver letto la previsione. Prima della previsione l'incertezza è H(X)=0,811H(X)=0{,}811 bit; dopo 0,7960{,}796 bit: la previsione ha ridotto l'incertezza di soli I(X;Y)=H(X)−H(X∣Y)=H(X)+H(Y)−H(X,Y)=0,811+0,954−1,75=0,0157 bit,I(X;Y)=H(X)-H(X|Y)=H(X)+H(Y)-H(X,Y)=0{,}811+0{,}954-1{,}75=0{,}0157\ \text{bit}, cioè di circa il 2%2\%. Questa è l'informazione mutua: quanta informazione sul tempo reale è contenuta nella previsione. Le previsioni attuali sono quasi inutili: quando prevedono pioggia piove nel 13\frac13 dei casi (contro il 14\frac14 di base), quando prevedono sole c'è pioggia nel 15\frac15 dei casi (contro 14\frac14).

La proposta dello studente

La previsione costante Y′=SY'=S ha: P(X=Y′)=pX(S)=34=75%P(X=Y')=p_X(S)=\frac34=75\%, contro P(X=Y)=12+18=58=62,5%P(X=Y)=\frac12+\frac18=\frac58=62{,}5\% della previsione attuale: la sua "accuratezza" è maggiore. Ma Y′Y' è una variabile costante, quindi H(Y′)=0,H(X,Y′)=H(X),H(X∣Y′)=H(X)=0,811 bit,I(X;Y′)=0:H(Y')=0,\qquad H(X,Y')=H(X),\qquad H(X|Y')=H(X)=0{,}811\ \text{bit},\qquad I(X;Y')=0: conoscere la previsione dello studente non riduce per nulla l'incertezza sul tempo reale (la variabile è indipendente da XX). La previsione attuale invece, pur debole, porta 0,01570{,}0157 bit.

Risposta: la proposta non va accettata. La percentuale di previsioni corrette è una misura ingannevole quando le classi sono sbilanciate (qui il sole è il 75%75\% dei giorni): si "vince" prevedendo sempre l'evento più frequente, senza dire nulla di utile. Una buona previsione si misura con l'informazione che porta, non con la probabilità di coincidenza: I(X;Y)I(X;Y) deve essere grande, e una previsione costante ha I=0I=0 qualunque sia la percentuale di giorni indovinati.

Lezioni in cui compare

Teoria collegata