Explainable AI (XAI)
In questa pagina 11
Un modello accurato che nessuno capisce può essere inaccettabile: la scelta dipende dall'applicazione.
- Previsione del mercato azionario: conta solo la qualità della previsione, si usa il modello più accurato anche se opaco (per esempio una rete profonda).
- Diagnosi medica automatizzata: i medici devono potersi fidare per decisioni sulla salute di altre persone; si rinuncia a un po' di accuratezza in cambio di interpretabilità.
- Auto a guida autonoma: gli errori sono catastrofici e non si possono simulare tutti gli scenari; l'interpretabilità serve a verificare che il modello abbia imparato rappresentazioni ragionevoli.
- Rischio assicurativo e concessione del credito: servono fairness (Fairness nel machine learningapprofondimento: non nel programma di Telecomunicazioni. Un sistema di ML è fair se le sue decisioni non producono esiti ingiusti rispetto agli attributi sensibili $A$ (razza, genere, età, religione...). Il bias nasce dai dati storici (problema dell'inerzia) e non esiste una definizione unica di equità (problema della definizione). Togliere $A$ dagli ingressi (fairness through unawareness, $\hat Y=f(X)$ con $A\notin X$) spesso non basta per le variabili proxy (es. CAP correlato alla razza, $\rho=-0{,}80$) e costa accuratezza. Metriche: Demographic Parity $DP=P(\hat Y=1|A=a)-P(\hat Y=1|A=d)$ (stesso tasso di esiti positivi nei gruppi) ed Equality of Opportunity $EO=P(\hat Y=1|A=a,Y=1)-P(\hat Y=1|A=d,Y=1)$ (stesso tasso di veri positivi). Interventi: soglie diverse per gruppo, vincoli di fairness nella loss, pre-processing dei dati; ogni intervento ha un compromesso con l'accuratezza. Casi: COMPAS (falsi positivi 44,9% contro 23,5%), riconoscimento facciale, RCA auto, consegne Amazon; GDPR e AI Act richiedono garanzie di non discriminazione.Fairness nel machine learning →) e il «diritto alla spiegazione» del GDPR per le decisioni automatizzate sulle persone.
Chirurgo umano o robot? Un chirurgo umano con di mortalità e pienamente interpretabile, o un robot con ma opaco, addestrato su esempi per un solo compito. Chi sceglie il robot cita l'accuratezza (i farmaci si testano così); chi sceglie l'umano chiede se il test era rappresentativo e non si fida di una scatola nera. La risposta dipende dall'applicazione e dall'accettazione della tecnologia: non è banale.
1. Concetti chiave
Definizione (interpretabilità). La scienza (o arte) di produrre descrizioni di un modello abbastanza semplici da essere comprese da un essere umano.
Definizione (spiegabilità). Interpretabilità più completezza: una spiegazione è completa quando permette di anticipare la previsione del modello.
- Fiducia: garanzie di prestazione in uso reale, robustezza a perturbazioni di dati e parametri, confronto tra gli errori del modello e quelli umani.
- Informatività: dare informazioni in più sul problema reale, di cui la formulazione ML è spesso solo un proxy.
- Fairness: verificare che le previsioni non discriminino i gruppi protetti.
Tassonomia
| asse | prima opzione | seconda opzione |
|---|---|---|
| origine | intrinseca: il modello stesso produce la spiegazione (modelli interpretabili) | post-hoc: un algoritmo esterno spiega un modello già addestrato |
| generalità | agnostica (model-agnostic): applicabile in principio a ogni modello; vantaggi: portabilità, confronto tra modelli | specifica (model-specific): su misura di un modello; vantaggi: accuratezza e velocità |
| ambito | globale: spiega il modello nel suo insieme | locale: spiega la singola previsione |
Che cosa producono i metodi
- Statistiche riassuntive delle feature: l'importanza di ciascuna feature o di coppie (interazioni).
- Visualizzazioni: curve e grafici (PDP, ICE).
- Data point: esempi controfattuali, punti simili ottenuti cambiando poco alcune feature e la cui previsione è molto diversa.
Buone spiegazioni: contrastive (rispondere a «perché non la classe B?» oltre che «perché A?»), brevi e intuitive (poche feature decisive), adatte al pubblico (tecnico o no).
2. Modelli intrinsecamente interpretabili
Regressione lineare
(Regressione lineareNell'apprendimento supervisionato si impara una funzione $F(x)$ dagli esempi $(x,y)$: regressione se $y$ è continua, classificazione se è categorica. Il modello lineare è $F_\beta(x)=\beta_0+\beta_1x_1+\dots+\beta_px_p=X\beta$ (con una colonna di uni per $\beta_0$) e i parametri si scelgono minimizzando l'errore quadratico medio $\mathrm{MSE}=\frac1n\sum_i(y_i-F_\beta(x_i))^2$, funzione convessa dei parametri. Annullando il gradiente di $J(\beta)=|y-X\beta|^2$ si ottengono le equazioni normali $X^TX\beta=X^Ty$ e la soluzione dei minimi quadrati ordinari $\beta=(X^TX)^{-1}X^Ty$. Il coefficiente di determinazione $R^2=1-SS_{res}/SS_{tot}$ misura la qualità del fit (0 = come la media, negativo = peggio della media). Un modello va valutato su un test set mai usato per addestrare: l'errore sul training è ottimistico e un polinomio di grado alto lo azzera senza generalizzare.Regressione lineare →). I pesi stimati con i minimi quadrati, (Metodo dei minimi quadratiQuando un sistema AX = b non ha soluzioni si cerca X che rende minima la norma di AX − b: AX è la proiezione ortogonale di b su Im A, e X si trova risolvendo le equazioni normali AᵀA X = Aᵀb; applicazione alla retta di regressione.Metodo dei minimi quadrati →), sono direttamente l'importanza: è di quanto cambia la previsione per un'unità in più di con tutte le altre feature ferme.
Esempio (noleggio di biciclette, giornaliero). Intercetta ; stagione estate ; inverno (rispetto alla stagione di riferimento); festività ; meteo pioggia/neve/temporale ; temperatura per grado; umidità per punto percentuale; vento per unità. Un giorno di pioggia ne perde circa rispetto al sereno, ogni grado in più ne dà .
Un intervallo di confidenza al per è (distribuzione approssimativamente gaussiana, Distribuzione gaussiana (normale)N(μ, σ²) ha densità e^(−(x−μ)²/(2σ²)) / √(2πσ²), a campana centrata in μ con larghezza σ; media μ, varianza σ²; si standardizza con Z = (X − μ)/σ ~ N(0, 1) e si calcola P(X ≤ x) = Φ((x − μ)/σ), con Φ(−z) = 1 − Φ(z); aX + b è ancora gaussiana, N(aμ + b, a²σ²).Distribuzione gaussiana (normale) →) e copre il peso «vero» solo se il modello lineare è giusto per i dati. Se zero è dentro l'intervallo la feature può non contare.
LASSO. Per ottenere poche feature attive si penalizza : (LASSO e discesa del gradienteIl LASSO è la regressione regolarizzata con penalità $L_1$: minimizza $\sum_i(y_i-x_i^T\beta)^2+\lambda\sum_{j\ge1}|\beta_j|$. A differenza della ridge, porta alcuni coefficienti esattamente a zero (soluzione sparsa, selezione delle feature): geometricamente le curve di livello dell'errore toccano il vincolo $\sum|\beta_j|\le s$ (un rombo) in uno spigolo. Non ha formula chiusa, quindi si minimizza con la discesa del gradiente $W\leftarrow W-\eta,\nabla J(W)$, usando il subgradiente $\operatorname{sign}(\beta_j)$ per il valore assoluto (nel punto 0 qualunque valore in $[-1,1]$). Il passo $\eta$ è critico: per l'errore quadratico converge se $\eta<1/\mu_{\max}(X^TX)$; si può usare $\eta_t=\eta_0/(1+\gamma t)$. L'Elastic Net combina le penalità $L_1$ e $L_2$ con $\lambda_1=\alpha\lambda$, $\lambda_2=(1-\alpha)\lambda$.LASSO e discesa del gradiente →). Alcuni pesi diventano esattamente zero (selezione di feature, spiegazione più breve). Limiti: l'accuratezza cala al crescere di (compromesso tra accuratezza e interpretabilità) e c'è il grouping effect: tra variabili molto correlate il LASSO ne sceglie una e le altre entrano e escono in modo instabile.
Regressione logistica
Il primo membro è il log-odds. dice di quanto aumenta il log-odds per un'unità in più di (e moltiplica gli odds per ): per esempio moltiplica gli odds per .
Attenzione alla scala. Se si riscala una feature, , il modello resta lo stesso con : le previsioni e il bordo di decisione non cambiano, cambia solo il valore numerico del coefficiente. Quindi i coefficienti sono confrontabili tra loro solo se le feature hanno la stessa scala (normalizzate).
Codifica delle variabili categoriche (laboratorio): one-hot trasforma una categoria in un vettore con un solo (per ChestPain: tipica , asintomatica ,...), adatta alle variabili nominali (nessun ordine) ma aumenta il numero di feature; label encoding assegna un intero a ogni categoria, adatto alle variabili ordinali (giovane adulto anziano).
Alberi di decisione
Un albero (Alberi di decisioneUn albero di decisione partiziona i dati con una sequenza di regole su una sola variabile alla volta (nodi interni = regole, foglie = predizioni: classe più frequente, oppure media del target in regressione). Si costruisce in modo ricorsivo scegliendo a ogni nodo la divisione che rende i figli più «puri»: con l'entropia $H=-\sum p_i\log_2p_i$ e il guadagno d'informazione $IG=H(S)-\sum\frac{|S_v|}{|S|}H(S_v)$ (ID3), oppure con l'indice di Gini $1-\sum p_i^2$ e soglie $x\le t$ su variabili numeriche (CART); in regressione con MSE o riduzione di varianza. Un albero pienamente sviluppato fa overfitting (varianza alta): si limita con la profondità massima (pre-potatura) o con la potatura a costo-complessità $R_\alpha(T)=R(T)+\alpha|T|$ (post-potatura). Pro: interpretabile, niente normalizzazione, predizione immediata; contro: varianza alta, da cui le foreste. Programma di Telecomunicazioni: Decision Trees e Random Forests.Alberi di decisione →) si spiega da solo: il percorso radice-foglia è una regola «se... allora...». L'albero dell'Iris ( campioni, variabili, classi) ne usa split, già tanti da leggere. Un singolo albero ha però alta varianza: si passa alle foreste, che sono più accurate ma non leggibili.
3. Importanza delle feature in foreste e alberi
Impurità di Gini e riduzione di impurità
Formula (Gini e Information Gain). Per un nodo con classi di probabilità : ; entropia . Lo split in due figli ha . La riduzione di impurità (Mean Decrease in Impurity, MDI) di uno split è
Grafico interattivo: Impurità di un nodo a due classi in funzione della frazione p di una classe: massima in p = 1/2 (nodo più misto), zero per nodi puri
Esempio. Nodo con campioni, di classe A e di B: . Uno split manda campioni (tutti A) a sinistra, impurità , e (1 A e 4 B) a destra, . Pesata: e .
Formula (importanza MDI, Gini importance). L'importanza di una feature è la somma delle riduzioni di impurità di tutti i nodi in cui essa è usata per lo split, pesate per la quota di campioni del nodo:
Nelle random forest (Metodi ensemble - bagging, random forest e boostingUn albero da solo ha varianza alta; un ensemble combina molti modelli deboli. Bagging: ogni albero è addestrato su un campione bootstrap (n estrazioni con rimpiazzo, circa il 63% di campioni distinti) e si vota o si fa la media: riduce la varianza, perché la media di $T$ stimatori con varianza $\sigma^2$ e correlazione $\rho$ ha varianza $\rho\sigma^2+(1-\rho)\sigma^2/T$. Random forest = bagging + a ogni split solo $\sqrt p$ feature casuali (alberi meno correlati); l'importanza di una feature è la somma delle riduzioni di Gini pesate sui nodi in cui è usata. Boosting: alberi in sequenza, ciascuno corregge gli errori dei precedenti, e si riduce il bias. Gradient boosting: $F\leftarrow F+\eta h$ con $h$ albero sui residui (gradiente negativo della perdita), $\eta$ piccolo; AdaBoost: stump e pesi sui campioni sbagliati; XGBoost: similarity score $\frac{(\sum r)^2}{N+\lambda}$, gain, potatura con $\gamma$, output $\frac{\sum r}{N+\lambda}$. Programma di Telecomunicazioni: Random Forests; boosting come approfondimento.Metodi ensemble - bagging, random forest e boosting →; bagging, campionamento con rimpiazzo, e feature bagging, scelta a caso di feature per split) si media sugli alberi. Nell'esempio, se lo split è la radice, il contributo è .
Difetto: feature selection bias. L'MDI può dare valori alti a feature poco legate al target, in particolare variabili con molti valori distinti (più occasioni di fare uno split che per caso riduce l'impurità). Rimedi: MDI corretto (debiased), alberi iterativi, e metodi basati sulla permutazione come Boruta: si permutano a caso le feature e si affiancano le copie rimescolate alle originali; una feature è utile solo se batte le sue copie casuali.
4. Metodi agnostici: importanza per permutazione
Definizione (permutation importance). Metodo post-hoc, agnostico, globale. Si valuta il modello (errore su un insieme di dati); poi si mescola a caso una feature su tutti i punti, rompendo il suo legame con il target, e si rivaluta. L'importanza è l'aumento dell'errore.
Procedura: (1) allenare il modello e ottenere le predizioni originali; (2) valutare le prestazioni; (3) scegliere una feature e mescolarne i valori; (4) ottenere le predizioni sui nuovi punti e rivalutare; (5) ripetere per ogni feature.
Esempio (slide). Cinque dati con , , etichette vere , predizioni originali : un errore su cinque, errore . Dopo aver mescolato le predizioni sono : differiscono dalle etichette in posizione e , errore . Dopo aver mescolato sono : sbagliate in posizione , errore . Importanza punti, punti: conta molto di più.
Idea intuitiva: se la feature serviva, rimescolarla fa precipitare le prestazioni. Limiti: ipotizza feature indipendenti (se sono correlate, rimescolando se ne creano combinazioni irrealistiche su cui il modello non è mai stato addestrato, e la correlata «copre» la mescolata) e richiede le etichette.
5. Grafici di dipendenza parziale (PDP) e ICE
Per i modelli non lineari (alberi, foreste) l'effetto di una feature non è costante: può far aumentare la previsione per alcuni campioni e diminuirla per altri, e dipende da interazioni con le altre. Con più di due feature non si può disegnare la superficie; si studia allora come cambia la previsione variando una (o due) feature e tenendo ferme le altre.
ICE (individual conditional expectation): per un campione, la previsione al variare di una feature tra il minimo e il massimo osservati (nel laboratorio, valori tra e dopo la normalizzazione).
Definizione (PDP, grafico di dipendenza parziale). Effetto marginale medio di un sottoinsieme di feature (di solito una o due) sulla previsione, ottenuto marginalizzando le altre feature : Il PDP è la media delle curve ICE (valore atteso come media sui dati, Valore attesoIl valore atteso E[X] = Σ x p_X(x) è la media dei valori di X pesata con le loro probabilità (esiste se la serie converge assolutamente); per una funzione g vale E[g(X)] = Σ g(x) p_X(x) senza trovare la legge di g(X), ed E è lineare: E[aX + bY + c] = aE[X] + bE[Y] + c.Valore atteso →).
Perché non fissare le altre feature a un valore qualsiasi: si creerebbero combinazioni mai osservate; neanche la media delle feature è una buona scelta. In pratica: (1) si prendono punti del dataset; (2) per ciascuno si fa variare la feature di interesse lasciando le altre ai valori di quel punto; (3) si calcolano le previsioni; (4) si fa la media.
Grafico interattivo: ICE e PDP per il modello f = x1 + x1·x2 con x2 ∈ {0,1,2}: le tre curve ICE (pendenze 1, 2, 3) hanno medie diverse, il PDP (pendenza 2) le riassume e nasconde l'eterogeneità
Esempio. e tre dati con . Per un valore fissato le tre ICE valgono e il PDP : la media nasconde che per un campione la pendenza è e per un altro . Il PDP si legge per capire se il legame è lineare, monotono o più complesso; con due feature si disegna una mappa di contorno (laboratorio: età e frequenza cardiaca massima).
6. Modelli surrogati locali: LIME
Definizione (LIME, Local Interpretable Model-agnostic Explanations). Spiega una singola previsione con un modello semplice che approssima il black-box vicino a quel punto.
Procedura: (1) si generano punti artificiali con piccole perturbazioni di ; (2) si ottengono le previsioni del black-box ; (3) si allena un modello interpretabile (per esempio un albero o un modello lineare) sulle coppie , pesando ogni punto per la vicinanza a (più è vicino, più conta); (4) si legge il modello semplice per capire «cosa succede» attorno a . È locale: lo stesso black-box può avere spiegazioni diverse in punti diversi. Difficoltà: la scelta dell'intorno e la stabilità.
7. SHAP e valori di Shapley
Definizione (valore di Shapley, SHAP). Dalla teoria dei giochi cooperativi: la previsione è un «pagamento» da distribuire tra le feature («giocatrici»). Il valore di Shapley della feature è la media del suo contributo marginale su tutti gli ordini in cui le feature possono essere aggiunte: con la previsione quando solo le feature in hanno il valore osservato e le altre un valore di riferimento (la media sul dataset di sfondo).
Il peso è la frazione degli ordinamenti in cui l'insieme esatto precede (Calcolo combinatorio per la probabilitàNegli spazi uniformi bisogna contare: principio di moltiplicazione, disposizioni con ripetizione n^k, disposizioni semplici n!/(n−k)!, permutazioni n!, combinazioni (n su k); estrazioni con e senza reinserimento e distribuzione ipergeometrica.Calcolo combinatorio per la probabilità →). Proprietà: la somma dei contributi è esattamente la differenza tra la previsione e quella di riferimento (efficienza: ); feature identiche ricevono contributi uguali; una feature irrilevante riceve .
Esempio. , riferimento , istanza , . Valori di : , , , , , , , . Per : . Per : . Per : . Somma . Si noti che il prodotto è diviso a metà tra e (ma ottiene solo perché da solo non vale nulla, ).
Il calcolo esatto richiede valutazioni: le librerie usano approssimazioni (nel laboratorio shap.Explainer). Spiegazione globale: il summary plot mostra i valori SHAP di tutto il training (importanza e verso dell'effetto). Spiegazione locale: il waterfall plot di un campione mostra come ogni feature sposta la previsione dal valore atteso a quella finale.
AcME (Accelerated Model Explanations): metodo ispirato a SHAP ma pensato per costare molto meno e con una visualizzazione più semplice.
8. Reti neurali profonde
- spiegare l'elaborazione: mappe di salienza (quali pixel contano, per esempio per occlusione, Reti neurali convolutive (CNN)approfondimento: non nel programma di Telecomunicazioni. Una rete convolutiva (CNN) sostituisce gli strati densi con filtri piccoli che scorrono sull'immagine: ogni neurone vede solo una patch locale (campo recettivo) e i pesi del filtro sono condivisi in tutta l'immagine, quindi i parametri non dipendono dalla dimensione dell'immagine ($K^2C_{in}C_{out}+C_{out}$ per strato) e si conserva l'informazione spaziale. Dimensione dell'uscita: $\lfloor(W-K+2P)/S\rfloor+1$. Pooling (max 2x2, stride 2) sottocampiona e dà invarianza locale; i filtri 1x1 riducono i canali; struttura tipica CONV+ReLU, POOL, ..., FLATTEN, FC, SOFTMAX, addestrata con cross-entropy e backpropagation. Tre strati 3x3 hanno il campo recettivo di un 7x7 con meno parametri e più non linearità (VGG). Architetture: LeNet, AlexNet (ReLU, dropout, data augmentation), VGG, GoogLeNet (moduli Inception), ResNet (blocchi residui $H(x)=F(x)+x$), EfficientNet. Nel lab: CNN su Fashion-MNIST (241 546 parametri) e su CIFAR-10 (122 570).Reti neurali convolutive (CNN) →) e Grad-CAM (mappe di attivazione ponderate dal gradiente della classe sull'ultimo strato convolutivo);
- spiegare le rappresentazioni: cosa codifica un neurone o uno strato (neuroni a massima attivazione, concept activation vectors);
- sistemi che producono spiegazioni: architetture trasparenti per costruzione (self-explaining neural networks).
9. Valutare l'interpretabilità
- Livello applicativo: esperti del dominio provano la spiegazione su un compito reale (la stima più veritiera, la più costosa).
- Livello umano: non esperti su compiti semplificati (più facile trovare soggetti).
- Livello funzionale: nessun umano, si misurano quantità proxy del modello (profondità dell'albero, sparsità). Sfida: trovare proxy davvero legati all'interpretabilità umana.
10. Il laboratorio: cardiopatia (AHD)
Il dataset Heart descrive pazienti con 13 feature (età, sesso, tipo di dolore al petto, pressione a riposo, colesterolo, glicemia, ECG, frequenza massima, angina da sforzo, ecc.); si predice se hanno la cardiopatia AHD.
- Preparazione. Il target è
AHD == "Yes". Le colonne categoriche (ChestPain,Ca,Thal) si codificano one-hot. Si divide in training e test (test_size=0.33) e si normalizza con min-max usando minimo e massimo del training: , applicato anche al test con gli stessi valori. - Regressione logistica: accuratezza di training , di test . Importanza = (sensata perché le feature sono normalizzate).
- LASSO con crescente (da a ):
ChestPain_asymptomatic,Ca_0.0eThal_normalsono le ultime a essere azzerate, e l'ordine di importanza cambia con la penalità. - Random forest (
max_depth=5): modello non lineare, spiegato con ICE (funzione che fa variare una feature in tenendo fisso il resto e calcolapredict_proba[:,1]), PDP (media delle ICE sul test) e mappa a due feature. - SHAP:
shap.Explainer(clf, X_train, feature_names=...),shap.summary_plot(globale) eshap.waterfall_plot(locale).
def ice_curve(model, sample, idx):
valori = np.linspace(0, 1, 100) # feature normalizzata in [0, 1]
probs = []
for v in valori:
sample[0, idx] = v # cambia SOLO la feature idx
probs.append(model.predict_proba(sample)[0, 1])
return valori, probs
# PDP = media di ice_curve su tutti i campioni; permutation importance:
# sklearn.inspection.permutation_importance(model, X_test, y_test)Esercizio: Esercizio - XAI su cardiopatia e calcolo a mano di permutation importance, PDP e Shapley.
11. Errori tipici
- Leggere i coefficienti di un modello lineare senza normalizzare le feature.
- Usare l'MDI dei random forest come verità: soffre di feature selection bias.
- Credere che il PDP mostri l'effetto per ogni individuo: è una media (guardare le ICE).
- Permutation importance con feature molto correlate: genera punti irrealistici e sottostima.
- Confondere spiegazione globale e locale, o spiegare con un metodo agnostico come se rivelasse il «vero» meccanismo del modello.
- Confondere correlazione e causalità: l'importanza di una feature non dice cosa succederebbe intervenendo su di essa.
Versione ripasso
- Definizioni: interpretabilità = descrizioni semplici per umani; spiegabilità = interpretabilità + completezza (permette di anticipare la previsione). Legata a fiducia, informatività, fairness (Fairness nel machine learningapprofondimento: non nel programma di Telecomunicazioni. Un sistema di ML è fair se le sue decisioni non producono esiti ingiusti rispetto agli attributi sensibili $A$ (razza, genere, età, religione...). Il bias nasce dai dati storici (problema dell'inerzia) e non esiste una definizione unica di equità (problema della definizione). Togliere $A$ dagli ingressi (fairness through unawareness, $\hat Y=f(X)$ con $A\notin X$) spesso non basta per le variabili proxy (es. CAP correlato alla razza, $\rho=-0{,}80$) e costa accuratezza. Metriche: Demographic Parity $DP=P(\hat Y=1|A=a)-P(\hat Y=1|A=d)$ (stesso tasso di esiti positivi nei gruppi) ed Equality of Opportunity $EO=P(\hat Y=1|A=a,Y=1)-P(\hat Y=1|A=d,Y=1)$ (stesso tasso di veri positivi). Interventi: soglie diverse per gruppo, vincoli di fairness nella loss, pre-processing dei dati; ogni intervento ha un compromesso con l'accuratezza. Casi: COMPAS (falsi positivi 44,9% contro 23,5%), riconoscimento facciale, RCA auto, consegne Amazon; GDPR e AI Act richiedono garanzie di non discriminazione.Fairness nel machine learning →). Tassonomia: intrinseca o post-hoc; agnostica (portabile) o specifica (accurata, veloce); globale o locale. Buone spiegazioni: contrastive, brevi, adatte al pubblico. Output: statistiche delle feature, visualizzazioni, controfattuali.
- Regressione lineare (Regressione lineareNell'apprendimento supervisionato si impara una funzione $F(x)$ dagli esempi $(x,y)$: regressione se $y$ è continua, classificazione se è categorica. Il modello lineare è $F_\beta(x)=\beta_0+\beta_1x_1+\dots+\beta_px_p=X\beta$ (con una colonna di uni per $\beta_0$) e i parametri si scelgono minimizzando l'errore quadratico medio $\mathrm{MSE}=\frac1n\sum_i(y_i-F_\beta(x_i))^2$, funzione convessa dei parametri. Annullando il gradiente di $J(\beta)=|y-X\beta|^2$ si ottengono le equazioni normali $X^TX\beta=X^Ty$ e la soluzione dei minimi quadrati ordinari $\beta=(X^TX)^{-1}X^Ty$. Il coefficiente di determinazione $R^2=1-SS_{res}/SS_{tot}$ misura la qualità del fit (0 = come la media, negativo = peggio della media). Un modello va valutato su un test set mai usato per addestrare: l'errore sul training è ottimistico e un polinomio di grado alto lo azzera senza generalizzare.Regressione lineare →, Metodo dei minimi quadratiQuando un sistema AX = b non ha soluzioni si cerca X che rende minima la norma di AX − b: AX è la proiezione ortogonale di b su Im A, e X si trova risolvendo le equazioni normali AᵀA X = Aᵀb; applicazione alla retta di regressione.Metodo dei minimi quadrati →): = variazione per unità di a parità delle altre. Esempio bici: temperatura /grado, pioggia , estate . IC al : (Distribuzione gaussiana (normale)N(μ, σ²) ha densità e^(−(x−μ)²/(2σ²)) / √(2πσ²), a campana centrata in μ con larghezza σ; media μ, varianza σ²; si standardizza con Z = (X − μ)/σ ~ N(0, 1) e si calcola P(X ≤ x) = Φ((x − μ)/σ), con Φ(−z) = 1 − Φ(z); aX + b è ancora gaussiana, N(aμ + b, a²σ²).Distribuzione gaussiana (normale) →). LASSO (LASSO e discesa del gradienteIl LASSO è la regressione regolarizzata con penalità $L_1$: minimizza $\sum_i(y_i-x_i^T\beta)^2+\lambda\sum_{j\ge1}|\beta_j|$. A differenza della ridge, porta alcuni coefficienti esattamente a zero (soluzione sparsa, selezione delle feature): geometricamente le curve di livello dell'errore toccano il vincolo $\sum|\beta_j|\le s$ (un rombo) in uno spigolo. Non ha formula chiusa, quindi si minimizza con la discesa del gradiente $W\leftarrow W-\eta,\nabla J(W)$, usando il subgradiente $\operatorname{sign}(\beta_j)$ per il valore assoluto (nel punto 0 qualunque valore in $[-1,1]$). Il passo $\eta$ è critico: per l'errore quadratico converge se $\eta<1/\mu_{\max}(X^TX)$; si può usare $\eta_t=\eta_0/(1+\gamma t)$. L'Elastic Net combina le penalità $L_1$ e $L_2$ con $\lambda_1=\alpha\lambda$, $\lambda_2=(1-\alpha)\lambda$.LASSO e discesa del gradiente →): pesi esattamente zero, ma grouping effect e perdita di accuratezza.
- Logistica (Regressione logistica e softmaxLa regressione lineare non è adatta alla classificazione (valori fuori da [0,1], retta tirata dai punti lontani). La regressione logistica passa il predittore lineare dalla sigmoide $\sigma(z)=1/(1+e^{-z})$ e interpreta $\hat y=\sigma(x^T\beta)$ come $P(y=1\mid x)$: si predice la classe 1 se $\hat y\ge0{,}5$, cioè $x^T\beta\ge0$ (bordo lineare). L'errore quadratico dà una funzione non convessa; si usa la log-verosimiglianza negativa $-\sum[y\log\hat y+(1-y)\log(1-\hat y)]$, convessa, con gradiente $X^T(\hat y-y)$ e nessuna formula chiusa (discesa del gradiente). Per più classi: one-vs-one ($C(C-1)/2$ classificatori, voto), one-vs-all ($C$ classificatori, massima probabilità), o la softmax $p_c=e^{z_c}/\sum_ke^{z_k}$ con cross-entropia. Si può regolarizzare (ridge, LASSO, Elastic Net) e la cross-validation si fa stratificata. Approfondimento: non nel programma di Telecomunicazioni.Regressione logistica e softmax →): da si ha , quindi ; moltiplica gli odds per (). Con si ha : i coefficienti si confrontano solo con feature normalizzate. One-hot (nominali) contro label (ordinali).
- Alberi e foreste (Alberi di decisioneUn albero di decisione partiziona i dati con una sequenza di regole su una sola variabile alla volta (nodi interni = regole, foglie = predizioni: classe più frequente, oppure media del target in regressione). Si costruisce in modo ricorsivo scegliendo a ogni nodo la divisione che rende i figli più «puri»: con l'entropia $H=-\sum p_i\log_2p_i$ e il guadagno d'informazione $IG=H(S)-\sum\frac{|S_v|}{|S|}H(S_v)$ (ID3), oppure con l'indice di Gini $1-\sum p_i^2$ e soglie $x\le t$ su variabili numeriche (CART); in regressione con MSE o riduzione di varianza. Un albero pienamente sviluppato fa overfitting (varianza alta): si limita con la profondità massima (pre-potatura) o con la potatura a costo-complessità $R_\alpha(T)=R(T)+\alpha|T|$ (post-potatura). Pro: interpretabile, niente normalizzazione, predizione immediata; contro: varianza alta, da cui le foreste. Programma di Telecomunicazioni: Decision Trees e Random Forests.Alberi di decisione →, Metodi ensemble - bagging, random forest e boostingUn albero da solo ha varianza alta; un ensemble combina molti modelli deboli. Bagging: ogni albero è addestrato su un campione bootstrap (n estrazioni con rimpiazzo, circa il 63% di campioni distinti) e si vota o si fa la media: riduce la varianza, perché la media di $T$ stimatori con varianza $\sigma^2$ e correlazione $\rho$ ha varianza $\rho\sigma^2+(1-\rho)\sigma^2/T$. Random forest = bagging + a ogni split solo $\sqrt p$ feature casuali (alberi meno correlati); l'importanza di una feature è la somma delle riduzioni di Gini pesate sui nodi in cui è usata. Boosting: alberi in sequenza, ciascuno corregge gli errori dei precedenti, e si riduce il bias. Gradient boosting: $F\leftarrow F+\eta h$ con $h$ albero sui residui (gradiente negativo della perdita), $\eta$ piccolo; AdaBoost: stump e pesi sui campioni sbagliati; XGBoost: similarity score $\frac{(\sum r)^2}{N+\lambda}$, gain, potatura con $\gamma$, output $\frac{\sum r}{N+\lambda}$. Programma di Telecomunicazioni: Random Forests; boosting come approfondimento.Metodi ensemble - bagging, random forest e boosting →): ; ; MDI (mediata sugli alberi, normalizzata). Esempio: . Difetto: feature selection bias; rimedi: MDI corretto, Boruta (copie permutate).
- Permutation importance: aumento dell'errore dopo aver mescolato una feature (globale, agnostica). Esempio slide: errore () e (): più importante. Limiti: feature correlate producono punti irrealistici.
- ICE e PDP: ICE = previsione di un campione al variare di una feature; PDP = media delle ICE (Valore attesoIl valore atteso E[X] = Σ x p_X(x) è la media dei valori di X pesata con le loro probabilità (esiste se la serie converge assolutamente); per una funzione g vale E[g(X)] = Σ g(x) p_X(x) senza trovare la legge di g(X), ed E è lineare: E[aX + bY + c] = aE[X] + bE[Y] + c.Valore atteso →). Esempio: , : ICE di pendenza , PDP che nasconde l'interazione.
- LIME: punti perturbati attorno a , previsioni del black-box, modello semplice pesato per vicinanza, spiegazione locale.
- SHAP (Shapley): (Calcolo combinatorio per la probabilitàNegli spazi uniformi bisogna contare: principio di moltiplicazione, disposizioni con ripetizione n^k, disposizioni semplici n!/(n−k)!, permutazioni n!, combinazioni (n su k); estrazioni con e senza reinserimento e distribuzione ipergeometrica.Calcolo combinatorio per la probabilità →); . Esempio: , : , somma (l'interazione è divisa a metà). Con due feature: , : . Globale: summary plot; locale: waterfall. AcME: versione veloce.
- DNN: salienza e occlusione (Reti neurali convolutive (CNN)approfondimento: non nel programma di Telecomunicazioni. Una rete convolutiva (CNN) sostituisce gli strati densi con filtri piccoli che scorrono sull'immagine: ogni neurone vede solo una patch locale (campo recettivo) e i pesi del filtro sono condivisi in tutta l'immagine, quindi i parametri non dipendono dalla dimensione dell'immagine ($K^2C_{in}C_{out}+C_{out}$ per strato) e si conserva l'informazione spaziale. Dimensione dell'uscita: $\lfloor(W-K+2P)/S\rfloor+1$. Pooling (max 2x2, stride 2) sottocampiona e dà invarianza locale; i filtri 1x1 riducono i canali; struttura tipica CONV+ReLU, POOL, ..., FLATTEN, FC, SOFTMAX, addestrata con cross-entropy e backpropagation. Tre strati 3x3 hanno il campo recettivo di un 7x7 con meno parametri e più non linearità (VGG). Architetture: LeNet, AlexNet (ReLU, dropout, data augmentation), VGG, GoogLeNet (moduli Inception), ResNet (blocchi residui $H(x)=F(x)+x$), EfficientNet. Nel lab: CNN su Fashion-MNIST (241 546 parametri) e su CIFAR-10 (122 570).Reti neurali convolutive (CNN) →), Grad-CAM, concept activation vectors, self-explaining networks. Valutazione: livello applicativo, umano, funzionale.
- Lab AHD (Heart): one-hot, min-max con statistiche del training, logistica train /test ; LASSO azzera per ultime
ChestPain_asymptomatic,Ca_0.0,Thal_normal; random forest (max_depth=5) con ICE/PDP; SHAP summary e waterfall. - Errori tipici: coefficienti non normalizzati; MDI come verità; PDP come effetto individuale; correlazione causalità.