Lezione 19Apprendimento non supervisionato e anomaly detection
In questa pagina 3
Settimana: 7 · Fonte: slide del corso Machine Learning, Ingegneria dell'Automazione UniPD (lezione 19)
Argomenti trattati
- Apprendimento non supervisionato: dati senza etichette, struttura e gruppi.
- Anomaly detection: che cos'è un'anomalia, quando eliminarle e quando no; box plot (1,5 IQR), carte di controllo μ±3σ.
- Metodo multivariato di Hotelling: statistica T2 e soglia chi quadro.
- Isolation forest e altri approcci; come valutare un sistema non supervisionato.
- Approfondimento: non nel programma di Telecomunicazioni.
Teoria
- Anomaly detectionUn'anomalia (outlier) è un'osservazione che si discosta tanto dalle altre da far pensare che sia generata da un meccanismo diverso. Rilevarle serve come pulizia dei dati (solo se sono errori o rumore, non per migliorare artificialmente le metriche), come obiettivo finale (frodi, guasti, cybersicurezza) e per il monitoraggio di un modello in produzione. Metodi semplici: box plot (oltre $1{,}5,\mathrm{IQR}$), carte di controllo univariate ($\mu\pm3\sigma$) e la statistica multivariata di Hotelling $T^2=(x-\bar x)^TS^{-1}(x-\bar x)$ con soglia $\chi^2_{p,1-\alpha}$, valida per dati gaussiani e unimodali. Metodi non supervisionati multivariati danno un anomaly score: l'isolation forest isola ogni punto con split casuali (le anomalie hanno cammini corti) e calcola $s(x,n)=2^{-E(h(x))/c(n)}$, con soglia scelta dalla contaminazione. Senza etichette si valuta con esperti, eventi noti o anomalie sintetiche. Approfondimento: non nel programma di Telecomunicazioni.Anomaly detection →
Esercizi
Lezione precedente: Lezione 18 · Laboratorio sui metodi ad albero
Lezione successiva: Lezione 20 · Clustering e k-means