Lezione 17Metodi ensemble basati su alberi
In questa pagina 3
Settimana: 6 · Fonte: slide del corso Machine Learning, Ingegneria dell'Automazione UniPD (lezione 17)
Argomenti trattati
- Bagging: campioni bootstrap, riduzione della varianza.
- Random forest: sottoinsieme casuale di feature a ogni divisione, importanza delle feature.
- Boosting: AdaBoost, gradient boosting per la regressione, XGBoost (similarity score, gain, parametri gamma e lambda).
- Curva ROC e AUC per confrontare albero e foresta.
- Approfondimento: non nel programma di Telecomunicazioni.
Teoria
- Metodi ensemble - bagging, random forest e boostingUn albero da solo ha varianza alta; un ensemble combina molti modelli deboli. Bagging: ogni albero è addestrato su un campione bootstrap (n estrazioni con rimpiazzo, circa il 63% di campioni distinti) e si vota o si fa la media: riduce la varianza, perché la media di $T$ stimatori con varianza $\sigma^2$ e correlazione $\rho$ ha varianza $\rho\sigma^2+(1-\rho)\sigma^2/T$. Random forest = bagging + a ogni split solo $\sqrt p$ feature casuali (alberi meno correlati); l'importanza di una feature è la somma delle riduzioni di Gini pesate sui nodi in cui è usata. Boosting: alberi in sequenza, ciascuno corregge gli errori dei precedenti, e si riduce il bias. Gradient boosting: $F\leftarrow F+\eta h$ con $h$ albero sui residui (gradiente negativo della perdita), $\eta$ piccolo; AdaBoost: stump e pesi sui campioni sbagliati; XGBoost: similarity score $\frac{(\sum r)^2}{N+\lambda}$, gain, potatura con $\gamma$, output $\frac{\sum r}{N+\lambda}$. Programma di Telecomunicazioni: Random Forests; boosting come approfondimento.Metodi ensemble - bagging, random forest e boosting →
Esercizi
Lezione precedente: Lezione 16 · Alberi di decisione e random forest
Lezione successiva: Lezione 18 · Laboratorio sui metodi ad albero