Salta al contenuto
Note per Studenti Lezione 24 · Addestramento delle reti neurali 1

Lezione 24Addestramento delle reti neurali 1

In questa pagina 3

Settimana: 9 · Fonte: slide del corso Machine Learning, Ingegneria dell'Automazione UniPD (lezione 24)

Argomenti trattati

  1. Chiarimenti sulla curva ROC: TPR e FPR, il classificatore sempre negativo (TPR == FPR =0=0), sempre positivo (11, 11) e casuale (TPR == FPR); esempio con 100100 persone (5050 positive) e soglie 0,80{,}8 e 0,50{,}5 (TP, FP, TN, FN =10,10,40,40=10,10,40,40 e 25,25,25,2525,25,25,25). Vedi Metriche di classificazioneIn classificazione binaria ogni previsione è vero positivo (TP), vero negativo (TN), falso positivo (FP, errore di tipo I) o falso negativo (FN, errore di tipo II). Da queste quattro quantità: accuracy $=\frac{TP+TN}{TP+TN+FP+FN}$, specificità $=\frac{TN}{TN+FP}$, precision $=\frac{TP}{TP+FP}$, recall $=\frac{TP}{TP+FN}$, e la loro media armonica $F_1=\frac{2PR}{P+R}$. Con dati sbilanciati l'accuracy inganna (un modello che predice sempre la classe maggioritaria ha 99%): si usano precision, recall, F1, ROC-AUC, la cross-validation stratificata e il riequilibrio con undersampling o oversampling (non SMOTE). Cambiando la soglia sulla probabilità si ottiene la curva ROC (TPR contro FPR) e l'area AUC. Approfondimento: non nel programma di Telecomunicazioni.Metriche di classificazione →.
  2. Ruolo di CC nelle SVM: CC alto penalizza gli errori e stringe il margine (rischio di overfitting), CC basso allarga il margine (vedi Support vector machines e metodi kernelUna SVM cerca l'iperpiano $w\cdot x+b=0$ che separa due classi con il margine più largo possibile: normalizzando $y_i(w\cdot x_i+b)\ge1$ il margine totale vale $2/|w|$, quindi si risolve $\min\frac12|w|^2$ (problema convesso, nessun minimo locale). Con classi sovrapposte si ammettono errori con le variabili di scarto $\xi_i$ e il parametro $C$ (soft margin, equivalente alla hinge loss più una penalità su $|w|^2$); $C$ piccolo = margine largo e più bias, $C$ grande = margine stretto e più varianza, si sceglie per cross-validation. La soluzione dipende solo dai vettori di supporto ($w=\sum\alpha_iy_ix_i$) e solo tramite prodotti scalari, per questo si può sostituire $x_i\cdot x_j$ con un kernel $K(x_i,x_j)=\langle\phi(x_i),\phi(x_j)\rangle$ (polinomiale, RBF) senza calcolare $\phi$: così si ottengono bordi non lineari. La SVR usa lo stesso schema con un tubo di tolleranza $\varepsilon$. Nell'esame le SVM sono solo nella parte teorica.Support vector machines e metodi kernel →).
  3. Ripasso del neurone e della rete feed-forward, feature progettate a mano contro feature apprese, reti multi-output.
  4. Loss e discesa del gradiente: minimizzazione della loss, SGD e mini-batch, effetto di scelte «semplici» in architetture grandi, complessità del paesaggio della loss.
  5. Backpropagation: regola della catena e esempio numerico con attivazione sigmoide (x=1x=1, w1=0,5w_1=0{,}5, w2=−1w_2=-1, y=1y=1).
  6. Domare l'addestramento: gradiente evanescente e dead ReLU; confronto di sigmoide, tanh, ReLU, Leaky ReLU, PReLU e randomized Leaky ReLU.

Teoria

Esercizi

Lezione precedente: Lezione 23 · Introduzione al deep learning Lezione successiva: Lezione 25 · Addestramento delle reti neurali 2