Lezione 23Introduzione al deep learning
In questa pagina 3
Settimana: 8 · Fonte: slide del corso Machine Learning, Ingegneria dell'Automazione UniPD (lezione 23)
Argomenti trattati
- Perché il deep learning: prestazioni (ImageNet, traduzione neurale, modelli di linguaggio), rappresentazione procedurale delle feature, generazione, ragioni per non sceglierlo (complessità, adversarial examples, bisogno di molti dati, alberi migliori sui dati tabulari). Parole chiave: AI, ML, DL, GenAI.
- Il neurone: Perceptron a soglia (vedi Halfspace e PerceptronUn halfspace (semispazio) classifica con un iperpiano: $h(x)=\operatorname{sign}(w^Tx+b)$, con $w$ normale al piano e $|w^Tx+b|/|w|$ distanza dal piano; aggiungendo una componente costante $1$ a $x$ si scrive $\operatorname{sign}(\tilde w^T\tilde x)$. Il Perceptron (Rosenblatt, 1958) è il neurone con attivazione a gradino e impara con una regola semplice: per ogni errore $y_i,w^Tx_i\le0$ si aggiorna $w\leftarrow w+y_ix_i$. Teorema di convergenza (Novikoff): se i dati sono linearmente separabili con margine $\gamma$ ($y_iw^{T}x_i\ge\gamma$, $|w^|=1$) e $|x_i|\le R$, il Perceptron fa al più $(R/\gamma)^2$ errori e si ferma. Non risolve problemi non separabili (XOR), non ha un criterio di margine ottimale (le SVM sì) e il suo analogo morbido è la regressione logistica. Programma di Telecomunicazioni: halfspace model, Perceptron.Halfspace e Perceptron →), unità sigmoide, forma generale .
- Funzioni di attivazione: sigmoide, tangente iperbolica, ReLU e relative derivate.
- Rete feed-forward a uno strato nascosto e a strati, universalità, gerarchia delle feature.
- Addestramento: loss, loss empirica, cross-entropy e MSE, discesa del gradiente, backpropagation come regola della catena, SGD e mini-batch (ripresi e approfonditi nella lezione 24).
Teoria
Esercizi
Lezione precedente: Lezione 22 · Support vector machines e kernel Lezione successiva: Lezione 24 · Addestramento delle reti neurali 1