Salta al contenuto
Note per Studenti Lezione 29 · Fairness e simulazione della parte pratica

Lezione 29Fairness e simulazione della parte pratica

In questa pagina 3

Settimana: 12 · Fonte: slide del corso Machine Learning, Ingegneria dell'Automazione UniPD (lezione 29)

Argomenti trattati

  1. Algorithmic fairness: desiderata dei sistemi di ML (informatività, robustezza, scalabilità, sparsità, fairness, spiegabilità).
  2. Dieci esempi di decisioni ingiuste: frodi, annunci di lavoro, consegne Amazon, monopattini, RCA auto, immagini mediche, riconoscimento facciale (caso Robert Williams), traduttori, IA generativa, COMPAS (cifre ProPublica).
  3. Definizioni: fairness, attributi sensibili AA, problema dell'inerzia e problema della definizione.
  4. Caso sintetico in stile COMPAS con random forest: fairness through unawareness, variabili proxy (CAP e razza, ρ=−0,80\rho=-0{,}80), compromesso accuratezza-fairness.
  5. Metriche: Demographic Parity ed Equality of Opportunity; come imporle (soglie per gruppo, regolarizzazione, pre-processing).
  6. GDPR e AI Act, limiti del «brute forcing» della fairness.
  7. Nella stessa settimana: simulazione della parte pratica d'esame (alberi ID3, regolarizzazione, random forest con bootstrap e feature bagging, curva ROC e AUC): si vedano Alberi di decisioneUn albero di decisione partiziona i dati con una sequenza di regole su una sola variabile alla volta (nodi interni = regole, foglie = predizioni: classe più frequente, oppure media del target in regressione). Si costruisce in modo ricorsivo scegliendo a ogni nodo la divisione che rende i figli più «puri»: con l'entropia $H=-\sum p_i\log_2p_i$ e il guadagno d'informazione $IG=H(S)-\sum\frac{|S_v|}{|S|}H(S_v)$ (ID3), oppure con l'indice di Gini $1-\sum p_i^2$ e soglie $x\le t$ su variabili numeriche (CART); in regressione con MSE o riduzione di varianza. Un albero pienamente sviluppato fa overfitting (varianza alta): si limita con la profondità massima (pre-potatura) o con la potatura a costo-complessità $R_\alpha(T)=R(T)+\alpha|T|$ (post-potatura). Pro: interpretabile, niente normalizzazione, predizione immediata; contro: varianza alta, da cui le foreste. Programma di Telecomunicazioni: Decision Trees e Random Forests.Alberi di decisione →, Metodi ensemble - bagging, random forest e boostingUn albero da solo ha varianza alta; un ensemble combina molti modelli deboli. Bagging: ogni albero è addestrato su un campione bootstrap (n estrazioni con rimpiazzo, circa il 63% di campioni distinti) e si vota o si fa la media: riduce la varianza, perché la media di $T$ stimatori con varianza $\sigma^2$ e correlazione $\rho$ ha varianza $\rho\sigma^2+(1-\rho)\sigma^2/T$. Random forest = bagging + a ogni split solo $\sqrt p$ feature casuali (alberi meno correlati); l'importanza di una feature è la somma delle riduzioni di Gini pesate sui nodi in cui è usata. Boosting: alberi in sequenza, ciascuno corregge gli errori dei precedenti, e si riduce il bias. Gradient boosting: $F\leftarrow F+\eta h$ con $h$ albero sui residui (gradiente negativo della perdita), $\eta$ piccolo; AdaBoost: stump e pesi sui campioni sbagliati; XGBoost: similarity score $\frac{(\sum r)^2}{N+\lambda}$, gain, potatura con $\gamma$, output $\frac{\sum r}{N+\lambda}$. Programma di Telecomunicazioni: Random Forests; boosting come approfondimento.Metodi ensemble - bagging, random forest e boosting → e Metriche di classificazioneIn classificazione binaria ogni previsione è vero positivo (TP), vero negativo (TN), falso positivo (FP, errore di tipo I) o falso negativo (FN, errore di tipo II). Da queste quattro quantità: accuracy $=\frac{TP+TN}{TP+TN+FP+FN}$, specificità $=\frac{TN}{TN+FP}$, precision $=\frac{TP}{TP+FP}$, recall $=\frac{TP}{TP+FN}$, e la loro media armonica $F_1=\frac{2PR}{P+R}$. Con dati sbilanciati l'accuracy inganna (un modello che predice sempre la classe maggioritaria ha 99%): si usano precision, recall, F1, ROC-AUC, la cross-validation stratificata e il riequilibrio con undersampling o oversampling (non SMOTE). Cambiando la soglia sulla probabilità si ottiene la curva ROC (TPR contro FPR) e l'area AUC. Approfondimento: non nel programma di Telecomunicazioni.Metriche di classificazione →.

Teoria

Esercizi

Lezione precedente: Lezione 28 · Laboratorio di deep learning (reti neurali 1) Lezione successiva: Lezione 30 · Laboratorio di deep learning 2 (reti neurali 2)