Fairness nel machine learning
In questa pagina 7
Un modello di ML addestrato bene può comunque essere ingiusto. Oltre all'accuratezza un sistema deve avere altri requisiti (desiderata): informatività (intervalli di confidenza o probabilità, non solo un'etichetta), robustezza a piccole perturbazioni dei dati, scalabilità, bassa complessità, fairness (equità), spiegabilità e interpretabilità (Explainable AI (XAI)approfondimento: non nel programma di Telecomunicazioni. L'interpretabilità è l'arte di produrre descrizioni di un modello abbastanza semplici da essere capite da un umano; la spiegabilità aggiunge la completezza (permettere di anticipare la previsione). I metodi si classificano in intrinseci o post-hoc, agnostici o specifici del modello, globali o locali. Modelli intrinsecamente interpretabili: regressione lineare (pesi $\beta_j$, intervalli di confidenza, LASSO per la sparsità), regressione logistica ($\log\frac y{1-y}=\beta_0+\sum\beta_jx_j$), alberi. Importanza nelle foreste: MDI $=\sum_{\text{nodi}}\frac{n_p}{n_{TOT}}\Delta Gini$ (con feature selection bias). Metodi agnostici: permutation importance (aumento dell'errore dopo aver mescolato una feature), PDP $\hat f_S(x_S)=\frac1n\sum_if(x_S,x_C^{(i)})$ (media delle curve ICE), LIME (modello semplice locale pesato sui punti perturbati), SHAP (valori di Shapley: media dei contributi marginali su tutti gli ordini, somma $=f(x)-f(\text{base})$). Per le reti profonde: mappe di salienza, Grad-CAM, occlusione. Valutazione: livello applicativo, umano, funzionale. Lab: cardiopatia AHD con logistica, LASSO, random forest, ICE, PDP, SHAP.Explainable AI (XAI) →). Questa nota tratta la fairness.
Definizione (fairness). Nell'AI/ML, assenza di bias, discriminazione o favoritismo nei confronti di individui o gruppi nei risultati, nelle decisioni e nei processi del sistema. Le decisioni non devono produrre esiti ingiusti o pregiudizievoli in base ad attributi sensibili come razza, genere, età, religione, stato socioeconomico.
Definizione (attributi sensibili o protetti). Caratteristiche degli individui sulle quali, per legge o per etica, il trattamento ingiusto va evitato (razza, etnia, genere, età, disabilità, religione, orientamento sessuale, nazionalità, stato civile, background socioeconomico). Sono «sensibili» perché storicamente alla base di disuguaglianze.
Notazione. è l'attributo sensibile ( oppure ); sono le altre feature; è il vero esito (target) e quello predetto dal modello. Le probabilità condizionate sono quelle di Probabilità condizionataLa probabilità di A sapendo che si è verificato B è P(A ∣ B) = P(A ∩ B) / P(B), con P(B) > 0; è una nuova misura di probabilità, e da essa seguono la regola del prodotto e la regola della catena.Probabilità condizionata →: la frazione di individui del gruppo con previsione positiva.
1. Esempi di decisioni ingiuste
Un sistema che prende decisioni in modo automatico su persone può essere ingiusto anche senza che nessuno lo voglia:
- Rilevamento di frodi (Francia). Il punteggio di rischio cresce con reddito basso, disoccupazione, sussidi di solidarietà, residenza in quartieri svantaggiati, alta quota di reddito per l'affitto, essere genitore single: criteri che colpiscono i più poveri.
- Offerte di lavoro (Google). Uno studio ha rilevato che alle donne erano mostrati meno annunci di lavori ben pagati.
- Consegna in giornata (Amazon, 2016). Un algoritmo scelse i CAP «redditizi» per ottimizzare la logistica; le zone escluse erano correlate con la composizione razziale: i residenti bianchi avevano il doppio delle probabilità di avere il servizio.
- Mobilità condivisa (monopattini a Roma). Per massimizzare il profitto i mezzi si concentrano in centro e le periferie restano senza servizio; algoritmi (per esempio di reinforcement learning) possono bilanciare profitto e copertura.
- RCA auto (Italia). A parità di storico di guida, auto, età, anni di patente, i guidatori nati all'estero pagano di più; nei casi estremi uno nato in Laos fino a € in più di uno nato a Milano.
- Immagini mediche. Persone nere e donne sono sottorappresentate nei dataset per la diagnosi di tumori della pelle: chi ha meno accesso alle cure produce meno dati, e lo strumento diagnostico è meno accurato proprio per loro.
- Riconoscimento facciale. I software commerciali sbagliano pochissimo sugli uomini bianchi e molto di più sulle donne nere (scarti di errore di oltre il ); nel 2020 a Detroit Robert Williams fu arrestato per un falso riconoscimento su un video sfocato e trattenuto per oltre ore.
- Traduzione automatica. Dal turco (lingua senza genere grammaticale) all'inglese le frasi ambigue diventano «he is a doctor, she is a nurse», stereotipi assorbiti dai dati.
- IA generativa. I primi modelli di immagini a un prompt come «un medico parla con un'infermiera» producevano solo medici uomini e infermiere donne; modelli più recenti sono più bilanciati.
- Previsione della recidiva (COMPAS). Algoritmo usato negli USA per stimare la probabilità che un imputato commetta di nuovo un reato. Un'analisi di ProPublica (2016) ha mostrato che gli errori non sono distribuiti allo stesso modo:
| errore | bianchi | afroamericani |
|---|---|---|
| etichettati ad alto rischio ma senza recidiva (falsi positivi) | ||
| etichettati a basso rischio ma con recidiva (falsi negativi) |
I falsi positivi degli afroamericani sono quasi il doppio e i falsi negativi dei bianchi sono molto più alti: il modello è «clemente» con i bianchi e severo con i neri.
2. Perché è difficile
Problema dell'inerzia. Un modello impara dai dati storici e quindi riproduce le discriminazioni passate. C'è un ritardo: il mondo migliora, il modello resta fermo ai dati con cui è stato addestrato.
Problema della definizione. Non esiste una definizione unica di fairness: secondo alcuni la decisione automatica va calibrata sui dati, secondo altri deve compensare la discriminazione presente nei dati. La nozione di equo dipende da etica e legge, cambia tra culture e paesi (per esempio nei dilemmi etici dei veicoli a guida autonoma) e cambia nel tempo anche dentro una cultura.
3. Un caso sintetico in stile COMPAS
Le slide usano un dataset sintetico simile a COMPAS: informazioni personali (sex, race, zip_code) e giudiziarie (diff_custody, diff_jail, priors_count, c_charge_degree, is_recid, two_year_recid). Il target binario è decile_score_binary ( = basso rischio di recidiva, = alto rischio), assegnato da giudici umani; race è afroamericano, è caucasico.
Modello di base. Una Metodi ensemble - bagging, random forest e boostingUn albero da solo ha varianza alta; un ensemble combina molti modelli deboli. Bagging: ogni albero è addestrato su un campione bootstrap (n estrazioni con rimpiazzo, circa il 63% di campioni distinti) e si vota o si fa la media: riduce la varianza, perché la media di $T$ stimatori con varianza $\sigma^2$ e correlazione $\rho$ ha varianza $\rho\sigma^2+(1-\rho)\sigma^2/T$. Random forest = bagging + a ogni split solo $\sqrt p$ feature casuali (alberi meno correlati); l'importanza di una feature è la somma delle riduzioni di Gini pesate sui nodi in cui è usata. Boosting: alberi in sequenza, ciascuno corregge gli errori dei precedenti, e si riduce il bias. Gradient boosting: $F\leftarrow F+\eta h$ con $h$ albero sui residui (gradiente negativo della perdita), $\eta$ piccolo; AdaBoost: stump e pesi sui campioni sbagliati; XGBoost: similarity score $\frac{(\sum r)^2}{N+\lambda}$, gain, potatura con $\gamma$, output $\frac{\sum r}{N+\lambda}$. Programma di Telecomunicazioni: Random Forests; boosting come approfondimento.Metodi ensemble - bagging, random forest e boosting → (random forest) su tutte le feature ha accuratezza e ripete la discriminazione di COMPAS: il tasso di accettazione (quota classificata «basso rischio») è circa per gli afroamericani contro per i caucasici, e il tasso di veri positivi circa contro (valori letti dai grafici delle slide).
Primo tentativo: ignorare la razza. Si addestra senza la colonna race.
Definizione (fairness through unawareness). Un algoritmo è giusto se gli attributi protetti non sono usati esplicitamente nel processo decisionale: con . È apprezzata dai giuristi (il GDPR vieta di trattare categorie particolari di dati, salvo eccezioni): un sistema non può discriminare in base a un attributo che non vede.
Il divario migliora ma resta notevole (accettazione circa contro , TPR circa contro ).
Le variabili proxy. Si guarda la matrice di correlazione (Correlazione e visualizzazione dei datiLa correlazione di Pearson $r=\sum(X_i-\bar X)(Y_i-\bar Y)/\big(\sqrt{\sum(X_i-\bar X)^2}\sqrt{\sum(Y_i-\bar Y)^2}\big)\in[-1,1]$ misura la relazione lineare tra due variabili (covarianza divisa per le deviazioni standard); correlazione non implica causalità. Serve a capire quali variabili contano per il target e a eliminare quelle quasi duplicate (|r| molto alto). Gli indicatori di sintesi non bastano (quartetto di Anscombe, Datasaurus): vanno affiancati ai grafici: istogramma, KDE, box plot, violin plot, heatmap di correlazione, scatter plot e matrice di scatter plot.Correlazione e visualizzazione dei dati →, Covarianza e coefficiente di correlazioneCov(X, Y) = E[(X − E X)(Y − E Y)] = E[XY] − E[X]E[Y] misura quanto X e Y variano insieme; è bilineare, Cov(X, X) = Var(X), Var(X + Y) = Var X + Var Y + 2Cov(X, Y); ρ = Cov / (σ_X σ_Y) sta in [−1, 1] e vale ±1 solo per legami lineari. Indipendenti ⇒ non correlate, ma non viceversa (tranne per i vettori gaussiani).Covarianza e coefficiente di correlazione →): il CAP (zip_code) è fortemente correlato con la razza, .
Definizione (variabile proxy). Una variabile che non è sensibile ma è fortemente correlata a un attributo sensibile. Anche senza
race, il modello può ricostruirla dal proxy e discriminare lo stesso.
Secondo tentativo: via razza e CAP. Il divario si assottiglia (accettazione circa contro , TPR circa contro ), ma l'accuratezza scende (): è il compromesso tra accuratezza e fairness. Togliere il proxy toglie anche informazione legittima.
4. Metriche di fairness
Finora si sono confrontati tassi di accettazione e TPR: sono esempi di metriche di fairness. Sia il gruppo avvantaggiato e quello svantaggiato.
Formula (Demographic Parity, parità demografica). Usata dove un esito positivo è desiderabile per tutti (selezione del personale, prestiti): la previsione dovrebbe essere indipendente dall'attributo sensibile, cioè la probabilità di un esito positivo uguale nei gruppi.
Formula (Equality of Opportunity, pari opportunità). Usata quando l'esito deve poter dipendere dal gruppo (in medicina la frequenza di certe patologie dipende da sesso o etnia): non si chiede lo stesso tasso di esiti positivi ma lo stesso tasso di veri positivi (TPR, Metriche di classificazioneIn classificazione binaria ogni previsione è vero positivo (TP), vero negativo (TN), falso positivo (FP, errore di tipo I) o falso negativo (FN, errore di tipo II). Da queste quattro quantità: accuracy $=\frac{TP+TN}{TP+TN+FP+FN}$, specificità $=\frac{TN}{TN+FP}$, precision $=\frac{TP}{TP+FP}$, recall $=\frac{TP}{TP+FN}$, e la loro media armonica $F_1=\frac{2PR}{P+R}$. Con dati sbilanciati l'accuracy inganna (un modello che predice sempre la classe maggioritaria ha 99%): si usano precision, recall, F1, ROC-AUC, la cross-validation stratificata e il riequilibrio con undersampling o oversampling (non SMOTE). Cambiando la soglia sulla probabilità si ottiene la curva ROC (TPR contro FPR) e l'area AUC. Approfondimento: non nel programma di Telecomunicazioni.Metriche di classificazione →), cioè la stessa probabilità di essere riconosciuto positivo tra chi lo è davvero.
Esempio. Gruppo : persone, con , previsione positiva per (di cui con ). Gruppo : persone, con , previsione positiva per (di cui con ). Allora e : . I TPR sono e : . Il gruppo è penalizzato sia nella quota di accettati sia nella probabilità di essere riconosciuto quando merita.
Le due metriche misurano cose diverse e in genere non si possono soddisfare insieme se i gruppi hanno frequenze di esito positivo diverse: bisogna scegliere in base al contesto.
5. Come imporre la fairness
- Soglie diverse per gruppo. Molti classificatori danno un punteggio (la random forest dà la confidenza, Metriche di classificazioneIn classificazione binaria ogni previsione è vero positivo (TP), vero negativo (TN), falso positivo (FP, errore di tipo I) o falso negativo (FN, errore di tipo II). Da queste quattro quantità: accuracy $=\frac{TP+TN}{TP+TN+FP+FN}$, specificità $=\frac{TN}{TN+FP}$, precision $=\frac{TP}{TP+FP}$, recall $=\frac{TP}{TP+FN}$, e la loro media armonica $F_1=\frac{2PR}{P+R}$. Con dati sbilanciati l'accuracy inganna (un modello che predice sempre la classe maggioritaria ha 99%): si usano precision, recall, F1, ROC-AUC, la cross-validation stratificata e il riequilibrio con undersampling o oversampling (non SMOTE). Cambiando la soglia sulla probabilità si ottiene la curva ROC (TPR contro FPR) e l'area AUC. Approfondimento: non nel programma di Telecomunicazioni.Metriche di classificazione →) e si decide con una soglia. Si abbassa la soglia per il gruppo svantaggiato finché i tassi di accettazione (o i TPR) si equivalgono.
- Vincoli nella loss. Si aggiunge un termine di regolarizzazione che penalizza la disparità: il modello cerca accuratezza e fairness (Regolarizzazione delle reti neuraliUna rete con tanti parametri tende a memorizzare il training set (overfitting): la loss di training scende ma quella di validazione risale. Le tecniche di regolarizzazione limitano la capacità effettiva: penalità sui pesi ($\ell_2$: $J+\lambda|W|_2^2$, il passo diventa $W\leftarrow(1-2\eta\lambda)W-\eta\nabla J$; $\ell_1$: $J+\lambda|W|_1$, porta pesi esattamente a zero), early stopping (si ferma l'addestramento quando la validation loss smette di scendere, con pazienza e ripristino dei pesi migliori), dropout (in training si azzera a caso una frazione $p$ delle attivazioni e si riscala per $1/(1-p)$; in inferenza è spento), batch normalization (effetto collaterale) e data augmentation. Nel lab MNIST con $\lambda=0{,}01$ la penalità $\ell_1$ è troppo forte (accuratezza di test 0,844 contro 0,9815 senza regolarizzazione), mentre dropout e early stopping non peggiorano e tengono la validation loss più bassa.Regolarizzazione delle reti neurali → per l'idea di penalità).
- Pre-processing dei dati. Se il problema è la sottorappresentazione, si aumentano i dati (data augmentation); se il bersaglio è distorto, si cerca un'etichetta più equa (nell'esempio,
is_recidal posto del giudizio umano). - Rimuovere sia sia i proxy (unawareness completa).
Quasi tutti i metodi hanno un costo in accuratezza.
Esempio (soglie). Punteggi (con vera etichetta) del gruppo : ; del gruppo : . Con soglia per tutti: gruppo accetta , quota , ; gruppo accetta , quota , . Si abbassa la soglia di a : ora accetta anche , quota e . ed ; nessun falso positivo in entrambi i gruppi ( e restano sotto soglia).
Grafico interattivo: Quota di accettati in funzione della soglia per due gruppi (schematico): per ottenere la stessa quota del 50% il gruppo svantaggiato d richiede una soglia più bassa (0,45 contro 0,60)
6. Conclusioni
- La legge richiede fairness: il GDPR (in particolare art. 22 e considerando 71: misure tecniche e organizzative per evitare effetti discriminatori in base a origine razziale o etnica, opinioni politiche, religione, appartenenza sindacale, stato genetico o di salute, orientamento sessuale) e l'AI Act europeo contengono regole sui sistemi automatici, molte delle quali sono vincoli di fairness. Conviene saperla garantire.
- «Forzare» la fairness non è sempre ragionevole: nessuna definizione unica, risposte nette rare, nessuno strumento software la risolve per tutti i sistemi; servono conoscenza del dominio e principi generali.
- Si sta migliorando: nei modelli generativi recenti (immagini di medici e infermieri, cibo e contesti culturali, medicina) i risultati sono più diversificati.
Esercizio: Esercizio - Metriche di fairness e soglie per gruppo.
7. Errori tipici
- Credere che togliere la colonna sensibile basti (proxy!).
- Scambiare Demographic Parity ed Equality of Opportunity: la prima confronta i tassi di previsione positiva, la seconda i TPR tra i soli positivi veri.
- Misurare la fairness solo con l'accuratezza globale: un medio può nascondere errori molto diversi tra gruppi.
- Dimenticare che le soglie diverse per gruppo e le altre correzioni costano accuratezza e che le due metriche non si possono sempre soddisfare insieme.
- Dimenticare il segno e l'ordine dei gruppi nelle differenze ( avvantaggiato meno svantaggiato).
Versione ripasso
- Fairness: nessun esito ingiusto in base agli attributi sensibili (razza, genere, età, religione, ...). = altre feature, = esito vero, = predetto; è una probabilità condizionata (Probabilità condizionataLa probabilità di A sapendo che si è verificato B è P(A ∣ B) = P(A ∩ B) / P(B), con P(B) > 0; è una nuova misura di probabilità, e da essa seguono la regola del prodotto e la regola della catena.Probabilità condizionata →). Oltre all'accuratezza: informatività, robustezza, scalabilità, sparsità, spiegabilità (Explainable AI (XAI)approfondimento: non nel programma di Telecomunicazioni. L'interpretabilità è l'arte di produrre descrizioni di un modello abbastanza semplici da essere capite da un umano; la spiegabilità aggiunge la completezza (permettere di anticipare la previsione). I metodi si classificano in intrinseci o post-hoc, agnostici o specifici del modello, globali o locali. Modelli intrinsecamente interpretabili: regressione lineare (pesi $\beta_j$, intervalli di confidenza, LASSO per la sparsità), regressione logistica ($\log\frac y{1-y}=\beta_0+\sum\beta_jx_j$), alberi. Importanza nelle foreste: MDI $=\sum_{\text{nodi}}\frac{n_p}{n_{TOT}}\Delta Gini$ (con feature selection bias). Metodi agnostici: permutation importance (aumento dell'errore dopo aver mescolato una feature), PDP $\hat f_S(x_S)=\frac1n\sum_if(x_S,x_C^{(i)})$ (media delle curve ICE), LIME (modello semplice locale pesato sui punti perturbati), SHAP (valori di Shapley: media dei contributi marginali su tutti gli ordini, somma $=f(x)-f(\text{base})$). Per le reti profonde: mappe di salienza, Grad-CAM, occlusione. Valutazione: livello applicativo, umano, funzionale. Lab: cardiopatia AHD con logistica, LASSO, random forest, ICE, PDP, SHAP.Explainable AI (XAI) →).
- Casi: frodi (reddito basso, genitori single); annunci di lavoro a donne; Amazon (CAP profittevoli, doppie probabilità di servizio per i bianchi); monopattini; RCA (fino a € in più per nati all'estero); immagini mediche (sottorappresentazione); riconoscimento facciale (errori sopra il per le donne nere, caso Robert Williams); traduttori; IA generativa; COMPAS: falsi positivi afroamericani contro bianchi, falsi negativi contro .
- Problemi: inerzia (i dati storici perpetuano le discriminazioni) e definizione (nessuna nozione unica: calibrare sui dati o compensare; dipende da legge, etica, cultura, tempo).
- Fairness through unawareness: con (GDPR vieta di trattare le categorie particolari di dati). Fallisce con le proxy: variabili non sensibili ma correlate a (Covarianza e coefficiente di correlazioneCov(X, Y) = E[(X − E X)(Y − E Y)] = E[XY] − E[X]E[Y] misura quanto X e Y variano insieme; è bilineare, Cov(X, X) = Var(X), Var(X + Y) = Var X + Var Y + 2Cov(X, Y); ρ = Cov / (σ_X σ_Y) sta in [−1, 1] e vale ±1 solo per legami lineari. Indipendenti ⇒ non correlate, ma non viceversa (tranne per i vettori gaussiani).Covarianza e coefficiente di correlazione →, Correlazione e visualizzazione dei datiLa correlazione di Pearson $r=\sum(X_i-\bar X)(Y_i-\bar Y)/\big(\sqrt{\sum(X_i-\bar X)^2}\sqrt{\sum(Y_i-\bar Y)^2}\big)\in[-1,1]$ misura la relazione lineare tra due variabili (covarianza divisa per le deviazioni standard); correlazione non implica causalità. Serve a capire quali variabili contano per il target e a eliminare quelle quasi duplicate (|r| molto alto). Gli indicatori di sintesi non bastano (quartetto di Anscombe, Datasaurus): vanno affiancati ai grafici: istogramma, KDE, box plot, violin plot, heatmap di correlazione, scatter plot e matrice di scatter plot.Correlazione e visualizzazione dei dati →). Caso sintetico: random forest, accuratezza , accettazione contro , TPR contro ; senza razza , TPR ; CAP e razza hanno ; senza razza e CAP , TPR ma accuratezza : compromesso accuratezza-fairness.
- Demographic Parity: , ideale (esito positivo desiderabile per tutti, indipendenza da ). Equality of Opportunity: , ideale (stesso TPR: Metriche di classificazioneIn classificazione binaria ogni previsione è vero positivo (TP), vero negativo (TN), falso positivo (FP, errore di tipo I) o falso negativo (FN, errore di tipo II). Da queste quattro quantità: accuracy $=\frac{TP+TN}{TP+TN+FP+FN}$, specificità $=\frac{TN}{TN+FP}$, precision $=\frac{TP}{TP+FP}$, recall $=\frac{TP}{TP+FN}$, e la loro media armonica $F_1=\frac{2PR}{P+R}$. Con dati sbilanciati l'accuracy inganna (un modello che predice sempre la classe maggioritaria ha 99%): si usano precision, recall, F1, ROC-AUC, la cross-validation stratificata e il riequilibrio con undersampling o oversampling (non SMOTE). Cambiando la soglia sulla probabilità si ottiene la curva ROC (TPR contro FPR) e l'area AUC. Approfondimento: non nel programma di Telecomunicazioni.Metriche di classificazione →); si usa quando l'esito può dipendere legittimamente dal gruppo. Le due in genere non si soddisfano insieme.
- Esempio: gruppo : persone, con , previsioni positive ( vere); gruppo : con , positive ( vere). ; TPR e , ; accuratezze e : l'accuratezza nasconde la disparità.
- Interventi: abbassare la soglia del gruppo svantaggiato (: quota e TPR da a , nell'esempio); vincoli nella loss (regolarizzazione); pre-processing (data augmentation, etichette più eque come
is_recid); togliere e proxy. Tutti con costo in accuratezza. - Legge: GDPR (art. 22, considerando 71) e AI Act; conta la conoscenza del dominio, nessuno strumento risolve la fairness per tutti i sistemi.
- Errori tipici: togliere solo la colonna sensibile; confondere DP ed EO; misurare solo l'accuratezza globale; dimenticare la convenzione su e sul gruppo avvantaggiato.