Salta al contenuto
Note per Studenti Fairness nel machine learning

Fairness nel machine learning

In questa pagina 7

Un modello di ML addestrato bene può comunque essere ingiusto. Oltre all'accuratezza un sistema deve avere altri requisiti (desiderata): informatività (intervalli di confidenza o probabilità, non solo un'etichetta), robustezza a piccole perturbazioni dei dati, scalabilità, bassa complessità, fairness (equità), spiegabilità e interpretabilità (Explainable AI (XAI)approfondimento: non nel programma di Telecomunicazioni. L'interpretabilità è l'arte di produrre descrizioni di un modello abbastanza semplici da essere capite da un umano; la spiegabilità aggiunge la completezza (permettere di anticipare la previsione). I metodi si classificano in intrinseci o post-hoc, agnostici o specifici del modello, globali o locali. Modelli intrinsecamente interpretabili: regressione lineare (pesi $\beta_j$, intervalli di confidenza, LASSO per la sparsità), regressione logistica ($\log\frac y{1-y}=\beta_0+\sum\beta_jx_j$), alberi. Importanza nelle foreste: MDI $=\sum_{\text{nodi}}\frac{n_p}{n_{TOT}}\Delta Gini$ (con feature selection bias). Metodi agnostici: permutation importance (aumento dell'errore dopo aver mescolato una feature), PDP $\hat f_S(x_S)=\frac1n\sum_if(x_S,x_C^{(i)})$ (media delle curve ICE), LIME (modello semplice locale pesato sui punti perturbati), SHAP (valori di Shapley: media dei contributi marginali su tutti gli ordini, somma $=f(x)-f(\text{base})$). Per le reti profonde: mappe di salienza, Grad-CAM, occlusione. Valutazione: livello applicativo, umano, funzionale. Lab: cardiopatia AHD con logistica, LASSO, random forest, ICE, PDP, SHAP.Explainable AI (XAI) →). Questa nota tratta la fairness.

Definizione (fairness). Nell'AI/ML, assenza di bias, discriminazione o favoritismo nei confronti di individui o gruppi nei risultati, nelle decisioni e nei processi del sistema. Le decisioni non devono produrre esiti ingiusti o pregiudizievoli in base ad attributi sensibili come razza, genere, età, religione, stato socioeconomico.

Definizione (attributi sensibili o protetti). Caratteristiche degli individui sulle quali, per legge o per etica, il trattamento ingiusto va evitato (razza, etnia, genere, età, disabilità, religione, orientamento sessuale, nazionalità, stato civile, background socioeconomico). Sono «sensibili» perché storicamente alla base di disuguaglianze.

Notazione. A∈AA\in\mathcal A è l'attributo sensibile (A={femmina,maschio}\mathcal A=\{\text{femmina},\text{maschio}\} oppure {Nero,Bianco,Asiatico}\{\text{Nero},\text{Bianco},\text{Asiatico}\}); XX sono le altre feature; YY è il vero esito (target) e Y^\hat Y quello predetto dal modello. Le probabilità condizionate P(Y^=1∣A=a)P(\hat Y=1\mid A=a) sono quelle di Probabilità condizionataLa probabilità di A sapendo che si è verificato B è P(A ∣ B) = P(A ∩ B) / P(B), con P(B) > 0; è una nuova misura di probabilità, e da essa seguono la regola del prodotto e la regola della catena.Probabilità condizionata →: la frazione di individui del gruppo A=aA=a con previsione positiva.

1. Esempi di decisioni ingiuste

Un sistema che prende decisioni in modo automatico su persone può essere ingiusto anche senza che nessuno lo voglia:

  1. Rilevamento di frodi (Francia). Il punteggio di rischio cresce con reddito basso, disoccupazione, sussidi di solidarietà, residenza in quartieri svantaggiati, alta quota di reddito per l'affitto, essere genitore single: criteri che colpiscono i più poveri.
  2. Offerte di lavoro (Google). Uno studio ha rilevato che alle donne erano mostrati meno annunci di lavori ben pagati.
  3. Consegna in giornata (Amazon, 2016). Un algoritmo scelse i CAP «redditizi» per ottimizzare la logistica; le zone escluse erano correlate con la composizione razziale: i residenti bianchi avevano il doppio delle probabilità di avere il servizio.
  4. Mobilità condivisa (monopattini a Roma). Per massimizzare il profitto i mezzi si concentrano in centro e le periferie restano senza servizio; algoritmi (per esempio di reinforcement learning) possono bilanciare profitto e copertura.
  5. RCA auto (Italia). A parità di storico di guida, auto, età, anni di patente, i guidatori nati all'estero pagano di più; nei casi estremi uno nato in Laos fino a 1 0001\,000 € in più di uno nato a Milano.
  6. Immagini mediche. Persone nere e donne sono sottorappresentate nei dataset per la diagnosi di tumori della pelle: chi ha meno accesso alle cure produce meno dati, e lo strumento diagnostico è meno accurato proprio per loro.
  7. Riconoscimento facciale. I software commerciali sbagliano pochissimo sugli uomini bianchi e molto di più sulle donne nere (scarti di errore di oltre il 30%30\%); nel 2020 a Detroit Robert Williams fu arrestato per un falso riconoscimento su un video sfocato e trattenuto per oltre 3030 ore.
  8. Traduzione automatica. Dal turco (lingua senza genere grammaticale) all'inglese le frasi ambigue diventano «he is a doctor, she is a nurse», stereotipi assorbiti dai dati.
  9. IA generativa. I primi modelli di immagini a un prompt come «un medico parla con un'infermiera» producevano solo medici uomini e infermiere donne; modelli più recenti sono più bilanciati.
  10. Previsione della recidiva (COMPAS). Algoritmo usato negli USA per stimare la probabilità che un imputato commetta di nuovo un reato. Un'analisi di ProPublica (2016) ha mostrato che gli errori non sono distribuiti allo stesso modo:
errore bianchi afroamericani
etichettati ad alto rischio ma senza recidiva (falsi positivi) 23,5%23{,}5\% 44,9%44{,}9\%
etichettati a basso rischio ma con recidiva (falsi negativi) 47,7%47{,}7\% 28,0%28{,}0\%

I falsi positivi degli afroamericani sono quasi il doppio e i falsi negativi dei bianchi sono molto più alti: il modello è «clemente» con i bianchi e severo con i neri.

2. Perché è difficile

Problema dell'inerzia. Un modello impara dai dati storici e quindi riproduce le discriminazioni passate. C'è un ritardo: il mondo migliora, il modello resta fermo ai dati con cui è stato addestrato.

Problema della definizione. Non esiste una definizione unica di fairness: secondo alcuni la decisione automatica va calibrata sui dati, secondo altri deve compensare la discriminazione presente nei dati. La nozione di equo dipende da etica e legge, cambia tra culture e paesi (per esempio nei dilemmi etici dei veicoli a guida autonoma) e cambia nel tempo anche dentro una cultura.

3. Un caso sintetico in stile COMPAS

Le slide usano un dataset sintetico simile a COMPAS: informazioni personali (sex, race, zip_code) e giudiziarie (diff_custody, diff_jail, priors_count, c_charge_degree, is_recid, two_year_recid). Il target binario è decile_score_binary (11 = basso rischio di recidiva, 00 = alto rischio), assegnato da giudici umani; race=1=1 è afroamericano, 00 è caucasico.

Modello di base. Una Metodi ensemble - bagging, random forest e boostingUn albero da solo ha varianza alta; un ensemble combina molti modelli deboli. Bagging: ogni albero è addestrato su un campione bootstrap (n estrazioni con rimpiazzo, circa il 63% di campioni distinti) e si vota o si fa la media: riduce la varianza, perché la media di $T$ stimatori con varianza $\sigma^2$ e correlazione $\rho$ ha varianza $\rho\sigma^2+(1-\rho)\sigma^2/T$. Random forest = bagging + a ogni split solo $\sqrt p$ feature casuali (alberi meno correlati); l'importanza di una feature è la somma delle riduzioni di Gini pesate sui nodi in cui è usata. Boosting: alberi in sequenza, ciascuno corregge gli errori dei precedenti, e si riduce il bias. Gradient boosting: $F\leftarrow F+\eta h$ con $h$ albero sui residui (gradiente negativo della perdita), $\eta$ piccolo; AdaBoost: stump e pesi sui campioni sbagliati; XGBoost: similarity score $\frac{(\sum r)^2}{N+\lambda}$, gain, potatura con $\gamma$, output $\frac{\sum r}{N+\lambda}$. Programma di Telecomunicazioni: Random Forests; boosting come approfondimento.Metodi ensemble - bagging, random forest e boosting → (random forest) su tutte le feature ha accuratezza ≈0,70\approx0{,}70 e ripete la discriminazione di COMPAS: il tasso di accettazione (quota classificata «basso rischio») è circa 0,390{,}39 per gli afroamericani contro 0,720{,}72 per i caucasici, e il tasso di veri positivi circa 0,600{,}60 contro 0,800{,}80 (valori letti dai grafici delle slide).

Primo tentativo: ignorare la razza. Si addestra senza la colonna race.

Definizione (fairness through unawareness). Un algoritmo è giusto se gli attributi protetti non sono usati esplicitamente nel processo decisionale: Y^=f(X)\hat Y=f(X) con A∉XA\notin X. È apprezzata dai giuristi (il GDPR vieta di trattare categorie particolari di dati, salvo eccezioni): un sistema non può discriminare in base a un attributo che non vede.

Il divario migliora ma resta notevole (accettazione circa 0,430{,}43 contro 0,670{,}67, TPR circa 0,640{,}64 contro 0,750{,}75).

Le variabili proxy. Si guarda la matrice di correlazione (Correlazione e visualizzazione dei datiLa correlazione di Pearson $r=\sum(X_i-\bar X)(Y_i-\bar Y)/\big(\sqrt{\sum(X_i-\bar X)^2}\sqrt{\sum(Y_i-\bar Y)^2}\big)\in[-1,1]$ misura la relazione lineare tra due variabili (covarianza divisa per le deviazioni standard); correlazione non implica causalità. Serve a capire quali variabili contano per il target e a eliminare quelle quasi duplicate (|r| molto alto). Gli indicatori di sintesi non bastano (quartetto di Anscombe, Datasaurus): vanno affiancati ai grafici: istogramma, KDE, box plot, violin plot, heatmap di correlazione, scatter plot e matrice di scatter plot.Correlazione e visualizzazione dei dati →, Covarianza e coefficiente di correlazioneCov(X, Y) = E[(X − E X)(Y − E Y)] = E[XY] − E[X]E[Y] misura quanto X e Y variano insieme; è bilineare, Cov(X, X) = Var(X), Var(X + Y) = Var X + Var Y + 2Cov(X, Y); ρ = Cov / (σ_X σ_Y) sta in [−1, 1] e vale ±1 solo per legami lineari. Indipendenti ⇒ non correlate, ma non viceversa (tranne per i vettori gaussiani).Covarianza e coefficiente di correlazione →): il CAP (zip_code) è fortemente correlato con la razza, ρ=−0,80\rho=-0{,}80.

Definizione (variabile proxy). Una variabile che non è sensibile ma è fortemente correlata a un attributo sensibile. Anche senza race, il modello può ricostruirla dal proxy e discriminare lo stesso.

Secondo tentativo: via razza e CAP. Il divario si assottiglia (accettazione circa 0,470{,}47 contro 0,570{,}57, TPR circa 0,660{,}66 contro 0,650{,}65), ma l'accuratezza scende (≈0,70→0,68→0,66\approx0{,}70\to0{,}68\to0{,}66): è il compromesso tra accuratezza e fairness. Togliere il proxy toglie anche informazione legittima.

4. Metriche di fairness

Finora si sono confrontati tassi di accettazione e TPR: sono esempi di metriche di fairness. Sia aa il gruppo avvantaggiato e dd quello svantaggiato.

Formula (Demographic Parity, parità demografica). Usata dove un esito positivo è desiderabile per tutti (selezione del personale, prestiti): la previsione dovrebbe essere indipendente dall'attributo sensibile, cioè la probabilità di un esito positivo uguale nei gruppi. DP=P(Y^=1∣A=a)−P(Y^=1∣A=d),ideale DP=0.DP=P(\hat Y=1\mid A=a)-P(\hat Y=1\mid A=d),\qquad\text{ideale }DP=0.

Formula (Equality of Opportunity, pari opportunità). Usata quando l'esito deve poter dipendere dal gruppo (in medicina la frequenza di certe patologie dipende da sesso o etnia): non si chiede lo stesso tasso di esiti positivi ma lo stesso tasso di veri positivi (TPR, Metriche di classificazioneIn classificazione binaria ogni previsione è vero positivo (TP), vero negativo (TN), falso positivo (FP, errore di tipo I) o falso negativo (FN, errore di tipo II). Da queste quattro quantità: accuracy $=\frac{TP+TN}{TP+TN+FP+FN}$, specificità $=\frac{TN}{TN+FP}$, precision $=\frac{TP}{TP+FP}$, recall $=\frac{TP}{TP+FN}$, e la loro media armonica $F_1=\frac{2PR}{P+R}$. Con dati sbilanciati l'accuracy inganna (un modello che predice sempre la classe maggioritaria ha 99%): si usano precision, recall, F1, ROC-AUC, la cross-validation stratificata e il riequilibrio con undersampling o oversampling (non SMOTE). Cambiando la soglia sulla probabilità si ottiene la curva ROC (TPR contro FPR) e l'area AUC. Approfondimento: non nel programma di Telecomunicazioni.Metriche di classificazione →), cioè la stessa probabilità di essere riconosciuto positivo tra chi lo è davvero. EO=P(Y^=1∣A=a,Y=1)−P(Y^=1∣A=d,Y=1),ideale EO=0.EO=P(\hat Y=1\mid A=a,Y=1)-P(\hat Y=1\mid A=d,Y=1),\qquad\text{ideale }EO=0.

Esempio. Gruppo aa: 100100 persone, 5050 con Y=1Y=1, previsione positiva per 6060 (di cui 4545 con Y=1Y=1). Gruppo dd: 100100 persone, 4040 con Y=1Y=1, previsione positiva per 3030 (di cui 2424 con Y=1Y=1). Allora P(Y^=1∣a)=60/100=0,60P(\hat Y=1|a)=60/100=0{,}60 e P(Y^=1∣d)=30/100=0,30P(\hat Y=1|d)=30/100=0{,}30: DP=0,30DP=0{,}30. I TPR sono 45/50=0,9045/50=0{,}90 e 24/40=0,6024/40=0{,}60: EO=0,30EO=0{,}30. Il gruppo dd è penalizzato sia nella quota di accettati sia nella probabilità di essere riconosciuto quando merita.

Le due metriche misurano cose diverse e in genere non si possono soddisfare insieme se i gruppi hanno frequenze di esito positivo diverse: bisogna scegliere in base al contesto.

5. Come imporre la fairness

Quasi tutti i metodi hanno un costo in accuratezza.

Esempio (soglie). Punteggi (con vera etichetta) del gruppo aa: 0,95(1),0,85(1),0,65(1),0,40(1),0,35(0),0,10(0)0{,}95(1),0{,}85(1),0{,}65(1),0{,}40(1),0{,}35(0),0{,}10(0); del gruppo dd: 0,90(1),0,70(1),0,55(1),0,45(1),0,30(0),0,20(0)0{,}90(1),0{,}70(1),0{,}55(1),0{,}45(1),0{,}30(0),0{,}20(0). Con soglia 0,60{,}6 per tutti: gruppo aa accetta 0,95,0,85,0,650{,}95,0{,}85,0{,}65, quota 3/6=0,503/6=0{,}50, TPR=3/4=0,75TPR=3/4=0{,}75; gruppo dd accetta 0,90,0,700{,}90,0{,}70, quota 2/6=0,332/6=0{,}33, TPR=2/4=0,50TPR=2/4=0{,}50. Si abbassa la soglia di dd a 0,50{,}5: ora accetta anche 0,550{,}55, quota 3/6=0,503/6=0{,}50 e TPR=3/4=0,75TPR=3/4=0{,}75. DP=0,50−0,50=0DP=0{,}50-0{,}50=0 ed EO=0,75−0,75=0EO=0{,}75-0{,}75=0; nessun falso positivo in entrambi i gruppi (0,350{,}35 e 0,300{,}30 restano sotto soglia).

Grafico interattivo: Quota di accettati in funzione della soglia per due gruppi (schematico): per ottenere la stessa quota del 50% il gruppo svantaggiato d richiede una soglia più bassa (0,45 contro 0,60)

6. Conclusioni

  • La legge richiede fairness: il GDPR (in particolare art. 22 e considerando 71: misure tecniche e organizzative per evitare effetti discriminatori in base a origine razziale o etnica, opinioni politiche, religione, appartenenza sindacale, stato genetico o di salute, orientamento sessuale) e l'AI Act europeo contengono regole sui sistemi automatici, molte delle quali sono vincoli di fairness. Conviene saperla garantire.
  • «Forzare» la fairness non è sempre ragionevole: nessuna definizione unica, risposte nette rare, nessuno strumento software la risolve per tutti i sistemi; servono conoscenza del dominio e principi generali.
  • Si sta migliorando: nei modelli generativi recenti (immagini di medici e infermieri, cibo e contesti culturali, medicina) i risultati sono più diversificati.

Esercizio: Esercizio - Metriche di fairness e soglie per gruppo.

7. Errori tipici

  • Credere che togliere la colonna sensibile basti (proxy!).
  • Scambiare Demographic Parity ed Equality of Opportunity: la prima confronta i tassi di previsione positiva, la seconda i TPR tra i soli positivi veri.
  • Misurare la fairness solo con l'accuratezza globale: un 70%70\% medio può nascondere errori molto diversi tra gruppi.
  • Dimenticare che le soglie diverse per gruppo e le altre correzioni costano accuratezza e che le due metriche non si possono sempre soddisfare insieme.
  • Dimenticare il segno e l'ordine dei gruppi nelle differenze (aa avvantaggiato meno dd svantaggiato).

Versione ripasso

Esercizi su questo argomento

Lezioni in cui compare

Teoria collegata