La Discriminazione Algoritmica: Cause, Tipologie e Soluzioni di Equità
Classificato in Informatica
Scritto il in
italiano con una dimensione di 3,34 KB
Il problema della discriminazione nelle decisioni algoritmiche
Solo raramente un sistema discrimina in modo esplicito, basando il successo sulle sue caratteristiche vietate come l'etnia o il genere di origine: è il trattamento assurdo. Più specificamente, la discriminazione è indiretta e si manifesta come un impatto insensibile, quando il risultato è probabile che venga fornito a un gruppo senza una giustificazione accettabile.
Le cause principali dei bias
Le cause scatenanti principali sono molteplici:
- Il bias storico: i sistemi supervisionati addestrati su decisioni umane passate ne riproducono i pregiudizi — un sistema di selezione del personale para a emulare il giudizio dei responsabili anziché prevedere la performance, e l'algoritmo dello Home Office britannico ordinava le domande di visto per rischio sulla base dei tassi di rifiuto per nazionalità, fino al ritiro.
- Le variabili proxy: il pregiudizio sopravvive anche escludendo le caratteristiche vietate, se esiste correlazione con altri predittori; il quartiere è una proxy dell’etnia, e nell’algoritmo Optum la spesa sanitaria pregressa, usata come proxy della salute del paziente, è stata usata così da limitare il rischio e la spesa, che è stata investita meno per facilitare l'accesso e non perché i pazienti fossero più sani.
- Il bias insito nei predittori: si verifica quando si usa un predittore favorevole accessibile solo ad alcuni; il VI-SPDAT per l'assegnazione di alloggi a Los Angeles, fondato su informazioni auto-dichiarate, avvantaggiava chi aveva maggiore capacità espositiva.
- Lo squilibrio del campione: un gruppo rappresentato da un sottogruppo esiguo riceve predizioni meno accurate, come nel bias di sotto-diagnosi in sanità.
La scelta dell'algoritmo e della funzione di costo, calibrata sull'accuratezza complessiva, genera l'aggregation bias: buone performance aggregate e cattive in un sottogruppo. Emblematico il caso COMPAS: secondo ProPublica l'accuratezza è stata del 61,2%, con imputati neri più spesso classificati erroneamente ad alto rischio (45% contro 23%) e bianchi erroneamente a basso rischio (48% contro 28%).
Rimedi e soluzioni per l'equità
I rimedi quantitativi combattono su tre livelli:
- Pre-processing sui dati (ricampionamento, con i rischi di overfitting dell'oversampling e di perdita informativa dell'undersampling; rietichettatura; Disparate Impact Removal, che riallinea le distribuzioni preservando l'ordine interno a ciascun gruppo);
- Algoritmo in-processing, con funzioni di costo che incorporano un vincolo di equità;
- Post-elaborazione, con soglie differenziate.
Vi si affiancano rimedi non quantitativi: scomporre il processo decisionale e comprendere le ragioni. La fine del modello non è la decisione perfetta per l'essere umano con la stessa differenza: la via è la combinazione tra giudizio umano e giudizio automatico.