Vai al contenuto
“Le parole restano.”

Che cosa è successo

Nel 2013, nel Wisconsin, Eric Loomis si è dichiarato colpevole di due reati: fuga da un agente di polizia e uso di un veicolo senza il consenso del proprietario. Nel rapporto pre-sentenza allegato al fascicolo compariva anche una valutazione COMPAS, un sistema commerciale di risk assessment sviluppato da Northpointe per stimare il rischio di recidiva e supportare decisioni di gestione, supervisione e trattamento.

Il rapporto classificava Loomis come ad alto rischio nelle tre scale considerate: rischio pre-processuale, rischio generale di recidiva e rischio di recidiva violenta. Il giudice ha richiamato quel risultato insieme ad altri elementi — gravità dei reati, precedenti e storia della supervisione — nel motivare l’esclusione della libertà vigilata. Loomis ha contestato successivamente l’uso del punteggio, sostenendo che la natura proprietaria del sistema gli impedisse di valutarne pienamente l’accuratezza e che il ricorso a dati differenziati anche per genere sollevasse problemi di due process.

Nel 2016 la Corte Suprema del Wisconsin ha confermato la decisione. Ha stabilito che un giudice può considerare COMPAS, ma ne circoscrisse fortemente l’uso: il punteggio non può determinare se una persona debba essere incarcerata, non può determinare la severità della pena e non può essere il fattore decisivo nella valutazione della possibilità di supervisione nella comunità. La Corte ha imposto inoltre che l’uso del sistema sia accompagnato da avvertenze sulla sua natura proprietaria, sui limiti della validazione, sull’impiego di dati di gruppo e sulle questioni sollevate da possibili disparità fra gruppi.

Lo stesso anno ProPublica ha pubblicato un’analisi indipendente su oltre settemila persone arrestate nella contea di Broward, in Florida. L’indagine ha rilevato che gli errori del sistema si distribuivano in modo molto diverso tra imputati neri e bianchi: i primi risultavano più spesso falsamente classificati ad alto rischio, mentre i secondi più spesso falsamente classificati a basso rischio. Northpointe ha contestato l’interpretazione di quei risultati, sostenendo che COMPAS rispettasse altre misure di equità, come la calibrazione e la parità predittiva. La controversia è diventata uno dei casi più citati nel dibattito sulla giustizia algoritmica.

Dove entra il sistema

COMPAS non emette una sentenza e non ordina un arresto. Produce un punteggio che sintetizza informazioni sul profilo e sulla storia di una persona confrontandole con dati di popolazione. Proprio questa distinzione è decisiva: il sistema non “decide” da solo, ma introduce un oggetto numerico dentro un processo istituzionale nel quale quel numero può acquistare peso.

La Corte Suprema del Wisconsin ha ricordato esplicitamente che il punteggio non rappresenta la probabilità individuale che una specifica persona commetta un nuovo reato. Esprime piuttosto il rischio associato a persone con caratteristiche simili. Una misura costruita su gruppi entra così in una decisione che riguarda un individuo concreto. È in questo passaggio — dalla statistica alla persona — che il problema smette di essere soltanto tecnico.

La questione della discriminazione è altrettanto meno semplice di quanto sembri. ProPublica ha messo in evidenza forti differenze nei tassi di falsi positivi e falsi negativi tra gruppi razziali. Northpointe ha replicato che, guardando ad altre metriche, il sistema mostrava una calibrazione simile tra gruppi. Studi successivi hanno chiarito che alcune definizioni di “equità” non possono essere soddisfatte simultaneamente quando i tassi di base differiscono. Di conseguenza, scegliere quale metrica privilegiare non è soltanto una scelta statistica: significa scegliere quali tipi di errore accettare e su chi possono ricadere.

Chi ha deciso

La catena è più lunga del nome “COMPAS”. Northpointe ha progettato e commercializzato il sistema. Il Dipartimento di correzione del Wisconsin lo ha scelto come strumento di valutazione. Il rapporto pre-sentenza lo ha inserito nel fascicolo di Loomis. L’accusa ne ha richiamato i risultati. Il giudice ha deciso quale peso attribuirgli insieme ad altri elementi.

Nessuno di questi passaggi è equivalente agli altri. Ma ciascuno introduce una decisione: acquistare uno strumento, autorizzarne l’uso, scegliere per quale scopo impiegarlo, inserirne l’output nel procedimento, trattarlo come informazione rilevante e infine trasformare o meno quel dato in una conseguenza per la persona sottoposta a giudizio.

Il caso diventa quindi meno interessante se viene raccontato come “un algoritmo che condanna”. La domanda più precisa è: quali istituzioni hanno deciso che quel punteggio potesse entrare nella decisione, con quali limiti e con quale possibilità di contestarlo?

Chi poteva decidere diversamente

Il fornitore avrebbe potuto rendere più trasparenti metodologia e validazioni. L’amministrazione pubblica poteva definire limiti più stretti già nella fase di adozione e pretendere verifiche indipendenti sulla popolazione nella quale il sistema sarebbe stato usato. Il rapporto pre-sentenza poteva presentare con maggiore evidenza i limiti interpretativi del punteggio. Il giudice poteva attribuirgli poco, molto o nessun peso, purché motivasse la decisione attraverso fattori indipendenti.

La Corte Suprema del Wisconsin è intervenuta proprio su questo punto: non ha vietato COMPAS, ma ha trasformato il suo impiego in un uso condizionato. Le avvertenze richieste dalla sentenza mostrano che un sistema può essere tecnicamente disponibile e, nello stesso tempo, non essere considerato adatto a ogni scopo per il quale qualcuno vorrebbe impiegarlo.

Perché questo caso conta

COMPAS è diventato un simbolo della “decisione algoritmica”, ma il suo valore per Dietro la macchina sta quasi nel contrario: mostra quanto sia facile attribuire alla macchina una decisione che resta distribuita tra progettisti, amministrazioni, professionisti e giudici.

Il punto non è sostenere che il punteggio sia irrilevante. Un numero può cambiare il modo in cui una persona viene percepita, soprattutto quando appare all’interno di un documento istituzionale e porta con sé l’autorità del calcolo. Ma proprio per questo occorre distinguere il risultato prodotto dal sistema dal potere che gli esseri umani decidono di assegnargli.

Il dibattito sulla “fairness” aggiunge un secondo livello. Non esiste una singola proprietà matematica chiamata equità capace di risolvere automaticamente il conflitto. Se due metriche ragionevoli possono portare a valutazioni diverse dello stesso sistema, allora qualcuno deve decidere quale errore considera più grave, quale soglia accetta e quale tutela riconosce a chi subisce l’errore. Il problema politico, giuridico e organizzativo non scompare dentro la formula: riappare nella scelta della formula e nel modo in cui la usiamo.

COMPAS non dimostra soltanto che un algoritmo può produrre risultati controversi. Mostra che il significato di quei risultati dipende dalle decisioni prese prima e dopo il calcolo.

Cosa possiamo fare

Se lo usi

Tratta il punteggio come un indicatore limitato, non come una descrizione della persona. Verifica per quale scopo il sistema è stato progettato, su quale popolazione è stato validato, quali errori produce e come quegli errori si distribuiscono. Un modello che ordina correttamente gruppi di rischio non diventa per questo una prova individuale.

Se lo introduci

Definisci prima dell’adozione ciò che il sistema può e non può decidere. Pretendi validazioni indipendenti, procedure di audit, documentazione delle metriche di errore e una regola chiara su chi ha l’autorità di ignorare o correggere il risultato. Se il funzionamento proprietario impedisce verifiche essenziali, il problema non può essere scaricato sull’utente finale: è una scelta di approvvigionamento e di governance.

Se ne subisci gli effetti

Dovrebbe essere possibile conoscere quali dati sono stati utilizzati, correggere informazioni errate, sapere che ruolo ha avuto il punteggio nella decisione e ottenere una motivazione fondata anche su elementi indipendenti dal sistema. La possibilità di contestare l’input senza poter capire il peso dell’output può non essere sufficiente quando la decisione produce conseguenze rilevanti sulla vita di una persona.

Fonti e documenti

Fonte primaria: Supreme Court of Wisconsin, State v. Eric L. Loomis, 2016 WI 68.

Analisi giornalistica: ProPublica, Machine Bias e metodologia dell’analisi. Per la controversia con Northpointe: risposta di ProPublica alle critiche dell’azienda.

Posizione del produttore: equivant — raccolta di white paper e studi su COMPAS, inclusi COMPAS Risk Scales: Demonstrating Accuracy Equity and Predictive Parity e altri documenti di risposta alla controversia.

Ricerca successiva: Julie Dressel e Hany Farid, The accuracy, fairness, and limits of predicting recidivism, Science Advances, 2018; Alexandra Chouldechova, Fair Prediction with Disparate Impact, Big Data, 2017.