Auditing Recorded Predictive Lead Service-Line Classifications Against Physical Verification: A Statewide Study of New York
Questo studio statale di New York rivela che, sebbene i modelli predittivi delle condotte di servizio dei servizi pubblici della maggior parte degli stati siano in linea con le verifiche fisiche, il sistema di New York City mostra una discrepanza statisticamente significativa in cui un modello classifica oltre 43.000 indirizzi come "Altro Noto" nonostante le escavazioni fisiche confermino la presenza di piombo in quasi 121.000 indirizzi, insieme all'evidenza che alcune determinazioni del lato pubblico siano state erroneamente copiate dagli output del modello del lato cliente.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Negli Stati Uniti, una norma federale chiamata Lead and Copper Rule Revisions richiede che ogni sistema idrico comunitario crei una mappa completa delle sue condotte di servizio, i tubi che trasportano l'acqua dalla strada alle singole case. L'obiettivo è trovare e sostituire i tubi fatti di piombo, un metallo tossico che può causare gravi problemi di salute, specialmente nei bambini. Per decenni, le aziende utility sapevano dove si trovavano i tubi di piombo perché avevano vecchi registri cartacei o perché li avevano scavati per controllarli. Ma per milioni di indirizzi dove non esistevano registri, le nuove regole hanno permesso alle compagnie idriche di usare modelli informatici per indovinare il materiale del tubo invece di scavare. Questi modelli analizzano dati come l'età della casa e il quartiere per prevedere se un tubo sia probabilmente di piombo, rame o plastica. L'idea era quella di risparmiare tempo e denaro, poiché scavare per ogni singolo tubo sarebbe incredibilmente costoso. Tuttavia, poiché questi modelli sono supposizioni, le regole richiedono che le utility ne controllino l'accuratezza attraverso l'ispezione fisica di un campione dei tubi che hanno classificato. L'interesse pubblico dipende dal fatto che queste supposizioni informatiche siano abbastanza affidabili da essere affidate alla salute pubblica, o se stiano nascondendo un numero pericoloso di tubi di piombo sotto uno strato di fiducia statistica.
Un ricercatore di nome Muhammad Sarmad Sohail ha deciso di testare questo sistema esaminando i registri pubblici depositati dalle utility idriche in tutto lo Stato di New York. Il New York è unico perché pubblica un elenco dettagliato per ogni singolo indirizzo, mostrando esattamente come l'utility ha determinato il materiale del tubo: se lo ha scavato, se ha controllato un registro cartaceo o se ha usato un modello informatico. Sohail non ha cercato di dimostrare che i modelli informatici fossero sbagliati in senso generale; invece, ha esaminato i numeri specifici depositati dalle utility per vedere se avessero senso. Si è concentrato sulle 153 località del New York che hanno utilizzato questi modelli informatici per almeno 100 indirizzi. Il suo primo passo è stato un controllo semplice: ha contato quante diverse risposte davano i modelli. In un sistema sano, un modello dovrebbe a volte dire "piombo", a volte "rame" e a volte "sconosciuto", a seconda della casa specifica. Ma in 75 di quelle località, che coprono quasi 126.000 indirizzi, il modello dava un'unica risposta singola per ogni singola casa. Era come se un previsore del tempo predicesse la pioggia per ogni singolo giorno dell'anno, indipendentemente dalla stagione o dalla località.
Questa mancanza di varietà non è automaticamente un segno di frode, ma è un segnale di avvertimento che qualcosa non va. Sohail ha poi confrontato questi elenchi a "risposta singola" con le ispezioni fisiche che le stesse utility idriche avevano eseguito in quelle stesse città. Nella maggior parte dei casi, la risposta singola fornita dal modello corrispondeva a ciò che gli operai avevano trovato nel terreno. Tuttavia, in sette luoghi specifici, la risposta singola del modello contraddiceva direttamente ciò che gli operai avevano visto. L'esempio più sorprendente è stato New York City. La città ha usato un modello informatico per classificare 43.215 indirizzi. Per ognuno di quei 43.215 indirizzi, il modello diceva che il tubo era "Known Other" (Altro noto), una categoria che significa che il tubo non è certamente di piombo, anche se il materiale specifico è sconosciuto. La città aveva trovato tubi di piombo in migliaia di altri posti usando metodi diversi, e aveva usato la categoria "sconosciuto" per oltre 120.000 altri indirizzi. Eppure, per questo enorme gruppo di 43.000 case, il modello non aveva mai suggerito che un tubo potesse essere di piombo o anche solo sconosciuto. Era un record perfetto e ininterrotto di "non piombo" per un gruppo di case che includeva molte costruite prima del 1940, un'epoca in cui i tubi di piombo erano comuni.
La contraddizione non era solo un caso statistico; è stata confermata dagli stessi lavoratori della città. Nei cinque distretti di New York City, i lavoratori avevano fisicamente scavato e ispezionato decine di migliaia di tubi, trovando il piombo in numeri significativi. Se il modello informatico avesse funzionato correttamente, avrebbe dovuto segnalare alcuni di quei 43.000 indirizzi come potenzialmente di piombo. Invece, li ha tutti esclusi. Lo stesso strano schema è apparso a East Rochester, un piccolo villaggio a 550 chilometri di distanza con una società idrica completamente diversa. Lì, il modello ha dato una singola risposta "non piombo" per ogni casa che ha classificato, anche se i lavoratori avevano scavato tubi in quel villaggio e avevano trovato il piombo in quasi il 10% di essi. Il ricercatore ha anche scoperto che i registri pubblici della città per questi tubi non erano stati creati in modo indipendente. I dati mostravano che la città aveva semplicemente copiato l'ipotesi informatica fatta per il lato del tubo del cliente e l'aveva incollata sul lato pubblico, anche se il tubo pubblico è un tubo diverso di proprietà della città. Ciò suggerisce che la determinazione non sia stata un'analisi fresca, ma un errore di copia-incolla che ha cancellato qualsiasi incertezza che il modello avrebbe potuto avere.
Per capire quanti tubi di piombo potrebbero nascondersi in quel gruppo di 43.215 indirizzi, il ricercatore ha esaminato l'età degli edifici. Il modello era stato applicato soprattutto a case più recenti, che naturalmente hanno meno tubi di piombo. Tuttavia, anche dopo aver regolato per l'età degli edifici, i numeri non tornavano. Negli edifici più vecchi, dove altri metodi hanno trovato il piombo, il modello non ha trovato nulla. Utilizzando i risultati delle ispezioni fisiche degli stessi quartieri come guida, il ricercatore ha stimato che tra i 1.150 e i 1.450 di quei 43.215 indirizzi abbiano probabilmente tubi di piombo erroneamente etichettati come sicuri. Questa stima si basa sull'assunto che gli operai che hanno scavato i tubi non fossero prevenuti, ma anche con questa incertezza, il divario tra il record perfetto del modello e la realtà del terreno è troppo grande per essere ignorato.
Lo studio non afferma che i modelli informatici non possano mai funzionare, né dice che ogni utility stia fallendo. Ha scoperto che in molti posti, i modelli hanno prodotto una miscela di risposte che corrispondevano alla realtà fisica. Il problema era specifico per il modo in cui i dati venivano riportati in queste sette località. Il ricercatore sostiene che il problema non sia necessariamente il codice informatico in sé, ma come i risultati siano stati gestiti prima di essere pubblicati. È possibile che il modello abbia prodotto una gamma di risposte, ma che un programma informatico o un processo umano abbia filtrato qualsiasi cosa che non fosse un risultato chiaramente "sicuro" prima di depositarlo con lo Stato. Ciò significherebbe che il registro pubblico mostra un elenco pulito e sicuro che nasconde l'incertezza che il modello aveva realmente. Le regole dello Stato richiedono che le utility forniscano un intervallo di confidenza — una misura di quanto siano sicure — e che abbiano un piano per controllare i risultati. I registri depositati da queste utility non mostravano nulla di tutto ciò.
Questo audit è stato possibile solo perché il New York pubblica il metodo utilizzato per ogni singolo indirizzo. In molti altri stati, il pubblico non sa se una classificazione del tubo provenga da una pala o da un foglio di calcolo. Il ricercatore suggerisce che richiedere questo livello di dettaglio a livello nazionale non costerebbe nulla, ma permetterebbe a chiunque di controllare se un'utility sta nascondendo l'incertezza dietro una risposta singola e immutabile. Le scoperte servono da avvertimento: quando un modello produce un risultato perfetto e invariabile attraverso migliaia di case, è probabile che non sia il segno di un modello perfetto, ma il segno che il processo ha perso la capacità di vedere la verità. I dati mostrano che, nel caso più grande, la dichiarazione non soddisfaceva le condizioni stabilite dallo Stato per l'uso di quella specifica etichetta. I ricercatori concludono che gli inventari dovrebbero registrare l'incertezza del modello, non solo la sua ipotesi finale, e che i regolatori dovrebbero trattare un elenco con variazione zero come un segnale di allarme che richiede un'immediata investigazione.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.