← Ultimi articoli
📊 statistics

Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling

Questo articolo presenta un sistema di misurazione basato sul design che combina il campionamento probabilistico assistito da ML con l'etichettatura tramite LLM per stimare in modo efficiente e accurato la prevalenza di contenuti che violano le policy attraverso vari segmenti di utenti, mantenendo al contempo l'assenza di pregiudizi statistici e l'efficacia dei costi.

Autori originali: Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

Pubblicato 2026-08-18
📖 8 min di lettura🧠 Approfondimento

Autori originali: Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Sui vasti paesaggi digitali dove miliardi di persone condividono foto, idee e storie ogni giorno, persiste una sfida silenziosa ma critica: come si può sapere cosa vedono realmente i propri utenti? Per anni, le piattaforme si sono affidate alle segnalazioni degli utenti per segnalare contenuti dannosi, ma questo metodo è come cercare di misurare la profondità di un fiume contando solo le persone che gridano per chiedere aiuto. Molti pericoli passano inosservati perché gli utenti non li notano, non sanno come segnalarli o semplicemente non vogliono interagire con il sistema. Per comprendere veramente la sicurezza di una piattaforma, i team devono misurare la prevalenza — ovvero la frazione effettiva di volte in cui un utente incontra contenuti che violano le regole. Ciò richiede l'analisi dell'intero flusso di contenuti, non solo delle parti che sono già state segnalate. Il problema è che i contenuti dannosi sono spesso rari, e controllare ogni singolo elemento manualmente è troppo lento ed costoso per essere fatto ogni giorno.

Un team di ricercatori di Pinterest ha sviluppato un nuovo modo per risolvere questo problema, creando un sistema che combina un campionamento intelligente con un'intelligenza artificiale avanzata per misurare la sicurezza con una velocità e un'accuratezza senza precedenti. Invece di aspettare i reclami, effettuano ogni giorno un'istantanea rappresentativa di tutto ciò che viene mostrato agli utenti. Utilizzano un metodo statistico che concentra il loro budget limitato di controllo sui candidati più probabili per una violazione, assicurando di trovare abbastanza esempi per essere certi dei propri numeri senza dover controllare tutto. Successivamente, utilizzano un modello linguistico di grandi dimensioni — un'IA addestrata a comprendere testi e immagini — per etichettare questi campioni, agendo come un revisore instancabile e coerente. Combinando queste tecniche, possono produrre un rapporto giornaliero su quanto spesso gli utenti vedano contenuti dannosi, completo di una misura di quanto sia precisa tale cifra. Ciò consente ai team di sicurezza di individuare i problemi emergenti immediatamente, testare se le loro correzioni stanno funzionando e capire esattamente dove e quando compaiono i rischi, il tutto senza dover aspettare settimane che i revisori umani si riprendano.

Il cuore di questo sistema è un modo intelligente di scegliere quali pezzi di contenuto esaminare. In un mare di miliardi di visualizzazioni quotidiane, trovare una violazione rara è come cercare un tipo specifico di foglia in una foresta. Se si scelgono foglie a caso, si potrebbe camminare per miglia senza trovare nulla. I ricercatori utilizzano invece un approccio "pesato". Osservano due indizi principali: quante volte un contenuto è stato mostrato alle persone e un punteggio di rischio generato dai modelli di sicurezza esistenti della piattaforma. Combinano questi indizi per creare una lista in cui gli elementi che sono sia popolari che rischiosi hanno maggiori probabilità di essere scelti per la revisione. Questo non significa che controllano solo gli elementi rischiosi; scelgono comunque dall'intera popolazione, ma inclinano leggermente le probabilità per garantire di ottenere abbastanza esempi di violazioni per fare una solida stima statistica. Questo metodo permette loro di utilizzare un numero fisso di controlli ogni giorno e ottenere comunque un quadro chiaro dell'intera piattaforma, anche quando le violazioni sono estremamente rare.

Una volta che il sistema ha selezionato il suo campione giornaliero, passa alla fase di etichettatura. Qui, i ricercatori hanno sostituito il tradizionale processo di revisione umana con un modello linguistico di grandi dimensioni multimodale. Questa IA può guardare un'immagine, leggere il testo e comprenderne il contesto, proprio come un moderatore umano. Tuttavia, i ricercatori non si sono limitati a lasciare che l'IA decidesse; hanno costruito un rigoroso sistema di controllo della qualità attorno ad essa. Prima che l'IA sia autorizzata a etichettare i campioni giornalieri, viene testata contro un "gold set" di contenuti che sono stati attentamente revisionati da esperti umani. L'IA deve corrispondere alle decisioni degli esperti umani entro un margine di errore molto stretto prima di essere attivata. Una volta operativa, il sistema continua a controllare il lavoro dell'IA inviando una selezione casuale dei suoi etichette giornaliere agli esperti umani per la verifica. Ciò assicura che l'IA non derivi o commetta errori sistematici nel tempo. Il risultato è un processo di etichettatura che è circa quindici volte più veloce della sola revisione umana e costa più di dieci volte meno, mantenendo un livello di accuratezza simile.

La forza di questo approccio risiede nella sua capacità di fornire una visione unica e unificata della piattaforma che può essere suddivisa e analizzata in molti modi diversi. Poiché i ricercatori estraggono un unico campione globale ogni giorno, possono rispondere immediatamente a domande su come la sicurezza vari per regione, per tipo di superficie di contenuto o per l'età del contenuto, senza dover eseguire un nuovo studio per ogni domanda. Possono vedere se un aggiornamento delle politiche sta funzionando confrontando i numeri prima e dopo, o se un tipo specifico di contenuto dannoso sta aumentando in un particolare paese. Il sistema calcola anche un intervallo di confidenza per ogni numero prodotto, il che dice al team di sicurezza quanto fiducia riporre nel risultato. Se il numero si basa su pochissimi esempi di una violazione rara, l'intervallo di confidenza sarà ampio, segnalando al team che deve attendere ulteriori dati prima di prendere una decisione importante.

I ricercatori hanno testato ampiamente questo sistema, sia in simulazioni che nel loro ambiente di produzione reale a Pinterest, dove è in funzione quotidianamente da oltre un anno. Hanno scoperto che utilizzando il loro metodo di campionamento assistito da ML, potevano trovare da sei a undici volte più violazioni nel loro campione giornaliero rispetto a un metodo di campionamento casuale standard. Questa efficienza ha significato che potevano raggiungere lo stesso livello di precisione statistica con molti meno controlli, o ottenere numeri molto più stretti e affidabili con lo stesso lavoro. Hanno anche dimostrato che anche quando i punteggi di rischio sottostanti utilizzati per guidare il campionamento cambiavano o diventavano meno accurati nel tempo, le stime finali del sistema rimanevano non influenzate da bias. Gli errori si manifestavano come intervalli di confidenza più ampi piuttosto che come risposte errate, il che è una distinzione cruciale per i decisori che devono sapere quando una tendenza è reale e quando è solo rumore.

Uno dei risultati più significativi è stato come il sistema gestisce gli inevitabili errori che derivano dall'etichettatura automatizzata. I ricercatori hanno scoperto che per le violazioni molto rare, il rischio maggiore non è mancare una violazione, ma segnalare erroneamente come dannoso un contenuto sicuro. Un singolo falso positivo in un mare di contenuti sicuri può far sembrare che un problema sia dieci volte peggiore di quanto non sia in realtà. Per gestire questo, il sistema monitora costantemente il tasso di falsi positivi dell'IA. Se il tasso diventa troppo alto, il sistema può applicare una correzione matematica ai numeri finali per tenere conto dell'errore, oppure può innescare una revisione umana degli elementi specifici che causano il picco. Ciò assicura che i rapporti giornalieri riflettano la realtà piuttosto che le stranezze del modello di IA. Il team ha anche scoperto che le fluttuazioni giorno per giorno nei numeri erano spesso guidate da cambiamenti nei tipi di contenuti pubblicati o da sottili spostamenti nell'interpretazione delle regole da parte dell'IA, piuttosto che da cambiamenti reali nei livelli di sicurezza. Mitigando queste variazioni a breve termine e concentrandosi sulle tendenze settimanali, sono riusciti a distinguere tra il normale rumore e le vere minacce emergenti.

Questo lavoro rappresenta un cambiamento nel modo in cui le piattaforme digitali monitorano la sicurezza, passando da un modello reattivo basato sui reclami degli utenti a un approccio proattivo e basato sui dati. Trattando la misurazione della sicurezza come una scienza statistica piuttosto che come un semplice compito di applicazione delle regole, i ricercatori hanno creato uno strumento in grado di rilevare i problemi nel momento stesso in cui iniziano ad apparire. Il sistema è progettato per essere flessibile, consentendo ai team di aggiungere rapidamente nuove politiche o regolare i parametri man mano che il panorama dei contenuti online cambia. Si basa su un ciclo continuo di campionamento, etichettatura tramite IA, verifica umana e analisi statistica, creando un ciclo di feedback abbastanza veloce da stare al passo con la velocità di Internet. I ricercatori sottolineano che questo sistema non è un sostituto del giudizio umano o dell'applicazione delle politiche, ma uno strumento complementare che fornisce la chiarezza necessaria per prendere tali decisioni in modo efficace. Esso rende visibile l'invisibile, dando ai team di sicurezza gli occhi necessari per comprendere lo stato reale delle loro piattaforme e proteggere i propri utenti con maggiore precisione e velocità.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →