Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling
Dit artikel presenteert een op ontwerp gebaseerd meetsysteem dat ML-ondersteunde waarschijnlijkheidssteekproeven combineert met LLM-labeling om de prevalentie van beleidsovertredende inhoud over verschillende gebruikerssegmenten heen efficiënt en nauwkeurig te schatten, terwijl de statistische onbevooroordeeldheid en kosteneffectiviteit behouden blijven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Op de uitgestrekte digitale landschappen waar miljarden mensen dagelijks foto's, ideeën en verhalen delen, blijft een stille maar cruciale uitdaging bestaan: hoe weet je wat je gebruikers werkelijk te zien krijgen? Jarenlang hebben platforms vertrouwd op gebruikersrapportages om schadelijke inhoud te signaleren, maar deze methode is als het proberen te meten van de diepte van een rivier door alleen de mensen te tellen die om hulp roepen. Veel gevaren worden niet gerapporteerd omdat gebruikers ze niet opmerken, niet weten hoe ze ze moeten rapporteren, of simpelweg niet met het systeem willen in interactie treden. Om de veiligheid van een platform werkelijk te begrijpen, moeten teams prevalentie meten — de werkelijke fractie van de keren dat een gebruiker content tegenkomt die de regels overtreedt. Dit vereist het bekijken van de gehele stroom aan content, niet alleen de delen die al zijn gemarkeerd. Het probleem is dat schadelijke content vaak zeldzaam is, en het handmatig controleren van elk item is te traag en te duur om elke dag te doen.
Een team onderzoekers bij Pinterest heeft een nieuwe manier ontwikkeld om dit op te lossen, door een systeem te creëren dat slimme bemonstering combineert met geavanceerde kunstmatige intelligentie om veiligheid met ongekende snelheid en nauwkeurigheid te meten. In plaats van te wachten op klachten, nemen ze een dagelijkse, representatieve snapshot op van alles wat aan gebruikers wordt getoond. Ze gebruiken een statistische methode die hun beperkte controlebudget richt op de meest waarschijnlijke kandidaten voor overtredingen, waardoor ze genoeg voorbeelden vinden om zeker te zijn van hun cijfers zonder alles te hoeven controleren. Vervolgens gebruiken ze een groot taalmodel — een AI die getraind is om tekst en afbeeldingen te begrijpen — om deze monsters te labelen, waarbij het fungeert als een onvermoeibare, consistente beoordelaar. Door deze technieken te combineren, kunnen ze een dagelijks rapport produceren over hoe vaak gebruikers schadelijke content zien, compleet met een maatstaf voor hoe precies dat getal is. Dit stelt veiligheidsteams in staat om opkomende problemen onmiddellijk te signaleren, te testen of hun oplossingen werken, en precies te begrijpen waar en wanneer risico's verschijnen, zonder te hoeven wachten tot menselijke beoordelaars wekenlang achterlopen.
De kern van dit systeem is een slimme manier om te kiezen welke stukken content onderzocht moeten worden. In een zee van miljarden dagelijkse weergaven is het vinden van een zeldzame overtreding als het zoeken naar een specifiek type blad in een bos. Als je willekeurig bladeren kiest, loop je misschien kilometers zonder iets te vinden. De onderzoekers gebruiken in plaats daarvan een "gewogen" benadering. Ze kijken naar twee belangrijke aanwijzingen: hoe vaak een stuk content aan mensen is getoond, en een risicoscore gegenereerd door de bestaande veiligheidsmodellen van het platform. Ze combineren deze aanwijzingen om een lijst te maken waarbij items die zowel populair als riskant zijn, een grotere kans hebben om voor controle te worden gekozen. Dit betekent niet dat ze alleen riskante items controleren; ze kiezen nog steeds uit de hele populatie, maar ze sturen de kansen iets bij om ervoor te zorgen dat ze genoeg voorbeelden van overtredingen krijgen om een solide statistische schatting te maken. Deze methode stelt hen in staat om een vast aantal controles per dag uit te voeren en toch een helder beeld van het hele platform te krijgen, zelfs wanneer overtredingen extreem zeldzaam zijn.
Zodra het systeem de dagelijkse steekproef heeft geselecteerd, gaat het over naar de labelingsfase. Hier hebben de onderzoekers het traditionele menselijke beoordelingsproces vervangen door een multimodale groot taalmodel. Deze AI kan naar een afbeelding kijken, de tekst lezen en de context begrijpen, net als een menselijke moderator. De onderzoekers lieten de AI echter niet simpelweg beslissen; ze bouwden een rigoureus kwaliteitscontrolesysteem rondom het model. Voordat de AI de dagelijkse monsters mag labelen, wordt deze getest tegen een "gold set" van content die zorgvuldig is beoordeeld door menselijke experts. De AI moet de beslissingen van de menselijke experts matchen binnen een zeer nauwe foutmarge voordat deze wordt ingezet. Eenmaal live blijft het systeem het werk van de AI controleren door een willekeurige selectie van de dagelijkse labels terug te sturen naar menselijke experts voor verificatie. Dit zorgt ervoor dat de AI niet afdwaalt of systematische fouten maakt over de tijd. Het resultaat is een labelingsproces dat ongeveer vijftien keer sneller is dan een proces met alleen menselijke beoordeling en meer dan tien keer minder kost, terwijl een vergelijkbaar niveau van nauwkeurigheid behouden blijft.
De kracht van deze aanpak ligt in het vermogen om een enkel, verenigd overzicht van het platform te bieden dat op veel verschillende manieren kan worden geanalyseerd. Omdat de onderzoekers elke dag één globale steekproef trekken, kunnen ze onmiddellijk antwoord geven op vragen over hoe de veiligheid varieert per regio, per type contentoppervlak of per ouderdom van de content, zonder voor elke vraag een nieuwe studie te hoeven uitvoeren. Ze kunnen zien of een nieuwe beleidswijziging werkt door de cijfers voor en na de wijziging te vergelijken, of dat een specifiek type schadelijke content piekt in een bepaat land. Het systeem berekent ook een betrouwbaarheidsinterval voor elk geproduceerd getal, wat het veiligheidsteam vertelt hoeveel vertrouwen zij in het resultaat kunnen stellen. Als het getal gebaseerd is op zeer weinig voorbeelden van een zeldzame overtreding, zal het betrouwbaarheidsinterval breed zijn, wat signaleert dat het team moet wachten op meer data voordat ze een belangrijke beslissing nemen.
De onderzoekers hebben dit systeem uitgebreid getest, zowel in simulaties als in hun werkelijke productieomgeving bij Pinterest, waar het al meer dan een jaar dagelijks draait. Ze ontdekten dat door hun ML-ondersteunde bemonsteringsmethode te gebruiken, ze zes tot elf keer meer overtredingen in hun dagelijkse steekproef konden vinden vergeleken met een standaard willekeurige bemonsteringsmethode. Deze efficiëntie betekende dat ze hetzelfde niveau van statistische precisie konden bereiken met veel minder controles, of veel nauwkeurigere, betrouwbaardere cijfers konden krijgen met dezelfde hoeveelheid werk. Ze toonden ook aan dat zelfs wanneer de onderliggende risicoscores die de bemonstering sturen in de loop van de tijd veranderden of minder nauwkeurig werden, de uiteindelijke schattingen van het systeem onbevooroordeeld bleven. De fouten uitten zich als bredere betrouwbaarheidsintervallen in plaats van foutieve antwoorden, wat een cruciaal onderscheid is voor besluitvormers die moeten weten wanneer een trend echt is en wanneer het slechts ruis is.
Een van de belangrijkste bevindingen was hoe het systeem omgaat met de onvermijdelijke fouten die gepaard gaan met automatische labeling. De onderzoekers ontdekten dat bij zeer zeldzame overtredingen het grootste risico niet het missen van een overtreding is, maar het onterecht markeren van veilige content als schadelijk. Eén enkele fout-positieve melding in een zee van veilige content kan het laten lijken alsof een probleem tien keer erger is dan het in werkelijkheid is. Om dit te beheersen, monitort het systeem constant het percentage fout-positieve meldingen van de AI. Als dit percentage te hoog wordt, kan het systeem een wiskundige correctie toepassen op de definitieve cijfers om voor de fout te compenseren, of het kan een menselijke controle triggeren van de specifieke items die de piek veroorzaken. Dit zorgt ervoor dat de dagelijkse rapporten de werkelijkheid weerspiegelen in plaats van de eigenaardigheden van het AI-model. Het team merkte ook op dat dagelijkse schommelingen in de cijfers vaak werden gedreven door veranderingen in de typen geposteerde content of subtiele verschuivingen in de interpretatie van de regels door de AI, in plaats van door werkelijke veranderingen in de veiligheidsniveaus. Door deze kortstondige variaties uit te middelen en zich te concentreren op wekelijkse trends, konden ze onderscheid maken tussen normale ruis en echte, opkomende dreigingen.
Dit werk vertegenwoordigt een verschuiving in hoe digitale platforms veiligheid monitoren, van een reactief model gebaseerd op gebruikersklachten naar een proactieve, datagestuurde aanpak. Door veiligheidsmeting te behandelen als een statistische wetenschap in plaats van alleen een handhavingsopdracht, hebben de onderzoekers een instrument gecreëerd dat problemen kan detecteren op het moment dat ze beginnen te verschijnen. Het systeem is ontworpen om flexibel te zijn, waardoor teams snel nieuwe regels kunnen toevoegen of parameters kunnen aanpassen naarmate het landschap van online content verandert. Het rust op een continue lus van bemonstering, AI-labeling, menselijke verificatie en statistische analyse, wat een feedbackloop creëert die snel genoeg is om het tempo van het internet bij te houden. De onderzoekers benadrukken dat dit systeem geen vervanging is voor menselijk oordeel of beleidshandhaving, maar een complementair hulpmiddel dat de helderheid biedt die nodig is om die beslissingen effectief te nemen. Het maakt het onzichtbare zichtbaar en geeft veiligheidsteams de ogen die ze nodig hebben om de werkelijke staat van hun platforms te begrijpen en hun gebruikers met grotere precisie en snelheid te beschermen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.