← Neueste Arbeiten
📊 statistics

Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling

Dieses Papier präsentiert ein designbasiertes Messsystem, das ML-gestützte Wahrscheinlichkeitsstichproben mit LLM-Labeling kombiniert, um die Prävalenz von richtlinienwidrigen Inhalten über verschiedene Nutzersegmente hinweg effizient und genau zu schätzen, während gleichzeitig statistische Unvoreingenommenheit und Kosteneffizienz gewahrt bleiben.

Ursprüngliche Autoren: Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

Veröffentlicht 2026-08-18
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Auf den riesigen digitalen Landschaften, auf denen täglich Milliarden von Menschen Fotos, Ideen und Geschichten teilen, besteht eine stille, aber kritische Herausforderung: Wie weiß man, was die Nutzer tatsächlich sehen? Jahrelang haben sich Plattformen auf Nutzerberichte verlassen, um schädliche Inhalte zu melden, aber diese Methode ist wie der Versuch, die Tiefe eines Flusses zu messen, indem man nur die Menschen zählt, die um Hilfe schreien. Viele Gefahren werden nicht gemeldet, weil Nutzer sie nicht bemerken, nicht wissen, wie man sie meldet, oder einfach nicht mit dem System interagieren wollen. Um die Sicherheit einer Plattform wirklich zu verstehen, müssen Teams die Prävalenz messen – also den tatsächlichen Anteil der Fälle, in denen ein Nutzer auf Inhalte stößt, die gegen die Regeln verstoßen. Dies erfordert die Betrachtung des gesamten Inhaltsstroms, nicht nur der Teile, die bereits gemeldet wurden. Das Problem ist, dass schädliche Inhalte oft selten sind und das Überprüfen jedes einzelnen Elements von Hand zu langsam und zu teuer wäre, um dies täglich zu tun.

Ein Forscherteam bei Pinterest hat einen neuen Weg entwickelt, um dieses Problem zu lösen, indem es ein System erschuf, das intelligentes Sampling mit fortschrittlicher künstlicher Intelligenz kombiniert, um Sicherheit mit beispielloser Geschwindigkeit und Genauigkeit zu messen. Anstatt auf Beschwerden zu warten, erstellen sie eine tägliche, repräsentative Momentaufnahme von allem, was den Nutzern gezeigt wird. Sie verwenden eine statistische Methode, die ihr begrenztes Prüfbudget auf die wahrscheinlichsten Kandidaten für Verstöße konzentriert und so sicherstellt, dass sie genügend Beispiele finden, um sich ihrer Zahlen sicher zu sein, ohne alles überprüfen zu müssen. Dann nutzen sie ein Large Language Model – eine KI, die darauf trainiert ist, Text und Bilder zu verstehen – um diese Stichproben zu labeln, was als unermüdlicher, beständiger Prüfer fungiert. Durch die Kombination dieser Techniken können sie einen täglichen Bericht darüber erstellen, wie oft Nutzer schädliche Inhalte sehen, ergänzt um ein Maß dafür, wie präzise diese Zahl ist. Dies ermöglicht es den Safety-Teams, aufkommende Probleme sofort zu erkennen, zu testen, ob ihre Korrekturen funktionieren, und genau zu verstehen, wo und wann Risiken auftreten, ohne darauf warten zu müssen, dass menschliche Prüfer aufholen.

Der Kern dieses Systems ist eine kluge Art und Weise, welche Stücke von Inhalten untersucht werden sollen. In einem Meer von Milliarden täglicher Aufrufe ist das Finden eines seltenen Verstoßes wie die Suche nach einer bestimmten Art von Blatt in einem Wald. Wenn man Blätter zufällig auswählt, läuft man vielleicht meilenweit und findet nichts. Die Forscher verwenden stattdessen einen „gewichteten“ Ansatz. Sie schauen auf zwei Hauptindikatoren: wie oft ein Stück Inhalt Menschen gezeigt wurde, und einen Risiko-Score, der von den bestehenden Sicherheitsmodellen der Plattform generiert wird. Sie kombinieren diese Hinweise, um eine Liste zu erstellen, in der Artikel, die sowohl populär als auch riskant sind, eine höhere Wahrscheinlichkeit haben, für eine Überprüfung ausgewählt zu werden. Dies bedeutet nicht, dass sie nur riskante Artikel prüfen; sie wählen immer noch aus der gesamten Population aus, aber sie neigen die Chancen leicht zu, um sicherzustellen, dass sie genügend Beispiele für Verstöße erhalten, um eine solide statistische Schätzung abzugeben. Diese Methode ermöglicht es ihnen, eine feste Anzahl von Prüfungen pro Tag durchzuführen und dennoch ein klares Bild der gesamten Plattform zu erhalten, selbst wenn Verstöße extrem selten sind.

Sobald das System seine tägliche Stichprobe ausgewählt hat, geht es in die Labeling-Phase über. Hier ersetzten die Forscher den traditionellen menschlichen Review-Prozess durch ein multimodales Large Language Model. Diese KI kann ein Bild betrachten, den Text lesen und den Kontext verstehen, genau wie ein menschlicher Moderator. Die Forscher ließen die KI jedoch nicht einfach entscheiden; sie bauten ein strenges Qualitätskontrollsystem um sie herum auf. Bevor die KI erlaubt ist, die täglichen Stichproben zu labeln, wird sie gegen ein „Gold Set“ von Inhalten getestet, die sorgfältig von menschlichen Experten überprüft wurden. Die KI muss die Entscheidungen der menschlichen Experten innerhalb einer sehr engen Fehlermarge treffen, bevor sie aktiviert wird. Sob einmal live, überprüft das System kontinuierlich die Arbeit der KI, indem es eine Zufallsauswahl der täglichen Labels zur Verifizierung an menschliche Experten zurücksendet. Dies stellt sicher, dass die KI nicht driftet oder systematische Fehler macht. Das Ergebnis ist ein Labeling-Prozess, der etwa fünfzehnmal schneller ist als ein reiner Human-Review und zehnmal weniger kostet, während er ein ähnliches Maß an Genauigkeit beibehält.

Die Stärke dieses Ansatzes liegt in seiner Fähigkeit, eine einzige, einheitliche Sicht auf die Plattform zu bieten, die in vielen verschiedenen Arten zerlegt und analysiert werden kann. Da die Forscher jeden Tag eine globale Stichprobe ziehen, können sie sofort Fragen beantworten, wie die Sicherheit je nach Region, nach der Art der Content-Oberfläche oder nach dem Alter des Inhalts variiert, ohne eine neue Studie für jede Frage durchführen zu müssen. Sie können sehen, ob ein neues Policy-Update funktioniert, indem sie die Zahlen vor und nach dem Update vergleichen, oder ob eine bestimmte Art von schädlichem Inhalt in einem bestimmten Land sprunghaft ansteigt. Das System berechnet auch ein Konfidenzintervall für jede produzierte Zahl, das dem Safety-Team sagt, wie viel Vertrauen es in das Ergebnis setzen kann. Wenn die Zahl auf sehr wenigen Beispielen eines seltenen Verstoßes basiert, wird das Konfidenzintervall weit sein, was signalisiert, dass das Team warten sollte, bis mehr Daten vorliegen, bevor es eine wichtige Entscheidung trifft.

Die Forscher testeten dieses System umfassend, sowohl in Simulationen als auch in ihrer tatsächlichen Produktionsumgebung bei Pinterest, wo es seit über einem Jahr täglich läuft. Sie fanden heraus, dass sie durch die Verwendung ihrer ML-gestützten Sampling-Methode in ihrer täglichen Stichprobe sechs- bis elfmal mehr Verstöße finden konnten als mit einer Standard-Random-Sampling-Methode. Diese Effizienz bedeutete, dass sie das gleiche Niveau an statistischer Präzision mit viel weniger Prüfungen erreichen konnten oder viel dichtere, zuverlässigere Zahlen mit der gleichen Menge an Arbeit erhielten. Sie zeigten auch, dass selbst wenn sich die zugrunde liegenden Risiko-Scores, die das Sampling leiten, im Laufe der Zeit änderten oder weniger genau wurden, die endgültigen Schätzungen des Systems unverzerrt blieben. Die Fehler zeigten sich als breitere Konfidenzintervalle statt als falsche Antworten, was ein entscheidender Unterschied für Entscheidungsträger ist, die wissen müssen, wann ein Trend real ist und wann er nur Rauschen ist.

Eine der bedeutendsten Erkenntnisse war, wie das System mit den unvermeidlichen Fehlern umgeht, die mit automatisiertem Labeling einhergehen. Die Forscher entdeckten, dass bei sehr seltenen Verstößen das größte Risiko nicht darin besteht, einen Verstoß zu übersehen, sondern harmlose Inhalte fälschlicherweise als schädlich zu markieren. Ein einztes False Positive in einer Menge sicherer Inhalte kann es so aussehen lassen, als sei ein Problem zehnmal schlimmer, als es tatsächlich ist. Um dies zu managen, überwacht das System ständig die False-Positive-Rate der KI. Wenn die Rate zu hoch wird, kann das System eine mathematische Korrektur auf die endgültigen Zahlen anwenden oder eine menschliche Überprüfung der spezifischen Artikel auslösen, die den Anstieg verursachen. Dies stellt sicher, dass die täglichen Berichte die Realität widerspiegeln und nicht die Eigenheiten des KI-Modells. Das Team fand auch heraus, dass tägliche Schwankungen in den Zahlen oft durch Änderungen in den Arten der geposteten Inhalte oder subtile Verschiebungen in der Interpretation der Regeln durch die KI getrieben wurden, statt durch tatsächliche Änderungen des Sicherheitsniveaus. Durch das Glätten dieser kurzfristigen Variationen und die Konzentration auf wöchentliche Trends konnten sie zwischen normalem Rauschen und echten, aufkommenden Bedrohungen unterscheiden.

Diese Arbeit stellt einen Wandel in der Art und Weise dar, wie digitale Plattformen Sicherheit überwachen – weg von einem reaktiven Modell, das auf Nutzerbeschwerden basiert, hin zu einem proaktiven, datengesteuerten Ansatz. Indem sie die Messung von Sicherheit als eine statistische Wissenschaft und nicht nur als eine Durchsetzungsaufgabe behandeln, haben die Forscher ein Werkzeug geschaffen, das Probleme erkennen kann, sobald sie auftauchen. Das System ist darauf ausgelegt, flexibel zu sein, sodass Teams schnell neue Richtlinien hinzufügen oder Parameter anpassen können, während sich die Landschaft der Online-Inhalte verändert. Es beruht auf einem kontinuierlichen Kreislauf aus Sampling, KI-Labeling, menschlicher Verifizierung und statistischer Analyse und schafft so eine Feedbackschleife, die schnell genug ist, um mit der Geschwindigkeit des Internets Schritt zu halten. Die Forscher betonen, dass dieses System keinen Ersatz für menschliches Urteilsvermögen oder die Durchsetzung von Richtlinien darstellt, sondern ein ergänzendes Werkzeug ist, das die Klarheit liefert, die notwendig ist, um diese Entscheidungen effektiv zu treffen. Es macht das Unsichtbare sichtbar und gibt den Safety-Teams die Augen an die Hand, die sie brauchen, um den wahren Zustand ihrer Plattformen zu verstehen und ihre Nutzer mit größerer Präzision und Geschwindigkeit zu schützen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →