← Derniers articles
📊 statistics

Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling

Cet article présente un système de mesure basé sur la conception qui combine l'échantillonnage probabiliste assisté par l'apprentissage automatique avec l'étiquetage par LLM afin d'estimer efficacement et précisément la prévalence des contenus violant les politiques à travers divers segments d'utilisateurs, tout en maintenant l'absence de biais statistique et la rentabilité.

Auteurs originaux : Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

Publié 2026-08-18
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Sur les vastes paysages numériques où des milliards de personnes partagent des photos, des idées et des histoires chaque jour, un défi discret mais critique persiste : comment savoir ce que vos utilisateurs voient réellement ? Pendant des années, les plateformes se sont appuyées sur les signalements des utilisateurs pour signaler le contenu préjudiciable, mais cette méthode revient à essayer de mesurer la profondeur d'une rivière en comptant seulement les personnes qui appellent à l'aide. De nombreux dangers ne sont pas signalés parce que les utilisateurs ne les remarquent pas, ne savent pas comment les signaler, ou ne souhaitent tout simplement pas s'engager dans le système. Pour comprendre véritablement la sécurité d'une plateforme, les équipes doivent mesurer la prévalence — la fraction réelle de fois où un utilisateur rencontre un contenu qui enfreint les règles. Cela nécessite d'examiner l'ensemble du flux de contenu, et non seulement les parties qui ont déjà été signalées. Le problème est que le contenu préjudiciable est souvent rare, et vérifier chaque élément à la main est trop lent et trop coûteux pour être fait quotidiennement.

Une équipe de chercheurs chez Pinterest a développé une nouvelle façon de résoudre ce problème, en créant un système qui combine un échantillonnage intelligent avec une intelligence artificielle avancée pour mesurer la sécurité avec une vitesse et une précision sans précédent. Au lieu d'attendre les plaintes, ils prennent chaque jour un instantané représentatif de tout ce qui est montré aux utilisateurs. Ils utilisent une méthode statistique qui concentre leur budget de vérification limité sur les candidats les plus susceptibles de constituer une violation, garantissant ainsi qu'ils trouvent suffisamment d'exemples pour être sûrs de leurs chiffres sans avoir à tout vérifier. Ensuite, ils utilisent un grand modèle de langage — une IA entraînée à comprendre le texte et les images — pour étiqueter ces échantillons, agissant comme un réviseur infatigable et cohérent. En combinant ces techniques, ils peuvent produire un rapport quotidien sur la fréquence à laquelle les utilisateurs voient du contenu préjudiciable, complet avec une mesure de la précision de ce nombre. Cela permet aux équipes de sécurité de repérer les problèmes émergents immédiatement, de tester si leurs correctifs fonctionnent et de comprendre exactement où et quand les risques apparaissent, le tout sans attendre des semaines que les réviseurs humains rattrapent le retard.

Le cœur de ce système est une manière ingénieuse de choisir les morceaux de contenu à examiner. Dans une mer de milliards de vues quotidiennes, trouver une violation rare est comme chercher un type spécifique de feuille dans une forêt. Si vous choisissez des feuilles au hasard, vous pourriez marcher des kilomètres sans rien trouver. Les chercheurs utilisent plutôt une approche « pondérée ». Ils observent deux indices principaux : le nombre de fois qu'un contenu a été montré aux gens, et un score de risque généré par les modèles de sécurité existants de la plateforme. Ils combinent ces indices pour créer une liste où les éléments qui sont à la fois populaires et risqués sont plus susceptibles d'être choisis pour examen. Cela ne signifie pas qu'ils ne vérifient que les éléments risqués ; ils choisissent toujours parmi l'ensemble de la population, mais ils inclinent légèrement les probabilités pour s'assurer d'obtenir suffisamment d'exemples de violations pour établir une estimation statistique solide. Cette méthode leur permet d'utiliser un nombre fixe de vérifications chaque jour et de toujours obtenir une image claire de l'ensemble de la plateforme, même lorsque les violations sont extrêmement rares.

Une fois que le système a sélectionné son échantillon quotidien, il passe à la phase d'étiquetage. Ici, les chercheurs ont remplacé le processus traditionnel de révision humaine par un grand modèle de langage multimodal. Cette IA peut regarder une image, lire le texte et comprendre le contexte, tout comme un modérateur humain. Cependant, les chercheurs n'ont pas simplement laissé l'IA décider ; ils ont construit un système de contrôle de qualité rigoureux autour d'elle. Avant que l'IA ne soit autorisée à étiqueter les échantillons quotidiens, elle est testée par rapport à un « ensemble d'or » (gold set) de contenus qui ont été soigneusement examinés par des experts humains. L'IA doit correspondre aux décisions des experts humains avec une marge d'erreur très étroite avant d'être activée. Une fois en service, le système continue de vérifier le travail de l'IA en renvoyant une sélection aléatoire de ses étiquettes quotidiennes à des experts humains pour vérification. Cela garantit que l'IA ne dérive pas ou ne commet pas d'erreurs systématiques au fil du temps. Le résultat est un processus d'étiquetage environ quinze fois plus rapide qu'une révision uniquement humaine et qui coûte plus de dix fois moins cher, tout en maintenant un niveau d'exactitude similaire.

La force de cette approche réside dans sa capacité à fournir une vue unique et unifiée de la plateforme qui peut être découpée et analysée de nombreuses manières différentes. Parce que les chercheurs tirent un échantillon mondial unique chaque jour, ils peuvent répondre immédiatement à des questions sur la façon dont la sécurité varie par région, par type de surface de contenu, ou selon l'ancienneté du contenu, sans avoir besoin de lancer une nouvelle étude pour chaque question. Ils peuvent voir si une nouvelle mise à jour de politique fonctionne en comparant les chiffres avant et après, ou si un type spécifique de contenu préjudiciable augmente brusquement dans un pays particulier. Le système calcule également un intervalle de confiance pour chaque nombre qu'il produit, ce qui indique à l'équipe de sécurité quel degré de confiance accorder au résultat. Si le nombre est basé sur très peu d'exemples d'une violation rare, l'intervalle de confiance sera large, signalant à l'équipe qu'elle doit attendre plus de données avant de prendre une décision majeure.

Les chercheurs ont testé ce système de manière approfondie, tant dans des simulations que dans leur environnement de production réel chez Pinterest, où il fonctionne quotidiennement depuis plus d'un an. Ils ont constaté qu'en utilisant leur méthode d'échantillonnage assistée par ML (apprentissage automatique), ils pouvaient trouver six à onze fois plus de violations dans leur échantillon quotidien par rapport à une méthode d'échantillonnage aléatoire standard. Cette efficacité signifiait qu'ils pouvaient atteindre le même niveau de précision statistique avec beaucoup moins de vérifications, ou obtenir des chiffres beaucoup plus serrés et fiables avec la même quantité de travail. Ils ont également démontré que même lorsque les scores de risque sous-jacents utilisés pour guider l'échantillonnage changeaient ou devenaient moins précis au fil du temps, les estimations finales du système restaient non biaisées. Les erreurs apparaissaient sous forme d'intervalles de confiance plus larges plutôt que de mauvaises réponses, ce qui est une distinction cruciale pour les décideurs qui doivent savoir quand une tendance est réelle et quand elle n'est que du bruit.

L'une des découvertes les plus significatives a été la manière dont le système gère les erreurs inévitables qui accompagnent l'étiquetage automatisé. Les chercheurs ont découvert que pour les violations très rares, le risque majeur n'est pas de manquer une violation, mais de signaler à tort un contenu sûr comme étant préjudiciable. Un seul faux positif dans une mer de contenus sûrs peut faire paraître un problème dix fois plus grave qu'il ne l'est réellement. Pour gérer cela, le système surveille constamment le taux de faux positifs de l'IA. Si le taux devient trop élevé, le système peut appliquer une correction mathématique aux chiffres finaux pour tenir compte de l'erreur, ou peut déclencher une révision humaine des éléments spécifiques causant ce pic. Cela garantit que les rapports quotidiens reflètent la réalité plutôt que les caprices du modèle d'IA. L'équipe a également constaté que les fluctuations quotidiennes des chiffres étaient souvent dues à des changements dans les types de contenus postés ou à des changements subtils dans la façon dont l'IA interprétait les règles, plutôt qu'à des changements réels des niveaux de sécurité. En lissant ces variations à court terme et en se concentrant sur les tendances hebdomadaires, ils ont pu distinguer le bruit normal des menaces émergentes réelles.

Ce travail représente un changement dans la manière dont les plateformes numériques surveillent la sécurité, passant d'un modèle réactif basé sur les plaintes des utilisateurs à une approche proactive et axée sur les données. En traitant la mesure de la sécurité comme une science statistique plutôt que comme une simple tâche d'application, les chercheurs ont créé un outil capable de détecter les problèmes dès qu'ils commencent à apparaître. Le système est conçu pour être flexible, permettant aux équipes d'ajouter rapidement de nouvelles politiques ou d'ajuster les paramètres à mesure que le paysage des contenus en ligne évolue. Il repose sur une boucle continue d'échantillonnage, d'étiquetage par l'IA, de vérification humaine et d'analyse statistique, créant une boucle de rétroaction assez rapide pour suivre la vitesse d'Internet. Les chercheurs soulignent que ce système n'est pas un remplacement du jugement humain ou de l'application des politiques, mais un outil complémentaire qui fournit la clarté nécessaire pour prendre ces décisions efficacement. Il rend l'invisible visible, donnant aux équipes de sécurité les yeux dont elles ont besoin pour comprendre l'état réel de leurs plateformes et protéger leurs utilisateurs avec plus de précision et de rapidité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →