Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling
Este artículo presenta un sistema de medición basado en el diseño que combina el muestreo probabilístico asistido por ML con el etiquetado mediante LLM para estimar de manera eficiente y precisa la prevalencia de contenido que infringe las políticas en diversos segmentos de usuarios, manteniendo al mismo tiempo la imparcialidad estadística y la rentabilidad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En los vastos paisajes digitales donde miles de millones de personas comparten fotos, ideas e historias cada día, persiste un desafío silencioso pero crítico: ¿cómo saber qué es lo que tus usuarios están viendo realmente? Durante años, las plataformas han dependido de los informes de los usuarios para señalar el contenido dañino, pero este método es como intentar medir la profundidad de un río contando solo a las personas que piden ayuda a gritos. Muchos peligros pasan sin ser reportados porque los usuarios no los notan, no saben cómo reportarlos o simplemente no quieren interactuar con el sistema. Para comprender verdaderamente la seguridad de una plataforma, los equipos necesitan medir la prevalencia: la fracción real de veces que un usuario encuentra contenido que infringe las normas. Esto requiere observar la totalidad del flujo de contenido, no solo las partes que ya han sido señaladas. El problema es que el contenido dañino suele ser poco frecuente, y revisar cada elemento individualmente a mano es demasiado lento y costoso para hacerlo a diario.
Un equipo de investigadores de Pinterest ha desarrollado una nueva forma de resolver esto, creando un sistema que combina un muestreo inteligente con inteligencia artificial avanzada para medir la seguridad con una velocidad y precisión sin precedentes. En lugar de esperar las quejas, toman una instantánea diaria y representativa de todo lo que se muestra a los usuarios. Utilizan un método estadístico que enfoca su presupuesto limitado de revisión en los candidatos más probables de infracción, asegurando que encuentren suficientes ejemplos para estar seguros de sus cifras sin tener que revisarlo todo. Luego, utilizan un modelo de lenguaje extenso —una IA entrenada para entender texto e imágenes— para etiquetar estas muestras, actuando como un revisor incansable y constante. Al combinar estas técnicas, pueden producir un informe diario sobre la frecuencia con la que los usuarios ven contenido dañino, junto con una medida de qué tan precisa es esa cifra. Esto permite a los equipos de seguridad detectar problemas emergentes de inmediato, probar si sus correcciones están funcionando y entender exactamente dónde y cuándo aparecen los riesgos, todo sin tener que esperar semanas a que los revisores humanos se pongan al día.
El núcleo de este sistema es una forma ingeniosa de elegir qué piezas de contenido examinar. En un mar de miles de millones de visualizaciones diarias, encontrar una violación poco frecuente es como buscar un tipo específico de hoja en un bosque. Si eliges hojas al azar, podrías caminar millas sin encontrar nada. Los investigadores, en cambio, utilizan un enfoque "ponderado". Observan dos pistas principales: cuántas veces se ha mostrado una pieza de contenido a las personas y una puntuación de riesgo generada por los modelos de seguridad existentes de la plataforma. Combinan estas pistas para crear una lista donde los elementos que son tanto populares como riesgosos tienen más probabilidades de ser elegidos para su revisión. Esto no significa que solo revisen elementos riesgosos; también eligen de toda la población, pero inclinan las probabilidades ligeramente para asegurar que obtengan suficientes ejemplos de violaciones para realizar una estimación estadística sólida. Este método les permite utilizar un número fijo de verificaciones cada día y, aun así, obtener una imagen clara de toda la plataforma, incluso cuando las violaciones son extremadamente raras.
Una vez que el sistema ha seleccionado su muestra diaria, pasa a la fase de etiquetado. Aquí, los investigadores reemplazaron el proceso tradicional de revisión humana con un modelo de lenguaje extenso multimodal. Esta IA puede mirar una imagen, leer el texto y entender el contexto, tal como lo haría un moderador humano. Sin embargo, los investigadores no simplemente dejaron que la IA decidiera; construyeron un riguroso sistema de control de calidad a su alrededor. Antes de que la IA tenga permitido etiquetar las muestras diarias, es probada contra un "conjunto de oro" (gold set) de contenido que ha sido cuidadosamente revisado por expertos humanos. La IA debe coincidir con las decisiones de los expertos humanos dentro de un margen de error muy estrecho antes de ser activada. Una vez en funcionamiento, el sistema continúa verificando el trabajo de la IA enviando una selección aleatoria de sus etiquetas diarias de vuelta a expertos humanos para su verificación. Esto asegura que la IA no se desvíe ni cometa errores sistemáticos con el tiempo. El resultado es un proceso de etiquetado que es aproximadamente quince veces más rápido que la revisión solo humana y cuesta más de diez veces menos, manteniendo un nivel de precisión similar.
El poder de este enfoque reside en su capacidad para proporcionar una visión única y unificada de la plataforma que puede segmentarse y analizar de muchas formas distintas. Debido a que los investigadores extraen una muestra global cada día, pueden responder inmediatamente a preguntas sobre cómo varía la seguridad por región, por el tipo de superficie de contenido o por la antigüedad del contenido, sin necesidad de ejecutar un nuevo estudio para cada pregunta. Pueden ver si una nueva actualización de política está funcionando comparando los números antes y después, o si un tipo específico de contenido dañino está aumentando en un país determinado. El sistema también calcula un intervalo de confianza para cada número que produce, lo que indica al equipo de seguridad cuánta confianza puede depositar en el resultado. Si el número se basa en muy pocos ejemplos de una violación rara, el intervalo de confianza será amplio, señalando al equipo que debe esperar a tener más datos antes de tomar una decisión importante.
Los investigadores probaron este sistema extensamente, tanto en simulaciones como en su entorno de producción real en Pinterest, donde ha estado funcionando diariamente durante más de un año. Descubrieron que, al utilizar su método de muestreo asistido por ML (aprendizaje automático), podían encontrar de seis a once veces más violaciones en su muestra diaria en comparación con un método de muestreo aleatorio estándar. Esta eficiencia significó que podían lograr el mismo nivel de precisión estadística con muchas menos verificaciones, o conseguir números mucho más ajustados y fiables con la misma cantidad de trabajo. También demostraron que incluso cuando las puntuaciones de riesgo subyacentes utilizadas para guiar el muestreo cambiaban o se volvían menos precisas con el tiempo, las estimaciones finales del sistema permanecían sin sesgo. Los errores se manifestaban como intervalos de confianza más amplios en lugar de respuestas incorrectas, lo cual es una distincción crucial para los responsables de la toma de decisiones que necesitan saber cuándo una tendencia es real y cuándo es solo ruido.
Uno de los hallazgos más significativos fue cómo el sistema maneja los errores inevitables que conllevan el etiquetado automatizado. Los investigadores descubrieron que, para violaciones muy raras, el mayor riesgo no es omitir una violación, sino marcar erróneamente contenido seguro como dañino. Un solo falso positivo en un mar de contenido seguro puede hacer que parezca que un problema es diez veces peor de lo que realmente es. Para gestionar esto, el sistema monitorea constantemente la tasa de falsos positivos de la IA. Si la tasa es demasiado alta, el sistema puede aplicar una corrección matemática a los números finales para tener en cuenta el error, o puede activar una revisión humana de los elementos específicos que causan el aumento. Esto asegura que los informes diarios reflejen la realidad y no las peculiaridades del modelo de IA. El equipo también encontró que las fluctuaciones día a día en los números solían ser impulsadas por cambios en los tipos de contenido que se publicaban o cambios sutiles en cómo la IA interpretaba las reglas, más que por cambios reales en los niveles de seguridad. Al suavizar estas variaciones a corto plazo y centrarse en las tendencias semanales, pudieron distinguir entre el ruido normal y las amenazas emergentes genuinas.
Este trabajo representa un cambio en la forma en que las plataformas digitales monitorean la seguridad, pasando de un modelo reactivo basado en las quejas de los usuarios a un enfoque proactivo y basado en datos. Al tratar la medición de la seguridad como una ciencia estadística en lugar de solo una tarea de cumplimiento, los investigadores han creado una herramienta que puede detectar problemas en el momento en que comienzan a aparecer. El sistema está diseñado para ser flexible, permitiendo a los equipos añadir rápidamente nuevas políticas o ajustar parámetros a medida que el panorama del contenido en línea cambia. Se apoya en un ciclo continuo de muestreo, etiquetado por IA, verificación humana y análisis estadístico, creando un bucle de retroalimentación lo suficientemente rápido como para seguir el ritmo de internet. Los investigadores enfatizan que este sistema no es un reemplazo para el juicio humano o la aplicación de políticas, sino una herramienta complementaria que proporciona la claridad necesaria para tomar esas decisiones de manera efectiva. Convierte lo invisible en visible, otorgando a los equipos de seguridad los ojos que necesitan para comprender el estado real de sus plataformas y proteger a sus usuarios con mayor precisión y velocidad.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.