Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study
Este estudio demuestra que los modelos de lenguaje extensos multimodales pueden proporcionar un método rentable y escalable para auditar la exposición de TikTok a contenidos perjudiciales en Francia, Italia y Suecia, revelando que las búsquedas basadas en palabras clave aumentan significativamente la exposición a contenidos perjudiciales en comparación con el desplazamiento pasivo y que los filtros de seguridad suelen subestimar los daños explícitos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Cada día, millones de jóvenes abren una aplicación para ver vídeos cortos, confiando en que la pantalla les mostrará cosas que podrían disfrutar. Entre bastidores, complejos programas informáticos deciden qué vídeos aparecen a continuación, aprendiendo de cada toque, pausa y salto para construir un canal personalizado. Aunque estos sistemas están diseñados para ser atractivos, a veces pueden empujar a los usuarios hacia contenido que es peligroso o perturbador, como material que promueve las autolesiones, los trastornos alimentarios o la violencia. Debido a que estos algoritmos operan como una "caja negra" dentro de los servidores de la empresa, a los investigadores independientes les ha costado ver exactamente qué es lo que ven los usuarios jóvenes. Es difícil revisar cada vídeo, y las reglas sobre lo que cuenta como dañino pueden variar según el idioma y el país. Sin una forma clara de medir esta exposición, es difícil saber si las medidas de seguridad están funcionando realmente o si están fallando a las mismas personas que pretenden proteger.
Para resolver esto, un equipo de investigadores del Politecnico di Milano en Italia se propuso auditar TikTok en tres países europeos diferentes: Francia, Italia y Suecia. Querían ver qué vídeos mostraría la aplicación a usuarios de diferentes edades, desde adolescentes tempranos hasta adultos. En lugar de contratar ejércitos de personas para ver miles de vídeos, recurrieron a un nuevo tipo de inteligencia artificial llamada modelo de lenguaje multimodal. Estos son sistemas informáticos avanzados que pueden leer texto, escuchar audio y mirar imágenes todo a la vez, de forma muy similar a como lo haría un humano. Los investigadores probaron primero varios de estos sistemas de IA en un pequeño conjunto de vídeos que ya habían sido etiquetados por expertos humanos. Descubrieron que un modelo específico, al mostrársele ocho imágenes estáticas tomadas de un vídeo junto con la descripción de texto, podía identificar contenido dañino con un nivel de precisión lo suficientemente bueno como para ser utilizado a gran escala. Este enfoque les permitió analizar casi 37.000 vídeos por el coste de unos cincuenta dólares, una tarea que habría sido prohibitivamente costosa y lenta utilizando únicamente revisores humanos.
El estudio utilizó cuentas de ordenador que pretendían ser usuarios reales con edades específicas: trece, dieciséis, diecinueve y cuarenta años. Estas cuentas se configuraron en Francia, Italia y Suecia para ver cómo se comportaba la aplicación en diferentes lugares. Los investigadores dejaron que estas cuentas se desplazaran por sus canales principales de vídeo sin hacer nada más, registrando qué elegía mostrar el algoritmo. También realizaron una segunda prueba donde las cuentas buscaron activamente palabras relacionadas con temas dañinos, como "suicidio" o "juego", para ver cómo respondía la aplicación a peticiones directas. Los resultados revelaron una diferencia notable entre lo que los usuarios ven cuando se desplazan pasivamente y lo que encuentran cuando buscan activamente. Cuando las cuentas simplemente se desplazaban, la cantidad de contenido dañino variaba significamente según el país. Italia mostró las tasas más altas de vídeos dañinos para cada grupo de edad, con casi la mitad de los vídeos mostrados a un perfil de diecinueve años marcados como dañinos. En contraste, las tasas en Francia y Suecia fueron más bajas, aunque todavía presentes.
Sin embargo, la situación cambió drásticamente cuando las cuentas empezaron a buscar. Cuando los investigadores escribieron palabras clave relacionadas con el daño, la aplicación devolvió inmediatamente una avalancha de contenido dañino, con la tasa saltando entre el treinta y cinco y el cincuenta y seis por ciento. Este fue un aumento masivo en comparación con el desplazamiento pasivo, demostando que la aplicación es muy buena encontrando este material cuando se le solicita, incluso sin advertencias visibles o bloqueos en el momento de la búsqueda. Curiosamente, este pico de contenido dañino fue temporal. Una vez terminada la búsqueda y cuando las cuentas volvieron a desplazarse, el canal regresó a su nivel normal y más bajo de contenido dañino en cuestión de minutos. Esto sugiere que el algoritmo no "envenena" permanentemente el canal de un usuario tras una sola búsqueda, pero sí proporciona acceso inmediato a material peligroso cuando se solicita.
El estudio también encontró que la edad del usuario importaba menos que el país en el que se encontraba. En Francia y Suecia, la cantidad de contenido dañino visto por los adolescentes más jóvenes era menor que la que veían los adultos, que es lo que las normas de seguridad pretenden lograr. Pero en Italia, los usuarios más jóvenes veían tanta o incluso más cantidad de contenido dañino que los adultos, lo que indica que los filtros de seguridad no estaban funcionando según lo previsto para esa región específica. Los investigadores señalaron que la inteligencia artificial que utilizaron no era perfecta; omitió algunos vídeos y ocasionalmente se negó a analizar otros, particularmente aquellos con desnudez muy explícita. Esto significa que los números que informaron son probablemente estimaciones conservadoras, y la cantidad real de contenido dañino podría ser ligeramente superior. A pesar de estas limitaciones, el estudio demuestra que el uso de IA avanzada para auditar plataformas de redes sociales es una forma viable y asequible de monitorear la seguridad a través de diferentes idiomas y países. Destaca que, si bien la función de búsqueda de la aplicación es una vía principal hacia el contenido dañino, el canal pasivo también varía enormemente según la ubicación, siendo Italia la que muestra la exposición más significativa para los usuarios jóvenes. Los hallazgos sugieren que las empresas de plataformas necesitan observar más de cerca cómo moderan los resultados de búsqueda y cómo adaptan sus medidas de seguridad para diferentes regiones, en lugar de asumir que un enfoque de "talla única" está protegiendo a los niños en todas partes.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.