← Últimos artículos
🤖 AI

Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes

Este artículo evalúa la detección de deepfakes audiovisuales mediante crowdsourcing, concluyendo que, si bien la agregación de múltiples juicios de trabajadores puede filtrar de manera fiable la autenticidad de los videos, el crowdsourcing tiene dificultades para identificar de forma consistente tipos específicos de manipulación y marcas temporales, particularmente en casos complejos de audio y video.

Autores originales: Michael Soprano, Andrea Cioci, Stefano Mizzaro

Publicado 2026-05-07
📖 4 min de lectura☕ Lectura para el café

Autores originales: Michael Soprano, Andrea Cioci, Stefano Mizzaro

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el editor de una redacción masiva. De repente, llega una avalancha de videos, algunos reales y otros "deepfakes": videos que parecen y suenan reales pero han sido alterados secretamente por una IA. Tu trabajo es clasificarlos. Pero no puedes verlos uno por uno tú solo, así que contratas a un equipo de 240 personas comunes (una "multitud") para que te ayuden a detectar los falsos.

Este documento es el boletín de calificaciones sobre el desempeño de ese equipo. Aquí está lo que descubrieron, explicado de forma sencilla:

La Configuración: Dos "Campamentos de Entrenamiento" Diferentes

Los investigadores no solo probaron a la multitud una vez; realizaron dos experimentos separados utilizando dos conjuntos diferentes de videos:

  1. El Campamento "Difícil" (AV-Deepfake1M): Estos videos eran cortos, engañosos y muy realistas.
  2. El Campamento "Más Fácil" (TMC): Estos videos eran más largos y ligeramente más fáciles de detectar.

En ambos campamentos, la multitud tuvo que hacer tres cosas por cada video:

  • Detectar el Falso: ¿Es esto real o está manipulado?
  • Nombrar al Tramposo: ¿Manipularon el audio (voz), el video (cara) o ambos?
  • Señalar el Momento: ¿Exactamente cuándo comenzó la manipulación?

Los Resultados: Lo que la Multitud Aciertó (y Falló)

1. El Efecto "Red de Seguridad" (RQ1)
La multitud fue excelente en no levantar falsas alarmas. Si un video era realmente real, los trabajadores casi nunca lo llamaron falso. Fueron muy cuidadosos de no acusar a videos inocentes.

  • El Problema: Fueron terribles detectando los falsos reales. Era como un guardia de seguridad muy bueno dejando entrar a personas reales, pero perdiendo casi a todos los ladrones que intentaban colarse.
  • La Diferencia: La multitud detectó aproximadamente el doble de falsos en el campamento "Más Fácil" (TMC) en comparación con el campamento "Difícil". Esto demuestra que el tipo de video importa mucho.

2. La "Mentalidad de Rebaño" (RQ2)
Cuando los investigadores preguntaron: "¿Estuvieron todos de acuerdo?", la respuesta fue "No realmente".

  • Para cualquier video individual, los trabajadores a menudo no estaban de acuerdo entre sí. Una persona podía pensar que era real, mientras que otra pensaba que era falso.
  • Sin embargo, cuando tomabas la votación mayoritaria (lo que dijo la mayoría), la señal se volvía mucho más clara. Es como pedirle a una sala llena de personas que adivinen el peso de una vaca; una persona podría estar muy equivocada, pero el promedio de 10 personas suele ser bastante cercano.
  • La Trampa: Incluso con la votación mayoritaria, si el video era un falso realmente complicado, la multitud aún lo pasaba por alto. No puedes arreglar un punto ciego simplemente preguntando a más personas.

3. El "Punto Ciego" en los Detalles (RQ3)
Esta fue la parte más difícil. Incluso cuando la multitud detectaba un falso, eran terribles adivinando cómo estaba manipulado.

  • La Confusión: Si un video tenía tanto una voz falsa como una cara falsa, la multitud generalmente solo adivinaba "Voz Falsa" o "Cara Falsa", acertando raramente la respuesta "Ambos".
  • El Lado Positivo (Marcas de Tiempo): Aunque no podían ponerse de acuerdo sobre qué estaba manipulado, eran sorprendentemente buenos poniéndose de acuerdo sobre cuándo sucedió. Si pensaban que un video era falso, generalmente podían señalar el mismo fragmento de 5 segundos donde comenzó la rareza.

La Conclusión: Una Estrategia de Dos Pasos

El documento sugiere una forma práctica de usar este sistema de "multitud", utilizando una analogía simple:

Piensa en la multitud como un detector de metales en un aeropuerto.

  • Paso 1 (Filtrado): El detector de metales (la multitud) es excelente escaneando miles de maletas rápidamente. Raramente marca una maleta que no tiene nada (bajas falsas alarmas), pero podría pasar por alto algunos objetos pequeños y ocultos (falsos no detectados).
  • Paso 2 (Revisión de Expertos): Si el detector suena, no le preguntas al detector qué es el objeto ni dónde exactamente está dentro de la maleta. Envías esa maleta a un experto humano (o a una IA inteligente) para que la abra y la inspeccione de cerca.

En resumen: La multitud es un gran "primer filtro" para detectar falsos obvios y marcar videos sospechosos para que los expertos los revisen. Pero no les pidas que sean los jueces finales sobre cómo fue manipulado el video, porque probablemente se equivoquen en eso.

Una Pequeña Advertencia

Los investigadores notaron que algunos trabajadores podrían haber comenzado la prueba con el volumen apagado. Como no podían escuchar el audio, podrían haber pasado por alto falsificaciones "solo de audio". Esto es un recordatorio de que incluso en una tarea simple, pequeños detalles (como el volumen) pueden cambiar los resultados.

En conclusión: La crowdsourcing es una herramienta útil para detectar "algo va mal" en los videos, pero necesita ayuda para averiguar exactamente "qué es lo que va mal".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →