← Últimos artículos
🤖 AI

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

El artículo presenta VendorBench-100, un banco de pruebas unificado de paradigma cruzado que evalúa 36 modelos de detección de deepfakes a través de APIs comerciales, modelos de visión y lenguaje, y detectores de código abierto utilizando un corpus curado de 100 imágenes, revelando que si bien las APIs comerciales lideran en el desempeño de la mediana, existe una divergencia crítica entre la capacidad de clasificación (ROC-AUC) y la toma de decisiones confiable (MCC).

Autores originales: Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

Publicado 2026-07-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el gerente de un equipo de seguridad. Tu trabajo es detectar fotos falsas (deepfakes) que se están utilizando para engañar a la gente. Tienes tres tipos de guardias de seguridad muy diferentes disponibles para contratar:

  1. Los Profesionales de Alta Tecnología (APIs Comerciales): Pagas a una empresa como "Neural Defend" o "Reality Defender" para que revisen las fotos. Tienen un entrenamiento especializado y costoso diseñado específicamente para este trabajo.
  2. Los Generalistas Inteligentes (LLMs de Visión): Le pides a un asistente de IA superinteligente (como un chatbot que puede ver imágenes) que dé un vistazo. No fueron entrenados específicamente para detectar falsificaciones, pero son muy inteligentes y pueden razonar sobre lo que ven.
  3. Los Entusiastas del DIY (Detectores de Código Abierto): Descargas herramientas gratuitas creadas por investigadores y aficionados. Algunas son brillantes, otras tienen errores, y todas las ejecutas en tus propias computadoras.

El problema es que nadie ha puesto a estos tres grupos en la misma habitación para realizar la misma prueba. Los "Profesionales" tienen sus propios informes, los "Generalistas" tienen sus puntuaciones generales y el grupo "DIY" tiene sus propios rankings. Es como comparar el tiempo de vuelta de un coche de carreras en una pista con la velocidad de un camión en una autopista y decir que ambos son "rápidos".

La Gran Idea del Artículo: La Prueba "VendorBench-100"
Los autores decidieron construir una prueba única, injusta y muy difícil para ver quién gana realmente. No se limitaron a crear una prueba con 1,000 fotos fáciles. Seleccionaron a mano 100 fotos específicas y complicadas diseñadas para romper estos sistemas.

Piensa en esta prueba como un "curso de supervivencia" para los detectores:

  • Algunas fotos son solo una cara intercambiada sobre un cuerpo, pero el fondo es real.
  • Algunas son fotogramas de videos de IA que parecen películas normales.
  • Algunas son fotos donde alguien usó una aplicación de teléfono para editar solo una pequeña parte de una imagen real.
  • Algunas son diminutas, borrosas y están fuertemente comprimidas (como una foto enviada por un mensaje de texto).

Pasaron 36 modelos diferentes (5 Profesionales, 7 Generalistas y 24 herramientas DIY) por este mismo campo de batalla de 100 fotos.

La Trampa: Por qué la "Exactitud" es una Mentira
Aquí está la parte más importante del artículo, explicada con una analogía simple.

Imagina que la prueba tiene 79 fotos falsas y 21 fotos reales.
Si contrataras a un guardia que fuera demasiado perezoso para mirar las fotos y simplemente gritara "¡FALSO!" para cada una de ellas, ¿qué pasaría?

  • Tendría las 79 falsas bien.
  • Tendría las 21 reales mal.
  • Su "Exactitud" sería del 79%. ¡Eso suena genial!

Pero en realidad, ese guardia es inútil. Solo está adivinando basándose en las probabilidades. El artículo argumenta que mirar la "Exactitud" es como juzgar a un chef solo por cuántos platos sirvió, ignorando si la comida era comestible.

En su lugar, los autores utilizaron una puntuación más inteligente llamada MCC (Coeficiente de Correlación de Matthews). Esta puntuación solo sube si aciertas tanto las falsas como las reales. Castiga al guardia perezoso que "siempre dice falso".

Los Resultados Sorprendentes
Cuando clasificaron a todos mediante esta puntuación más inteligente, esto fue lo que encontraron:

  1. Los Profesionales Ganaron (En su mayoría): Los servicios comerciales de pago generalmente hicieron el mejor trabajo. Fueron los guardias más fiables.
  2. Los Generalistas quedaron en el Medio: Los chatbots inteligentes estuvieron bien, pero no fueron tan buenos como los profesionales.
  3. El Grupo DIY fue una Mezcla de Todo: La mayoría de las herramientas gratuitas fueron las peores. Sin embargo, algunas herramientas gratuitas específicas fueron en realidad mejores que los chatbots inteligentes a la hora de detectar patrones.

El Gran Giro: El "Ranking" frente a la "Decisión"
Este es el mayor descubrimiento del artículo. Encontraron que un modelo puede ser excelente en el ranking (clasificar las fotos falsas por encima de las reales) pero terrible en la decisión (decir realmente "Falso" o "Real" cuando se le pregunta).

  • El Ejemplo de "TruthScan": Una herramienta comercial fue increíble clasificando. Si le dabas una lista de 100 fotos, podía separar perfectamente las falsas de las reales en orden. Su "Puntuación de Ranking" fue la más alta de todas.
  • El Problema: Pero cuando le pedías que tomara una decisión final, tenía tanto miedo de perderse una falsa que decidía que TODO era falso. Falló la prueba porque marcó todas las fotos reales como falsas.

Es como un detector de metales en un aeropuerto que pita para todo: monedas, llaves, hebillas de cinturón y armas. Tiene un "ranking" perfecto (encuentra todo el metal), pero es inútil como guardia de seguridad porque nunca deja pasar a nadie.

La Conclusión
El artículo concluye que no puedes limitarte a mirar un solo número (como una puntuación de un ranking) para decidir qué detector usar.

  • Si solo miras el Ranking, podrías elegir una herramienta que es excelente clasificando pero terrible tomando decisiones.
  • Si solo miras la Exactitud, podrías elegir una herramienta perezosa que simplemente adivina "Falso" todo el tiempo.

Para elegir al guardia adecuado, necesitas comprobar tanto qué tan bien pueden distinguir entre lo real y lo falso, como qué tan bien toman la decisión final sin cometer demasiados errores. Los autores publicaron todos sus datos y herramientas para que otras personas puedan realizar estas pruebas nuevamente y verificar los resultados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →