ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors
Este artículo presenta ARMOR++, un marco multiagente robusto que aprovecha Qwen2.5-VL y Qwen3 para orquestar un conjunto diverso de primitivas adversarias, logrando tasas de éxito de ataque y de transferibilidad significativamente más altas contra detectores de deepfakes en comparación con los métodos actuales del estado del arte bajo estrictas restricciones de caja negra.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina el internet como una galería de arte gigante y bulliciosa donde cualquiera puede pintar un cuadro. Durante mucho tiempo, si querías saber si una pintura era real o una falsificación, solo la mirabas con tus ojos. Pero recientemente, apareció un nuevo tipo de pincel mágico —la inteligencia artificial— que puede pintar rostros de forma tan perfecta que incluso los expertos tienen dificultades para notar la diferencia. Esto ha creado un juego de gato y ratón de alto riesgo. Por un lado, tenemos a los "detectives" (modelos de IA) entrenados para detectar los defectos diminutos e invisibles dejados por estos pinceles mágicos. Por el otro, tenemos a los "hackers" tratando de engañar a los detectives añadiendo el ruido justo a un rostro falso para que parezca real ante el detective, sin cambiar realmente cómo se ve el rostro para un humano. Esto no es solo sobre arte; es sobre la confianza. Si no podemos distinguir qué es real, no podemos confiar en nuestras noticias, nuestras cámaras de seguridad o incluso en nuestros propios ojos. La gran pregunta es: ¿cómo sabemos si nuestros detectives digitales son realmente fiables, o si simplemente son fácilmente engañados por un truco ingenioso?
Entra ARMOR++, un nuevo equipo de "hackers" súper inteligente diseñado para probar a estos detectives. Piensa en los detectores de deepfakes como guardias de seguridad en un club. Algunos guardias solo miran la forma del rostro de una persona (como una Red Neuronal Convolucional), mientras que otros miran la imagen completa y cómo encajan las piezas (como un Transformador de Visión). El problema es que un truco que funciona en un tipo de guardia a menudo falla en el otro. Los intentos previos de engañar a estos guardias fueron como lanzar un solo tipo de piedra contra una pared; a veces funcionaba, pero a menudo la pared era demasiado fuerte o estaba hecha de un material diferente.
ARMOR++ es diferente porque no solo lanza una piedra; envía a todo un equipo de especialistas que hablan entre sí. El equipo es liderado por dos "agentes" muy inteligentes (programas informáticos basados en grandes modelos de lenguaje). El primer agente, el Analista, observa el rostro falso y usa sus "ojos" para encontrar los puntos extraños —como un borde borroso o una textura extraña— y dice: "¡Hey, ataca aquí!". El segundo agente, el Director, actúa como un entrenador. No solo elige un ataque; gestiona un escuadrón de cinco diferentes "atacantes", cada uno con un superpoder único:
- El Mezclador: Añade una capa de ruido suave y densa en todas partes.
- El Pinzador: Retoca solo unos pocos píxeles específicos para confundir al guardia.
- El Deformador: Retuerce suavemente el rostro, como estirar una hoja de goma.
- El Mago de la Frecuencia: Cambia los "colores" de la imagen de una manera que los humanos no pueden ver pero las computadoras sí (como girar el dial de una radio).
- El Mezclador de Bloques: Corta la imagen en piezas de rompecabezas y las intercambia.
Lo que hace especial a ARMOR++ es que juega un juego de "adivinar y comprobar" sin pedir nunca ayuda al guardia objetivo. Practica con un conjunto de guardias de práctica (modelos sustitutos o surrogates) que conoce a la perfección. Prueba diferentes combinaciones de sus cinco atacantes, escucha a sus agentes inteligentes y ajusta su estrategia en tiempo real. Si un ataque no está funcionando, el equipo no se rinde; cambian las reglas, prueban una mezcla diferente de ataques y siguen adelante hasta encontrar la combinación perfecta que engañe al guardia objetivo.
El artículo encuentra que este enfoque basado en equipos es increíblemente efectivo. Al ser probado en una colección masiva de rostros falsos (el benchmark AADD-2025), ARMOR++ logró engañar a los guardias "ciegos" más avanzados (aquellos que nunca había visto antes) aproximadamente el 44.3% de las veces en imágenes de baja calidad y el 32.1% de las veces en imágenes de alta calidad. Para ponerlo en perspectiva, el mejor equipo anterior (llamado ARMOR) solo engañó a ellos aproximadamente el 39.6% y 28.3% de las veces, y los métodos estándar de "ataque único" apenas superaron el 20%.
Los investigadores también comprobaron si estos trucos seguían funcionando si los guardias tenían un entrenamiento básico para resistir ataques (como el "entrenamiento adversarial"). Incluso entonces, ARMOR++ fue el más exitoso, engañando a los guardias aproximadamente el 19.8% de las veces, mientras que otros métodos cayeron casi a cero. Esto sugiere que incluso nuestros mejores sistemas de seguridad actuales tienen un "punto ciego" significativo cuando se enfrentan a estos trucos inteligentes y polifacéticos. Los autores concluyen que, aunque nuestros detectores están mejorando para detectar falsificaciones, todavía no son lo suficientemente fiables para ser confiados completamente, especialmente cuando enfrentan a un atacante que puede pensar, adaptarse y usar muchos tipos diferentes de trucos a la vez. Es una llamada de atención: en la carrera entre los creadores de falsificaciones y los detectores reales, los detectores aún tienen mucho trabajo por hacer.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.