← Últimos artículos
🤖 AI

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

Este artículo presenta SceneSplit, un nuevo método de jailbreak de caja negra que fragmenta narrativas dañinas en escenas individualmente benignas para manipular el espacio de salida generativa de los modelos de Texto-a-Video, logrando altas tasas de éxito en ataques en múltiples sistemas de última generación y revelando vulnerabilidades críticas en sus mecanismos de seguridad.

Autores originales: Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

Publicado 2026-05-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que intentas pasar un objeto peligroso de contrabando ante un guardia de seguridad en un aeropuerto. Si intentas caminar por el detector de metales sosteniendo una espada gigante y obvia, la alarma sonará inmediatamente y te detendrán. Así funcionan los actuales modelos de IA de "Texto a Video": tienen filtros de seguridad que escanean tu solicitud (prompt) y bloquean cualquier cosa que parezca poder generar contenido dañino, como violencia o desnudez.

Este artículo introduce un truco astuto llamado SceneSplit que elude a estos guardias. En lugar de intentar pasar la espada completa de una sola vez, los atacantes descomponen la espada en piezas que parecen inofensivas, las pasan una por una y luego permiten que la IA las vuelva a ensamblar en el objeto peligroso.

Así es como funciona el método, desglosado en tres pasos simples:

1. El truco de los "Lego" (División de escenas)

Imagina que quieres generar un video de una pelea violenta. Si escribes "Dos hombres peleando con cuchillos", el guardia de seguridad de la IA dice: "No, eso es peligroso" y lo bloquea.

SceneSplit toma esa idea peligrosa y la corta en 3 a 5 escenas separadas y diminutas que parecen completamente inofensivas por sí solas:

  • Escena 1: "Un hombre sosteniendo un objeto metálico brillante". (Seguro)
  • Escena 2: "Una mujer acostada en una silla, con aspecto relajado". (Seguro)
  • Escena 3: "Una cámara haciendo zoom en un líquido rojo goteando sobre el suelo". (Seguro)

Individualmente, ninguna de estas solicitudes activa la alarma. Son como bloques de Lego inofensivos. Sin embargo, cuando se le indica a la IA que reproduzca estas escenas en orden, conecta los puntos. El "objeto brillante" se convierte en un cuchillo, la "mujer relajada" se convierte en una víctima y el "líquido rojo" se convierte en sangre. La combinación obliga a la IA a crear el video violento que se le pidió originalmente, aunque nunca vio las palabras peligrosas "pelea" o "cuchillo" en una sola solicitud.

2. El "Ajuste Fino" (Manipulación de escenas)

A veces, incluso con los bloques de Lego, la IA podría confundirse y generar un video seguro (como un hombre sosteniendo una cuchara en lugar de un cuchillo).

Para solucionar esto, el método utiliza un bucle de retroalimentación. Examina el video que hizo la IA y pregunta: "¿Qué escena específica hizo que la IA se confundiera?". Si la IA hizo una cuchara en lugar de un cuchillo, el sistema identifica que la Escena 1 era demasiado vaga. Luego, pide a un asistente de IA inteligente que reescriba solo esa escena específica para que sea ligeramente más explícita, manteniendo las demás escenas igual. Sigue ajustando esa única escena hasta que la IA finalmente genera el video dañino, "cazando" efectivamente la línea exacta donde falla el filtro de seguridad.

3. La "Chuleta" (Biblioteca de estrategias)

Cada vez que los investigadores logran engañar a la IA, guardan la "receta" que usaron. Si lograron dividir una solicitud sobre violencia en 4 escenas usando un tipo específico de redacción, guardan ese patrón.

La próxima vez que quieran atacar a la IA con una solicitud violenta diferente, consultan su "Chuleta". Ven: "Oh, dividirlo en 4 escenas funcionó la última vez", y usan esa misma estrategia inmediatamente. Esto hace que el ataque sea más rápido y efectivo con el tiempo, ya que el sistema aprende de sus propios éxitos.

¿Qué descubrieron?

Los investigadores probaron este "truco de Lego" en varios generadores de video comerciales importantes (como Veo2, Hailuo y Luma Ray2). Descubrieron que:

  • Funciona muy bien: El método generó videos dañinos con éxito aproximadamente entre el 77% y el 84% de las veces en diferentes modelos.
  • Las defensas existentes son débiles: Los filtros de seguridad actuales son buenos para detectar palabras malas obvias, pero son terribles para entender cómo una serie de escenas con apariencia inofensiva pueden combinarse para contar una historia peligrosa.
  • La "Brecha de Seguridad": El artículo concluye que, aunque tenemos buenos guardias para oraciones individuales, no tenemos buenos guardias para secuencias de eventos.

En resumen: El artículo demuestra que puedes engañar a la IA de video dividiendo una idea mala en muchas piezas pequeñas y con buena apariencia, permitiendo que la IA las unifique y luego ajustando las piezas hasta que la idea mala emerge. Esto revela una brecha significativa en cómo protegemos actualmente estos sistemas de IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →