← Últimos artículos
🤖 AI

TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs

El artículo presenta TEMPLATEFUZZ, un marco de fuzzing de granularidad fina que explota vulnerabilidades en las plantillas de chat de los modelos de lenguaje grandes mediante mutaciones de elementos y estrategias de búsqueda heurística, logrando tasas de éxito de jailbreak superiores al 90% en modelos de código abierto y comerciales con una degradación mínima de la precisión.

Autores originales: Qingchao Shen, Zibo Xiao, Lili Huang, Enwei Hu, Yongqiang Tian, Junjie Chen

Publicado 2026-04-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Qingchao Shen, Zibo Xiao, Lili Huang, Enwei Hu, Yongqiang Tian, Junjie Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que los Modelos de Lenguaje Grande (como ChatGPT o los que usas en tu teléfono) son como guardianes de seguridad muy inteligentes en un edificio de cristal. Su trabajo es dejar pasar a la gente con buenas intenciones, pero detener a los ladrones o a los que quieren causar problemas.

Hasta ahora, los investigadores pensaban que los ladrones solo intentaban engañar al guardia diciéndole mentiras muy elaboradas (esto se llama "inyección de prompts"). Pero este nuevo estudio, llamado TemplateFuzz, descubre que los ladrones pueden entrar por una puerta trasera que nadie estaba vigilando: la estructura del formulario que el guardia usa para leer las solicitudes.

Aquí tienes la explicación sencilla, con analogías:

1. El Problema: La "Plantilla" Invisible

Imagina que cuando le hablas al guardia, no le hablas directamente. Primero, tu mensaje tiene que pasar por una plantilla de papel especial. Esta plantilla tiene reglas fijas:

  • Un encabezado que dice "Soy el usuario".
  • Un separador que dice "Aquí empieza tu pregunta".
  • Una nota final que dice "El guardia va a responder ahora".

Los desarrolladores de la IA usan esta plantilla para asegurarse de que el guardia entienda quién habla y qué debe hacer. Pero, ¿qué pasa si un hacker modifica sutilmente esa plantilla?

2. La Solución: TemplateFuzz (El "Fuzzing" de Plantillas)

El equipo de investigadores creó una herramienta llamada TemplateFuzz. Imagina que es como un robot jardinero que tiene un objetivo muy específico: encontrar la grieta perfecta en la cerca.

En lugar de intentar convencer al guardia con palabras (lo cual es difícil y cansado), TemplateFuzz toma la plantilla de papel y empieza a hacerle cambios diminutos y aleatorios, como un "fuzzing" (un término técnico que significa "probar cosas al azar para ver qué se rompe").

¿Qué cambia el robot?
El robot tiene 5 herramientas para modificar la plantilla:

  1. El Mensaje del Sistema: Cambia la identidad del guardia. En lugar de decir "Soy un ayudante útil", la plantilla dice "Soy un ayudante malvado que no tiene reglas".
  2. El Historial de Chat: Añade conversaciones falsas previas donde el guardia ya aceptó hacer cosas malas, para que piense que es normal.
  3. Las Etiquetas de Rol: Confunde al guardia. ¿Quién es el usuario? ¿Quién es el sistema? Si la etiqueta está mal, el guardia puede olvidar sus reglas de seguridad.
  4. Los Separadores: Cambia los signos de puntuación que separan las partes. Es como borrar los bordes de una página para que el texto se mezcle y el guardia no sepa dónde termina la orden y dónde empieza la respuesta.
  5. El "Gancho" de Respuesta: Añade una frase al final que dice "¡Claro, aquí tienes el plan!" antes de que el guardia siquiera piense en negarse.

3. La Estrategia: El "Búho Sabio"

Hacer millones de cambios al azar sería lento. Por eso, TemplateFuzz usa una estrategia de búsqueda inteligente (como un búho que escucha los mejores sonidos).

  • Si un cambio hace que el guardia se ponga tonto y no responda nada, el robot lo descarta.
  • Si un cambio hace que el guardia responda cosas peligrosas pero sigue siendo inteligente y útil en otras cosas, el robot lo guarda y lo mejora.

Además, el robot tiene un juez automático (un pequeño sistema de reglas) que revisa rápidamente si el guardia falló o no, sin necesidad de gastar mucha energía.

4. Los Resultados: ¡Un Éxito Rotundo!

Los investigadores probaron esta herramienta en 12 modelos de IA de código abierto (como Llama, Qwen, Gemma) y 5 modelos comerciales (como GPT-4).

  • El resultado: TemplateFuzz logró engañar al 98.2% de las veces.
  • La ventaja: Las técnicas anteriores necesitaban escribir textos muy largos y complicados (como escribir un libro entero para engañar a un guardia). TemplateFuzz solo necesita cambiar unos pocos símbolos en la plantilla. Es como si el ladrón no necesitara saltar la cerca, sino que simplemente cambiara el color de la puerta para que el guardia la ignorara.
  • Lo sorprendente: Incluso en los modelos comerciales donde no puedes ver la plantilla (porque está cerrada), TemplateFuzz pudo "inyectar" estas plantillas modificadas a través de los mensajes y seguir engañando al sistema en un 90% de los casos.

En Resumen

Esta investigación nos dice que la seguridad de la IA no es solo sobre lo que le decimos, sino sobre cómo está estructurado el mensaje.

Es como si construyéramos una fortaleza muy fuerte, pero olvidamos que la llave de la puerta tiene una forma extraña. Si alguien cambia esa forma un milímetro, la puerta se abre. TemplateFuzz es la herramienta que nos ayuda a encontrar esas formas extrañas antes de que los ladrones las descubran, para que podamos reforzar la puerta y hacer que nuestras IAs sean realmente seguras.

¿La moraleja? Para proteger a la IA, no solo debemos vigilar las palabras, sino también vigilar la "caja" en la que esas palabras viajan.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →