← Últimos artículos
💬 NLP

STACK: Adversarial Attacks on LLM Safeguard Pipelines

Este artículo presenta el procedimiento de ataque adversarial STACK, el cual compromete con éxito un novedoso flujo de trabajo de salvaguardia de LLM basado en pocos disparos (few-shot-prompted) con una tasa de éxito de ataque del 71%, resaltando así vulnerabilidades críticas en los sistemas de defensa actuales de la IA de frontera y proponiendo mitigaciones específicas.

Autores originales: Ian R. McKenzie, Oskar J. Hollinsworth, Tom Tseng, Xander Davies, Stephen Casper, Aaron D. Tucker, Robert Kirk, Adam Gleave

Publicado 2026-02-06
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ian R. McKenzie, Oskar J. Hollinsworth, Tom Tseng, Xander Davies, Stephen Casper, Aaron D. Tucker, Robert Kirk, Adam Gleave

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás construyendo un asistente robótico muy potente y útil. Quieres que sea inteligente, pero te aterra que pueda, accidentalmente (o a propósito), darle a alguien instrucciones sobre cómo construir una bomba o crear un virus peligroso.

Para evitar esto, los creadores del robot no se limitan a confiar en una sola señal de "pare". En su lugar, construyen un pipeline de seguridad, como una fortaleza de múltiples capas. Este artículo, titulado STACK, investiga qué tan bien resisten estas fortalezas frente a hackers astutos.

Aquí está el desgido del artículo, utilizando analogías simples:

1. La Fortaleza: "Defensa en Profundidad"

Imagina el sistema de seguridad de la IA como un castillo con tres guardias parados en línea:

  1. Guardia 1 (Clasificador de Entrada): Revisa la carta que envías antes de que llegue al robot. Si la carta parece sospechosa, la detiene inmediatamente.
  2. El Robot (El Modelo): Si la carta pasa el Guardia 1, el robot la lee y escribe una respuesta.
  3. Guardia 2 (Clasificador de Salida): Revisa la respuesta del robot antes de que te llegue a ti. Si la respuesta contiene instrucciones peligrosas, este guardia arrebata la carta.

La idea es que para que un mal tipo tenga éxito, tiene que engañar a ambos guardias y al robot. Esto se llama "Defensa en Profundidad" (o el modelo del "queso suizo"), donde incluso si una capa tiene un agujero, las otras deberían detectar la amenaza.

2. El Problema: Los Guardias Están Dormidos

Los investigadores construyeron una versión de prueba de esta fortaleza utilizando herramientas de código abierto (como un plano público). Descubrieron que los "guardias" (los clasificadores de seguridad) eran a menudo demasiado fáciles de engañar.

  • Probaron trucos estándar (como reformular una pregunta o añadir errores tipográficos aleatorios) y descubrieron que muchos guardias de seguridad fallaron en detenerlos, especialmente cuando la petición era verdamente peligrosa (como pedir recetas de armas químicas).
  • Sin embargo, también descubrieron que un truco simple —darle al guardia algunos ejemplos de lo que debe buscar (llamado "few-shot prompting")— hizo al guardia mucho más agudo. Este guardia simple era mejor que los sofisticados y pre-entrenados.

3. El Nuevo Ataque: STACK (Staged AttaCK)

Este es el principal descubrimiento del artículo. Los investigadores se dieron cuenta de que, aunque la fortaleza es fuerte, los guardias están mirando las cosas por separado. No se comunican entre sí durante el ataque.

Inventaron un nuevo método de hackeo llamado STACK (Staged AttaCK - Ataque por Etapas). En lugar de intentar romper todo el castillo a la vez, lo rompieron capa por capa, como un ladrón forzando cerraduras en un orden específico:

  • Paso 1: Engañar al Robot. Primero, usaron una técnica de persuasión para convencer al robot de que respondiera a la pregunta peligera, ignorando sus propias reglas de seguridad internas.
  • Paso 2: Engañar al Guardia 1. Encontraron una "frase mágica" (un jailbreak universal) que, al añadirse al principio del mensaje, hacía que el Guardia 1 pensara que el mensaje era inofensivo.
  • Paso 3: Engañar al Guardia 2. Esta fue la parte más difícil. Necesitaban que el robot escribiera una respuesta que incluyera una "frase mágica" al final para engañar al Guardia 2 y hacerle pensar que la respuesta era segura.

La Analogía: Imagina que quieres meter una nota prohibida en una escuela.

  1. Primero escribes la nota de una manera en que el profesor (el robot) la lea y responda.
  2. Luego envuelves la nota en un envoltorio que el guardia de seguridad en la puerta (el Guardia 1) piense que es solo una caja de almuerzo.
  3. Finalmente, añades un sello específico al reverso de la nota que haga que el guardia de seguridad en la salida (el Guardia 2) piense que es un permiso escolar.

Al combinar estos tres trucos específicos, los investigadores lograron evadir toda la fortaleza.

4. Los Resultados: ¿Qué Tan Bien Funcionó?

  • La Fortaleza Resistió (Más o Menos): Cuando usaron ataques estándar, la fortaleza funcionó de maravilla. El guardia de "few-shot" detuvo el 100% de los ataques en el conjunto de datos más peligroso.
  • STACK Rompió la Fortaleza: Cuando usaron su nuevo método STACK, evadieron la fortaleza el 71% de las veces.
  • La Sorpresa de la "Caja Negra": Incluso cuando los hackers no podían ver la lógica interna de los guardias (un escenario de "caja negra") y tenían que adivinar qué guardia los detuvo, aun así tuvieron éxito el 33% de las veces. Esto es aterrador porque significa que no necesitas ser un infiltrado para romper el sistema; solo necesitas ser astuto.

5. La Prueba del Mundo Real

Los investigadores no solo probaron esto en su propio modelo de juguete. Intentaron su método en los modelos reales de alto nivel de grandes empresas (como Anthropic's Opus 4 y OpenAI's GPT-5).

  • Descubrieron que estos sistemas del mundo real también filtran información (como cuánto tiempo tarda en procesarse una petición o mensajes de error específicos) que le dice a un hacker qué guardia lo detuvo.
  • Usando esta información, lograron evadir estos sistemas de alta seguridad para obtener respuestas peligrosas. Las empresas reconocieron los problemas y los parchearon.

6. La Conclusión

El artículo concluye con algunas lecciones simples para los constructores de estas fortalezas de IA:

  • No reveles tus secretos: Si tu sistema le dice a un hacker "El Guardia de Entrada te detuvo" en lugar de "El Guardia de Salida te detuvo", le estás dando un mapa. Haz que todas las negativas parezcan iguales.
  • No dejes que los hackers espíen: Si lanzas un modelo "hermano" (una versión ligeramente más pequeña de tu guardia de seguridad) al público, los hackers pueden entrenar sus ataques en él y luego usarlos contra tu sistema principal.
  • La Defensa en Profundidad es buena, pero no perfecta: Tener capas de seguridad es mejor que no tener ninguna, pero si las capas no se comunican o si los guardias son demasiado predecibles, un ataque por etapas astuto puede filtrarse por completo.

En resumen: El artículo muestra que, si bien las capas de seguridad de la IA son una buena idea, actualmente son vulnerables a un tipo específico de ataque de "divide y vencerás". Si atacas las capas una por una, puedes derrotar todo el sistema.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →