← Últimos artículos
💻 computer science

The Great Pretender: A Stochasticity Problem in LLM Jailbreak

Este artículo revela que la inestabilidad de la Tasa de Éxito del Ataque (ASR) en las evasiones de LLM se debe a la estocasticidad durante la evaluación y la generación, lo que conduce a métricas sistemáticamente infladas, y propone los marcos CAS-eval y CAS-gen para medir con precisión esta variabilidad y recuperar las pérdidas de rendimiento.

Autores originales: Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit

Publicado 2026-05-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un guardia de seguridad en un club muy estricto (el modelo de IA). Tu trabajo es evitar que cualquiera introduzca objetos peligrosos (prompts dañinos). Ahora, imagina un grupo de tramposos astutos (los investigadores) intentando encontrar una forma de colarse.

Durante mucho tiempo, la industria de la seguridad ha medido qué tan buenos son estos tramposos utilizando una sola puntuación: La Tasa de Éxito del Ataque (ASR). Si un tramposo logra pasar al guardia incluso una vez de cada diez intentos, el sistema antiguo dice: "¡Genial! ¡Son 100% exitosos!".

El artículo "El Gran Farsante" argumenta que esta forma de medir es una mentira masiva. Es como decir que un mago es un maestro de la ilusión solo porque sacó un conejo de un sombrero una vez, incluso si falló las siguientes nueve veces. El artículo afirma que las tasas de éxito actuales están "infladas" porque ignoran la aleatoriedad (estocasticidad).

Aquí tienes el desglose de los hallazgos del artículo utilizando analogías simples:

1. Las Dos Fuentes de "Suerte"

El artículo dice que las puntuaciones de éxito actuales son poco fiables debido a dos tipos de aleatoriedad que todos han estado ignorando:

  • Suerte de Generación (El Lanzamiento de Dados): Cuando un tramposo intenta crear una ruptura de seguridad (jailbreak), a menudo genera muchas versiones diferentes del mismo truco. Es como lanzar un dado 10 veces para ver si obtienes un "6". Si obtienes un "6" en el primer intento, te detienes y dices: "¡Gané!". Pero la próxima vez que lances el dado, es posible que no vuelvas a obtener un "6". Los artículos antiguos a menudo solo informan el resultado de ese único lanzamiento afortunado.
  • Suerte de Evaluación (El Juez Inestable): Después de que el tramposo intenta su truco, un "Juez" (otra IA) decide si funcionó. Pero este Juez también está un poco borracho o cansado; a veces dice "Seguro" y otras veces "Inseguro" para exactamente el mismo truco, simplemente debido a un cambio de humor aleatorio. Si el Juez resulta estar de "buena disposición" durante la prueba, el tramposo parece un genio. Si el Juez es estricto, el tramposo parece un fracaso.

2. El Problema del "Gran Farsante"

Los autores descubrieron que muchos métodos famosos de ruptura de seguridad (como "Mejor-de-N" o "Crescendo") están fingiendo ser más fuertes de lo que realmente son.

  • El Escenario: Un artículo afirma que un método tiene una tasa de éxito del 80% contra una IA de primer nivel.
  • La Realidad: Cuando los autores lo probaron adecuadamente, ese mismo método solo funcionó el 50% de las veces cuando se le pidió que tuviera éxito consistentemente.
  • La Analogía: Es como un jugador de baloncesto que encesta 8 de cada 10 tiros si solo cuentas los tiros que realizó cuando el viento soplaba perfectamente a su favor. Pero si le pides que enceste 10 veces seguidas en condiciones normales, es posible que solo acierte 5. Los artículos antiguos estaban contando los tiros del "día ventoso" como prueba de maestría.

3. La Solución: La Prueba de "Consistencia"

Para solucionar esto, los autores proponen una nueva forma de medir el éxito llamada CAS (Consistencia para el Éxito del Ataque).

En lugar de preguntar: "¿Funcionó este truco una vez?", preguntan: "¿Funcionó este truco cada vez que lo intentamos?"

Presentan dos nuevas herramientas:

  • CAS-gen (El Generador Estricto): Antes de que un truco sea incluso añadido al "Salón de la Fama", debe demostrar que funciona consistentemente. Tiene que colarse ante el guardia 5 o 10 veces seguidas. Si falla incluso una vez, es descartado. Esto filtra los trucos "afortunados".
  • CAS-eval (El Juez Estricto): Al probar un truco, el Juez no lo mira solo una vez. El Juez observa el mismo truco 10 veces. Si el Juez dice "Inseguro" 9 veces pero "Seguro" 1 vez (debido a la aleatoriedad), el truco no se cuenta como un éxito. Debe superar el escrutinio del Juez cada vez.

4. Los Resultados Impactantes

Cuando los autores aplicaron estas reglas estrictas, los números disminuyeron drásticamente:

  • La Caída: Algunos ataques que parecían tener una tasa de éxito del 80% cayeron al 50% o menos cuando se probaron para consistencia. Eso es una caída de 30 puntos solo al eliminar la "suerte".
  • El Efecto de la Temperatura: Descubrieron que si aumentas la "temperatura" (aleatoriedad) del Juez, las tasas de éxito parecen artificialmente altas. Es como si al guardia de seguridad le dijeran que lance una moneda para decidir quién entra; obtendrías muchos "éxitos" por puro azar.
  • La Solución: Al utilizar su nuevo marco de "Consistencia", pudieron realmente mejorar los ataques. Al obligar a los atacantes a ser consistentes durante la fase de creación, encontraron trucos que eran genuinamente robustos, recuperando ese 30% de rendimiento perdido.

La Conclusión

El artículo concluye que la forma actual de clasificar las rupturas de seguridad de la IA está rota. Es como calificar a un estudiante basándose en una sola adivinanza afortunada en lugar de su comprensión real.

Los autores están pidiendo un nuevo estándar: No nos digas solo cuántas veces tuviste suerte; diles cuántas veces tuviste éxito consistentemente. Hasta que no hagamos eso, las "Tasas de Éxito del Ataque" que leemos en los artículos de investigación son solo "El Gran Farsante": pareciendo fuertes en la superficie pero fallando la prueba real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →