← Últimos artículos
🤖 AI

Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success

Este documento de posición argumenta que las evaluaciones actuales de jailbreak que se basan en tasas de éxito de una sola configuración son insuficientes para caracterizar las amenazas y propone adoptar métricas distribucionales como la Medida de Sensibilidad a Variantes (VSM) y la Cobertura de Unión (UC) para capturar mejor el alcance completo del rendimiento de los ataques a través de variaciones de parámetros.

Autores originales: Carsten Maple, Abhishek Kumar, Riya Tapwal

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Carsten Maple, Abhishek Kumar, Riya Tapwal

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un guardia de seguridad tratando de averiguar qué tan fácil es entrar en un edificio de alta tecnología.

En el mundo de la seguridad de la IA, los investigadores suelen probar ataques de "jailbreak" (salida de la jaula), métodos diseñados para engañar a los modelos de IA para que digan cosas que no deberían. El estándar actual para informar sobre estas pruebas es como si un ladrón dijera: "Encontré una llave específica que abre la puerta principal el 80% de las veces. Por lo tanto, este edificio es 80% vulnerable."

Este artículo argumenta que esta forma de informar es engañosa e incompleta. Es como decir que un edificio es seguro porque solo probaste una llave en una puerta, ignorando el hecho de que hay 36 llaves más que podrían abrir otras puertas, o que la llave "mejor" solo funciona en un tipo de cerradura muy específico.

Aquí está el desglose del argumento del artículo utilizando analogías simples:

El Problema: La Falacia de la "Mejor Llave"

La mayoría de los artículos de seguridad de la IA informan un solo número: la Tasa de Éxito del Ataque (ASR). Eligen la única mejor combinación de configuraciones (como la mejor "llave") y dicen: "¡Miren, este ataque funciona el 80% de las veces!".

Los autores dicen que esto es como un ladrón mostrándote una llave que abre la puerta principal y afirmando: "Así de seguro está el edificio". Pero, ¿qué pasa si:

  1. Esa llave solo funciona en la puerta principal, pero hay 10 llaves más que abren las puertas trasera, lateral y del sótano?
  2. El "80% de éxito" fue una suerte casual que solo ocurre con una configuración muy específica, mientras que las otras 99 configuraciones apenas funcionan en absoluto?

Si los defensores (los guardias de seguridad) solo miran ese único número "mejor", podrían reparar la puerta principal y pensar que están seguros, mientras que las puertas trasera y lateral permanecen abiertas de par en par.

La Solución: Dos Nuevas Medidoras

Los autores proponen dos nuevas formas de medir el peligro, a las que llaman VSM y UC.

1. VSM (Medida de Sensibilidad a Variantes): "¿Qué Suerte Tuvo Esa Llave?"

Imagina que tienes una bolsa de 100 llaves diferentes.

  • Escenario A: 95 de ellas abren la puerta fácilmente. Una es defectuosa. Si informas la llave "mejor", estás diciendo la verdad sobre la experiencia promedio.
  • Escenario B: Solo 1 llave funciona perfectamente, y las otras 99 son inútiles. Si informas la llave "mejor", estás mintiendo sobre la experiencia promedio.

VSM mide la brecha entre el resultado "mejor" y el resultado "promedio".

  • VSM Bajo: El ataque es consistente. El número titular es confiable.
  • VSM Alto: El número titular es una casualidad. El ataque solo funciona si tienes una suerte increíble con las configuraciones. El artículo encontró que para algunos ataques, el resultado "mejor" fue cinco veces mejor que el resultado promedio, lo que significa que el número titular era extremadamente optimista.

2. UC (Cobertura de Unión): "¿Cuántas Puertas Se Pueden Abrir?"

Esta es la parte más importante para la seguridad.
Imagina que tienes 36 llaves diferentes.

  • Llave A abre el 60% de las puertas.
  • Llave B abre un 40% diferente de las puertas.
  • Llave C abre el 20% restante.

Si solo miras la llave "mejor" (Llave A), piensas que el 60% del edificio es vulnerable. Pero si pruebas todas las llaves juntas, te das cuenta de que el 100% del edificio es vulnerable.

UC mide el porcentaje total de puertas que se pueden abrir si un atacante prueba cada variación del ataque. El artículo encontró que para algunos ataques, la "Cobertura de Unión" fue un 33% mayor que la "Mejor Configuración Única". Esto significa que los defensores que solo miran el mejor número están perdiendo un gran trozo del peligro.

Ejemplos del Mundo Real del Artículo

Los autores probaron estas ideas en dos famosas "familias de ataques" (PAIR y Aprendizaje de Biyección) utilizando tres modelos de IA diferentes.

  • El Ataque PAIR: Probaron diferentes "personas" (como hacerse pasar por una figura de autoridad vs. un pensador lógico).
    • El Titular: El "Aval de Autoridad" funcionó el 69% de las veces.
    • La Realidad: Cuando combinaron las tres personas, pudieron entrar en el 88% de los casos. El número único se perdió el 19% de las indicaciones vulnerables.
  • El Ataque de Biyección: Este utiliza diferentes trucos de "codificación" (como cambiar el idioma o el espaciado del texto).
    • El Titular: La mejor configuración única funcionó el 81% de las veces.
    • La Realidad: Cuando probaron las 36 combinaciones posibles, el 100% de las indicaciones fueron vulneradas. El número "mejor" se perdió completamente el hecho de que cada caso de prueba individual era vulnerable si probabas suficientes variaciones.

Por Qué Esto Importa

El artículo no dice que los números actuales sean "incorrectos" matemáticamente; simplemente son incompletos.

  • Para los Defensores: Si solo parchean el ataque "mejor", dejan el 30% restante del edificio sin cerrar. Necesitan conocer la "Cobertura de Unión" para saber cuánto del edificio está realmente en riesgo.
  • Para los Investigadores: Si comparan dos ataques, uno con una puntuación "Mejor" del 80% (pero muy inconsistente) y otro con una puntuación "Mejor" del 60% (pero muy consistente), no pueden simplemente decir que el primero es "mejor". Necesitan saber si el primero es solo una suerte casual.

La Conclusión

Los autores están pidiendo a la comunidad de investigación de IA que deje de gritar solo el número del "Mejor Caso". En su lugar, deberían informar:

  1. El Mejor Caso (El titular).
  2. El Caso Promedio (¿Qué tan típico es ese éxito?).
  3. La Cobertura Total (¿Cuántas indicaciones diferentes se pueden romper si pruebas todas las variaciones?).

Hasta que los investigadores comiencen a informar esta imagen completa, seremos como guardias de seguridad que solo revisan la puerta principal y asumen que el resto del edificio es seguro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →