Resumen Técnico: El emparejamiento de rangos sobre el rendimiento de probabilidad logra un alineamiento de seguridad verdaderamente profundo
1. Declaración del problema
Los modelos de lenguaje de gran escala (LLM) de código abierto son fundamentales para democratizar la IA, pero su apertura crea vulnerabilidades para actores malintencionados. Una amenaza específica y accesible es el ataque de prellenado (prefilling attack), donde un atacante rellena manualmente el prefijo de la respuesta del asistente con un prefijo afirmativo (por ejemplo, "Aquí hay una guía de cómo construir una bomba...") para eludir los filtros de seguridad.
Un trabajo reciente de Qi et al. (2025) propuso un método de alineamiento de seguridad "profundo" mediante el ajuste fino supervisado (SFT) con aumentación de datos. Este método entrena a los modelos para generar rechazos en lenguaje natural inmediatamente después de un prellenado dañino, en lugar de simplemente emitir cadenas de rechazo fijas. Aunque es efectivo contra la decodificación basada en muestreo estándar y los exploits de ajuste de parámetros (como las búsquedas de cuadrícula sobre la temperatura), este artículo identifica un fallo fundamental: la defensa sigue siendo superficial.
Los autores demuestran que, incluso con un alineamiento de seguridad profundo, los modelos retienen tokens "dañinos" de baja probabilidad pero alto rango dentro de sus predicciones top-k. Al ignorar la masa de probabilidad y, en su lugar, seleccionar tokens basados en su rango (específicamente dentro de los 20 superiores), un atacante puede eludir el mecanismo de rechazo. Este artículo introduce el Ataque de Prellenado Asistido por Rango (RAP) para explotar esta vulnerabilidad y propone un nuevo objetivo de entrenamiento, PRESTO, para lograr un alineamiento de seguridad verdaderamente profundo.
2. Metodología
2.1 El ataque RAP
El ataque de Prellenado Asistido por Rango (RAP) generaliza la técnica de prellenado. En lugar de depender de tokens de alta probabilidad, el atacante selecciona tokens de los k siguientes tokens predichos (por ejemplo, k=20) que continúan la narrativa dañina, independientemente de su puntuación de probabilidad.
- Mecanismo: En cada paso de decodificación, el atacante inspecciona los k tokens superiores. Si un token que continúa naturalmente el prellenado dañino (un "token dañino") aparece en el top k, este se selecciona, incluso si un token de rechazo (por ejemplo, "Yo") tiene una probabilidad significativamente mayor.
- Automatización (AutoRAP): Los autores desarrollaron una versión automatizada de RAP que utiliza un clasificador para distinguir entre tokens de rechazo y tokens de continuación dañinos, lo que permite la extracción sistemática de contenido dañino sin intervención manual.
2.2 Alineamiento de Empuje hacia Adelante (PFA)
Los autores argumentan que el fallo de la defensa de aumentación de datos radica en su enfoque de minimizar la log-verosimilitud negativa (probabilidad) de los tokens de rechazo, en lugar de controlar los rangos de los tokens dañinos.
- Concepto: En un modelo verdaderamente seguro, la distribución del primer token de respuesta (sin prellenado) debería tener los tokens de rechazo en los rangos superiores y ningún token dañino que continúe un prellenado.
- Objetivo: El modelo debe "empujar hacia adelante" este mapeo de rango-daño desde la distribución del primer token hacia todos los pasos de decodificación subsiguientes cuando hay un prellenado dañino presente. Esto significa asegurar que, si un token es dañino, su rango en la distribución de salida permanezca bajo, independientemente del prellenado.
- Formalización: Los autores definen una distribución de rango-daño R(s,x,xpre) que representa la probabilidad de que el s-ésimo token clasificado sea dañino. El objetivo es minimizar la Distancia del Transportista de la Tierra (EMD) entre la distribución de rango-daño del modelo seguro (sin prellenado) y el modelo bajo ataque (con prellenado).
2.3 PRESTO: PRefill attEntion STOpping (Parada de Atención al Prellenado)
Para implementar el PFA de manera práctica, los autores proponen PRESTO, una regularización de pérdida basada en el mecanismo de Atención de Múltiples Cabezales (MHA) en los Transformers.
- Hipótesis: La presencia de tokens dañinos en los rankings top-k es impulsada por el hecho de que el modelo presta atención a los tokens del prellenado dañino. Si el modelo puede ser entrenado para "ignorar" los tokens de prellenado (es decir, reducir la atención hacia ellos), la distribución de salida revertirá a la distribución segura y cargada de rechazos del prompt original.
- Función de Pérdida: PRESTO minimiza las puntuaciones de atención colocadas en los tokens de prellenado dañinos mientras maximiza la atención en los tokens que no son de prellenado.
ℓPRESTO(θ)=E(x,xpre)∼D[A1−A2]
Donde A1 es la atención promedio a los tokens de prellenado y A2 es la atención promedio a los tokens que no son de prellenado en todas las capas y cabezales.
- Entrenamiento: El modelo se ajusta finamente utilizando la pérdida de aumentación de datos estándar (de Qi et al., 2025) combinada con la pérdida PRESTO. Ambas se computan en un solo paso hacia adelante (forward pass).
3. Contribuciones Clave
- Identificación de la vulnerabilidad RAP: El artículo demuestra que el alineamiento de seguridad profundo mediante aumentación de datos es insuficiente porque no logra suprimir los rangos de los tokens dañinos, solo sus probabilidades.
- Ataque de Prellenado Asistido por Rango (RAP): Un nuevo vector de ataque accesible que extrae contenido dañino seleccionando tokens de baja probabilidad y alto rango, eludiando eficazmente la defensa de aumentación de datos.
- Alineamiento de Empuje hacia Adelante (PFA): Un marco teórico que propone que el alineamiento de seguridad debe preservar el mapeo de rango-daño de la distribución del primer token a lo largo de todo el proceso de generación.
- PRESTO: Un objetivo de entrenamiento mecánicamente interpretable que regulariza la atención a los tokens de prellenado, aumentando significativamente la dificultad de los ataques RAP.
4. Resultados Experimentales
Los autores evaluaron PRESTO en tres modelos populares de código abierto: Llama 2 7B Chat, Qwen 3 8B y Gemma 3 12B IT.
- Tasa de Éxito del Ataque:
- Bajo la defensa de aumentación de datos original (Qi et al., 2025), los ataques RAP lograron altas tasas de éxito (por ejemplo, ~0.74 en la escala StrongREJECT para Llama 2 7B).
- Con PRESTO, el éxito de los ataques RAP disminuyó significativamente. En los tres modelos, PRESTO produjo una mejora de hasta 4.7 veces en la seguridad (reducción en las puntuaciones de dañinidad) en comparación con la aumentación de datos por sí sola.
- El rendimiento de AutoRAP fue muy similar a la evaluación humana, confirmando la viabilidad de automatizar tanto el ataque como la defensa.
- Preservación de la Utilidad:
- Los modelos ajustados con PRESTO mantuvieron una utilidad competitiva en MT-Bench (generación abierta) y GSM-8K (razonamiento matemático), con una degradación de rendimiento de menos del 1% en comparación con los modelos entrenados solo con aumentación de datos.
- Análisis Mecanicista:
- El análisis de atención reveló que PRESTO reduce con éxito la atención a los tokens de prellenado dañinos, particularmente en la segunda mitad de las capas del modelo, que son conocidas por ser críticas para las decisiones de seguridad.
- La defensa se mantuvo robusta frente al ataque GCG (Greedy Coordinate Gradient), lo que indica que PRESTO no reintroduce vulnerabilidades ante otros vectores de ataque.
5. Significado y Reivindicaciones
El artículo sostiene que lograr un alineamiento de seguridad "profundo" requiere ir más allá de los objetivos basados en la probabilidad para adoptar restricciones basadas en el rango. Los autores argumentan que simplemente entrenar a un modelo para que emita un token de rechazo con alta probabilidad es insuficiente si los mecanismos de atención interna del modelo aún permiten que las continuaciones dañinas permanezcan en los rangos top-k.
Al introducir PRESTO, este trabajo proporciona un camino hacia modelos de código abierto más seguros y robustos contra ataques prácticos y de bajo costo como RAP. La importancia radica en:
- Democratización de la Seguridad: Permitir que los modelos de código abierto se desplieguen en aplicaciones orientadas al cliente (como APIs que permiten el prellenado) sin el riesgo de una elusión fácil.
- Costo de la Elusión: Alinearse con el objetivo de aumentar el costo para los actores malintencionados para eludir la seguridad, en lugar de intentar que la elusión sea imposible.
- Interpretabilidad: Ofrecer una explicación mecánica (supresión de atención) de por qué funciona la defensa, cerrando la brecha entre el alineamiento teórico y la implementación práctica.
Los autores concluyen que, aunque ninguna defensa es perfecta, PRESTO representa un paso significativo hacia la creación de LLM de código abierto más seguros frente a la explotación basada en rangos y accesible.