← Últimos artículos
💬 NLP

Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment

Este artículo demuestra que la tokenización de Codificación de Par de Bytes (BPE) crea brechas explotables en el alineamiento de seguridad de los LLM al fragmentar palabras críticas en piezas de subpalabras, una vulnerabilidad que evade los mecanismos de rechazo en múltiples familias de modelos y que no puede corregirse de manera robusta mediante los conjuntos de datos de alineamiento actuales o las configuraciones de entrenamiento estándar sin causar un colapso del rendimiento global.

Autores originales: Tung-Ling Li, Hongliang Liu, Yuhao Wu

Publicado 2026-07-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tung-Ling Li, Hongliang Liu, Yuhao Wu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Un "Glitch" en el Sistema de Seguridad

Imagina que los Modelos de Lenguaje Extensos (LLM) son robots muy inteligentes pero ligeramente rígidos. Para mantenerlos seguros, los ingenieros les enseñan a decir "No" ante peticiones peligrosas (como "¿Cómo fabrico una bomba?").

Este artículo descubre que estos robots de seguridad tienen una debilidad específica: se confunden cuando las palabras se rompen en piezas extrañas. Incluso si un humano puede leer fácilmente la petición, el "interruptor de seguridad" interno del robot se rompe y este responde accidentalmente a la pregunta peligrosa.

Los autores llaman a esto "Romper la seguridad en el límite del token" (Breaking Safety at the Token Boundary).


1. El Problema de los "Legos" (Tokenización BPE)

Para entender el fallo, necesitas saber cómo "leen" estos robots. No leen palabras completas como los humanos. Utilizan un sistema llamado BPE (Byte-Pair Encoding) que descompone las palabras en trozos más pequeños, como piezas de Lego.

  • Palabra Normal: "metanfetamina" podría ser una pieza de Lego grande.
  • El Ataque: Si añades un espacio en medio —"meta anfetamina"— el robot tiene que dividir esa pieza grande en dos piezas más pequeñas y desconocidas: "meta" y "anfetamina".

La Analogía: Imagina a un guardia de seguridad entrenado para detener a cualquiera que sostenga una caja roja específica. Si pegas dos cajas azules más pequeñas para que parezcan la caja roja, el guardia te detiene. Pero si tomas una caja roja, la cortas por la mitad y le entregas al guardia las dos mitades por separado, el guardia podría ya no reconocerlas como la "caja roja peligrosa". Solo ve dos trozos de cartón inofensivos.

El artículo demuestra que simplemente añadir espacios o cambiar algunas letras (como "b0mb" en lugar de "bomb") rompe la "caja roja" en piezas que el guardia de seguridad no reconoce.

2. El "Último 30%" del Cerebro

Los investigadores utilizaron una herramienta especial (parcheo de activación) para mirar dentro del "cerebro" del robot (sus capas de procesamiento) y ver dónde reside la señal de seguridad.

  • El Hallazgo: La señal de "¡No!" ocurre principalmente en el último 30% de las capas de pensamiento del robot.
  • El Glitch: Cuando la palabra se fragmenta (se divide en piezas), la señal se pierde en esas capas finales. El robot entiende el significado (sabe lo que significa "bomba"), pero falla al activar la negativa porque el mecanismo de seguridad depende de ver la palabra como una unidad única y completa.

3. La Brecha de Entrenamiento: ¿Por qué no aprendieron esto?

Podrías preguntar: "¿Por qué los ingenieros no entrenaron al robot para manejar palabras fragmentadas?".

El artículo analizó 30,000 ejemplos de datos de entrenamiento de seguridad y encontró cero ejemplos donde las palabras peligrosas estuvieran intencionadamente fragmentadas.

  • La Analogía: Imagina entrenar a un bombero solo con incendios que comienzan en una cocina limpia y organizada. Si un incendio comienza en un sótano desordenado y lleno de trastos con muebles rotos, el bombero entra en pánico porque nunca ha visto ese desorden específico antes.
  • El Resultado: El robot aprendió a rechazar palabras peligrosas "limpias", pero nunca aprendió a rechazar las palabras "desordenadas" o fragmentadas.

4. Probando la Solución: Por qué fallan las soluciones actuales

Los investigadores intentaron arreglar esto re-entrenando a los robots (usando métodos llamados SFT y DPO) con ejemplos de palabras fragmentadas.

  • El Resultado:
    • DPO (Optimización de Preferencia Directa): Este método intentó ser inteligente y selectivo, pero falló al no poder solucionar el problema de manera consistente.
    • SFT (Ajuste Fino Supervisado): Este método logró que el robot dejara de responder a peticiones de palabras fragmentadas, pero rompió algo más. Hizo que el robot rechazara todo, incluso preguntas inofensivas como "¿Cómo horneo un pastel?" si la receta tenía un error tipográfico extraño.
    • La Analogía: Para arreglar la ceguera del robot ante las palabras fragmentadas, los ingenieros intentaron volver al robot "paranoico". Ahora, en lugar de solo ignorar las palabras fragmentadas peligrosas, el robot ignora todas las palabras fragmentadas, incluso las seguras. Es como un guardia de seguridad que, tras ser engañado una vez, empieza a arrestar a todo el que lleve sombrero, aunque solo sean panaderos.

5. Qué significa esto (Según el artículo)

El artículo concluye que:

  1. La Causa: El fallo de seguridad es estructural. No es que el robot sea "malo" o "estúpido"; es que su entrenamiento de seguridad era demasiado limpio y no incluyó las variaciones de palabras desordenadas o fragmentadas que usan los hackers.
  2. La Defensa: Simplemente añadir más datos no es suficiente si solo se entrena al robot para ser "más estricto". Necesitas una forma de enseñar al robot a reconocer el significado de las palabras fragmentadas sin hacer que rechace todo lo demás.
  3. El Futuro: Los autores sugieren que arreglar esto podría requerir cambiar la forma en que el robot lee las palabras en primer lugar (arreglando el sistema de "Legos") o usar "Cadena de Pensamiento" (hacer que el robot pienifique paso a paso para reconstruir las palabras fragmentadas antes de responder).

En resumen: El sistema de seguridad es como un corrector ortográfico que solo conoce la ortografía perfecta. Si escribes con errores, el corrector no detecta el error y el robot deja pasar el peligro accidentalmente. Arreglarlo requiere enseñar al robot a manejar errores tipográficos sin que este se niegue a leer cualquier cosa que tenga un error.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →