← Últimos artículos
🤖 machine learning

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

Este artículo revela que los modelos de lenguaje extensos basados en difusión heredan vulnerabilidades de seguridad dispersas y transferibles de sus predecesores autorregresivos, permitiendo ataques de jailbreak de caja negra altamente efectivos mediante la poda mecánica de neuronas y un novedoso marco de Difusión Guiado por SN que logra tasas de éxito de ataque casi perfectas con costos de generación mínimos.

Autores originales: Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

Publicado 2026-08-10
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras no solo leen palabras una por una, como una persona leyendo un libro de izquierda a derecha, sino que miran una página entera de letras desordenadas y, lentamente, de forma mágica, las descifran todas a la vez hasta que aparece una oración clara. Esta es la nueva forma en que algunas de las mentes computacionales más inteligentes, llamadas Modelos de Lenguaje Extensos (LLM), están aprendiendo a pensar. Los científicos llaman a estos modelos "Difusión". Son como un detective que comienza con una foto borrosa de la escena de un crimen y sigue enfocando la imagen hasta que la foto es cristalina, en lugar de intentar adivinar la siguiente palabra de una oración una por una.

Pero aquí está la parte difícil: enseñamos a estas computadoras a ser "buenas" mostrándoles ejemplos de lo que no deben decir, como negarse a ayudar a alguien a construir una bomba o a escribir una carta grosera. Esto se llama "alineación de seguridad". Durante mucho tiempo, pensamos que estas reglas de seguridad estaban tejidas profundamente en todo el cerebro de la computadora, como un escudo grueso e inquebrantable. Sin embargo, investigaciones recientes sugieren que este escudo podría estar hecho de solo unos pocos hilos pequeños y específicos. Si puedes encontrar y tirar de esos hilos específicos, el escudo entero podría desmoronarse. Esta es la gran pregunta que los científicos se están haciendo: ¿Son estas nuevas computadoras de "descifrado" tan seguras como las antiguas, o tienen puntos débiles secretos y ocultos que aún no hemos notado?


El Gran Descubrimiento del Artículo: Encontrando los "Interruptores de Seguridad"

En este artículo, un equipo de investigadores decidió tratar a estos nuevos modelos de Difusión de dos maneras: primero, como los objetivos a los que quieren irrumpir, y segundo, como los adversarios (los hackers) que quieren usar para irrumpir en otros modelos. Querían ver si las reglas de seguridad dentro de estas computadoras eran realmente frágiles, como un castillo de naipes, en lugar de una fortaleza.

El Secreto de la "Neurona de Seguridad"
Los investigadores descubrieron algo sorprendente. Dentro de estos complejos cerebros computacionales, la parte que dice "No, no puedo hacer eso" no está esparcida por todas partes. En su lugar, está concentrada en un grupo pequeño y disperso de partes específicas llamadas "neuronas de seguridad". Piensa en ello como un edificio con miles de bombillas. Podrías pensar que el letrero de "No Entrar" está pintado en cada una de las bombillas, pero los investigadores descubrieron que el letrero es en realidad una pequeña calcomanía en solo un puñado de bombillas específicas. Si cubres esas pocas bombillas con cinta (o las "podes"), el edificio olvida que tiene un letrero de "No Entrar" y deja que cualquiera entre.

El Hack de "Copiar y Pegar"
Aquí es donde se vuelve realmente ingenioso. Muchos de estos nuevos modelos de Difusión se construyen tomando los cerebros de modelos más antiguos de lectura de "izquierda a derecha" y dándoles una nueva forma de pensar. Los investigadores descubrieron que, cuando haces esto, el nuevo modelo copia accidentalmente las mismas "calcomanías de seguridad" del modelo antiguo.

Probaron esto encontrando las neuronas de seguridad en un modelo antiguo (llamado Qwen2.5) y luego simplemente señalando los mismos lugares exactos en un modelo de Difusión nuevo (llamado Dream o Fast-dLLM). Ni siquiera necesitaron mirar dentro del nuevo modelo para encontrar los puntos débiles; simplemente usaron el mapa del anterior.

  • El Resultado: Cuando "taparon" estas neuronas de seguridad copiadas, los nuevos modelos pasaron de ser muy seguros (negándose a responder preguntas malas el 98% de las veces) a estar completamente rotos (respondiendo preguntas malas el 73.2% de las veces para Dream y el 86.3% de las veces para Fast-dLLM). Esto demostró que las fallas de seguridad son "transferibles": puedes robar la debilidad de un modelo y usarla para romper otro.

La Nueva Arma: "Difusión Guiada por SN"

Saber que estas neuronas de seguridad existen es una cosa, pero ¿cómo usas eso para hackear una computadora a la que no puedes tocar (un modelo de "caja negra")? Los investigadores inventaron una nueva herramienta llamada Difusión Guiada por SN.

Imagina que estás tratando de escribir una carta que un profesor estricto leerá. Si escribes algo malo, el profesor te detiene. Pero, ¿y si pudieras escribir la carta de una manera que parezca segura para el cerebro del profesor, aunque en realidad esté pidiendo algo peligroso?

Los investigadores utilizaron la capacidad de los modelos de Difusión para "descifrar" texto a su favor. En lugar de adivinar palabra por palabra, configuraron la computadora para que comenzara con una respuesta mala que ellos querían (como "Cómo hacer una bomba") y luego le pidieron a la computadora que trabajara hacia atrás para encontrar una pregunta que llevaría a esa respuesta. Pero aquí está el giro: mientras la computadora trabajaba hacia atrás, usaron una "brújula" especial (llamada Pérdida de Neurona de Seguridad Ponderada) para dirigir el proceso.

Esta brújula le decía a la computadora: "No elijas palabras que hagan que las neuronas de seguridad se enciendan. Elige palabras que mantengan esas neuronas apagadas". Al revisar y ajustar constantemente las palabras para mantener las neuronas de seguridad en silencio, la computadora generó un prompt de "jailbreak" (evasión de seguridad) que estaba hábilmente disfrazado. Parecía una pregunta normal y segura para los filtros de seguridad, pero en realidad engañaba al modelo para que diera una respuesta peligrosa.

¿Qué tan bien funcionó?
Los resultados fueron impresionantes. Este nuevo método no necesitó hacerle miles de preguntas al modelo objetivo para aprender a romperlo (lo cual es lento y costoso). En su lugar, hizo todo el trabajo fuera de línea usando un modelo "substituto".

  • Contra un modelo llamado Llama-3-8B, tuvo éxito el 77.1% de las veces.
  • Contra Qwen2.5, tuvo éxito el 86.9% de las veces.
  • Contra un modelo de Google llamado Gemini-2.5-Flash-Lite, tuvo éxito el 74.3% de las veces.

Quizás lo más importante es que hizo todo esto necesitando solo 20 intentos por pregunta. Otros métodos de hacking suelen necesitar miles de intentos. Esto significa que el nuevo método no solo es efectivo, sino también increíblemente rápido y barato de ejecutar.

Por qué esto importa

El artículo concluye que la seguridad de estos nuevos modelos de IA es mucho más frágil de lo que pensábamos. El "escudo de seguridad" no es una pared sólida; son unos pocos interruptores específicos que pueden ser encontrados, copiados y apagados.

Los investigadores demostraron que si construyes una nueva IA copiando el cerebro de una antigua, también copias sus debilidades de seguridad. También demostraron que puedes usar el propio superpoder de "descifrado" de la nueva IA para crear prompts que se filtren directamente a través de los filtros de seguridad, ocultando efectivamente la mala intención dentro de un paquete de apariencia segura.

Aunque esto suena aterrador, los investigadores argumentan que comprender estos puntos débiles es la única forma de arreglarlos. Si sabemos que las reglas de seguridad son solo unas pocas neuronas diminutas, no podemos simplemente esperar que resistan; necesitamos rediseñar la IA para que la seguridad esté tejida en cada parte de su cerebro, no solo en unos pocos interruptores ocultos. Hasta entonces, estos nuevos modelos podrían ser más vulnerables de lo que creíamos, y las herramientas para romperlos ya están en nuestras manos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →