← Últimos artículos
💻 computer science

The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models

Este artículo revela que los conceptos eliminados en los modelos de difusión desaprendidos persisten como subespacios lineales coherentes dentro de los embeddings de tokens, lo que conduce al desarrollo de SubAttack, un poderoso método de jailbreaking que explota esta estructura, y SubDefense, un mecanismo ligero que proyecta fuera el subespacio para suprimir robustamente los conceptos dañinos residuales mientras preserva la calidad de la generación.

Autores originales: Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu

Publicado 2026-08-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras pueden pintar cuadros con solo escuchar tus palabras. Dices: "un gato usando un sombrero", y puf, aparece una imagen perfecta. Estos se llaman Modelos de Difusión, y son como artistas digitales que aprendieron a crear estudiando millones de fotos. Pero a veces, estos artistas se vuelven un poco demasiado buenos recordando cosas que no deberían. Si les pides que dibujen algo peligroso o con derechos de autor, es posible que lo hagan de todos modos. Para solucionar esto, los científicos inventaron un proceso llamado "Desaprendizaje" (Unlearning). Piensa en ello como un profesor intentando hacer que un estudiante olvide un dato específico, como la capital de un país, sin hacer que olvide cómo hacer matemáticas o leer. El objetivo es "borrar" la mala idea del cerebro de la computadora mientras se mantiene su capacidad de dibujar todo lo demás. Pero aquí está la parte difícil: incluso después de que el profesor dice: "Olvida ese dato", es posible que el estudiante todavía tenga una forma secreta de recordarlo, oculta de una manera que no podemos ver fácilmente. Este artículo profundiza en este misterio, preguntándose: Si creemos que hemos borrado una mala idea, ¿dónde se esconde realmente y cómo podemos deshacernos de ella finalmente?

Los investigadores en este artículo descubrieron que cuando un modelo de difusión intenta "desaprender" un concepto dañino (como la desnudez o el estilo de un artista específico), en realidad no lo elimina. En su lugar, el concepto se esconde en un subespacio lineal secreto dentro de la memoria de la computadora. Para usar una metáfora, imagina que el cerebro de la computadora es una biblioteca gigante de palabras. Cuando intentamos eliminar el libro sobre la "Desnudez", la computadora no quema el libro. En su lugar, tritura las páginas y esconde los fragmentos dentro de un cajón específico e invisible en la biblioteca. El artículo muestra que estos fragmentos todavía están organizados en una línea limpia y predecible. Los autores llaman a este cajón oculto un "subespacio residual".

Para probar esto, el equipo creó una nueva herramienta llamada SubAttack. En lugar de adivinar palabras al azar para engañar a la computadora (que es como los hackers anteriores intentaban hacerlo), SubAttack actúa como un maestro bibliotecario que sabe exactamente dónde está ese cajón invisible. Aprende un conjunto especial de "llaves mágicas" (que son simplemente combinaciones de palabras normales) que abren el cajón. Cuando usaron estas llaves, la computadora "desaprendida" comenzó a dibujar inmediatamente las imágenes dañinas de nuevo, demostrando que el concepto nunca se había ido realmente. Lo que es fascinante es que estas llaves están hechas de palabras que podemos entender. Por ejemplo, para hacer que la computadora dibuje a una persona "desnuda" de nuevo, las llaves podrían ser una mezcla de palabras como "esclavo", "caderas" y "piel". Esto muestra que la computadora todavía está conectando la mala idea con estos indicios ocultos y relacionados.

El artículo también encontró que este cajón secreto no está solo en una computadora; está en muchos modelos "desaprendidos" diferentes. Si encuentras la llave para un modelo, a menudo funciona en otros también. Esto sugiere que la forma en que estas computadoras "olvidan" es defectuosa de una manera muy similar en todos los casos. No están borrando la memoria; solo la están escondiendo de una manera que sigue una línea recta y predecible.

Pero la historia no termina con el hackeo. Debido a que los investigadores entendieron exactamente cómo se escondía el concepto, construyeron un escudo llamado SubDefense. Si SubAttack es la llave que abre el cajón, SubDefense es una placa de metal pesado que suelda ese cajón para cerrarlo. Funciona tomando toda la biblioteca de palabras de la computadora y "proyectándolas" matemáticamente lejos de ese cajón secreto. Es como decirle al bibliotecario: "No importa qué palabra uses, asegúrate de que nunca apunte hacia ese cajón oculto específico".

Los resultados fueron impresionantes. Cuando usaron SubDefense, la computadora se volvió mucho más difícil de engañar. Incluso cuando los hackers intentaron usar los métodos antiguos o las nuevas llaves de SubAttack, la computadora se negó a dibujar las imágenes dañinas. Al mismo tiempo, la computadora no perdió su capacidad de dibujar imágenes seguras y hermosas. De hecho, las imágenes que dibujó después de la defensa eran tan de alta calidad como antes. El artículo sugiere que, aunque aún no podemos borrar el concepto perfectamente, al menos podemos bloquear el camino específico que utiliza para filtrarse de nuevo. Esto nos brinda una nueva y clara forma de entender por qué el "desaprendizaje" es tan difícil y ofrece una solución práctica y lista para usar para hacer que estos artistas digitales sean más seguros para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →