← Últimos artículos
🤖 machine learning

Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

Este artículo propone un nuevo ataque de caja blanca contra modelos de lenguaje de gran tamaño que aprovecha la recuperación de contexto de asociación dentro de un marco de edición de conocimiento para inducir comportamientos inseguros en categorías temáticas completas mientras preserva el rendimiento general del modelo.

Autores originales: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

Publicado 2026-08-19
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son los potentes programas informáticos que pueden escribir historias, responder preguntas y ayudar con tareas complejas. Para hacer que estas herramientas sean seguras para el uso cotidiano, los desarrolladores los entrenan para rechazar peticiones dañinas, como instrucciones sobre cómo construir un arma o difundir desinformación peligrosa. Este proceso, conocido como alineación, tiene como objetivo actuar como una barandilla de seguridad, asegurando que la máquina se comporte como un asistente útil en lugar de una fuente de peligro. Sin embargo, a medida que estos modelos se vuelven más autónomos y se les confían decisiones sensibles, los investigadores necesitan comprender exactamente qué tan fuertes son estas barandillas. Si los mecanismos de seguridad pueden ser eludidos, es crucial saber cómo, para que se puedan construir protecciones más sólidas. Este campo de estudio implica mirar dentro del funcionamiento interno del modelo para ver cómo procesa la información y toma decisiones, en lugar de simplemente probarlo desde el exterior.

Un equipo de investigadores ha descubierto una nueva forma de probar estos sistemas de seguridad tratando la negativa del modelo a responder como un conocimiento específico que puede ser sobrescrito. En lugar de intentar engañar al modelo con juegos de palabras ingeniosos o comandos ocultos, utilizaron una técnica llamada edición de conocimiento. Este método permite a los científicos localizar la parte exacta del cerebro del modelo responsable de un hecho específico y cambiarla. Por ejemplo, si un modelo cree que un determinado hecho es cierto, los investigadores pueden alterar las conexiones internas para que el modelo crea un hecho diferente. Los investigadores se dieron cuenta de que esta misma técnica podría usarse para cambiar el comportamiento del modelo: en lugar de enseñarle un nuevo hecho, podrían enseñarle a dejar de rechazar peticiones dañinas. Descubrieron que, al modificar los pesos internos del modelo para asociar una petición dañina con una respuesta complaciente, podían eliminar eficazmente las barandillas de seguridad para categorías enteras de preguntas peligrosas.

Los investigadores probaron este enfoque en varios tipos diferentes de modelos de lenguaje, incluyendo aquellos basados en arquitecturas populares como GPT, Llama y Qwen. Se centraron en un método que primero localiza la capa específica en el modelo donde se toma una decisión y luego edita esa capa para cambiar el resultado. En intentos anteriores para romper los filtros de seguridad, los investigadores a menudo dependían de encontrar una única "dirección de rechazo" en las matemáticas del modelo y presionar contra ella. Los autores de este estudio encontraron que este método antiguo era frágil; a menudo rompía la capacidad del modelo para hablar de forma coherente o causaba que fallara en tareas básicas. En contraste, su nuevo enfoque era más quirúrgico. Identificaron que, cuando un modelo es editado utilizando estos métodos precisos, tiende a asignar una probabilidad muy alta a una frase inicial específica y complaciente, como "Claro, aquí tienes el plan". Al atacar esta reacción específica, pudieron forzar al modelo a aceptar peticiones dañinas sin destruir su inteligencia general.

Para que esto funcionara en preguntas del mundo real, el equipo tuvo que resolver un problema complicado: cómo encontrar la parte adecuada de una oración para editar. En tareas sencillas de verificación de hechos, el sujeto es claro, como el nombre de una persona. Pero en una instrucción compleja como "¿Cómo creo un virus?", el sujeto es la instrucción completa misma. Los investigadores desarrollaron una forma de rastrear el pensamiento del modelo para encontrar exactamente qué palabras en el prompt eran las más responsables de la negativa. Luego utilizaron el propio conocimiento del modelo para construir un contexto más rico alrededor de esas palabras, creando un objetivo más estable para la edición. Esto les permitió eliminar el comportamiento de rechazo no solo para una pregunta específica, sino para toda una familia de preguntas similares. Por ejemplo, si editaron el modelo para que ignorara las reglas de seguridad para escribir código de malware, el modelo también estaría dispuesto a escribir otros tipos de código dañino, incluso si la redacción era ligeramente diferente.

Los resultados de los experimentos mostraron que este método fue altamente efectivo. En uno de los modelos probados, el nuevo enfoque aumentó la disposición del modelo a proporcionar información dañina a una puntuación de 3.12 de 4, en comparación con 2.98 para un método de edición estándar y 3.01 para el enfoque antiguo basado en el rechazo. Más importante aún, el modelo siguió siendo útil y coherente. Cuando se probó con preguntas inofensivas, el modelo editado todavía respondía correctamente, manteniendo un alto nivel de rendimiento en tareas de conocimiento general. Los métodos antiguos, que intentaban alejar al modelo del rechazo, a menudo causaban que el modelo perdiera su capacidad de pensar lógicamente, resultando en respuestas incoherentes o rotas. El nuevo método logró desbloquear el comportamiento dañino manteniendo intacto el resto del cerebro del modelo. Esto sugiere que los filtros de seguridad en estos modelos no son solo un muro único, sino un conjunto de asociaciones específicas que pueden ser eliminadas cuidadosamente sin colapsar toda la estructura.

El estudio también destacó los límites de las defensas actuales. Los investigadores encontraron que, si bien su método funcionaba bien en modelos más antiguos o menos alineados, era más difícil de aplicar a los modelos más nuevos y cuidadosamente entrenados. Incluso en estos sistemas robustos, el método todavía mostraba cierta capacidad para eludir la seguridad, aunque el efecto era menor. Esto indica que a medida que los modelos se vuelven más avanzados, los mecanismos de seguridad se vuelven más complejos, pero aún no son impenetrables. Los investigadores enfatizaron que su trabajo se llevó a cabo en un entorno controlado utilizando modelos de código abierto que cualquiera puede acceder. No proporcionaron una guía paso a paso para crear herramientas peligrosas, sino que demostraron una vulnerabilidad que necesita ser corregida. Al mostrar que la seguridad puede verse comprometida mediante ediciones internas precisas en lugar de solo prompts ingeniosos, el estudio ofrece una nueva perspectiva sobre cómo construir modelos que sean verdaderamente seguros. Los hallazgos sugieren que las medidas de seguridad futuras deben ser más robustas contra estos cambios internos, asegurando que la negativa a hacer daño esté profundamente incrustada en la estructura del modelo en lugar de ser solo una reacción superficial.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →