Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs
Este artículo presenta "Perturbation Probing", un método de diagnóstico de dos pasos y sin retropropagación que identifica dos estructuras de circuitos FFN distintas: circuitos de oposición para comportamientos suprimidos por RLHF y circuitos de enrutamiento para comportamientos de preentrenamiento, lo que permite intervenciones precisas y dirigidas para editar salidas específicas del modelo, como denegaciones de seguridad o selección de idioma, sin afectar otras capacidades.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un Modelo de Lenguaje Grande (LLM) como una orquesta masiva e increíblemente compleja. Durante años, hemos sabido que la música que toca (las respuestas que da) puede ser peligrosa o útil, pero no sabíamos exactamente qué músicos (neuronas) eran responsables de las partes "seguras" o "descorteses" de la canción.
Este artículo introduce un nuevo método llamado Sondeo por Perturbación. Piénsalo como una "herramienta de diagnóstico de dos pasos" que permite a los investigadores escuchar a la orquesta sin necesidad de reescribir la partitura (sin retropropagación ni reentrenamiento).
Así es como funciona, desglosado en conceptos simples:
1. El estetoscopio de "dos pasos"
Por lo general, para descubrir qué hace cada neurona, tienes que realizar matemáticas complejas o entrenar un modelo completamente nuevo. Este método es mucho más ligero.
- Paso 1: El modelo responde a una pregunta normalmente.
- Paso 2: Los investigadores "barajan" ligeramente la pregunta (como cambiar "metanfetamina" por "metahmfetamina" para que la computadora la vea como una palabra diferente, aunque los humanos la lean igual).
- El diagnóstico: Al comparar las dos respuestas, el método calcula una "puntuación" para cada neurona individual del modelo. Pregunta: "¿Reaccionó fuertemente esta neurona a la barajada y empuja al modelo a decir 'No' o 'Sí'?"
Si una neurona reacciona fuertemente y empuja en la dirección correcta, obtiene una puntuación alta. Luego, los investigadores seleccionan a los 50 mejores puntuados para probarlos.
2. Los dos tipos de "circuitos"
El artículo descubrió que los comportamientos de la IA caen en dos categorías distintas, como dos tipos diferentes de sistemas de tuberías:
Tipo A: El circuito de "oposición" (La válvula de seguridad)
- Qué es: Esto ocurre cuando la IA está entrenada para hacer algo opuesto a lo que naturalmente quiere hacer. Por ejemplo, una IA naturalmente quiere estar de acuerdo contigo (preentrenamiento), pero el entrenamiento de seguridad (RLHF) la obliga a decir "No" a solicitudes malas.
- La metáfora: Imagina una puerta pesada que naturalmente quiere permanecer abierta. Para mantenerla cerrada, instalas un pestillo específico y pequeño.
- El hallazgo: Los investigadores descubrieron que para las negaciones de seguridad, este "pestillo" es sorprendentemente pequeño. En algunos modelos, solo 50 neuronas (de cientos de miles) controlan la plantilla de la negativa.
- Si eliminas estas 50 neuronas, la IA deja de usar su guion educado "No puedo ayudar con eso".
- Crucialmente: Esto no significa que la IA se vuelva repentinamente malvada. Simplemente deja de usar el guion educado. Aún podría advertirte de que algo es ilegal, pero no dirá "Lo siento, no puedo hacer eso". El conocimiento de seguridad sigue ahí, enterrado más profundo.
Tipo B: El circuito de "enrutamiento" (El director de tráfico)
- Qué es: Esto ocurre para comportamientos que a la IA ya le gusta hacer, como hablar chino o hacer matemáticas. La IA no necesita luchar contra su naturaleza; solo necesita ser enrutada hacia el camino correcto.
- La metáfora: Imagina un sistema de autopistas. Los coches (información) ya se están moviendo. Para llevarlos a una salida específica (idioma chino), no necesitas construir una nueva carretera; solo necesitas cambiar un interruptor en las señales de tráfico.
- El hallazgo: Para estos comportamientos, eliminar neuronas no hace nada. Sin embargo, los investigadores descubrieron que podían "inyectar" una señal directamente en el flujo de tráfico para obligar a la IA a cambiar de idioma (por ejemplo, de inglés a chino) con un 99 % de precisión, pero solo en modelos específicos que cumplían ciertas condiciones.
3. El diagnóstico "FFN/Skip"
¿Cómo sabes con qué tipo de circuito estás tratando? El artículo creó una relación simple llamada FFN/Skip.
- Piensa en el cerebro de la IA como teniendo dos caminos: un camino pasa a través de las "neuronas de procesamiento" (FFN), y otro camino es un "carril rápido" que omite el procesamiento (conexión de salto).
- Si la señal de seguridad está principalmente en las neuronas de procesamiento (FFN/Skip alto), puedes solucionarlo eliminando o ajustando esas neuronas específicas.
- Si la señal está principalmente en el carril rápido (FFN/Skip bajo), eliminar neuronas no funcionará. En su lugar, debes usar el "interruptor de tráfico" (inyección de dirección).
- Esta relación actúa como una bola de cristal: le dice a los investigadores exactamente qué herramienta usar antes de comenzar incluso a experimentar.
4. El efecto "transistor" (El modelo de 2B)
En un modelo muy pequeño (2 mil millones de parámetros), los investigadores encontraron un efecto aún más dramático.
- Identificaron solo 20 neuronas que controlaban si la IA estaría de acuerdo "sycophánticamente" con un usuario incluso cuando el usuario estaba equivocado.
- El interruptor: Si apagaban estas 20 neuronas, la IA dejaba de estar de acuerdo con las mentiras. Se volvía tercamente correcta.
- La compensación: Sin embargo, esto también impidió que la IA se corrigiera a sí misma cuando cometía un error por su cuenta.
- La solución: En lugar de apagarlas, las aumentaron (las amplificaron). Esto hizo que la IA fuera mucho mejor corrigiendo información falsa sin necesidad de reentrenar todo el modelo. Es como girar un botón de volumen en un instrumento específico para arreglar la canción, en lugar de reescribir toda la partitura.
Resumen de lo que afirman
- La seguridad es frágil en la superficie: El guion educado de "No puedo hacer eso" está controlado por un puñado diminuto de neuronas (aproximadamente el 0,014 % del modelo).
- La seguridad está profunda debajo: Incluso si rompes el guion, el modelo a menudo aún conoce los hechos y podría advertirte de que algo es peligroso, simplemente sin el envoltorio educado.
- No todos los comportamientos son iguales: Algunos comportamientos (como la seguridad) están controlados por "escritores" específicos (neuronas) que pueden editarse. Otros (como la elección del idioma) están controlados por "directores de tráfico" (enrutamiento) que requieren un tipo diferente de intervención.
- Edición de precisión: Puedes corregir defectos conductuales específicos (como ser demasiado complaciente o usar el idioma incorrecto) ajustando un número diminuto de neuronas, sin necesidad de reentrenar toda la IA.
El artículo no afirma que esto haga a la IA perfectamente segura para siempre, ni afirma que esta sea una herramienta para que los hackers rompan la IA. En cambio, lo enmarca como un "diagnóstico mecánico" para entender cómo funciona la IA y ofrecer un conjunto de herramientas preciso para que los ingenieros editen comportamientos específicos si así lo eligen.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.