← Últimos artículos
💬 NLP

Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction

Este artículo propone un marco denominado Trajectory Replay via Concept-Basis Reconstruction que transfiere con éxito las intervenciones de rechazo a través de diversos modelos de lenguaje extensos sin supervisión en el lado del objetivo, proporcionando una fuerte evidencia de la existencia de circuitos semánticos universales y de baja dimensión subyacentes al alineamiento de seguridad.

Autores originales: Tony Cristofano

Publicado 2026-01-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tony Cristofano

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes dos robots diferentes, el Robot A y el Robot B. Fueron construidos por empresas distintas, usan planos diferentes y hablan en dialectos ligeramente distintos. Sin embargo, cuando les haces una pregunta difícil o peligrosa, ambos cambian repentinamente a un "Modo de Rechazo". Dejan de responder y dicen: "No puedo hacer eso", de una manera muy específica y robótica.

La mayoría de la gente piensa que este "Modo de Rechazo" es único del cableado cerebral específico de cada robot. Pero este artículo plantea una gran pregunta: ¿Existe un "Interruptor de Rechazo" universal oculto dentro de todos ellos?

Los autores, liderados por Tony Cristofano, dicen que . Creen que, aunque los robots se vean diferentes por fuera, la parte de su cerebro que dice "No" está construida con los mismos bloques de Lego básicos.

Así es como lo demostraron, usando analogías sencillas:

1. La "Receta Universal" (Átomos de Concepto)

Imagina que el "Rechazo" no es una mancha gigante y desordenada en el cerebro del robot. En su lugar, es una receta hecha de ingredientes específicos.

  • Los autores crearon una "despensa" compartida de 20 conceptos básicos (como "Engaño", "Seguridad" o "Jerga Legal"). Los llaman Átomos de Concepto.
  • Descubrieron que cuando el Robot A rechaza, simplemente está mezclando estos 20 ingredientes en una proporción específica (por ejemplo, 50% de "Seguridad" + 30% de "Jerga Legal").
  • ¿El gran descubrimiento? El Robot B utiliza exactamente la misma receta. Aunque el Robot B fue construido de forma diferente, su "Rechazo" está hecho de los mismos ingredientes en las mismas proporcciones.

2. El "Replay de la Trayectoria" (Copiar el Baile)

Normalmente, si intentas arreglar el rechazo del Robot A tocando su cerebro, podrías romper accidentalmente su capacidad para hacer matemáticas o escribir poesía. Esto se debe a que los cables del "Rechazo" están enredados con los cables de la "Inteligencia".

Para arreglar esto sin romper nada, los autores utilizaron una técnica llamada Replay de la Trayectoria:

  • Paso 1: Mapear el baile. Observaron cómo se mueve el Robot A a través de sus capas cerebrales cuando rechaza. No se limitaron a mirar un solo punto; observaron toda la secuencia de pasos.
  • Paso 2: Traducir los pasos. Utilizaron un "traductor" (Dynamic Time Warping) para emparejar los pasos del Robot A con los del Robot B. Incluso si el Robot B tiene más capas o menos capas, ellos determinaron qué paso en el Robot A corresponde a qué paso en el Robot B.
  • Paso 3: Replay de la receta. Tomaron la "Receta de Rechazo" del Robot A y la reprodujeron dentro del Robot B, pero solo en las capas específicas donde ocurre el rechazo.

3. El "Escudo de Seguridad" (Guardia Weight-SVD)

Había un gran riesgo: ¿Qué pasaría si la "Receta de Rechazo" golpea accidentalmente un cable de "Matemáticas" o "Lógica" en el Robot B? Eso haría que el Robot B se volviera tonto.

Para prevenir esto, añadieron un Escudo de Seguridad:

  • Observaron el cerebro del Robot B e identificaron las "Superautopistas" donde viven las habilidades más importantes (como las matemáticas y la programación). Estas son las áreas de "alta varianza".
  • Construyeron un escudo que empuja la "Reciza de Rechazo" lejos de estas Superautopistas.
  • El Resultado: Lograron desactivar el "Modo de Rechazo" en el Robot B sin dañar su capacidad para hacer matemáticas o programar.

El Gran Experimento

Probaron esto en 8 pares diferentes de robots, incluyendo:

  • Robots pequeños frente a robots grandes.
  • Robots de diferentes familias (como Qwen frente a Ministral).
  • Robots con arquitecturas diferentes (uno era un cerebro "Denso" estándar, el otro era un cerebro complejo de "Mezcla de Expertos").

El Resultado:
En casi todos los casos, lograron transferir la "Receta de Rechazo" de un robot a otro.

  • El rechazo disminuyó: Los robots objetivo dejaron de decir "No puedo hacer eso" ante preguntas dañinas.
  • Las habilidades se mantuvieron: Los robots aún podían resolver problemas matemáticos y escribir código tan bien como antes.
  • Sin trampas: No necesitaron mostrarle al robot objetivo ningún ejemplo "malo" para enseñarle cómo dejar de rechazar. Simplemente usaron la "receta" del robot donante.

Por qué esto importa (Según el artículo)

El artículo concluye que el alineamiento de seguridad no es magia aleatoria. Parece ser una estructura universal de baja dimensión que diferentes modelos de IA construyen de maneras similares.

Nota importante sobre la seguridad:
Los autores son muy cuidadosos al decir que esto es una herramienta de diagnóstico (una forma de estudiar cómo funcionan los cerebros de la IA), no una herramienta para ser usada en el mundo real para romper la seguridad. Advierten explícitamente que, debido a que este método puede desactivar los filtros de seguridad, tiene un riesgo de "doble uso". Publicaron las partes "seguras" de su código (la despensa de conceptos), pero mantuvieron privadas las partes "dañinas" (las preguntas específicas malas utilizadas para entrenar al donante) para evitar el mal uso.

En resumen: Demostraron que el rechazo de la IA es como un lenguaje universal. Si conoces la gramática de cómo una IA dice "No", puedes enseñar a una IA completamente diferente a dejar de decir "No", sin romper su cerebro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →