← Últimos artículos
🤖 machine learning

CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

CircuitSteer es un marco novedoso que aprovecha los Autoencoders Dispersos para identificar y manipular circuitos semánticos de múltiples capas y geométricamente alineados, permitiendo un control de comportamiento robusto y que preserva la fluidez en modelos de lenguaje de gran tamaño que supera a los métodos de dirección de una sola capa existentes.

Autores originales: Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad, Ali Abbasi, Seyedarmin Azizi

Publicado 2026-08-07
📖 1 min de lectura☕ Lectura para el café

Autores originales: Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad, Ali Abbasi, Seyedarmin Azizi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: CircuitSteer

Planteamiento del Problema

Controlar el comportamiento de los Modelos de Lenguaje de Gran Escala (LLMs) mediante la dirección (steering) en el tiempo de inferencia sigue siendo un desafío crítico para la alineación de la IA. Los métodos existentes, como la Adición de Activación Contrastiva (CAA) y la Ingeniería de Representación (RepE), dependen típicamente de intervenciones de una sola capa fija derivadas de diferencias de activación agregadas. Estos enfoques enfrentan dos limitaciones primarias:

  1. Confluencia Semántica: Aplican un vector de intervención único a través de entradas semánticamente diversas, lo que a menudo impide capturar la naturaleza distribuida de los conceptos de alto nivel.
  2. Desalineación Geométrica: Los conceptos semánticos de alto nivel están distribuidos en múltiples capas y evolucionan progresivamente a través de la red. Las intervenciones de múltiples capas sin consideración geométrica fallan porque las características que codifican el mismo concepto en diferentes profundidades suelen tener direcciones de decodificación que están geométricamente desalineadas. Combinar estas sin alineación resulta en una interferencia destructiva, causando un colapso de la fluidez (degradación de la calidad del texto) o cambios de comportamiento inestables.

Los métodos actuales basados en Autoencoders Dispersos (SAEs) mejoran la interpretabilidad al descomponer las activaciones en características monosemánticas, pero a menudo siguen asumiendo que la intervención de una sola capa es suficiente, ignorando la propagación trans-capa de las señales semánticas.

Metodología: CircuitSteer

CircuitSteer es un marco de trabajo (framework) libre de entrenamiento que aprovecha los SAEs para identificar y manipular circuitos semánticos coherentes distribuidos a través de múltiples capas. En lugar de seleccionar características de forma independiente en cada capa, construye un circuito de flujo de características basado en dos criterios conjuntos:

  1. Co-activación de Características: Identificación de pares de características (l,i)(l, i) y (l+1,j)(l+1, j) que se activan simultáneamente en las mismas entradas, aproximando la influencia causal.
  2. Alineación Geométrica: Asegurar que las direcciones de decodificación de estas características sean compatibles (alta similitud de coseno). Esto evita la interferencia destructiva cuando se aplican las intervenciones a través de las capas.

El método procede en tres etapas:

  • Descubrimiento de Circuitos: Utilizando un análisis contrastivo entre prompts objetivo (D+D^+) y prompts benignos (DD^-), el método calcula una puntuación de especificidad contrastiva para las aristas en el grafo de flujo de características. Las aristas con puntuaciones de especificidad altas se retienen para aislar el subcircuito responsable del comportamiento objetivo.
  • Síntesis de Vectores: Para cada capa involucrada en el subcircuito aislado, se sintetiza un vector de dirección denso promediando las direcciones de decodificación de todas las características que participan en las aristas del circuito. Esto desacopla la magnitud de la intervención del tamaño del circuito.
  • Intervención de Múltiples Puntos: Durante la inferencia, estos vectores sintetizados se aplican simultáneamente en todas las capas relevantes con un coeficiente escalar λ\lambda. La alineación geométrica asegura que las intervenciones refuercen un cambio direccional consistente a través de la profundidad, en lugar de permitir que las capas posteriores compensen las perturbaciones anteriores.

El marco no requiere actualizaciones de pesos ni optimización basada en gradientes; utiliza SAEs pre-entrenados (por ejemplo, Gemma-Scope, Llama-Scope) y realiza operaciones algebraicas sobre las activaciones del paso hacia adelante (forward-pass).

Contribuciones Clave

  • Marco CircuitSteer: Un nuevo método de dirección de múltiples capas libre de entrenamiento que identifica circuitos de SAE específicos de un comportamiento mediante la co-activación de características y la alineación geométrica de las direcciones de decodificación.
  • Necesidad de Alineación Geométrica: Demostración empírica de que la alineación geométrica de las direcciones de decodificación es un prerrequisito para una dirección de múltiples capas estable. Las características desalineadas causan un colapso de la fluidez, mientras que las alineadas logran una reducción de comportamiento consistente con una perplejidad cercana a la línea base.
  • Evaluación Exhaustiva: Evaluación contra ocho líneas base (incluyendo CAA, RepE, ITI, LoReFT y métodos basados en SAE) a través de cuatro conjuntos de datos de comportamiento (Toxicidad, Emoción, Sicofancia, Rechazo) y dos familias de modelos (Gemma-2-2B y Llama-3.1-8B-Instruct).

Resultados

En todos los modelos y conjuntos de datos, CircuitSteer es el único método que produce consistentemente intervenciones que preservan la fluidez:

  • Preservación de la Fluidez: Los métodos competidores o sacrifican la calidad del texto (alta perplejidad) o no logran una reducción de comportamiento suficiente. CircuitSteer mantiene la perplejidad normalizada cerca de 1.0 mientras logra una reducción de comportamiento significativa.
  • Comportamientos Complejos: En tareas difíciles como la sicofancia y el rechazo, los métodos de una sola capa (por ejemplo, CAA) a menudo fallan por completo o producen cambios insignificantes. CircuitSteer reduce con éxito la sicofancia en Gemma-2-2B (donde otros métodos fallan) y reduce las tasas de rechazo del 89% al 0% en Llama-3.1-8B-Instruct.
  • Robustez: El método escala efectivamente a modelos más grandes (Qwen3.5-27B) y diferentes familias de SAE sin necesidad de reajuste de hiperparámetros.
  • Preservación de Capacidades: La dirección fuerte no degrada significativamente las capacidades principales; la precisión en MMLU y GSM8K permanece mayormente intacta.

Significado y Reivindicaciones

El artículo afirma que CircuitSteer demuestra que la dirección de circuitos de múltiples capas, habilitada mediante la imposición de la alineación geométrica entre las características seleccionadas, produce un control de comportamiento estrictamente más robusto y efectivo que las intervenciones estáticas de un solo punto.

Los autores posicionan este trabajo como un paso fundamental hacia el despliegue seguro de modelos de lenguaje mediante:

  1. El paso de intervenciones opacas en el flujo residual a un control transparente a nivel de característica, donde el subcircuito específico para un comportamiento puede ser inspeccionado y ajustado.
  2. El abordaje de los modos de falla fundamentales de la dirección de múltiples capas sin consideración geométrica (interferencia destructiva y colapso de la fluidez).
  3. La provisión de un mecanismo escalable y libre de entrenamiento para el control del comportamiento que respeta la estructura computacional distribuida de los LLMs.

El artículo concluye que alinear las intervenciones con la propia geometría de características del modelo es esencial para lograr tanto la robustez como la transparencia en la alineación de la IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →