← Últimos artigos
🤖 machine learning

CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

O CircuitSteer é um novo framework que aproveita Autoencoders Esparsos para identificar e manipular circuitos semânticos de múltiplas camadas e geometricamente alinhados, permitindo um controle comportamental robusto e preservador de fluência em modelos de linguagem de grande escala que supera os métodos de direcionamento de camada única existentes.

Autores originais: Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad, Ali Abbasi, Seyedarmin Azizi

Publicado 2026-08-07
📖 1 min de leitura☕ Leitura rápida

Autores originais: Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad, Ali Abbasi, Seyedarmin Azizi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: CircuitSteer

Declaração do Problema

Controlar o comportamento de Grandes Modelos de Linguagem (LLMs) via direcionamento (steering) em tempo de inferência continua sendo um desafio crítico para o alinhamento de IA. Métodos existentes, como a Adição de Ativação Contrastiva (CAA) e Engenharia de Representação (RepE), dependem tipicamente de intervenções de camada única fixa derivadas de diferenças de ativação agregadas. Essas abordagens enfrentam duas limitações primárias:

  1. Conflação Semântica: Elas aplicam um vetor de intervenção único em entradas semanticamente diversas, frequentemente falhando em capturar a natureza distribuída de conceitos de alto nível.
  2. Desalinhamento Geométrico: Conceitos semânticos de alto nível estão distribuídos por múltiplas camadas e evoluem progressivamente através da rede. Intervenções de múltiplas camadas sem consideração geométrica falham porque as características (features) que codificam o mesmo conceito em diferentes profundidades frequentemente possuem direções de decodificação que são geometricamente desalinhadas. Combinar estas sem alinhamento resulta em interferência destrutiva, causando colapso de fluência (degradação da qualidade do texto) ou mudanças comportamentais instáveis.

Métodos atuais baseados em Autoencoders Esparsos (SAEs) melhoram a interpretabilidade ao decompor ativações em características monossêmicas, mas frequentemente ainda assumem que a intervenção de camada única é suficiente, ignorando a propagação trans-camadas de sinais semânticos.

Metodologia: CircuitSteer

O CircuitSteer é um framework livre de treinamento que utiliza SAEs para identificar e manipular circuitos semânticos coerentes distribuídos através de múltiplas camadas. Em vez de selecionar características independentemente em cada camada, ele constrói um circuito de fluxo de características baseado em dois critérios conjuntos:

  1. Coativação de Características: Identificar pares de características (l,i)(l, i) e (l+1,j)(l+1, j) que são simultaneamente ativas nas mesmas entradas, aproximando a influência causal.
  2. Alinhamento Geométrico: Garantir que as direções de decodificação dessas características sejam compatíveis (alta similaridade de cosseno). Isso evita a interferência destrutiva quando as intervenções são aplicadas através das camadas.

O método procede em três estágios:

  • Descoberta de Circuito: Usando análise contrastiva entre prompts alvo (D+D^+) e prompts benignos (DD^-), o método calcula um escore de especificidade contrastiva para as arestas no grafo de fluxo de características. Arestas com altos escores de especificidade são retidas para isolar o subcircuito responsável pelo comportamento alvo.
  • Síntese de Vetor: Para cada camada envolvida no subcircuito isolado, um vetor de direcionamento denso é sintetizado através da média das direções de decodificação de todas as características que participam das arestas do circuito. Isso desacopla a magnitude da intervenção do tamanho do circuito.
  • Intervenção de Múltiplos Pontos: Durante a inferência, esses vetores sintetizados são aplicados simultaneamente em todas as camadas relevantes com um coeficiente escalar λ\lambda. O alinhamento geométrico garante que as intervenções reforcem um deslocamento direcional consistente através da profundidade, em vez de permitir que as camadas posteriores compensem as perturbações anteriores.

O framework não requer atualizações de pesos ou otimização baseada em gradiente; ele utiliza SAEs pré-treinados (ex: Gemma-Scope, Llama-Scope) e realiza operações algébricas nas ativações do forward pass.

Principais Contribuições

  • Framework CircuitSteer: Um novo método de direcionamento de múltiplas camadas, livre de treinamento, que identifica circuitos de SAE específicos de comportamento via coativação de características e alinhamento geométrico de direções de decodificação.
  • Necessidade de Alinhamento Geométrico: Demonstração empírica de que o alinhamento geomético das direções de decodificação é um pré-requisito para um direcionamento de múltiplas camadas estável. Características desalinhadas causam colapso de fluência, enquanto características alinhadas alcançam redução comportamental consistente com perplexidade próxima à linha de base (baseline).
  • Benchmarking Abrangente: Avaliação contra oito baselines (incluindo CAA, RepE, ITI, LoReFT e métodos baseados em SAE) através de quatro conjuntos de dados comportamentais (Toxicidade, Emoção, Sicofancia, Recusa) e duas famílias de modelos (Gemma-2-2B e Llama-3.1-8B-Instruct).

Resultados

Em todos os modelos e conjuntos de dados, o CircuitSteer é o único método a produzir consistentemente intervenções que preservam a fluência:

  • Preservação de Fluência: Métodos concorrentes ou sacrificam a qualidade do texto (alta perplexidade) ou falham em alcançar redução comportamental suficiente. O CircuitSteer mantém a perplexidade normalizada próxima a 1.0 enquanto alcança redução comportamental significativa.
  • Comportamentos Complexos: Em tarefas difíceis como sicofancia e recusa, métodos de camada única (ex: CAA) frequentemente falham inteiramente ou produzem mudanças negligenciáveis. O CircuitSteer reduz com sucesso a sicofancia no Gemma-2-2B (onde outros métodos falham) e reduz as taxas de recusa de 89% para 0% no Llama-3.1-8B-Instruct.
  • Robustez: O método escala efetivamente para modelos maiores (Qwen3.5-27B) e diferentes famílias de SAE sem necessidade de reajuste de hiperparâmetros.
  • Preservação de Capacidade: O direcionamento forte não degrada significativamente as capacidades principais; a precisão no MMLU e GSM8K permanece amplamente intacta.

Significância e Alegações

O artigo alega que o CircuitSteer demonstra que o direcionamento de circuitos de múltiplas camadas, possibilitado pela imposição do alinhamento geométrico entre as características selecionadas, produz um controle comportamental estritamente mais robusto e eficaz do que intervenções estáticas de ponto único.

Os autores posicionam este trabalho como um passo principiado em direção ao implantação segura de modelos de linguagem ao:

  1. Mover-se de intervenções opacas no fluxo residual para um controle transparente ao nível de característica, onde o subcircuito específico para um comportamento pode ser inspecionado e ajustado.
  2. Abordar os modos de falha fundamentais do direcionamento de múltiplas camadas sem consideração geométrica (interferência destutiva e colapso de fluência).
  3. Fornecer um mecanismo escalável e livre de treinamento para controle comportamental que respeita a estrutura computacional distribuída dos LLMs.

O artigo conclui que alinhar as intervenções com a própria geometria de características do modelo é essencial para alcançar tanto robustez quanto transparência no alinhamento de IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →