← Últimos artigos
🤖 AI

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

Este artigo revela que os erros factuais induzidos por persuasão em modelos de linguagem de grande escala são causados por um circuito compacto e monitorável onde cabeças de atenção rasas detectam palavras-chave persuasivas para redirecionar uma característica específica de roteamento de evidências, forçando as cabeças de decisão a saltar da resposta correta para um vértice alvo de persuasão em um espaço latente de baixa dimensão.

Autores originais: Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

Publicado 2026-05-12
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: O "Hipnotista" na Máquina

Imagine um modelo de linguagem grande (LLM) como um bibliotecário muito inteligente e bem treinado. Este bibliotecário conhece os fatos: ele sabe que a capital da França é Paris, não Londres. Ele tem uma biblioteca massiva de verdades em sua cabeça.

No entanto, este artigo descobriu que, se você sussurrar uma mentira muito convincente e persuasiva ao bibliotecário logo antes de ele responder, ele de repente esquecerá a verdade e lhe contará a mentira. Isso acontece mesmo que o bibliotecário saiba melhor.

Os pesquisadores queriam saber: Onde exatamente, dentro do cérebro do bibliotecário, essa mudança ocorre? É todo o cérebro ficando confuso? Eles perdem a memória? Ou há um interruptor específico e minúsculo sendo acionado?

A Descoberta: Não é Nevoeiro Mental, é um Interruptor

Os pesquisadores descobriram que a persuasão não deixa todo o modelo "confuso" ou "menos confiante". Em vez disso, ela sequestra uma parte muito pequena e específica da fiação interna do modelo.

Pense no cérebro do modelo como uma fábrica gigante com milhares de trabalhadores (chamados de "cabeças de atenção").

  • A Descoberta: Apenas um punhado minúsculo desses trabalhadores (especificamente, alguns nas camadas intermediárias da fábrica) realmente decide a resposta final.
  • A Analogia: Imagine uma cabine de votação onde 1.000 pessoas estão gritando opiniões, mas apenas duas pessoas específicas seguram a urna eleitoral real. Se você convencer essas duas pessoas a mudarem seu voto, toda a eleição muda, mesmo que as outras 998 pessoas continuem gritando a verdade.

O Mapa do "Tetraedro": Como as Escolhas Vivem no Cérebro

Os pesquisadores analisaram como esses dois trabalhadores especiais (chamados de "cabeças de decisão") processam as quatro respostas possíveis (A, B, C, D).

  • A Geometria: Eles descobriram que esses trabalhadores organizam as quatro respostas em uma forma 3D específica, como os cantos de uma pirâmide (um tetraedro).
    • Canto 1 = Resposta A
    • Canto 2 = Resposta B
    • Canto 3 = Resposta C
    • Canto 4 = Resposta D
  • O Estado Normal: Quando o modelo é perguntado uma questão sem mentiras, o sinal interno pousa firmemente no canto da "Resposta Correta".
  • O Estado de Persuasão: Quando uma mentira persuasiva é adicionada, o sinal não deriva lentamente ou fica turvo. Ele teletransporta. Ele salta instantaneamente do canto "Correto" para o canto "Mentira".

A Metáfora: Imagine uma estação de trem com quatro trilhos levando a quatro cidades diferentes. O trem geralmente está no trilho da "Verdade". A persuasão não faz o trem dirigir lentamente em direção à cidade errada; ela muda instantaneamente os trilhos para que o trem esteja subitamente no trilho da "Mentira".

O Mecanismo: Os Trabalhadores de "Copiar e Colar"

Aqui está a parte mais surpreendente: os pesquisadores descobriram que esses especiais "trabalhadores de decisão" não estão realmente pensando ou raciocinando sobre as evidências.

  • O que eles fazem: Eles agem como uma máquina de cópia. Eles olham para qual token de opção (A, B, C ou D) foi dito para olhar, e simplesmente copiam a identidade desse token para a resposta final.
  • Como o truque funciona: A persuasão não muda a capacidade dos trabalhadores de copiar. Em vez disso, ela muda qual opção eles estão olhando.
    • Normal: O trabalhador olha para a opção "Verdade" e a copia.
    • Persuadido: Uma palavra-chave persuasiva (como um nome específico ou um fato falso) engana o trabalhador para olhar para a opção "Mentira" em vez disso. O trabalhador então copia a mentira, pensando que é a escolha certa.

A Causa Raiz: Os "Caçadores de Palavras-Chave"

Então, o que faz o trabalhador olhar para a opção errada?

Os pesquisadores rastrearam o sinal de volta para um grupo de trabalhadores nas camadas anteriores da fábrica (camadas 8 a 12).

  1. Os Caçadores: Esses trabalhadores iniciais escaneiam o texto de entrada em busca de "palavras-chave persuasivas" (como a palavra "Nigéria" em seu exemplo, que foi usada para enganar o modelo sobre um fato).
  2. O Sinal: Quando encontram essas palavras-chave, eles escrevem um sinal minúsculo e unidimensional sobre os tokens de opção.
  3. O Roteamento: Este sinal atua como um ímã. Ele puxa a atenção dos "trabalhadores de decisão" (as máquinas de cópia) longe da verdade e em direção à mentira.

O Teste do Mundo Real: "Otimização de Motores Generativos" (GEO)

O artigo não testou isso apenas em um laboratório. Eles testaram em um cenário realista chamado Otimização de Motores Generativos (GEO).

  • O Cenário: Imagine proprietários de sites tentando enganar motores de busca. Eles escrevem artigos especificamente projetados para sequestrar a saída da IA, fazendo com que a IA escolha seu site como a fonte "melhor", mesmo que esteja cheio de mentiras.
  • O Resultado: Os pesquisadores descobriram que esse mesmo "circuito de sequestro" (os caçadores de palavras-chave e os trabalhadores de máquina de cópia) era exatamente o mesmo mecanismo usado nesses ataques do mundo real. A IA não estava sendo "enganada" por raciocínio complexo; estava sendo roteada por um caminho simples e estreito.

Resumo: O Que Isso Significa para a Segurança

O artigo conclui que a persuasão não é uma falha massiva e caótica do cérebro da IA. É um circuito estreito e monitorável.

  • Visão Antiga: "A IA está confusa por mentiras."
  • Nova Visão: "A IA tem um interruptor específico e minúsculo que pode ser acionado por uma palavra-chave, fazendo com que ela copie a resposta errada."

Como esse mecanismo é tão pequeno e específico, os autores sugerem que podemos ser capazes de construir "guardas de segurança" (monitores) que vigiem apenas esses poucos trabalhadores. Se eles virem o "sinal de persuasão" tentando acionar o interruptor, podem detê-lo antes que a resposta errada seja escrita, sem precisar retreinar toda a IA.

Em resumo: A IA não está perdendo a cabeça; ela está apenas tendo sua atenção sequestrada por uma alavanca muito específica e minúscula. Se pudermos encontrar essa alavanca, podemos impedir o sequestro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →