A Shared Subcircuit Lets LLMs Count Down Across Tasks
Este artigo identifica um "subcircuito de contagem regressiva" compartilhado no Llama-3.1-70B-Instruct que permite aos modelos de linguagem rastrear os tokens restantes em diversas tarefas, revelando um mecanismo generalizável para estimar o tempo até o objetivo que se transfere entre diferentes modelos e contextos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está jogando um jogo onde tem que escrever uma frase, mas há uma regra rigorosa: ela deve ter exatamente 10 palavras de comprimento, e a última palavra obrigatoriamente tem que ser "telescópio". Se você escrever 9 palavras, você perde. Se escrever 11, você perde.
Por muito tempo, pensamos que os Grandes Modelos de Linguagem (LLMs) — os cérebros de IA superinteligentes por trás dos chatbots — apenas tentavam adivinhar o caminho para essas tarefas. Mas um novo estudo sugere que algo muito mais organizado está acontecendo dentro da máquina. Os pesquisadores descobriram que a IA possui um pequeno "subcircuito de contagem regressiva" especializado que atua como um cronômetro integrado, contando as palavras restantes até atingir a linha de chegada.
O Cronômetro Escondido
Os pesquisadores começaram instruindo um modelo específico, o Llama-3.1-70B-Instruct, a escrever frases de um comprimento fixo. Eles queriam saber como o modelo sabia quando parar. Ao espiar dentro do "cérebro" do modelo (especificamente observando como ele processa informações camada por camada), descobriram um grupo específico de três cabeças de atenção (pense nelas como pequenos trabalhadores especializados) na camada 18 que são responsáveis por essa contagem regressiva.
Esses três trabalhadores — rotulados como L18H24, L18H28 e L18H30 — não apenas adivinham. Eles realmente medem a distância entre onde a frase está agora e onde ela precisa terminar.
- Um trabalhador torna-se ativo cedo na frase.
- Outro entra em ação durante o meio.
- O terceiro dispara logo no final.
Juntos, eles criam um sinal de "contagem regressiva" suave que se torna mais forte e intenso à medida que o modelo se aproxima da contagem de palavras alvo. É como ter três despertadores diferentes configurados para tocar em momentos diferentes, garantindo que o modelo saiba exatamente quanto tempo (ou, neste caso, quantas palavras) lhe resta.
A Magia da Contagem "Implícita"
Aqui é onde fica realmente legal. Você poderia pensar que essa contagem regressiva só funciona se você disser explicitamente à IA: "Escreva uma frase de 10 palavras". Mas os pesquisadores descobriram que o modelo é mais esperto do que isso.
Eles testaram o modelo com comandos que não forneciam número algum. Em vez disso, deram ao modelo um padrão. Por exemplo, mostraram a ele uma lista de sequências de DNA ou códigos base64, todos exatamente do mesmo comprimento. Ao serem solicitados a continuar a lista, o modelo não precisou de um número; ele simplesmente "deduziu" o padrão. Ele inferiu o comprimento alvo a partir dos exemplos anteriores e usou esse mesmo subcircuito de contagem regressiva para parar no lugar certo.
O estudo sugere que o modelo armazena essa informação de comprimento "invisível" logo ao final das strings anteriores (como uma nota oculta dizendo "A próxima deve ter este comprimento"). Quando o modelo vê o fim de uma string, ele lê essa nota e inicia sua contagem regressiva para a próxima.
Uma Ferramenta Universal Entre Modelos e Tarefas
Os pesquisadores não pararam por aí. Eles usaram uma técnica chamada "sondagem não supervisionada" para ver onde mais essa ferramenta de contagem estava escondida pelo mundo. Eles escanearam quantidades massivas de texto, incluindo artigos de notícias, logs de chat e código, procurando por lugares onde esses trabalhadores específicos estavam operando.
Eles encontraram o subcircuito de contagem regressiva surgindo em todos os tipos de lugares surpreendentes:
- Tweets Incorporados: O modelo percebeu que estava lendo um tweet e contou regressivamente até o limite de 280 caracteres, mesmo que o texto não dissesse "tweet".
- Tabelas ASCII: Ao formatar uma tabela, o modelo contou os espaços para garantir que todas as colunas tivessem a mesma largura.
- Haikus: Ele rastreou a contagem de sílabas para a estrutura 5-7-5.
- Hashes SHA: Ele sabia exatamente quando um código de 64 caracteres estava terminado.
Isso sugere que o modelo não está apenas memorizando regras para tarefas específicas; ele possui um "motor de contagem regressiva" de uso geral que reutiliza para quase tudo que exige o rastreamento de um comprimento.
Um Projeto Compartilhado?
Talvez a descoberta mais fascinante seja que isso não é apenas uma peculiaridade do modelo Llama. Os pesquisadores compararam a "geometria" interna (a forma dos dados) deste subcircuito de contagem regressiva com um modelo diferente, o Claude 3.5 Haiku, que foi estudado em uma tarefa diferente (ajustar o texto para caber em uma linha).
Eles descobriram que ambos os modelos usam exatamente a mesma forma matemática para armazenar e processar informações de comprimento. É como se dois fabricantes de carros diferentes, trabalhando em fábricas diferentes, tivessem decidido usar exatamente o mesmo design de motor para seus carros. Isso sugere que este "motivo de contagem regressiva" pode ser um bloco de construção fundamental que muitos modelos de IA descobrem por conta própria quando precisam rastrear tempo ou espaço.
O Que Isso Significa (e O Que Não Significa)
O artigo é cuidadoso ao dizer que eles fizeram engenharia reversa deste comportamento específico. Eles provaram que, se você mexer nos sinais nestas cabeças específicas, o modelo para de contar corretamente. Eles mediram os sinais e observaram os padrões.
No entanto, eles não alegam ter resolvido o mistério de como a IA pensa em geral. Eles estão apenas mostrando que, para o trabalho específico de "saber quando parar", a IA usa uma ferramenta muito específica, reutilizável e surpreendentemente universal. É uma pequena, mas poderosa peça do quebra-cabeça, mostrando que, mesmo no mundo complexo e caótico da IA, existem sub-rotinas organizadas e nítidas que ajudam a máquina a dar sentido ao mundo.
Portanto, da próxima vez que você vir uma IA escrever um haiku perfeito ou formatar uma tabela sem ser instruída sobre quantos espaços usar, lembre-se: em algum lugar profundo, três pequenos trabalhadores na camada 18 estão silenciosamente contando o tempo, garantindo que tudo termine exatamente como deveria.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.