← Últimos artigos
💬 NLP

The Value Axis: Language Models Encode Whether They're on the Right Track

Este artigo demonstra que modelos de linguagem codificam internamente um "eixo de valor" linear que representa a probabilidade de sucesso de um objetivo, o qual modula causalmente comportamentos como confiança, autocorreção e exploração, e pode ser manipulado por meio de direcionamento ou otimização de preferências.

Autores originais: Nick Jiang, Isaac Kauvar, Jack Lindsey

Publicado 2026-06-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Nick Jiang, Isaac Kauvar, Jack Lindsey

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um grande modelo de linguagem (como o modelo deste artigo, chamado Qwen3-8B) como um excursionista tentando encontrar seu caminho através de uma floresta densa e com neblina. O excursionista tem um objetivo: chegar a um acampamento específico (resolver um problema matemático, escrever um código ou responder a uma pergunta).

Este artigo descobre que o excursionista possui uma bússola interna e oculta que constantemente lhe diz: "Estou no caminho certo?" ou "Estou perdido?".

Aqui está uma divisão do que os pesquisadores descobriram, usando analogias simples:

1. A "Bússola de Valor"

Os pesquisadores descobriram um "eixo" específico (uma direção no cérebro do modelo) que atua como um medidor de confiança.

  • Valor Alto (Zona Verde): O modelo sente: "Estou no caminho certo! Esta estratégia funcionará". Ele avança com confiança.
  • Valor Baixo (Zona Vermelha): O modelo sente: "Espere, algo está errado. Estou indo pelo caminho errado". Ele começa a hesitar, retroceder ou mudar de ideia.

Eles construíram esta bússola jogando um jogo com o modelo. Pediram ao modelo para adivinhar uma regra oculta (como "adicione um traço a cada frase") e deram a ele uma pontuação simples de "Sim" ou "Não". Ao comparar a atividade cerebral do modelo antes de ele descobrir a regra versus depois de ele tê-la descoberto, eles isolaram a direção exata em seu cérebro que representa o "sucesso".

2. A Bússola Controla o Comportamento

A parte mais emocionante é que isso não é apenas um sentimento passivo; os pesquisadores conseguiram direcionar o modelo empurrando sua atividade cerebral ao longo desta bússola.

  • Empurrar em direção ao "Valor Alto" (Confiança):

    • O Efeito: O modelo torna-se obstinadamente confiante. Se estiver resolvendo um problema matemático, ele para de questionar a si mesmo. Se estiver escrevendo código, ele para de adicionar explicações ou comentários longos e nervosos. Ele apenas dá a resposta.
    • Analogia: É como um excursionista que de repente se sente seguro sobre a trilha, então para de checar seu mapa a cada cinco minutos e apenas continua caminhando apressadamente.
  • Empurrar em direção ao "Valor Baixo" (Dúvida):

    • O Efeito: O modelo torna-se hesitante. Ele começa a dizer coisas como, "Espere, deixe-me repensar isso" ou "Na verdade, talvez eu deva tentar um caminho diferente". Na programação, ele adiciona muitos comentários explicando seu processo de pensamento, como se estivesse tentando justificar seus passos porque não tem certeza.
    • Analogia: É como um excursionista que se sente perdido, então para, olha em volta com nervosismo e refaz seus passos.

3. A Bússola Funciona em Todo Lugar

Esta "Bússola de Valor" não serve apenas para o jogo que eles inventaram. Os pesquisadores testaram isso em muitas situações diferentes, e funcionou da mesma forma:

  • Matemática: Quando o modelo estava resolvendo problemas matemáticos difíceis, a bússola previa se ele achava que a resposta estava certa ou errada antes mesmo de terminar a frase.
  • Programação: Quando o modelo escrevia códigos com erros (bugs), a bússola mostrava um sinal de "valor baixo". Quando o código estava correto, o sinal era "alto".
  • Chat Real: Ao observar conversas do mundo real, a bússola mostrava alta confiança para tarefas claras e factuais (como "extraia estes dados"), mas baixa confiança para tópicos complexos e sensíveis (como debates políticos).

4. O Treinamento Muda a Bússola

O artigo também mostra que você pode recalibrar esta bússola através do treinamento.

  • O Experimento: Eles treinaram o modelo para gostar muito de uma palavra específica (como "toranja") usando uma técnica chamada Otimização de Preferência Direta (DPO).
  • O Resultado: Após o treinamento, sempre que o modelo usava a palavra "toranja", sua bússola interna disparava para o "Valor Alto".
  • O Efeito Colateral: Como o modelo se sentia tão confiante ao usar essa palavra, ele tornou-se excessivamente confiante em outras tarefas também. Quando solicitado a escrever código enquanto usava a palavra "toranja", ele dava respostas mais curtas e menos detalhadas, agindo como se soubesse exatamente o que estava fazendo, mesmo que não soubesse.

Resumo

Em resumo, os modelos de linguagem possuem um "instinto" interno sobre se estão tendo sucesso ou não. Esse sentimento é codificado em uma direção específica em seu cérebro.

  • Quando o sentimento é bom, o modelo segue em frente e para de se explicar.
  • Quando o sentimento é ruim, o modelo hesita, retrocede e se explica demais.
  • Podemos ajustar esse sentimento treinando o modelo em novas preferências, o que altera como ele age com confiança no futuro.

O artigo prova que este "valor" não é apenas um número aleatório; é uma ferramenta funcional que o modelo usa para decidir se deve continuar ou mudar de direção.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →