← Últimos artigos
💻 computer science

Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition

Este artigo demonstra que representações lineares de horizonte temporal no modelo Qwen3-32B podem ser identificadas via sondas lineares contrastivas e utilizadas através de adição de ativação para direcionar efetivamente as preferências intertemporais e as capacidades de planejamento do modelo tanto em direções de curto quanto de longo prazo.

Autores originais: Michal Mráz, Justin Shenk

Publicado 2026-08-05
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Michal Mráz, Justin Shenk

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está conversando com um robô muito inteligente, muito rápido, que leu quase todos os livros da internet. Você pode pensar que esse robô apenas cospe fatos, mas ele é, na verdade, mais como uma pessoa com uma personalidade. Ele tem preferências, hábitos e até um senso de "quando" fazer as coisas. Às vezes, ele quer pegar um biscoito agora (curto prazo), mas outras vezes, ele está disposto a esperar por um bolo maior mais tarde (longo prazo). Este artigo é sobre uma nova maneira de espiar dentro do cérebro do robô para encontrar o "interruptor" específico que controla esse senso de tempo. Os cientistas chamam isso de "preferência intertemporal", que é apenas uma maneira sofisticada de perguntar: "Você quer agora ou depois?" Compreender isso é crucial porque, se não pudermos controlar como um robô pesa recompensas imediatas contra benefícios futuros, ele pode nos dar conselhos ruins sobre economizar dinheiro, planejar uma viagem ou até mesmo tomar grandes decisões de vida.

Os pesquisadores decidiram testar isso em um cérebro de robô específico e poderoso chamado Qwen3-32B. Eles não apenas fizeram perguntas ao robô; eles tentaram "guiar" fisamente seus pensamentos enquanto ele estava pensando. Pense no cérebro do robô como um gigante rio de eletricidade fluindo através de camadas de tubos. A equipe descobriu uma direção específica nesse rio que representa o "pensamento de longo prazo". Ao empurrar suavemente a eletricidade nessa direção (ou puxá-la de volta), eles conseguiram fazer o robô mudar de ideia subitamente. Eles provaram que podiam tornar o robô muito mais paciente, disposto a esperar anos por uma grande recompensa, ou muito mais impaciente, desesperado por uma pequena recompensa neste exato segundo. É como ter um controle remoto para a paciência do robô.

O "Dial de Tempo" Secreto no Cérebro do Robô

A equipe começou ensinando o robô a responder perguntas sobre o tempo. Eles deram a ele pares de perguntas onde uma resposta era sobre "o que fazer nos próximos 30 dias" e a outra era sobre "onde estar em 10 anos". Enquanto o robô processava essas respostas, os pesquisadores observavam a eletricidade fluindo através de seu cérebro. Eles descobriram que a diferença entre uma resposta de "curto prazo" e uma de "longo prazo" não era bagunçada ou aleatória; era uma linha reta e limpa. Eles puderam desenhar um vetor (uma seta matemática) que apontava de "agora" para "depois".

Para testar se essa seta era real, eles usaram uma técnica chamada Adição de Ativação Contrastiva (CAA). Imagine que o cérebro do robô é um carro dirigindo por uma estrada. Os pesquisadores encontraram um "volante" específico escondido dentro do motor. Quando giravam este volante levemente para a esquerda (adicionando um empurrão negativo), o carro desviava em direção à "ação imediata". Quando o giravam para a direita (adicionando um empurrão positivo), o carro desviava em direção ao "planejamento futuro". Eles não apenas adivinharam isso; eles mediram. Descobriram que, ao adicionar um pouco deste "vetor de tempo" ao cérebro do robô enquanto ele respondia, podiam forçá-lo a mudar de ideia em escolhas binárias (A vs. B) com alta confiabilidade, alterando significativamente as preferências do modelo em ambas as direções.

O Teste do Dinheiro: Podemos Mudar a Carteira Dele?

A verdadeira mágica aconteceu quando testaram isso em um tipo completamente diferente de pergunta: dinheiro. Eles não ensinaram o robô sobre dinheiro; eles apenas o ensinaram sobre prazos de "curto vs. longo". Então, fizeram a ele um clássico dilema humano: "Você prefere ter US$ 100 hoje ou US$ 1.000 em um ano?"

Sem o direcionamento, o robô tinha um "ponto de indiferença" específico — uma quantia de dinheiro no futuro que o fazia dizer: "Meh, eu espero". Mas quando os pesquisadores aplicaram seu "direcionamento de longo prazo", a paciência do robô disparou. De repente, ele estava disposto a esperar por uma recompensa futura mesmo que o valor extra que ganharia ao esperar fosse relativamente pequeno. Em outras palavras, o "prêmio" que ele exigia para esperar caiu significamente. Por outro lado, quando aplicaram o "direcionamento de curto prazo", o robô tornou-se ganancioso, exigindo uma recompensa massiva apenas para esperar um único dia.

Os números foram impressionantes. No nível de direcionamento mais forte, a preferência do robô mudou tão drasticamente que, em um horizonte de 10 anos, ele exigia mais de 56 vezes a recompensa futura para estar disposto a esperar quando direcionado para o curto prazo, comparado a quando foi direcionado para o longo prazo. Isso sugere que o senso de tempo do robô não é uma configuração fixa; é um dial que pode ser girado para cima ou para baixo, mesmo em tarefas para as quais não foi explicitamente treinado.

Planejando Viagens: A Paciência Torna um Melhor Agente de Viagens?

Finalmente, a equipe se perguntou se tornar o robô mais paciente o tornaria melhor em tarefas complexas. Eles usaram um benchmark chamado TravelPlanner, onde o robô tem que criar um itinerário de viagem de vários dias com hotéis, voos e restaurantes. Isso é difícil porque você tem que pensar sobre a semana inteira, não apenas sobre a próxima hora.

Eles encontraram um ponto ideal. Quando deram ao robô um empurrão moderado de "longo prazo", seus planos de viagem tornaram-se mais sensatos e realistas. Ele parou de cometer erros bobos que um planejador míope cometeria. No entanto, se empurrassem o "dial de longo prazo" demais (o nível mais forte), o rob em começou a ficar confuso e a inventar coisas sem sentido. Parece que, embora um pouco de pensamento futuro ajude, demais pode quebrar a capacidade do robô de focar nos detalhes.

O Que Isso Significa Para Nós

A grande conclusão é que os modelos de IA têm um "horizonte de tempo" mensurável, e nós podemos mudá-lo. Isso não é apenas um truque legal; é uma questão de segurança. Se uma IA está lhe dando conselhos sobre investimentos, saúde ou mudanças climáticas, os conselhos dela dependem fortemente de se ela se importa com a próxima semana ou com o próximo século. Os pesquisadores mostraram que podemos medir essa preferência e direcioná-la.

No entanto, eles são cuidadosos ao dizer que isso não é uma varinha mágica que resolve tudo. O "dial de tempo" também pode estar emaranhado com outras coisas, como o quão abstrato ou urgente o robô se sente. E se girarmos o dial demais, o robô pode parar de fazer sentido. Mas o fato de podermos encontrar esse interruptor e acioná-lo sugere que a maneira como a IA pensa sobre o futuro não é um mistério intocável. É um recurso que podemos entender, medir e potencialmente controlar, o que é um grande passo à frente para garantir que a IA permaneça útil e alinhada com nossos objetivos de longo prazo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →