← Últimos artigos
💬 NLP

Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models

Este artigo propõe o Dynamic Thinking-Token Selection (DynTS), um método que aumenta a eficiência de Grandes Modelos de Raciocínio ao identificar e reter apenas os estados de cache Key-Value de tokens decisivos para a decisão em traços de raciocínio, enquanto descarta entradas redundantes.

Autores originais: Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

Publicado 2026-06-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Problema: O "Pensador Excessivo" com uma Mochila Cheia

Imagine um estudante brilhante (o Grande Modelo de Raciocínio) que é incrivelmente bom em resolver problemas difíceis de matemática e ciências. Diferente de um aluno normal que apenas chuta a resposta, este estudante tem um hábito especial: antes de escrever a resposta final, ele escreve um enorme processo de "pensamento passo a passo" em um quadro branco. Ele escreve cada pensamento, cada beco sem saída, cada "espere, deixe-me verificar isso" e cada cálculo.

Este "rastro de pensamento" ajuda o estudante a chegar à resposta correta. No entanto, há um porém: a memória.

Para manter esse processo de pensamento funcionando, o estudante precisa manter cada palavra que já escreveu no quadro branco em sua memória de curto prazo (chamada de KV Cache). À medida que o problema fica mais difícil, o quadro branco fica cada vez mais longo. Eventualmente, a mochila do estudante (a memória do computador) fica tão pesada com todas essas notas que ele não consegue mais se mover rápido. Ele fica lento, e o computador que o executa fica sem espaço.

A Descoberta: A "Regra 80/20" do Pensamento

Os pesquisadores fizeram uma pergunta simples: Será que o estudante realmente precisa se lembrar de cada palavra que escreveu para chegar à resposta final?

Eles analisaram as notas do estudante e encontraram um padrão surpreendente, que chamam de Princípio de Pareto (ou a regra 80/20):

  • O Insight: De uma longa cadeia de 100 pensamentos, apenas cerca de 20 a 30 deles são os pensamentos "dourados" que realmente levam à solução.
  • O Resto: Os outros 70+ pensamentos são apenas "enchimento". São como o estudante dizendo, "Ok, vamos começar", ou "Hmm, talvez", ou repetindo um número. Esses pensamentos são necessários para o fluxo da conversa, mas não alteram a resposta final. Se você os apagasse, o estudante ainda conseguiria resolver o problema tão bem quanto antes.

A Solução: DYNTS (O Bibliotecário Inteligente)

Os pesquisadores construíram um novo sistema chamado DYNTS (Seleção Dinâmica de Tokens de Pensamento). Pense no DYNTS como um bibliotecário superinteligente que fica ao lado do estudante enquanto ele pensa.

Veja como o bibliotecário funciona:

  1. O "Preditor de Importância" (O Radar do Bibliotecário):
    O bibliotecário possui um radar especial que consegue identificar instantaneamente quais pensamentos são "Dourados" (críticos para a resposta) e quais são "Enchimento" (redundantes). Este radar é uma ferramenta pequena e leve acoplada ao cérebro do estudante que aprende a reconhecer ideias importantes.

  2. A Estratégia de "Janela Dupla" (A Mochila):
    O estudante tem uma mochila com três bolsos específicos:

  • Bolso A (A Pergunta): O problema original nunca é removido. Ele permanece seguro para sempre.
  • Bolso B (A Janela Local): Os últimos pensamentos que o estudante acabou de escrever são mantidos aqui para garantir que a frase faça sentido (gramática e fluxo).
  • Bolso C (A Janela de Seleção): É aqui que vai o longo histórico de pensamentos.
  1. A Ação (A Purga):
    À medida que o estudante escreve mais e mais, a mochila fica cheia. Quando ela atinge o limite, o bibliotecário intervém:
  • Ele observa o longo histórico no Bolso C.
  • Usando seu radar, ele identifica os pensamentos "Dourados".
  • Ele mantém os pensamentos Dourados.
  • Ele descarta (expulsa) os pensamentos de "Enchimento" que não importam.

O Resultado: Mais Rápido e Mais Leve

Ao fazer isso, os pesquisadores descobriram que:

  • Velocidade: O estudante pode pensar de 1,8 a 2,6 vezes mais rápido porque não está carregando uma mochila pesada cheia de notas inúteis.
  • Memória: A mochila é de 3 a 5 vezes menor, o que significa que você pode rodar este estudante inteligente em computadores menores e mais baratos.
  • Precisão: Surpreendentemente, o estudante não fica mais burro. Como o bibliotecário apenas descartou o "enchimento" e manteve os pensamentos "dourados", o estudante ainda chega à resposta certa com a mesma frequência de antes.

Analogia de Resumo

Imagine que você está tentando lembrar de uma longa história para contar a um amigo.

  • Jeito Antigo: Você tenta memorizar cada palavra, incluindo "hum", "ah" e "deixe-me pensar", até que seu cérebro doa e você esqueça o ponto principal.
  • Jeito DYNTS: Você memoriza os pontos principais do enredo e os clímax (os tokens críticos) e mantém apenas as últimas frases na cabeça para manter o fluxo suave. Você esquece os "hums" e "ahs". Você conta a história tão bem quanto antes, mas leva metade do esforço e não tem dor de cabeça.

O artigo prova que, para esses modelos de IA de "pensamento", não precisamos salvar cada pensamento. Só precisamos salvar os importantes, e um sistema inteligente pode descobrir quais são eles em tempo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →