← Últimos artigos
🤖 AI

Reasoning Models Can be Accurately Pruned Via Chain-of-Thought Reconstruction

Este artigo propõe a Compressão Consciente do Raciocínio (RAC), uma técnica de poda que reconstrói conjuntamente as ativações de entrada e os traços de cadeia de pensamento em política para reduzir efetivamente os custos de implantação de modelos de raciocínio, evitando a degradação de desempenho e o aumento de latência causados pelos métodos de poda padrão.

Autores originais: Ryan Lucas, Kayhan Behdin, Zhipeng Wang, Qingquan Song, Shao Tang, Rahul Mazumder

Publicado 2026-05-06
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ryan Lucas, Kayhan Behdin, Zhipeng Wang, Qingquan Song, Shao Tang, Rahul Mazumder

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um aluno brilhante e superdesempenhoso chamado "IA de Raciocínio". Este aluno é incrível resolvendo problemas matemáticos complexos e escrevendo código, mas tem um hábito peculiar: antes de lhe dar a resposta final, ele escreve um diário massivo e detalhado de seu processo de pensamento. Ele não diz apenas "A resposta é 42"; ele escreve 50 páginas de "Vamos ver, se eu tentar isso, então aquilo, mas espera, talvez não..." antes finalmente chegar à resposta.

Embora isso o torne muito preciso, também é incrivelmente lento e caro para executar. Você quer contratar uma versão menor e mais barata deste aluno (um modelo "podado") para fazer o mesmo trabalho.

O Problema: O Erro da "Tarefa de Casa Errada"
Geralmente, quando engenheiros tentam encolher esses grandes modelos de IA, eles usam um método chamado poda. Pense na poda como editar um livro para torná-lo mais curto, cortando palavras que você não acha importantes.

Para decidir quais palavras cortar, os editores (os algoritmos de poda) geralmente olham para uma amostra da entrada do aluno — as perguntas que lhe são feitas. Eles assumem: "Ok, o aluno é bom em responder a essas perguntas, então se mantivermos as partes do cérebro dele que lidam com as perguntas, estaremos bem."

O artigo argumenta que isso é um enorme erro para modelos de raciocínio. É como tentar treinar um maratonista apenas observando-o amarrar os sapatos. Você está ignorando a parte onde ele realmente corre.

Para modelos de raciocínio, a parte da "corrida" é a longa cadeia de pensamentos (o CoT). Se você treinar seu algoritmo de poda apenas nas perguntas (a entrada) e ignorar o longo processo de pensamento, o modelo encolhido fica confuso. Ele começa a divagar ainda mais do que antes, escrevendo 100 páginas de pensamentos confusos em vez de 50, e ainda assim erra a resposta. Ele se torna mais lento e mais burro ao mesmo tempo.

A Solução: "Compressão Consciente do Raciocínio" (RAC)
Os autores propõem uma correção simples chamada Compressão Consciente do Raciocínio (RAC).

Em vez de apenas mostrar ao algoritmo de poda as perguntas, eles dizem: "Vamos fazer o modelo responder às perguntas primeiro, escrever todo o seu processo de pensamento e, em seguida, usar todo esse processo para decidir o que cortar."

A Analogia: O Ensaio
Imagine que você está editando uma peça de teatro.

  • Método Antigo: Você lê as linhas de abertura do roteiro e decide quais atores demitir com base em como eles parecem na primeira cena.
  • Método RAC: Você assiste ao ensaio completo, incluindo as cenas longas e bagunçadas do meio onde os atores estão descobrindo o enredo. Você só demite os atores que erram durante a apresentação real.

Ao permitir que o modelo "ensaiasse" seu próprio processo de pensamento durante a fase de edição, o algoritmo de poda aprende exatamente quais partes do cérebro são necessárias para os passos longos e complexos de raciocínio.

O Que Aconteceu Quando Eles Tentaram?
A equipe testou isso em vários modelos de IA poderosos (como DeepSeek-R1 e Qwen) usando testes de matemática e codificação.

  1. Precisão: Quando usaram o método antigo, cortar 50% do cérebro do modelo fez com que ele falhasse em quase tudo. Com o RAC, o modelo encolhido manteve quase toda a sua inteligência, mesmo com 50% de seus pesos removidos.
  2. Velocidade: O método antigo deixou os modelos tão confusos que eles divagariam por horas, levando uma eternidade para responder. O RAC manteve os modelos focados. Eles responderam tão rápido quanto os grandes modelos, ou até mais rápido, porque não ficaram presos em loops de pensamento confuso.
  3. Versatilidade: Este truque funcionou tanto quando cortavam o modelo aleatoriamente quanto em padrões específicos, e funcionou em diferentes tipos de modelos.

A Conclusão
Se você quer tornar uma IA inteligente e de raciocínio menor e mais barata, não pode apenas olhar para as perguntas que lhe são feitas. Você precisa observar como ela pensa enquanto as responde. Ao incluir o próprio "diário de pensamento" do modelo no processo de edição, você pode encolher o modelo sem perder seu cérebro ou torná-lo mais lento. É um ajuste simples que impede o modelo de se perder em seus próprios pensamentos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →