← Últimos artigos
🤖 machine learning

Quantized Reasoning Models Think They Need to Think Longer, but They Do Not

Este artigo revela que a quantização agressiva de pós-treinamento faz com que modelos de raciocínio "pensem demais", gerando etapas intermediárias desnecessárias e falhando em fornecer respostas corretas encontradas anteriormente, um problema que pode ser mitigado efetivamente aplicando uma penalidade de logit livre de treinamento a marcadores específicos de excesso de pensamento para reduzir o comprimento do raciocínio enquanto preserva a precisão.

Autores originais: Sanae Lotfi, Polina Kirichenko, Steven Li, Zechun Liu

Publicado 2026-06-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Sanae Lotfi, Polina Kirichenko, Steven Li, Zechun Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Problema Central: A IA que "Pensa Demais"

Imagine que você tem um aluno brilhante (uma IA) que é ótimo em resolver problemas de matemática. Normalmente, ele resolve um problema, escreve a resposta e para.

Agora, imagine que você coloca esse aluno em uma sala barulhenta e lotada onde ele não consegue ouvir os próprios pensamentos com clareza (isso representa a Quantização, uma técnica usada para tornar os modelos de IA menores e mais rápidos).

O artigo descobriu algo surpreendente: quando a IA está nessa "sala barulhenta", ela não apenas dá respostas erradas. Em vez disso, ela fica confusa. Ela encontra a resposta correta no meio do seu processo de raciocínio, mas então começa a duvidar de si mesma. Ela pensa: "Espere, talvez eu esteja errada? E se eu tentar de um jeito diferente?" Ela abre novas portas mentais, questiona sua própria lógica e entra em um ciclo longo e redundante de pensamento.

Eventualmente, ela fica sem tempo ou memória antes de conseguir realmente dizer a resposta que encontrou anteriormente. Ela "pensa demais" até falhar.

A Descoberta: Não é Falta de Cérebro, é Falta de Poder de Parada

Os pesquisadores analisaram milhares de tentativas fracassadas desses modelos de IA "barulhentos". Eles descobriram que em até 52% das falhas, a IA já havia descoberto a resposta certa no meio do caminho.

  • A Suposição Antiga: "A IA é burra demais para resolver o problema porque foi reduzida de tamanho."
  • A Nova Realidade: "A IA é inteligente o suficiente para resolver, mas o 'ruído' faz com que ela duvide tanto de si mesma que nunca para de falar para dar a resposta."

É como um chef que cozinha uma refeição perfeita, prova, percebe que está deliciosa, mas então começa a se preocupar: "Será que está salgado demais? Talvez eu deva adicionar mais sal? Ou talvez eu deva cozinhar de novo?" A comida é arruinada não porque o chef não sabe cozinhar, mas porque ele não consegue parar de cozinhar.

O Diagnóstico: Os Gatilhos do "Espere" e do "Mas"

Para entender por que isso acontece, os pesquisadores compararam a IA "barulhenta" com uma IA "clara" (a versão original, de tamanho total). Eles analisaram as palavras específicas que a IA gerou.

Eles descobriram que o "ruído" afeta especificamente as palavras de hesitação.

  • Palavras Estáveis: Palavras como números, símbolos matemáticos e formatação (ex: "255", "sqrt", "resposta") permanecem claras e estáveis.
  • Palavras Instáveis: Palavras que sinalizam dúvida ou caminhos de ramificação (ex: "Espere", "Mas", "Alternativamente", "Talvez") tornam-se muito mais propensas a aparecer quando a IA está confusa.

Quando a IA chega a um ponto onde já está incerta (alta incerteza), o "ruído" torna muito mais provável que ela escolha uma palavra como "Espere". Isso dispara uma nova cadeia de pensamento, fazendo com que a IA abandone o caminho correto em que já estava.

A Solução: O "Botão do Silêncio"

Os pesquisadores criaram uma solução inteligente e gratuita que não exige o retreinamento da IA.

Eles criaram uma lista de 50 "marcadores de excesso de pensamento" (palavras como "Espere", "Mas", "No entanto", "Reconsiderar"). Durante o processo de pensamento da IA, eles aplicam uma pequena penalidade a essas palavras específicas.

Pense nisso como um professor rigoroso tocando no ombro do aluno toda vez que ele começa a dizer: "Espere, talvez eu devesse..." O professor não impede o aluno de pensar; ele apenas desencoraja gentilmente o uso de frases hesitantes.

Os Resultados:

  • Pensamento Mais Curto: A IA para de entrar em espirais. Ela termina seu raciocínio de 12% a 23% mais rápido.
  • Melhor Precisão: Como ela para de duvidar de si mesma, ela realmente acerta a resposta com mais frequência. Em alguns casos, a precisão melhorou significativamente (ex: saltando de 47% para 61% em um teste de matemática).
  • Sem Custo Extra: Esta correção não requer poder computacional adicional ou tempo de treinamento. É apenas uma regra simples aplicada enquanto a IA fala.

O Panorama Geral

O artigo mostra que, quando encolhemos modelos de IA para torná-los mais rápidos, acidentalmente os tornamos indecisos. Eles não perdem a capacidade de calcular; eles perdem a capacidade de confiar em seus cálculos.

Ao simplesmente dizer à IA para "parar de hesitar" (penalizando palavras como "Espere" e "Mas"), podemos fazer com que esses modelos menores e mais rápidos performem quase tão bem quanto os gigantes e caros, sem que eles percam tempo falando em círculos.

Em resumo: Modelos quantizados não falham porque não conseguem pensar; eles falham porque não conseguem parar de pensar. Um pouco de disciplina (uma penalidade em palavras de hesitação) resolve o problema.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →