← Últimos artigos
🤖 AI

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

Este artigo introduz uma taxonomia do raciocínio de Cadeia de Pensamento comprimido (Explícito, Composto e Implícito) e demonstra, por meio de experimentos controlados, que, embora o raciocínio mais grosseiro exija mais dados e apresente comportamentos distintos de escalonamento e memorização, o subsequente aprendizado por reforço com recompensas verificáveis pode decompor efetivamente esses passos comprimidos aprendidos durante o ajuste fino supervisionado.

Autores originais: Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

Publicado 2026-05-28
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô muito inteligente, mas muito literal, a resolver um quebra-cabeça matemático complexo. O quebra-cabeça envolve uma longa cadeia de etapas: "Pegue este número, multiplique-o, some aquilo, divida por isto..."

Para ensinar o robô, você pode mostrar a solução de três maneiras diferentes. Este artigo explora qual maneira funciona melhor, quanto dados são necessários e o que acontece se você tentar fazer o robô "pensar mais rápido" pulando etapas.

Aqui está a divisão de suas descobertas usando analogias simples:

1. As Três Maneiras de Ensinar (A Taxonomia)

Os pesquisadores categorizaram como mostraram a solução ao robô:

  • CoT Explícito (O Tour Lento e Constante): Você mostra ao robô cada etapa individual. "Multiplique por 2. Agora some 5. Agora divida por 3." É longo, mas o robô vê exatamente como a resposta foi construída.
  • CoT Composto (As Etapas Agrupadas): Você agrupa duas etapas juntas. Em vez de mostrar "Multiplique por 2" e depois "Some 5", você diz: "Multiplique por 2 e some 5". O robô vê as operações, mas os números intermediários ficam ocultos.
  • CoT Implícito (O Truque de Mágica): Você pula o meio completamente. Você apenas mostra o número inicial e o resultado final de um bloco, sem mostrar como você chegou lá. É como dizer: "Comece com 3, termine com 15", e o robô tem que adivinhar a matemática no meio.

2. O Custo da "Compressão" (Mais Dados Necessários)

O artigo encontrou uma compensação: Quanto mais você comprime as instruções, mais exemplos você precisa para ensinar o robô.

  • Analogia: Imagine ensinar alguém a assar um bolo.
    • Se você der a eles uma receita com cada etapa individual (Explícito), eles podem aprender depois de vê-la 10 vezes.
    • Se você der uma receita "comprimida" que diz "Misture os ingredientes secos e úmidos" sem mostrar o processo de mistura (Composto/Implícito), eles ficam confusos. Para aprender isso, você tem que mostrar essa receita comprimida centenas de vezes (mais dados) antes que eles finalmente entendam o padrão.
  • Descoberta: Raciocínio mais grosseiro e comprimido requer significativamente mais dados de treinamento para alcançar o mesmo nível de habilidade.

3. Repetição vs. Variedade (O Efeito do "Treino")

Uma vez que você decide usar dados comprimidos, como deve apresentá-los? Você deve mostrar ao robô os mesmos 10 problemas repetidamente (Repetição) ou 10.000 problemas diferentes (Escala)?

  • CoT Composto (As Etapas Agrupadas): Este tipo ama a repetição. Se você mostrar ao robô as mesmas etapas agrupadas repetidamente, ele fica muito bom naquele padrão específico. É como treinar um movimento específico em um esporte; a repetição torna isso memória muscular.
  • CoT Implícito (O Truque de Mágica): Este tipo odeia a repetição. Se você mostrar ao robô o mesmo "truque de mágica" repetidamente, ele apenas memoriza a resposta para aquele truque específico. Ele falha quando você dá a ele um novo quebra-cabeça. Ele precisa de variedade (dados diferentes) para realmente aprender a lógica subjacente; caso contrário, ele apenas trapaceia memorizando.

4. A Fase de "Desaprendizado" (SFT vs. RL)

Esta é a parte mais surpreendente. Os pesquisadores primeiro ensinaram o robô com dados comprimidos (SFT) e depois permitiram que ele praticasse sozinho com recompensas (RL).

  • O Problema: Quando ensinado com dados comprimidos, o robô fica preso em um padrão. Se você pedir para ele resolver um quebra-cabeça que requer uma "meia-etapa" (uma etapa que não se encaixa nos grupos comprimidos), ele falha completamente. É como um robô treinado apenas para andar em pares de passos; se você pedir para ele dar um passo único, ele cai.
  • A Solução: Quando eles mudaram para Aprendizado por Reforço (RL), o robô começou a "pensar" novamente. Ele percebeu: "Espere, posso quebrar este grande bloco de volta em pequenas peças!"
  • Analogia: Imagine um aluno que memorizou uma fórmula matemática como um único bloco. Ele não consegue resolver um problema que exige dividir a fórmula. Mas se você permitir que ele pratique resolver problemas sozinho (RL), ele eventualmente percebe: "Ah! Posso quebrar este grande bloco de volta nas pequenas etapas que aprendi antes." A fase de RL descomprime o conhecimento comprimido.

5. A Ordem Importa (Ruas de Mão Única)

Finalmente, eles olharam para a direção do pensamento.

  • Frente/Trás (Mão Única): Pensar do início ao fim, ou do fim ao início, funciona muito bem. O robô generaliza bem para quebra-cabeças mais longos e difíceis.
  • Hierárquico (A Árvore): É aqui que você resolve pequenos blocos e depois os combina (como construir uma árvore). O artigo descobriu que isso falha quando os quebra-cabeças ficam mais longos. O robô se perde tentando segurar muitos "galhos" intermediários em sua cabeça de uma só vez.
  • Conclusão: Para longas cadeias de raciocínio, uma linha reta (uma direção) é muito melhor do que uma estrutura de árvore ramificada.

Resumo

Para tornar uma IA inteligente eficiente (pensamento mais curto) sem perder sua inteligência:

  1. Não comprima demais a menos que você tenha uma quantidade massiva de dados.
  2. Se você comprimir, use etapas Compostas (mostrando as operações) e repita-as frequentemente. Evite etapas Implícitas (escondendo operações) a menos que você tenha dados grandes e diversos.
  3. SFT (Ajuste Fino Supervisionado) ensina ao robô os atalhos comprimidos, mas RL (Aprendizado por Reforço) é necessário para ensinar o robô a quebrar esses atalhos de volta quando o problema fica estranho ou mais longo.
  4. Mantenha o processo de pensamento em uma linha reta, não em uma árvore complexa, para os melhores resultados.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →