← Últimos artigos
💬 NLP

Compositional Generalization from Learned Skills via CoT Training: A Theoretical and Structural Analysis for Reasoning

Este trabalho demonstra teórica e estruturalmente que o treinamento com Cadeia de Pensamento (CoT) aprimora a generalização composicional em modelos de linguagem ao internalizar um circuito de raciocínio em duas etapas, permitindo que o modelo combine habilidades aprendidas para resolver problemas complexos e fora da distribuição, ensinando-o a "como pensar" em vez de apenas "o que pensar".

Autores originais: Xinhao Yao, Ruifeng Ren, Yun Liao, Lizhong Ding, Yong Liu

Publicado 2026-02-13
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xinhao Yao, Ruifeng Ren, Yun Liao, Lizhong Ding, Yong Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando uma criança a resolver um quebra-cabeça complexo. Existem duas maneiras de fazer isso:

  1. O jeito antigo (Sem CoT): Você mostra a criança a foto da caixa do quebra-cabeça (a pergunta) e a foto da solução final (a resposta). A criança tenta memorizar qual foto corresponde a qual caixa. Se você der a ela um quebra-cabeça novo, que nunca viu antes, ela provavelmente vai falhar, porque apenas memorizou as caixas antigas, não aprendeu como montar as peças.
  2. O jeito novo (Com CoT - "Cadeia de Pensamento"): Você não mostra apenas a resposta final. Você senta com a criança e diz: "Primeiro, encontre as peças de borda. Depois, procure as peças azuis do céu. Agora, conecte-as". Você ensina o processo passo a passo.

Este artigo de pesquisa, apresentado na conferência ICLR 2026, explica exatamente por que o segundo método (CoT) é tão poderoso para os Inteligências Artificiais (LLMs), usando uma mistura de matemática avançada e uma análise de "como o cérebro" do computador funciona por dentro.

Aqui está a explicação simplificada, usando analogias do dia a dia:

1. O Grande Segredo: "Aprender a Pensar" vs. "Aprender o que Pensar"

A descoberta principal é que o treinamento com CoT não ensina apenas a resposta certa; ele ensina a máquina a pensar.

  • Sem CoT: A IA tenta adivinhar a resposta final baseada em padrões que viu antes. É como tentar adivinhar o final de um filme apenas vendo o pôster. Se o filme for novo, você não sabe o final.
  • Com CoT: A IA aprende a decompor um problema grande em "habilidades menores" que ela já conhece. É como aprender a cozinhar. Se você sabe fritar um ovo e sabe cozinhar macarrão, o treinamento CoT ensina você a combinar essas duas habilidades simples para fazer um "macarrão com ovo" (um problema novo e complexo), mesmo que ninguém tenha te ensinado essa receita específica antes.

2. A Teoria: O Mapa do Tesouro (Generalização)

Os autores usaram matemática para provar algo importante sobre como a IA lida com situações novas (chamadas de "fora da distribuição" ou OOD).

  • O Problema: Imagine que você treinou um robô apenas para andar em pisos de madeira (dados comuns). Se você colocá-lo em um piso de gelo, ele cai.
  • A Solução CoT: O treinamento CoT ensina o robô a entender a física do andar (equilíbrio, atrito), não apenas a memória do piso de madeira.
  • A Analogia: É como se o treinamento CoT dividisse o problema em duas partes:
    1. O que você já sabe (ID): Resolver problemas que são muito parecidos com o treino.
    2. O que é novo (OOD): Combinar as peças que você já sabe usar de uma maneira nova.
      A matemática do artigo mostra que, com CoT, a IA consegue "pular" para a solução correta em cenários novos porque ela está montando o quebra-cabeça peça por peça, em vez de tentar adivinhar a imagem inteira de uma vez.

3. A Estrutura Interna: A Fábrica de Duas Etapas

Os pesquisadores olharam "por dentro" do cérebro da IA (as camadas do modelo) para ver como ela processa a informação. Eles descobriram uma estrutura fascinante:

  • Sem CoT (A Fábrica Bagunçada): A IA tenta fazer tudo de uma vez. Ela só consegue resolver o problema se tiver visto algo exatamente igual antes. Se o problema for novo, ela se perde. É como tentar montar um móvel complexo sem ler o manual, apenas chutando onde vai cada parafuso.

  • Com CoT (A Linha de Montagem de Duas Etapas): O treinamento CoT organiza o cérebro da IA como uma linha de montagem eficiente:

    • Etapa 1 (Camadas mais rasas): A IA resolve a primeira parte do problema e guarda o resultado intermediário (como encontrar a peça de borda do quebra-cabeça).
    • Etapa 2 (Camadas mais profundas): A IA pega esse resultado e usa para resolver a segunda parte.

    A Metáfora do Elevador: Imagine que a IA tem vários andares (camadas).

    • Sem CoT, ela precisa subir até o 5º andar para encontrar a resposta intermediária, deixando poucos andares para o resto do trabalho.
    • Com CoT, ela encontra a resposta intermediária já no 3º andar! Isso deixa os andares 4 e 5 livres para fazerem o trabalho pesado da segunda etapa. Isso torna a IA mais eficiente e capaz de lidar com problemas mais difíceis.

4. Resistência a Erros (O "Ruído")

Uma parte muito legal do estudo foi testar o que acontece se o treinamento tiver erros (como um professor que às vezes erra a conta na lousa).

  • A Descoberta: Mesmo com erros no treinamento (ruído), a IA que aprendeu com CoT continua funcionando muito bem, desde que os erros não sejam totais.
  • A Analogia: Se você ensina uma criança a andar de bicicleta e ela cai algumas vezes ou você comete um erro ao explicar como pedalar, ela ainda vai aprender a andar se você tiver mostrado o processo correto a maior parte do tempo. Mas, se você ensinar o processo errado completamente (como "pedale para trás"), ela nunca vai aprender. O CoT é robusto porque ensina a lógica, não apenas a memorização.

Resumo Final

Este artigo diz que o sucesso de modelos como o GPT-4 ou o DeepSeek-R1 não é apenas porque eles leram muita internet. O segredo é que, quando treinamos essas IAs para escreverem seus pensamentos passo a passo (CoT), nós as transformamos de "memorizadores de fatos" em "resolvedores de problemas".

Elas aprendem a combinar habilidades simples para criar soluções complexas. É a diferença entre ter um livro de respostas e ter um manual de instruções de como pensar. E o melhor: isso funciona mesmo quando a IA encontra problemas que ela nunca viu antes, porque ela sabe como montar as peças, não apenas qual peça encaixa em qual buraco.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →