← Últimos artigos
🤖 machine learning

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

Este artigo apresenta o RECAP, uma estratégia de replay de ponta a ponta com reponderação dinâmica de objetivos que mitiga eficazmente o esquecimento de capacidades gerais em modelos de raciocínio de grande escala treinados com aprendizagem por reforço, enquanto simultaneamente melhora o desempenho de raciocínio através de compensações flexíveis de recompensa.

Autores originais: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

Publicado 2026-06-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A Armadilha do "Especialista"

Imagine que você contrata um chef brilhante e versátil, capaz de cozinhar qualquer coisa: ele pode fazer um bolo perfeito, picar vegetais com precisão e até consertar uma torneira vazando na cozinha (uma metáfora para a habilidade de um modelo em lidar com matemática, visão e conhecimento geral).

Então, você decide treinar esse chef especificamente para vencer um concurso de comer tortas de alto nível. Você o coloca em uma sala com apenas receitas de torta e regras estritas sobre como segurar o garfo.

O que acontece?
Após algumas semanas de treinamento intenso, o chef se torna um comedor de tortas de classe mundial. Ele segue as regras do garfo perfeitamente. No entanto, como ele passou todo o seu tempo praticando torta, ele começa a esquecer como picar vegetais ou consertar a torneira. Se você pedir para ele picar uma cebola, ele pode ficar olhando fixamente ou tentar comê-la inteira.

No mundo da IA, é exatamente isso que está acontecendo. Pesquisadores estão usando uma técnica chamada RLVR (Aprendizado por Reforço com Recompensas Verificáveis) para ensinar Grandes Modelos de Linguagem (LLMs) a "raciocinar" (resolver problemas matemáticos, seguir lógicas complexas). Embora os modelos fiquem incríveis em raciocínio, eles começam a esquecer suas outras habilidades, como reconhecer objetos em uma imagem, ler texto em uma imagem ou manter-se seguros e honestos.

A Solução do Artigo: "RECAP"

Os autores propõem um novo método chamado RECAP (Replay-Enhanced CApability Preservation - Preservação de Capacidade Aprimorada por Replay). Pense no RECAP como um cronograma de treinamento inteligente para esse chef.

Em vez de apenas alimentar o chef com receitas de torta o dia todo, o RECAP faz duas coisas:

  1. Replay dos Fundamentos: Ele ocasionalmente traz de volta as antigas receitas de "picar vegetais" e "consertar a torneira" para que o chef não as esqueça.
  2. Ponderação Dinâmica: Funciona como um treinador inteligente que observa o progresso do chef em tempo real.

Como o "Treinador Inteligente" Funciona (A Analogia)

Imagine que o chef está praticando três coisas ao mesmo tempo:

  • A Regra do Garfo (Formato): Como segurar o garfo.
  • O Sabor (Precisão): A torta tem um gosto bom?
  • A Limpeza (Habilidades Gerais): Manter a cozinha organizada.

Em uma sessão de treinamento normal, o treinador poderia dizer: "Pratique as três coisas igualmente!". Mas isso é ineficiente.

  • A Regra do Garfo é fácil. O chef a domina em 5 minutos. Se o treinador continuar fazendo ele praticar isso por uma hora, é um desperdício de tempo.
  • O Sabor é difícil. O chef tem dificuldades com isso.
  • A Limpeza está ficando bagunçada porque o chef está distraído.

O Treinador do RECAP observa os dados e diz:

"Ei, o chef já dominou a Regra do Garfo. Vamos parar de focar nisso (diminuir o peso). Vamos dedicar mais tempo ao Sabor e à Limpeza, porque são essas as áreas onde ele ainda está com dificuldades ou onde o desempenho está instável."

O RECAP detecta automaticamente quais habilidades estão "saturadas" (já aprendidas) e quais estão "voláteis" (com dificuldades ou mudando rapidamente). Ele desloca o foco do treinamento para as habilidades que estão enfrentando dificuldades, para que o modelo não aprenda demais o que é fácil enquanto esquece o que é difícil.

O Que Eles Descobriram (Os Resultados)

Os pesquisadores testaram isso em modelos de IA poderosos (especificamente a família Qwen2.5-VL). Aqui está o que descobriram:

  1. O "Esquecimento" é Real: Quando treinaram os modelos apenas em tarefas de raciocínio, os modelos ficaram melhores em matemática, mas ficaram significativamente piores em coisas como ler texto em imagens ou reconhecer objetos.
  2. RECAP Salva o Dia: Ao usar seu cronograma dinâmico, os modelos mantiveram suas habilidades de raciocínio altas (às vezes até melhorando-as) mas não perderam suas habilidades gerais. Na verdade, eles frequentemente tiveram um desempenho melhor em tarefas gerais do que os modelos treinados com métodos padrão.
  3. Eficiência: Os modelos treinados com RECAP não ficaram apenas mais inteligentes; eles também se tornaram mais eficientes. Eles começaram a dar respostas mais curtas e diretas em vez de divagar, porque o sistema parou de forçá-los a "pensar" (escrever longas cadeias de texto) em tarefas que não precisavam disso.

A Conclusão

O artigo argumenta que não devemos apenas forçar os modelos de IA a se tornarem "máquinas de raciocínio" ignorando todo o resto. Se o fizermos, eles se tornam especialistas de um único truque que esquecem como ser úteis no mundo real.

RECAP é uma ferramenta simples, do tipo "plug-in", que atua como uma dieta equilibrada para o treinamento de IA. Ele garante que, enquanto o modelo aprende a resolver quebra-cabeças complexos, ele não esqueça como ver, ler e entender o mundo ao seu redor. Trata-se de manter a IA bem preparada em diversas áreas, enquanto ainda a torna um gênio em sua função principal.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →