← Últimos artigos
🤖 machine learning

RL Fine-Tuning Heals OOD Forgetting in SFT

Este artigo desafia a noção de que "o SFT memoriza e o RL generaliza", demonstrando por meio de análises checkpoint a checkpoint e espectrais que o SFT frequentemente causa esquecimento fora da distribuição, que é subsequentemente restaurado pelo RL, um processo de recuperação ligado à rotação dos vetores singulares e não a mudanças nos valores singulares.

Autores originais: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

Publicado 2026-05-12
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: A Dança de "Dois Passos" do Treinamento de IA

Imagine que você está ensinando um aluno brilhante, mas inexperiente (um Modelo de Linguagem de Grande Escala) a resolver quebra-cabeças complexos. A receita padrão para transformar esse aluno em um especialista em raciocínio envolve dois passos:

  1. Passo 1: Ajuste Fino Supervisionado (SFT) – Você entrega ao aluno um livro didático com respostas e diz: "Memorize esses padrões e copie o estilo."
  2. Passo 2: Aprendizado por Reforço (RL) – Você coloca o aluno em um jogo onde ele ganha pontos por respostas corretas e perde pontos por erradas, dizendo: "Agora, descubra a lógica por si mesmo para vencer."

Por muito tempo, a comunidade de IA acreditou em uma história simples: "O SFT faz o aluno memorizar o livro didático (bom para problemas conhecidos), e o RL faz o aluno generalizar e pensar criativamente (bom para problemas novos)."

Este artigo diz que essa história está incompleta. Os autores descobriram que, embora o SFT seja ótimo no início, ele na verdade começa a prejudicar a capacidade do aluno de resolver novos tipos de quebra-cabeças se você deixá-lo estudar o livro didático por tempo demais. Então, o RL não necessariamente ensina a eles novos superpoderes; ele principalmente conserta o dano causado pelo SFT.


A Descoberta: O "Pico e o Colapso"

Os pesquisadores observaram o progresso do aluno todos os dias durante o processo de treinamento. Eles encontraram um padrão surpreendente:

  • A Vitória Inicial: No início absoluto do "estudo do livro didático" (SFT), o aluno fica muito bom em resolver novos tipos de quebra-cabeças (tarefas Fora de Distribuição ou OOD). É como se o aluno de repente entendesse a lógica subjacente da matemática.
  • O Colapso: À medida que o aluno continua estudando o livro didático, ele começa a ficar pior nos quebra-cabeças novos, mesmo ficando melhor nos problemas específicos do livro didático. Ele se torna tão obcecado pelo formato exato das respostas do livro didático que esquece como aplicar a lógica a situações ligeiramente diferentes.
  • O Conserto: Quando finalmente mudam para a fase de "jogo" (RL), o desempenho do aluno em novos quebra-cabeças sobe novamente.

A Analogia:
Imagine um chef aprendendo a cozinhar.

  • SFT Inicial: O chef aprende as regras básicas do sabor. Ele consegue cozinhar uma ótima refeição com qualquer ingrediente.
  • SFT Tardio: O chef é forçado a memorizar um livro de receitas específico. Ele se torna incrível em fazer aquele prato exato, mas esquece como ajustar os sabores se receber ingredientes diferentes. Ele "esqueceu" sua intuição geral de cozinhar.
  • RL: O chef é colocado em uma competição onde ganha pontos por comida saborosa, independentemente da receita. Isso o força a parar de seguir cegamente o livro e começar a usar sua intuição novamente. Ele recupera suas habilidades gerais de cozinhar, mas não se torna repentinamente um chef melhor do que era no início de seu treinamento.

A Descoberta Chave: O RL é um "Restaurador", não um "Criador"

O artigo desafia a ideia de que o RL cria novas capacidades de raciocínio do zero. Em vez disso, os autores descobriram:

  1. O SFT Esquece: Se você treinar por tempo demais em dados específicos, o modelo "esquece" sua capacidade de lidar com situações estranhas ou novas.
  2. O RL Recupera: O RL age como um curativo. Ele tapa os buracos que o SFT fez, restaurando o modelo ao nível de desempenho que ele tinha no pico da fase de SFT.
  3. O Teto: O RL raramente torna o modelo melhor do que aquele pico inicial. Ele apenas o traz de volta ao ponto onde estava antes de ficar muito especializado.

A Zona "Cachinhos Dourados":
Os pesquisadores descobriram que o RL só funciona se você começar no momento certo.

  • Se você começar o RL muito cedo (antes do modelo conhecer o básico), ele falha porque o modelo está muito confuso.
  • Se você começar o RL muito tarde (depois que o modelo esqueceu tudo), os sinais do "jogo" são muito bagunçados para o modelo aprender com eles.
  • Existe um "ponto ideal" específico (uma faixa de checkpoints) onde o RL pode curar com sucesso o esquecimento.

O Mecanismo Secreto: A "Bússola Giratória"

Para entender por que isso acontece, os autores olharam dentro do cérebro do modelo usando uma ferramenta matemática chamada Decomposição em Valores Singulares (SVD). Pense no conhecimento do modelo como uma bússola gigante com muitas agulhas apontando em direções diferentes.

  • O Tamanho das Agulhas (Valores Singulares): Os pesquisadores descobriram que a força dessas agulhas (quanto conhecimento é armazenado) mal muda durante o treinamento. Elas permanecem estáveis.
  • A Direção das Agulhas (Vetores Singulares): No entanto, a direção para a qual as agulhas apontam muda drasticamente.

A Analogia:
Imagine que o conhecimento do modelo é um mapa.

  • O SFT não apaga o mapa (o tamanho dos dados permanece o mesmo), mas rota o mapa. Ele gira a bússola para que o "Norte" aponte para os exemplos específicos do livro didático, tornando difícil encontrar o "Norte" para locais novos e diferentes.
  • O RL gira a bússola de volta. Ele não adiciona novas terras ao mapa; apenas realinha a bússola para que o "Norte" aponte para a lógica geral novamente, permitindo que o modelo navegue em novos terrenos.

Resumo para o Leitor Comum

  • Antiga Crença: "O SFT memoriza, o RL generaliza."
  • Nova Realidade: "O SFT esquece (por superespecialização), e o RL recupera (por realinhamento)."
  • A Lição: Não continue treinando sua IA nos mesmos dados específicos para sempre. Ela perderá sua capacidade de pensar de forma flexível. Se você quiser que ela seja inteligente sobre coisas novas, você precisa parar a fase de "memorização" no momento certo e usar a fase de "jogo" para corrigir o foco, em vez de esperar que o jogo lhe ensine habilidades inteiramente novas do zero.

O artigo conclui que o melhor desempenho para resolver problemas novos e difíceis geralmente ocorre cedo no processo de treinamento, e a segunda etapa (RL) está principalmente lá para nos salvar dos erros que cometemos ao treinar por tempo demais na primeira etapa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →