← Últimos artigos
🤖 machine learning

Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy

Este artigo aborda a discrepância entre treino e inferência em aprendizagem por reforço de LLMs ao formulá-la como um Processo de Decisão de Markov com Restrição de Discrepância (DCMDP) com um mecanismo de relaxação Lagrangiana dinâmica, o qual estabiliza o treino e melhora o desempenho ao equilibrar adaptativamente a maximização da recompensa com o controlo da discrepância para permitir a exploração livre dentro de uma região de tolerância enquanto corrige desvios excessivos.

Autores originais: Jiashun Liu, Runze Liu, Xu Wan, Jing Liang, Hongyao Tang, Ling Pan

Publicado 2026-06-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jiashun Liu, Runze Liu, Xu Wan, Jing Liang, Hongyao Tang, Ling Pan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um aluno brilhante (a IA) a resolver problemas matemáticos complexos. Você tem duas salas diferentes para este treinamento:

  1. A Sala de Treinamento: Este é um laboratório de alta tecnologia, superpreciso, com o melhor equipamento. Aqui, o aluno aprende usando ferramentas perfeitas e de alta fidelidade.
  2. A Sala de Exame: Esta é uma sala de aula apertada, de baixo orçamento, onde o aluno realmente fará a prova. As ferramentas aqui são mais baratas e ligeiramente menos precisas.

O Problema: O "Fantasma" na Máquina
No passado, pesquisadores notaram uma falha estranha. O aluno estudava muito na Sala de Treinamento luxuosa, mas, ao entrar na Sala de Exame, subitamente esquecia tudo ou começava a cometer erros bobos. Isso acontecia porque o "motor" que rodava o cérebro do aluno na Sala de Treinamento era ligeiramente diferente do motor da Sala de Exame. Mesmo que o "conhecimento" (os pesos do modelo) fosse o mesmo, a maneira como ele processava a informação mudava o suficiente para causar um colapso total no desempenho.

Tentar consertar isso tornando a Sala de Treinamento exatamente igual à Sala de Exame (rebaixando as ferramentas sofisticadas para ferramentas baratas) não funcionou bem; tornava o processo de aprendizado instável e propenso a explosões.

A Solução: Um Treinador de "Zona de Segurança"
Os autores deste artigo criaram uma nova maneira de treinar o aluno. Eles perceberam que o aluno não precisa ser perfeitamente idêntico em ambas as salas para ter sucesso. Na verdade, forçá-lo a ser idêntico cedo demais impede que ele aprenda soluções novas e criativas.

Eles introduziram o conceito de DCMDP (Processo de Decisão de Markov com Restrição de Discrepância). Veja como funciona usando uma analogia simples:

1. A "Zona de Tolerância" (O Buffer de Segurança)

Imagine o aluno caminhando em uma corda bamba.

  • O Jeito Antigo: O treinador gritava "PARE!" no momento em que o aluno oscilava até mesmo um milímetro. Isso deixava o aluno com muito medo de se mover, então ele nunca aprendia a equilibrar-se ou a andar rápido.
  • O Novo Jeito (DCMDP): O treinador desenha uma ampla "Zona de Segurança" invisível ao redor da corda bamba. Enquanto o aluno permanecer dentro desta zona, o treinador diz: "Ótimo! Continue explorando! Você pode balançar um pouco para a esquerda ou para a direita". Isso permite que o aluno aprenda e melhore suas habilidades matemáticas livremente.

2. A "Penalidade Mágica" (A Correção)

No entanto, se o aluno oscilar demais para fora dessa Zona de Segurança (significando que o comportamento na Sala de Treinamento está ficando muito diferente do comportamento na Sala de Exame), o treinador o puxa de volta de forma gentil, mas firme.

  • O artigo descobriu que a melhor maneira de medir essa "oscilação" é observar a diferença de probabilidade de cada palavra (token) que o aluno diz.
  • Se o aluno disser uma palavra que é altamente provável na Sala de Treinamento, mas muito improvável na Sala de Exames, isso é um "sinal de alerta".

3. O Treinador Inteligente (O Multiplicador de Lagrange)

O artigo introduz um "Treinador Inteligente" (uma ferramenta matemática chamada multiplicador de Lagrange) que ajusta a força do puxão automaticamente.

  • Se o aluno estiver oscilando descontroladamente, o treinador puxa com mais força.
  • Se o aluno estiver permanecendo majoritariamente dentro da zona, o treinador relaxa e o deixa focar em resolver os problemas matemáticos.
  • Isso garante que o aluno aprenda a ser inteligente e confiável ao mesmo tempo.

O Resultado: O Superpoder "Heterogêneo"

A parte mais emocionante deste artigo é que ele permite o Treinamento Heterogêneo.

  • Você pode treinar o aluno no Laboratório de Alto Nível (usando computadores caros e precisos) para obter a melhor velocidade e qualidade de aprendizado possíveis.
  • Mas, você o ensina a estar pronto para a Sala de Exame de Baixo Orçamento (usando computadores baratos e com recursos limitados) ao verificar constantemente se ele permanece dentro da "Zona de Segurança".

Em Resumo:
Em vez de tentar fazer com que os ambientes de treinamento e teste sejam idênticos (o que é difícil e caro), este método ensina a IA a ser autoconsciente. Ele permite que a IA explore e aprenda livremente, desde que não se afaste demais de como ela realmente se comportará no mundo real. Se ela começar a se afastar demais, uma correção inteligente e automática a coloca de volta nos trilhos.

O artigo testou isso em grandes modelos de IA (como Qwen-8B e Qwen-30B) resolvendo problemas matemáticos. Eles descobriram que este método evitou que a IA "travasse" e, de fato, fez com que ela tivesse um desempenho melhor, mesmo quando a configuração de treinamento era muito mais poderosa do que a configuração de implantação.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →