← Últimos artigos
🤖 machine learning

LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts

Este artigo introduz o LoRA Scaffolded Policy Optimization (LSPO), um mecanismo de tempo de amostragem que recupera gradientes de aprendizagem por reforço em prompts de "penhasco" onde todas as trajetórias amostradas falham ao ajustar temporariamente um adaptador de baixo posto para gerar soluções bem-sucedidas, melhorando significativamente o desempenho de raciocínio matemático em benchmarks como AIME e MATH em comparação com os baselines padrão.

Autores originais: Ken Ding

Publicado 2026-07-31
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ken Ding

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a resolver problemas de matemática. Você não fica sentado ali corrigindo cada erro individual; em vez disso, você deixa o robô tentar resolver um problema, verifica se a resposta está certa e dá um "polegar para cima" ou "polegar para baixo". Isso é chamado de Aprendizado por Reforço. Para tornar o aprendizado ainda mais rápido, o robô tenta resolver o mesmo problema dez vezes seguidas. Se ele acertar algumas e errar outras, o robô aprende: "Ei, as que receberam o polegar para cima foram melhores que a média!" Ele usa essa diferença para descobrir como melhorar. Esta é a maneira padrão pela qual esses sistemas aprendem.

Mas há uma situação complicada onde esse método encontra um muro. Imagine que o robô tenta resolver um problema dez vezes e falha em todas elas. Todas as dez tentativas recebem um "polegar para baixo". Como todas as tentativas são igualmente ruins, o robô não consegue dizer qual delas foi "menos ruim" ou "mais próxima da resposta". A matemática diz que a diferença entre elas é zero, então o robô não recebe instrução alguma. É como estar na beira de um precipício onde o chão simplesmente desaparece; o robô fica preso nos problemas mais difíceis que ainda não consegue resolver, e o método de aprendizado usual simplesmente para de funcionar. Este é o "problema do precipício", e ele deixa os desafios mais inteligentes e difíceis completamente intocados pelo processo de aprendizado.

Apresentamos uma nova ideia chamada Otimização de Política com Andaime LoRA (LSPO - LoRA Scaffolded Policy Optimization). Pense no LSPO como uma rede de segurança inteligente que captura o robô logo antes de ele cair nesse precipédio. Quando o robô tenta um problema difícil e falha todas as vezes, o sistema pausa o aprendizado usual e retira uma pequena e temporária "rodinha de treinamento" chamada de adaptador LoRA. Isso não é uma mudança permanente no cérebro do robô; é um pequeno dispositivo destacável.

Aqui está o truque de mágica: o sistema pega a resposta correta para aquele problema impossível (que ele possui em seu banco de dados) e rapidamente ensina este pequeno dispositivo a resolvê-lo. É como entregar ao robô uma folha de cola apenas para este momento específico. Então, o robô tenta o problema novamente, mas desta vez com a folha de cola acoplada. De repente, ele resolve o problema! O sistema pega essa nova tentativa bem-sucedida e a troca no grupo de dez tentativas. Agora, em vez de dez falhas, o grupo tem nove falhas e um sucesso. A matemática volta a funcionar! O robô pode finalmente ver a diferença entre as tentativas ruins e a boa, e aprende como melhorar.

O melhor de tudo? Assim que o robô aprende com essa única tentativa bem- sucedida, o sistema imediatamente arranca a folha de cola (o adaptador LoRA) e a joga fora. O cérebro permanente do robô aprende apenas com a experiência, mas não mantém o dispositivo temporário. Isso garante que o robô permaneça "limpo" e não se confunda com a folha de cola mais tarde.

Os pesquisadores testaram isso em um modelo treinado com 103.000 problemas de matemática. Eles descobriram que este método funciona incrivelmente bem. Em um conjunto de 16 testes diferentes (misturando várias competições de matemática e níveis de dificuldade), o novo método superou o padrão antigo em 15 de 16 casos, com um caso sendo um empate perfeito. Em alguns dos testes mais difíceis, o novo método melhorou a taxa de sucesso em até 10,7 pontos. Eles também mediram exatamente com que frequência essa "rede de segurança" funcionou: ela transformou com sucesso cerca de 43% daqueles grupos de falhas "travadas" em grupos que podiam realmente aprender.

Este artigo não afirma ter resolvido todos os problemas de matemática ou ter encontrado uma solução perfeita para todas as situações. Ele sugere que, ao usar um adaptador de baixo posto temporário para corrigir esses momentos específicos de "precipício", podemos recuperar sinais de aprendizado que antes eram perdidos. Os resultados baseiam-se em experimentos específicos com um modelo e conjunto de dados particulares, mostrando que esta abordagem de "encaixar e descartar" é uma forma promissora de ajudar modelos de IA a enfrentar os problemas mais difíceis que eles enfrentam atualmente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →