← Últimos artigos
💬 NLP

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

Este artigo apresenta o Length-Unbiased Sequence Policy Optimization (LUSPO), um novo algoritmo que analisa teoricamente e retifica o viés de comprimento no Group Sequence Policy Optimization (GSPO) para evitar o colapso do comprimento da resposta, alcançando, assim, o estado da arte em tarefas de raciocínio matemático e multimodal.

Autores originais: Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

Publicado 2026-02-06
📖 4 min de leitura☕ Leitura rápida

Autores originais: Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está treinando um aluno brilhante (um modelo de IA) para resolver quebra-cabeças complexos de matemática e lógica. Para ajudá-lo a aprender, você usa um método chamado Aprendizagem por Reforço com Recompensas Verificáveis (RLVR). Pense nisso como um treinador que apresenta um problema ao aluno, deixa que ele tente resolvê-lo e depois verifica a resposta. Se a resposta estiver correta, ele ganha uma estrela de ouro; se estiver errada, recebe um gentil "tente novamente".

Com o tempo, o aluno aprende a pensar de forma mais longa e profunda, decompondo grandes problemas em pequenos passos. Esse processo de "pensar em voz alta" é crucial para resolver tarefas difíceis.

No entanto, os autores deste artigo descobriram uma falha oculta na forma como os métodos de treinamento atuais (especificamente algoritmos chamados GRPO e GSPO) estavam avaliando os alunos.

O Problema: A Armadilha da "Resposta Curta"

Imagine que o treinador está corrigindo uma prova.

  • A Falha: O sistema de avaliação atual acidentalmente pune alunos que escrevem explicações longas e detalhadas, mesmo que essas explicações estejam corretas. É como um professor que dá a um aluno que escreveu uma redação perfeita de 5 páginas uma nota menor do que a de um aluno que escreveu um ensaio de 1 página, simplesmente porque a matemática da fórmula de avaliação favorece o trabalho mais curto.
  • O Resultado: Os alunos (modelos de IA) percebem rapidamente que, para obter a melhor pontuação, devem parar de pensar profundamente e apenas dar respostas curtas e rápidas.
  • O Colapso: Nos experimentos do artigo, um dos métodos populares (GSPO) causou o "colapso" das respostas da IA. A IA começou a dar respostas muito breves e preguiçosas, perdendo sua capacidade de raciocinar através de problemas complexos. Foi como um maratonista que de repente decidiu caminhar porque a linha de chegada estava sendo aproximada toda vez que ele dava um passo longo.

A Solução: LUSPO (O Treinador Justo)

Os autores, Fanfan Liu e sua equipe da Meituan, propuseram um novo método chamado Otimização de Política de Sequência Sem Viés de Comprimento (LUSPO - Length-Unbiased Sequence Policy Optimization).

Pense no LUSPO como um novo treinador mais justo que corrige a fórmula de avaliação.

  • A Correção: O novo treinador diz: "Não importa se sua resposta tem 10 palavras ou 1.000 palavras. Se o raciocínio estiver correto, você recebe pontuação total". Eles ajustam a matemática para que o comprimento da resposta não aumente ou diminua a pontuação de forma injusta.
  • A Analogia: Se o método antigo era como julgar um discurso com base em quantas palavras você usou, o LUSPO é como julgar com base em quão bem você comunicou suas ideias, independentemente de ter falado por 5 ou 30 minutos.

O Que Aconteceu Quando Eles Testaram Isso?

A equipe testou este novo "treinador justo" em diferentes tipos de modelos de IA (alguns que apenas leem texto e outros que também podem olhar para imagens e gráficos).

  1. A IA Começou a Pensar por Mais Tempo: Em vez de encurtar suas respostas, os modelos começaram a escrever explicações mais longas e detalhadas. Eles estavam dispostos a dedicar tempo para "pensar" através do problema.
  2. Melhores Pontuações: Como os modelos estavam pensando de forma mais profunda, eles ficaram melhores em resolver quebra-cabeças difíceis de matemática e lógica. Nos testes, os modelos treinados com LUSPO pontuaram mais alto do que aqueles treinados com os métodos antigos.
    • Por exemplo, em um teste de matemática difícil (AIME24), o novo método melhorou as pontuações em até 6,9% em um modelo e 2,9% em outro.
    • Em quebra-cabeças visuais (olhando para tabelas e gráficos), também superou os métodos anteriores mais eficazes.
  3. Estabilidade: O processo de treinamento tornou-se muito mais estável. Os modelos não ficaram confusos nem começaram a dar respostas preguiçosas; eles melhoraram consistentemente sua capacidade de raciocínio.

O Ponto Principal

O artigo mostra que a maneira como treinamos atualmente a IA para "pensar" possui um erro oculto que a faz querer ser preguiçosa e breve. Ao corrigir esse erro com o LUSPO, a IA torna-se um aluno mais diligente, disposto a escrever soluções longas, detalhadas e precisas para problemas complexos. É uma mudança simples na matemática que leva a um comportamento de IA muito mais inteligente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →