← Últimos artigos
💬 NLP

Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models

Este artigo propõe o MPO (Multi-token Policy Gradient Optimization), um framework que trata sequências de K tokens como ações semânticas unificadas para superar as limitações dos métodos tradicionais baseados em tokens individuais em tarefas de raciocínio complexo, demonstrando superioridade em benchmarks de matemática e programação.

Autores originais: Mufan Xu, Kehai Chen, Xuefeng Bai, Zhengyu Niu, Muyun Yang, Tiejun Zhao, Min Zhang

Publicado 2026-02-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Mufan Xu, Kehai Chen, Xuefeng Bai, Zhengyu Niu, Muyun Yang, Tiejun Zhao, Min Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô superinteligente a resolver problemas de matemática ou a escrever código. Até agora, a maneira padrão de treinar esse robô era como se ele estivesse aprendendo a andar: um passo de cada vez.

O robô olhava para a frase anterior, pensava: "Qual é a próxima palavra?" e escolhia uma. Depois, olhava para a nova frase e repetia o processo. O problema é que, em tarefas complexas (como resolver uma equação ou criar uma função de código), a "decisão" não é uma única palavra. É um bloco inteiro de pensamento.

Por exemplo, quando o robô decide escrever x = 5, ele não está apenas escolhendo a letra "x", depois o "=", depois o "5". Ele está tomando uma decisão lógica de definir uma variável. Se o robô focar apenas em cada letra isoladamente, ele pode perder o sentido do bloco inteiro, como tentar montar um quebra-cabeça olhando apenas para uma peça de cada vez, sem ver a imagem completa.

A Solução: O Método "MPO" (Otimização de Blocos)

Os autores deste artigo propuseram uma nova técnica chamada MPO (Otimização de Política de Múltiplos Tokens). Vamos usar uma analogia simples para entender como funciona:

1. A Analogia do Maestro e da Orquestra

  • O Método Antigo (Token por Token): Imagine um maestro que diz para cada músico: "Toque uma nota agora". O violinista toca uma nota, o flautista toca outra, e assim por diante. O maestro avalia se cada nota individual foi boa. O problema? Às vezes, a nota sozinha é perfeita, mas quando junta com as outras, a melodia fica estranha. O maestro não vê a "frase musical" completa.
  • O Novo Método (MPO): Agora, imagine que o maestro diz: "Toquem esta frase inteira de 5 notas". Ele avalia a frase como um todo. Se a frase faz sentido musicalmente, ele elogia o grupo. Se a frase está errada, ele corrige o grupo inteiro.

No mundo dos computadores, em vez de avaliar a probabilidade de gerar uma única palavra (token), o MPO avalia a probabilidade de gerar um bloco de palavras (por exemplo, 5 palavras seguidas) como uma única ação semântica.

2. Por que isso é importante?

Em raciocínio complexo, como matemática ou programação, as ideias são construídas em blocos:

  • Definir uma variável (let x = 10).
  • Escrever uma equação (y = x + 5).
  • Criar uma função inteira.

Se o robô tentar aprender apenas palavra por palavra, ele pode "esquecer" o objetivo do bloco no meio do caminho. O MPO força o robô a pensar: "Vou gerar esse pequeno parágrafo inteiro e ver se ele faz sentido lógico". Isso ajuda o robô a manter a coerência e a lógica por mais tempo.

3. O Resultado na Prática

Os pesquisadores testaram essa ideia em modelos de linguagem famosos (como o Llama e o DeepSeek) em tarefas de matemática e programação.

  • O que aconteceu? Os modelos treinados com o método "bloco a bloco" (MPO) ficaram melhores do que os treinados com o método "palavra por palavra".
  • A vantagem: Eles cometeram menos erros de lógica, mantiveram a coerência em respostas longas e resolveram problemas mais difíceis com mais precisão. Além disso, o treinamento foi mais estável, como se o robô tivesse menos "tonturas" enquanto aprendia.

Resumo em uma frase

O MPO ensina a inteligência artificial a pensar em parágrafos e ideias completas em vez de apenas em palavras soltas, permitindo que ela raciocine de forma mais humana, lógica e coerente, assim como um maestro que ouve a melodia inteira e não apenas uma nota isolada.

É um passo importante para fazer com que as IAs não apenas "adivinhem a próxima palavra", mas realmente "entendam e planejem" a próxima etapa do raciocínio.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →