← Últimos artigos
💻 computer science

GraphPO: Graph-based Policy Optimization for Reasoning Models

O GraphPO introduz um novo framework de aprendizado por reforço baseado em grafos que representa rollouts de raciocínio como grafos acíclicos direcionados para fundir caminhos semanticamente equivalentes e compartilhar informações entre ramos, reduzindo assim a exploração redundante e a variância da estimativa de vantagem, ao mesmo tempo em que supera métodos existentes baseados em cadeias e árvores em benchmarks de raciocínio.

Autores originais: Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

Publicado 2026-06-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um aluno muito inteligente, mas um pouco repetitivo, a resolver um problema matemático complexo ou a escrever um código. Você não dá instruções passo a passo; em vez disso, você o deixa tentar diferentes abordagens e só diz ao final: "Correto!" ou "Incorreto."

É assim que os modelos de IA atuais (chamados de Large Reasoning Models) aprendem. Eles tentam, erram e tentam novamente até chegar à resposta certa. Mas existem dois grandes problemas com esse método, que o artigo GraphPO visa corrigir.

O Problema: O "Explorador Solitário" e o "Método da Árvore"

1. O Esforço Desperdiçado (Método da Cadeia)
Imagine enviar 100 alunos para um labirinto. Cada aluno percorre um caminho completamente separado.

  • O Problema: Mesmo estando em caminhos diferentes, 50 deles podem ficar presos exatamente no mesmo beco sem saída ou passar pelo mesmo corredor confuso. Eles estão desperdiçando tempo e energia fazendo exatamente a mesma coisa repetidamente. Em termos de IA, isso é "exploração redundante".

2. O Método da "Árvore" (A Melhoria, mas não é perfeita)
Para corrigir o desperdício, pesquisadores tentaram um método de "Árvore". Imagine que os alunos começam juntos e, no primeiro desvio no caminho, eles se separam. Se dois alunos fizerem a mesma primeira curva, eles caminham juntos por um tempo.

  • O Problema: Isso ajuda um pouco, mas uma vez que eles se separam em um segundo desvio, eles estão sozinhos novamente. Se dois ramos diferentes de uma árvore acabarem levando ao mesmo corredor confuso (mesmo que tenham chegado lá por rotas diferentes), os alunos não sabem que estão no mesmo lugar. Eles continuam explorando esse corredor separadamente, desperdiçando mais tempo. Eles também não conseguem "compartilhar as boas notícias" se um aluno encontrar a saída desse corredor; os outros continuam apenas adivinhando.

A Solução: O "Mapa Inteligente" (GraphPO)

Os autores propõem o GraphPO, que é como dar aos alunos um mapa compartilhado e vivo em vez de apenas uma árvore.

Como funciona:

  1. O Mapa (O Grafo): Em vez de apenas desenhar linhas (ramos), a IA desenha um mapa onde cada "sala" (um passo no raciocínio) é um nó.
  2. Identificando Gêmeos (Fusão Semântica): À medida que a IA explora, ela observa as "salas" que diferentes caminhos alcançaram. Se dois caminhos diferentes chegam a uma sala que parece a mesma (mesmo que as palavras usadas para chegar lá sejam ligeiramente diferentes), a IA diz: "Ei, vocês dois estão no mesmo lugar!" e os funde em um único ponto no mapa.
  3. Compartilhando as Boas Notícias (Compartilhamento de Sufixo): Uma vez que dois caminhos são fundidos, eles compartilham tudo o que vem depois daquele ponto. Se um caminho encontra a resposta corre never daquele ponto fundido, o outro caminho recebe o crédito por esse sucesso instantaneamente, sem ter que percorrer o resto do caminho novamente.
  4. O Bônus de "Eficiência": A IA também aprende a preferir o caminho mais curto para chegar a uma determinada "sala". Se o Caminho A leva 10 passos para chegar a um bom lugar, e o Caminho B leva 15 passos para chegar ao mesmo lugar, a IA aprende a favorecer o Caminho A. É como recompensar o aluno que pega o atalho.

O Resultado: Mais Inteligente, Mais Rápido e Menos Desperdiçador

Ao usar essa abordagem de "Mapa Inteligente", o GraphPO alcança três coisas principais:

  • Chega de Passos Desperdiçados: Ele impede que a IA explore os mesmos becos sem saída duas vezes. Ele redireciona o "orçamento" (poder computacional) para explorar novas áreas em vez de repetir as antigas.
  • Melhor Aprendizado com Erros: Como ele funde caminhos semelhantes, pode dizer à IA "Este passo específico foi bom" muito mais cedo do que antes, mesmo que a resposta final ainda não seja perfeita. Ele transforma um vago "Você acertou no final" em um claro "Este movimento específico foi inteligente".
  • Respostas Mais Curtas: Como recompensa o caminho mais curto para uma solução, a IA aprende a ser mais concisa e eficiente, cortando conversas desnecessárias.

A Conclusão

O artigo testou este método em três modelos de IA diferentes em problemas matemáticos, codificação e tarefas de busca. Os resultados mostraram que o GraphPO consistentemente superou os métodos antigos (tanto os exploradores solitários quanto as árv de ramificação). Ele resolveu mais problemas, usou menos palavras para fazê-lo e aprendeu mais rápido, tudo isso utilizando a mesma quantidade de poder computacional.

Em resumo, o GraphPO ensina a IA a parar de andar em círculos e começar a compartilhar um mapa, tornando o processo de aprendizado muito mais inteligente e menos desperdiçador.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →