← Últimos artigos
💬 NLP

Negative Advantage Is a Double-Edged Sword: Calibrating Advantage in GRPO for Deep Search

O artigo propõe o método CalibAdv para calibrar a atribuição de vantagens no algoritmo GRPO, mitigando penalidades excessivas em etapas intermediárias corretas e estabilizando o treinamento de agentes de busca profunda, o que resulta em melhor desempenho e estabilidade em diversos benchmarks.

Autores originais: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

Publicado 2026-04-21
📖 2 min de leitura☕ Leitura rápida

Autores originais: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está treinando um detetive de IA para resolver mistérios complexos (perguntas difíceis) usando a internet. Esse detetive não apenas lê uma resposta pronta; ele precisa pesquisar, pensar, buscar mais informações, pensar de novo e, finalmente, dar a resposta.

Esse processo é chamado de "Deep Search" (Busca Profunda). Para ensinar esse detetive a ficar inteligente, os cientistas usam um método chamado GRPO, que é como um treinador que dá notas (recompensas ou punições) ao final de cada caso.

O Problema: O Treinador Está "Atirando para Cima"

O artigo explica que, embora o GRPO seja bom, ele tem dois grandes defeitos quando usado nesse tipo de tarefa complexa:

  1. A Punição Injusta (O "Efeito Cascata"):
    Imagine que o detetive faz um trabalho incrível nas primeiras etapas: ele encontra documentos certos, faz anotações corretas e segue o caminho certo. Mas, no final, ele erra a conclusão.

    • O que o GRPO faz: Ele olha só para o resultado final e diz: "Você errou a resposta final? Então tudo o que você fez foi errado!"
    • O resultado: O detetive é punido por ter feito coisas certas no meio do caminho. Ele fica confuso: "Mas eu encontrei a informação certa! Por que estou sendo punido?" Isso faz com que ele aprenda a ter medo de tentar coisas novas.
  2. O Colapso do Treinamento (O "Ataque de Pânico"):
    Com o tempo, como o detetive recebe muitas punições (porque errar a resposta final é comum no início), ele começa a entrar em pânico.

    • O que acontece: Ele para de falar português e começa a repetir palavras sem sentido, gerar símbolos estranhos ou "bucinar" (repetir tokens como `

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →