← Últimos artigos
💬 NLP

RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents

O artigo propõe o RC-GRPO, um novo framework que aprimora a chamada de ferramentas em múltiplos turnos em LLMs ao injetar tokens de recompensa discretos para condicionar a geração de trajetórias e diversificar os rollouts, superando, assim, o problema de desaparecimento de atualização causado pela baixa variação de recompensa dentro do grupo e alcançando o estado da arte no benchmark BFCLv4.

Autores originais: Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

Publicado 2026-02-04
📖 4 min de leitura☕ Leitura rápida

Autores originais: Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô assistente muito inteligente, mas rígido, a usar um conjunto de ferramentas (como uma calculadora, um calendário ou um motor de busca) para resolver um quebra-cabeça complexo de várias etapas.

O Problema: A Armadilha do "Aluno Perfeito"

Normalmente, para ensinar este robô, você primeiro mostra exemplos de soluções perfeitas (Ajuste Fino Supervisionado, ou SFT). O robô aprende isso perfeitamente e torna-se um "aluno nota dez".

Depois, você tenta ensinar o robô a ser ainda melhor usando um método chamado GRPO (Otimização de Política de Grupo Relativa). Pense no GRPO como um treinador que reúne um grupo de alunos, dá-lhes o mesmo quebra-cabeça e pede que tentem diferentes soluções. O treinador compara os resultados: "Tu foste bem, tu foste mal, tu foste mediano". Os alunos que se saíram melhor recebem um incentivo; os que se saíram pior recebem um empurrão para tentar algo diferente.

A Armadilha: Como o robô foi treinado tão perfeitamente nos exemplos "perfeitos", cada vez que você pede ao grupo para tentar, todos voltam com a mesma solução exata. Todos são "perfeitos" da mesma forma monótona.

  • O treinador olha para o grupo e diz: "Bem, todos tiraram 10/10".
  • Como não há diferença entre eles, o treinador não consegue dizer a ninguém para melhorar. O sinal de aprendizagem desaparece. O robô fica preso, incapaz de explorar novas formas de resolver o quebra-cabeça porque tem medo de desviar do caminho "perfeito" que já conhece.

A Solução: RC-GRPO (A Estratégia do "Anel de Humor")

Os autores deste artigo propõem um novo método chamado RC-GRPO para corrigir isto. Em vez de esperar que o robô tente algo diferente aleatoriamente, eles dão ao robô um "anel de humor" ou uma instrução de token específica antes de ele começar a trabalhar.

Passo 1: Ensinar o Robô a Agir Diferente Sob Comando (RCTP)
Primeiro, eles treinam o robô num conjunto misto de histórias: algumas onde teve sucesso (Recompensa Alta) e outras onde falhou (Recompensa Baixa). Crucialmente, eles anexam uma etiqueta especial a cada história, como <|High Reward|> ou <|Low Reward|>.

  • O robô aprende: "Quando vejo a etiqueta <|High Reward|>, devo tentar ser perfeito. Quando vejo a etiqueta <|Low Reward|>, devo tentar um caminho diferente, talvez mais arriscado ou simples."
  • Agora, o robô não é apenas um aluno rígido; é um camaleão que pode alternar entre diferentes "modos" de comportamento com base na etiqueta que vê.

Passo 2: O Novo Jogo do Treinador (GRPO Condicionado à Recompensa)
Agora, quando o treinador (o algoritmo de RL) reúne o grupo para resolver um quebra-cabeça, eles não dizem apenas "Já!"

  • Eles entregam a cada aluno uma etiqueta diferente.
  • O Aluno A recebe <|High Reward|> e tenta ser perfeito.
  • O Aluno B recebe <|Low Reward|> e tenta uma abordagem diferente, talvez mais desordenada.
  • O Aluno C recebe <|High Reward|> novamente, mas talvez tente um caminho perfeito ligeiramente diferente.
  • Porque os alunos estão agora condicionados a agir de forma diferente com base nas suas etiquetas, o grupo tem variedade.
  • O treinador pode agora ver: "O Aluno A tirou 10, o Aluno B tirou 2, o Aluno C tirou 9."
  • Agora existe uma diferença clara! O treinador pode dar um feedback útil: "Aluno B, tenta ser mais como o Aluno A."
  • Isto mantém o motor de aprendizagem a funcionar sem problemas.

Por Que Funciona (A Analogia)

No método antigo, o robô era como um coro onde todos cantavam exatamente a mesma nota perfeitamente. O regente não conseguia dizer quem estava a cantar melhor porque eram todos idênticos.

No novo método RC-GRPO, o regente dá a cada cantor uma partitura diferente (etiquetas de Recompensa Alta vs. Baixa). De repente, o coro soa diversificado. O regente consegue ouvir as diferenças, selecionar as melhores notas e guiar os cantores para melhorar.

Os Resultados

O artigo testou isto num benchmark chamado BFCLv4, que é como um exame difícil para agentes de IA que utilizam ferramentas.

  • O Método Antigo: O robô ficou preso e não melhorou muito.
  • O Novo Método (RC-GRPO): O robô aprendeu muito mais rápido e resolveu mais quebra-cabeças corretamente.
  • A Grande Vitória: Num teste específico de modelo (Qwen-2.5-7B), este novo método permitiu que o robô de código aberto superasse todos os famosos e caros robôs de "código fechado" (como os das grandes empresas de tecnologia) que costumam vencer estes exames.

Resumo

O artigo resolve um problema onde a IA se torna boa demais em copiar exemplos e deixa de aprender. Ao ensinar a IA a agir intencionalmente de forma diferente com base numa simples "etiqueta de recompensa", eles forçam a IA a explorar diferentes caminhos, permitindo que aprenda mais rápido e se torne mais inteligente a utilizar ferramentas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →