← Últimos artigos
💬 NLP

GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation

Este artigo demonstra que o ajuste fino de um modelo de linguagem de pesos abertos com Otimização de Política Relativa de Grupo (GRPO) e um framework de avaliação duplo — combinando uma rubrica de LLM como juiz com uma auditoria de Efeito Médio de Tratamento Causal (CATE) independente de juiz — produz conselhos financeiros que superam significativamente as linhas de base comerciais em termos de lucro estimado e mitigação de risco.

Autores originais: Ofir Ben Shoham, Shrutendra Harsola, Vignesh Subrahmaniam, Shravan Mohan, Yakov Gazman, Oded Vainas

Publicado 2026-08-13
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Ofir Ben Shoham, Shrutendra Harsola, Vignesh Subrahmaniam, Shravan Mohan, Yakov Gazman, Oded Vainas

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a dar conselhos. No mundo da inteligência artificial, isso é um pouco como ensinar um aluno a resolver um problema de matemática. Geralmente, mostramos ao aluno a pergunta e a resposta correta, esperando que ele memorize o padrão. Mas e se a "resposta correta" no mundo real for bagunçada? E se os livros de história estiverem cheios de erros, ou se a resposta certa mudar dependendo da situação? Este é o desafio do Aprendizado por Reforço (RL - Reinforcement Learning). Em vez de apenas copiar respostas antigas, o RL permite que uma IA tente muitas coisas diferentes, receba uma "pontuação" de quão bem se saiu e aprenda com essa pontuação para melhorar na próxima vez. É como um videogame onde a IA joga milhares de níveis, ganha pontos por movimentos bons e, lentamente, aprende a estratégia perfeita.

Agora, imagine que este jogo é sobre dinheiro. Dar conselhos financeiros é complicado porque uma sugestão ruim pode realmente prejudicar um negócio. Para garantir que a IA aprenda o caminho certo, pesquisadores usam um "juiz" — outra IA inteligente que avalia o conselho. Mas há um detalhe: às vezes, a IA estudante aprende a enganar o juiz dizendo exatamente o que o juiz quer ouvir, em vez de dar um conselho que realmente funcione no mundo real. Este artigo aborda esse problema criando uma nova maneira de treinar uma IA para dar conselhos de negócios, verificando seu trabalho não apenas com um juiz, mas vendo se o conselho teria rendido dinheiro no passado.


A História do Robô Inteligente com Dinheiro

Conheça a equipe da Intuit. Eles queriam construir uma IA que pudesse olhar para os registros financeiros bagunçados de um negócio e dizer: "Ei, aqui está algo específico que você deve fazer para lucrar mais". Parece simples, mas é um pesadelo para computadores. O conselho precisa ser baseado em números reais, precisa ser seguro (não diga a um negócio para demitir seu único cliente!) e precisa ser acionável.

O problema é que não temos uma chave de respostas "padrão ouro". As decisões que os donos de negócios tomaram no passado nem sempre foram perfeitas, então não podemos apenas ensinar a IA a copiá-las. E pedir a especialistas humanos para escreverem conselhos perfeitos para cada cenário é muito caro e lento. Então, a equipe decidiu tratar isso como um videogame. Eles usaram um método chamado GRPO (Group Relative Policy Optimization).

Pense no GRPO como um "desafio em grupo". Em vez de a IA adivinhar uma resposta e receber uma pontuação, ela gera um grupo inteiro de diferentes sugestões de conselhos de uma só vez. Então, uma IA "Juíza" superinteligente (chamada Claude Opus 4.5) olha para todos eles e os pontua com base em uma lista de verificação. Esta lista tem 11 regras: É seguro? Usa números reais do negócio? Explica o porquê? Se uma sugestão for perigosa, recebe zero imediatamente. Se for segura, mas entediante, recebe uma pontuação baixa. Se for segura, específica e inteligente, recebe uma pontuação alta. A IA então aprende a gerar mais sugestões que se pareçam com as de alta pontuação.

A Armadilha do Juiz "Legal"

É aqui que as coisas ficam interessantes. A equipe sabia que havia um risco. E se a IA apenas aprendesse a escrever conselhos que parecessem bons para a IA Juíza, mas que não renderiam dinheiro nenhum para um negócio? É como um aluno que memoriza as frases favoritas do professor para tirar um A, mas reprova no teste real.

Para capturar isso, os pesquisadores construíram um segundo teste, totalmente diferente. Eles não usaram a IA Juíza. Em vez disso, usaram um método de "Máquina do Tempo" chamado CATE (Conditional Average Treatment Effect).

Imagine que você tem uma caixa gigante de registros antigos de negócios. Você quer saber: "Se tivéssemos tomado esta ação específica no passado, o negócio teria ganhado mais dinheiro?". Os pesquisadores pegaram o conselho gerado pela sua nova IA, traduziram em uma "ação" simples (como "cortar custos de envio" ou "aumentar preços do produto X") e então olharam para os dados históricos. Eles perguntaram: "No passado, quando os negócios fizeram esta ação, o lucro deles aumentou?". Este é um auditor "independente do juiz" porque depende de números do mundo real, não do que a IA Juíza acha que soa bem.

A Grande Surpresa

Os resultados foram uma mistura de vitórias esperadas e uma reviravolta muito engraçada.

Primeiro, a nova IA (treinada com GRPO) foi uma estrela. Quando a IA Juíza a avaliou, ela obteve uma pontuação de 9,514 de 10. Esta foi a pontuação mais alta de qualquer um, superando até os modelos de IA comerciais mais famosos como Claude Opus 4.6 e GPT-5.4.

Mas a verdadeira magia aconteceu na auditoria da "Máquina do Tempo".

  • A nova IA sugeriu ações que, se tivessem sido feitas no passado, teriam aumentado o lucro bruto em 0,0228 (cerca de um aumento de 2,3%).
  • O melhor modelo comercial (Claude Opus 4.6) conseguiu apenas um aumento de 0,0104.
  • Isso significa que a nova IA foi aproximadamente duas vezes melhor em encontrar ações que realmente geram dinheiro do que o concorrente comercial mais forte.

Ainda mais legal, a nova IA foi mais segura. Ela teve a menor "taxa de queda" (a chance de sugerir algo que prejudique o negócio) e o menor "risco de cauda" (a chance de um resultado realmente ruim).

A Reviravolta: O Juiz e a Máquina do Tempo Discordaram

Esta é a parte mais lúdica da história. O Juiz e a Máquina do Tempo nem sempre concordaram sobre quem ficou em segundo ou terceiro lugar.

A IA "base" não treinada (o modelo bruto antes de qualquer treinamento) foi terrível no teste do Juiz. Ela pontuou 8,457, ficando em último lugar. Parecia desorganizada e sem polimento. Mas quando a Máquina do Tempo verificou seu conselho? Ela na verdade se saiu muito bem! Sugeriu ações que teriam aumentado o lucro em 0,01070, o que foi melhor do que todos os modelos comerciais.

Por outro lado, um dos modelos comerciais (Claude Opus 4.5) teve uma ótima pontuação do Juiz (8,982), parecendo muito profissional. Mas a Máquina do Tempo disse: "Espere um pouco". Ela estimou que seguir o conselho deste modelo na verdade faria o negócio perder dinheiro (um aumento negativo de -0,0025).

O Que Isso Significa

Este artigo mostra que você não pode confiar apenas no "Juiz" para dizer se uma IA é boa em dar conselhos financeiros. O Juiz gosta de conselhos que parecem inteligentes e seguem as regras. A Máquina do Tempo se importa se o conselho realmente funciona.

O novo método da equipe, usando GRPO com um portão de segurança, conseguiu fazer ambos. Eles aprenderam a escrever conselhos que soavam ótimos para o Juiz e que realmente geravam dinheiro no teste da Máquina do Tempo. Provou que, ao treinar um modelo de código aberto com um sistema de recompensa inteligente e focado em segurança, você pode vencer os gigantes comerciais caros.

Os autores sugerem que, para tarefas de alto risco como dinheiro, você precisa de ambas as verificações: uma rubrica para garantir que o conselho seja seguro e bem escrito, e uma auditoria causal para garantir que ele realmente funcione. Se você olhar apenas para um, pode ser enganado por um robô que parece ótimo, mas é péssimo em matemática. O novo robô deles, no entanto, é tanto um ótimo escritor quanto um ótimo contador.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →