← Últimos artigos
🤖 machine learning

Le Critique: Privileged Value Functions for LLM Reinforcement Learning

O artigo introduz o "Le Critique", um framework que aprimora o aprendizado por reforço de Grandes Modelos de Linguagem ao combinar Funções de Valor Privilegiadas (PVF) para injetar sinais de nível de token relevantes para a tarefa e o TETHER para interpolar adaptativamente entre baselines relativos ao grupo e de valor, alcançando assim um desempenho superior aos baselines de função de valor padrão e resultados competitivos com o GRPO, enquanto mitiga problemas como rollouts de atrasados (stragglers) e alta variância.

Autores originais: Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

Publicado 2026-08-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, existe uma luta constante para ensinar os programas de computador a pensar melhor. Imagine um aluno fazendo uma prova. Se ele acerta a resposta final, recebe uma boa nota. Se erra, recebe uma nota ruim. É assim que muitos sistemas de IA modernos aprendem: eles tentam muitas maneiras diferentes de resolver um problema, e o computador ajusta seu cérebro com base em se o resultado final foi um sucesso ou um fracasso. Este método é chamado de aprendizado por reforço. No entanto, há um problema. Se o aluno escreve uma redação longa e complicada e recebe a nota final errada, o computador não sabe qual frase específica causou o erro. Ele apenas sabe que a redação inteira foi ruim. Isso torna o aprendizado lento e ineficiente, como tentar consertar o motor de um carro adivinhando qual peça está quebrada sem ter ferramentas.

Para resolver isso, pesquisadores há muito tempo tentam construir um "crítico" para a IA. Este é um segundo programa de computador que observa o aluno enquanto ele escreve, frase por frase, e prevê quão boa será a resposta final. Se o crítico conseguir prever a nota final precocemente, ele pode dizer ao aluno imediatamente quando ele toma um rumo errado, permitindo um aprendizado muito mais rápido e preciso. Por muito tempo, essa abordagem perdeu o favor porque construir e treinar esse segundo programa era difícil e frequentemente pouco confiável. Recentemente, o campo moveu-se para métodos que ignoram o crítico inteiramente, baseando-se, em vez disso, na comparação de grupos de respostas entre si. Mas este novo artigo sugere que a antiga ideia do crítico não está morta; ela apenas precisava de uma nova forma de ver o mundo.

Os pesquisadores, trabalhando na Mistral AI e outras instituições, descobriram que o crítico falha não porque seja uma má ideia, mas porque muitas vezes lhe é pedido o impossível. Eles descobriram que, se dessem ao crítico um pouco de informação extra que o aluno principal de IA não tinha permissão para ver, o crítico se tornaria incrivelmente preciso. Eles chamam isso de uma "função de valor privilegiada". Para entender como isso funciona, imagine um aluno fazendo uma prova de matemática. O aluno está resolvendo um problema passo a passo. O crítico está observando. Normalmente, o crítico tem que adivinhar a pontuação final baseando-se apenas no que o aluno escreveu até agora. Mas, nesta nova configuração, o crítico recebe secretamente o gabarito. Ele não mostra a resposta ao aluno, mas usa esse conhecimento secreto para julgar o progresso atual do aluno com muito mais precisão. Se o passo atual do aluno estiver longe do caminho correto, o crítico sabe imediatamente e dá um sinal claro para mudar de curso. Esse sinal ajuda o aluno a aprender muito mais rápido do que se o crítico tivesse que adivinhar cegamente.

A equipe testou essa ideia em várias tarefas de raciocínio difíceis, incluindo a resolução de quebra-cabeças de lógica e escrita de código de programação. Em um experimento, eles usaram um Sudoku, onde a IA tinha que preencher uma grade um número de cada vez. A IA principal só podia ver os números que já havia colocado. O crítico privilegiado, no entanto, foi mostrado a grade completamente resolvida. Isso permitiu que o crítico dissesse instantaneamente à IA se um movimento estava levando a um beco sem saída, mesmo que a IA tivesse feito apenas alguns movimentos. Os resultados foram impressionantes. Em todas as tarefas que testaram, o uso deste crítico "privilegiado" ajudou a IA a aprender mais rápido e a alcançar pontuações mais altas do que os métodos padrão. A IA não teve apenas sorte; ela aprendeu a tomar decisões melhores porque tinha um mapa mais claro de para onde estava indo.

Os pesquisadores também perceberam que, às vezes, o crítico ainda está aprendendo e não é perfeito ainda. Se o crítico for muito confiante, mas estiver errado, ele pode confundir a IA. Para corrigir isso, eles construíram uma segunda ferramenta chamada "Tether". Este sistema atua como um interruptor inteligente. No início do treinamento, quando o crítico é novo e não confiável, o sistema depende principalmente da comparação de grupos de respostas, que é um método seguro, mas mais lento. À medida que o crítico melhora e começa a dar conselhos precisos, o sistema Tether desloca gradualmente a confiança para o crítico. Ele combina os dois métodos, passando suavemente de um para o outro sem a necessidade de engenheiros humanos ajustarem as configurações. Isso garante que a IA sempre tenha a melhor orientação possível, seja o crítico um novato ou um especialista.

O estudo mostra que a antiga ideia de usar um segundo programa para guiar o aprendizado não é apenas válida, mas superior, desde que lhe sejam dadas as ferramentas certas. Ao permitir que o crítico veja coisas que a IA principal não pode ver, os pesquisadores removeram a adivinhação do processo de aprendizado. Eles também mostraram que essa abordagem pode ser robusta e automática, adaptando-se ao próprio nível de habilidade do crítico. Embora este trabalho tenha exigido um poder computacional significativo e uma engenharia cuidadosa, os resultados sugerem um caminho claro a seguir. Em vez de abandonar o crítico, o futuro de ensinar a IA a raciocinar pode residir em dar a ela uma visão melhor da solução, permitindo que aprenda com seus erros com uma clareza que antes era inalcançável.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →