← Últimos artigos
🤖 machine learning

AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning

Este artigo apresenta o AIRL-S, um framework unificado que combina Aprendizado por Reforço Inverso Adversário com Otimização de Política Relativa de Grupo para inferir recompensas densas e passo a passo a partir de trajetórias de referência, eliminando assim a necessidade de dados de processo rotulados enquanto possibilita um escalonamento de tempo de teste robusto e de baixo custo que alcança o desempenho de nível GPT-4o em benchmarks de matemática, ciência e geração de código.

Autores originais: Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

Publicado 2026-08-27
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os modelos de linguagem de grande escala são os motores poderosos por trás de muitos sistemas modernos de inteligência artificial, capazes de gerar texto, resolver problemas e escrever código. Durante anos, pesquisadores tentaram tornar esses sistemas mais inteligentes ensinando-os a pensar através de problemas passo a passo, um método conhecido como "cadeia de pensamento" (chain of thought). No entanto, ensinar um modelo a raciocinar bem é difícil porque o computador muitas vezes só sabe se a resposta final está certa ou errada, não se os passos que levaram até ela foram lógicos. Para corrigir isso, cientistas tentaram duas abordagens principais. Uma envolve treinar o modelo com recompensas apenas ao final de uma tarefa, o que pode ser instável e ineficiente. A outra utiliza um guia separado para verificar cada um dos passos do processo de raciocínio, mas a criação desse guia geralmente exige especialistas humanos caros para rotular milhares de exemplos, e o guia frequentemente falha quando o modelo começa a pensar de novas maneiras.

Uma equipe de pesquisadores introduziu um novo sistema chamado AIRL-S que unifica essas duas abordagens em um único ciclo de autoaperfeiçoamento. Em vez de depender de rótulos humanos para cada passo, o sistema aprende a criar seu próprio guia interno ao observar exemplos de raciocínio de alta qualidade. Ele então usa esse guia tanto para treinar o modelo quanto para ajudar na busca pelas melhores respostas durante o uso no mundo real. Em testes em oito diferentes benchmarks envolvendo matemática, ciência e codificação, os pesquisadores descobriram que este método melhorou o desempenho do modelo em uma média de nove por cento em relação à sua versão inicial. O sistema resultante teve um desempenho comparável ao dos modelos comerciais mais avançados disponíveis, como o GPT-4o, sem precisar da supervisão humana custosa que os métodos anteriores exigiam.

A inovação central reside em como o sistema aprende a julgar o próprio trabalho. Tradicionalmente, para ensinar um modelo a raciocinar passo a passo, os pesquisadores precisariam de um "modelo de recompensa de processo" (process reward model) — um programa separado treinado em dados onde humanos marcaram cada passo correto e incorreto. Isso é lento e caro. O novo método contorna isso usando uma técnica chamada aprendizado adversarial. Imagine o sistema jogando um jogo onde uma parte tenta gerar passos de raciocínio e outra parte tenta distinguir entre esses passos gerados e um conjunto de exemplos de referência de alta qualidade. Através dessa competição, o sistema aprende a reconhecer o que um bom passo de raciocínio parece, sem nunca ser explicitamente instruído por um humano. Esse guia aprendido, ou modelo de recompensa, torna-se denso e detalhado, oferecendo feedback sobre cada passo do processo de raciocínio, em vez de apenas o resultado final.

Uma vez que o sistema aprendeu esse guia interno, ele o utiliza de duas maneiras simultaneamente. Primeiro, utiliza o guia para treinar o modelo principal, incentivando-o a dar passos melhores durante a fase de aprendizado. Segundo, mantém o mesmo guia para atuar como um verificador durante a fase de resolução de problemas real. Quando o modelo é solicitado a resolver um problema difícil, ele pode gerar muitas soluções possíveis diferentes. O guia aprendido então pontua cada passo dessas potenciais soluções, ajudando o sistema a selecionar o caminho mais lógico. Isso cria um pipeline unificado onde a ferramenta usada para ensinar o modelo é a mesma ferramenta usada para ajudá-lo a pensar durante um teste. Os pesquisadores demonstraram que este guia é robusto; ele funciona efetivamente mesmo quando aplicado a diferentes modelos ou diferentes estratégias de busca, sugerindo que o conhecimento que ele aprendeu é geral e transferível.

Os resultados desta abordagem foram medidos através de uma ampla gama de tarefas desafiadoras. Os pesquisadores testaram seu modelo em oito benchmarks padrão, incluindo competições matemáticas complexas, questões de raciocínio científico e desafios de codificação. O modelo, que começou como um modelo de linguagem de código aberto padrão, melhorou sua precisão média em nove por cento após o treinamento com este novo método. Em tarefas matemáticas e científicas específicas, a melhoria foi ainda maior, atingindo treze por cento. Quando comparado a outros modelos que foram treinados com dados caros rotulados por humanos ou outras técnicas avançadas de aprendizado por reforço, este novo sistema apresentou um desempenho consistentemente superior. Ele até igualou o desempenho do GPT-4o, um modelo comercial de alto nível, apesar de possuir significativamente menos parâmetros. Isso sugere que a qualidade do processo de raciocínio, guiado por este sistema de recompensa autoaprendido, é mais importante do que simplesmente ter um modelo maior.

Uma descoberta fundamental do estudo é como os dois tipos diferentes de sinais de aprendizado trabalham juntos. O sistema combina o feedback detalhado, passo a passo, de seu guia autoaprendido com as recompensas de resultado final dos métodos tradicionais. Os pesquisadores descobriram que confiar em apenas um tipo de sinal era menos eficaz. O guia passo a passo ajudou o modelo a explorar melhores caminhos de raciocínio, enquanto o sinal de resultado final garantiu que o modelo permanecesse focado em obter a resposta correta. Quando equilibrados corretamente, esses dois sinais reforçaram-se mutuamente, levando a um treinamento mais estável e melhores resultados. Além disso, o sistema mostrou que poderia usar este guia aprendido para melhorar várias estratégias de busca, como aquelas que tentam muitas soluções de uma vez ou aquelas que constroem uma árvore de possibilidades. O guia foi particularmente eficaz em cenários de busca complexos, onde o modelo tinha que avaliar o valor de passos intermediários para fazer a melhor escolha.

As implicações deste trabalho estendem-se para além de apenas obter pontuações mais altas em testes. Ao remover a dependência de anotações humanas caras para o raciocínio passo a passo, este método oferece uma maneira mais escalável e econômica de melhorar a inteligência artificial. Sugere que os modelos podem aprender a ser seus próprios professores, refinando suas capacidades de raciocínio ao observar exemplos de alta qualidade e competir contra si mesmos. Os pesquisadores observaram que sua abordagem é particularmente bem adequada para tarefas onde o resultado final pode ser verificado automaticamente, como matemática e codificação. Embora o método seja poderoso, os autores reconhecem que ele atualmente depende desses resultados verificáveis e pode exigir mais desenvolvimento para lidar com tarefas de questões abertas onde não existe uma única resposta correta. No entanto, a capacidade de unificar o treinamento e a busca em tempo de inferência em um único sistema eficiente marca um passo significativo para tornar os modelos de linguagem de grande escala em raciocinadores mais confiáveis e capazes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →