← Últimos artigos
🤖 AI

Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

O artigo introduz o Policy of Thoughts (PoT), um framework que aprimora o raciocínio de LLMs ao tratar a execução em tempo de teste como um processo de otimização online onde um adaptador LoRA transitório é dinamicamente atualizado via Group Relative Policy Optimization para internalizar o feedback e evoluir a estratégia de raciocínio do modelo, permitindo que um modelo de 4B supere significativamente modelos de última geração muito maiores em benchmarks complexos de codificação.

Autores originais: Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

Publicado 2026-07-16
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando resolver um quebra-cabeça incrivelmente difícil, como um desafio de codificação complexo ou um problema matemático que exige uma longa cadeia de raciocínio. Você tem um assistente superinteligente (um Modelo de Linguagem Grande) que conhece muitos fatos, mas às vezes fica preso em um loop, repetindo os mesmos erros repetidamente. No mundo da inteligência artificial, esse assistente geralmente trabalha com um cérebro "congelado": uma vez que começa a pensar, não pode mudar sua estratégia fundamental no meio do processo. Se ele tomar um caminho errado, continuará caminhando por esse caminho errado, esperando encontrar a resposta certa por pura sorte ou tentando muitos camros diferentes ao mesmo tempo. Isso é como tentar encontrar a saída de um labirinto correndo cegamente por cada corredor até bater em uma parede, em vez de aprender com as paredes com as quais já esbarrou.

Por muito tempo, a melhor maneira de resolver esses problemas difíceis era apenas dar ao computador mais tempo e poder de computação para tentar milhões de palpites diferentes. Mas este artigo sugere uma maneira mais inteligente: em vez de apenas tentar com mais força, o computador deve aprender enquanto está tentando. Pense nisso como um personagem de videogame que não apenas renasce e tenta novamente, mas que realmente aprende com a armadilha específica que acabou de matá-lo, ajustando sua estratégia instantaneamente para a próxima tentativa. O que os pesquisadores por trás deste estudo estão perguntando é: e se nossa IA pudesse "pensar rápido sobre os pés", atualizando suas próprias regras de raciocínio em tempo real com base em se seus palpites anteriores falharam ou tiveram sucesso? Esta é a diferença entre um robô que apenas segue um roteiro e um que adapta e evolui seu próprio cérebro para cada novo desafio que enfrenta.


A "Política de Pensamentos": Ensinando a IA a Aprender Enquanto Joga

Conheça o PoT (Policy of Thoughts - Política de Pensamentos), um novo framework que trata a resolução de um problema não como um palpite de uma única vez, mas como uma conversa viva e evolutiva entre a IA e o próprio problema. Os autores, uma equipe de pesquisadores de universidades como a Universidade de Zhejiang e a LMU de Munique, argumentam que a antiga maneira de fazer as coisas — onde a estratégia da IA permanece congelada enquanto ela busca respostas — está nos atrasando. Eles propõem um sistema onde a IA recebe uma "segunda chance" de aprender com seus próprios erros durante o teste, treinando a si mesma de forma dinâmica.

O Enigma Popperiano: Supor, Testar e Evoluir

A ideia central é inspirada por um famoso filósofo chamado Karl Popper, que acreditava que a ciência avança através de "conjecturas e refutações". Em termos simples, isso significa que você faz um palpite, testa-o contra a realidade e, se ele falhar, você aprende exatamente por que falhou para poder fazer um palpite melhor na próxima vez.

O PoT traz essa filosofia à vida para a IA. Veja como o ciclo funciona:

  1. A Conjectura (O Palpite): A IA olha para um problema e gera alguns diferentes possíveis soluções (como esboçar três rotas diferentes em um mapa).
  2. A Refutação (O Teste de Realidade): O sistema executa essas soluções em um ambiente real (como um compilador de código). Se o código travar ou der a resposta errada, isso é uma "refutação".
  3. A Evolução (O Aprendizado): Esta é a parte mágica. Em vez de apenas descartar o palpite que falhou, o PoT usa a falha para atualizar a "política" interna da IA (sua estratégia de pensamento). Ele faz pequenos ajustes instantâneos em como a IA pensa, especificamente para este problema.
  4. A Repetição: A IA tenta novamente com seu cérebro recém-atualizado, agora mais bem equipada para evitar o erro específico que acabou de cometer.

O Truque do "Cérebro Temporário"

Você pode se perguntar: "Se a IA aprende com cada problema, ela não ficará confusa ou esquecerá o que sabia antes?" Os autores têm uma solução inteligente. Eles usam uma técnica chamada LoRA (Low-Rank Adaptation), que é como dar à IA um "chapéu de pensar" temporário e destacável.

Imagine que a IA tem uma biblioteca massiva e permanente de conhecimento (seu modelo base). Quando enfrenta um problema difícil, ela coloca um "chapéu de pensar" especial e leve (o adaptador LoRA). Este chapéu permite que a IA aprenda e adapte rapidamente sua estratégia para este problema específico. Assim que o problema é resolvido (ou o tempo acaba), o chapéu é retirado e jogado fora. A biblioteca permanente permanece intocada e sem confusão. Isso significa que a IA pode ser mestre em adaptação para cada novo problema sem bagunçar seu conhecimento geral.

Os Resultados: Cérebro Pequeno, Grandes Vitórias

Os pesquisadores testaram essa ideia em desafios de codificação, que são notoriamente difíceis porque exigem lógica precisa, passo a passo. Eles usaram um modelo de IA relativamente pequeno (apenas 4 bilhões de parâmetros) e deram a ele o framework PoT.

Os resultados foram surpreendentes. Este modelo minúsculo, usando o PoT, conseguiu resolver 49,71% dos problemas em um benchmark rigoroso chamado LiveCodeBench V6. Para colocar em perspectiva:

  • Ele venceu o GPT-4o, um modelo comercial massivo, que marcou 29,71% nesse mesmo benchmark específico.
  • Ele superou significativamente o desempenho de base de outros modelos grandes neste teste específico, demonstrando que um modelo pequeno com aprendizado dinâmico pode superar o raciocínio estático de sistemas muito maiores.
  • Embora modelos como o Gemini-2.5-Flash (60,91% no geral) e o Claude-Opus-4 (55,22% no geral) tenham alcançado pontuações mais altas em benchmarks mais amplos e mistos, os 49,71% do modelo potencializado pelo PoT no rigoroso LiveCodeBench V6 representam um salto enorme para um modelo mais de 50 vezes menor, provando que o raciocínio adaptativo pode diminuir a distância em relação aos gigantes em tarefas específicas e complexas.

O mais impressionante é que o modelo potencializado pelo PoT é mais de 50 vezes menor do que alguns dos modelos gigantes com os quais compete. Ele não venceu por ter um cérebro maior; ele venceu por ter uma maneira mais inteligente de usar o cérebro que possuía.

Por Que Isso Importa

O artigo sugere que o futuro do raciocínio da IA não é apenas construir modelos cada vez maiores. É dar aos modelos a capacidade de "pensar rápido sobre os pés". Ao transformar o processo de teste em uma sessão de treinamento, a IA para de desperdiçar energia em caminhos falhos e começa a usar essa energia para melhorar sua estratégia instantaneamente.

Os autores descobriram que este método funciona melhor quando há um feedback claro (como um código que roda ou trava). Quando o feedback é impreciso, os ganhos são menores, mas ainda assim positivos. Eles também mostraram que esta abordagem funciona em diferentes tipos de modelos, não apenas no que começaram utilizando.

Em suma, o PoT sugere que a melhor maneira de resolver um problema difícil não é apenas tentar com mais força; é aprender mais rápido. Ao permitir que a IA evolua sua própria estratégia de raciocínio para cada desafio, podemos obter resultados superinteligentes de computadores muito menores e mais eficientes. É uma mudança de "procurar pela resposta certa" para "aprender como encontrar a resposta certa".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →