← Últimos artigos
💻 computer science

Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

O artigo propõe o PPC (Pré-planejamento-Planejamento-CoT), um novo quadro que introduz uma etapa explícita de "pré-planejamento" para esclarecer os tipos de problema e as ferramentas antes do planejamento, o que melhora significativamente o desempenho de raciocínio matemático de LLMs em múltiplos benchmarks sem adicionar sobrecarga de inferência.

Autores originais: Shaojie Wang, Liang Zhang

Publicado 2026-05-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Shaojie Wang, Liang Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um problema matemático muito complicado, como um quebra-cabeça complexo. No passado, os Modelos de Linguagem de Grande Escala (LLMs) tentavam resolvê-los mergulhando diretamente no trabalho: "Ok, vamos começar a calcular passo a passo até obter uma resposta". Isso é chamado de Cadeia de Pensamento.

No entanto, à medida que os problemas ficam mais difíceis, essa abordagem de "apenas começar a trabalhar" frequentemente leva o modelo a se perder, tomar rumos errados ou desperdiçar tempo com métodos que não se encaixam no quebra-cabeça.

Para corrigir isso, pesquisadores tentaram um novo método: Planejar-Então-Solver. Eles disseram ao modelo: "Pare! Escreva um plano primeiro, depois faça o trabalho". Isso ajudou, mas o artigo argumenta que ainda havia uma peça faltando. O modelo estava planejando como fazer a matemática, mas não estava tirando um momento para realmente entender o que o problema estava pedindo.

Aqui está a solução do artigo, explicada de forma simples:

O Passo Faltante: O "Pré-planejamento"

Os autores introduzem uma nova etapa chamada Pré-planejamento. Pense nisso como um treinador falando com um atleta antes da corrida começar.

  • O Jeito Antigo (Pergunta → Plano → Solução): O atleta ouve o tiro de largada e começa a correr imediatamente, pensando: "Vou correr rápido, depois virar à esquerda, depois dar um sprint". Eles podem correr rápido, mas se correrem na direção errada, a velocidade não importa.
  • O Jeito Novo (Pergunta → Pré-planejamento → Plano → Solução): Antes mesmo do atleta pensar em correr, o treinador diz: "Espere. Olhe para a pista. É uma pista circular com uma colina íngreme. O vento está soprando contra nós. Precisamos conservar energia para a colina, não dar um sprint no início".

Esse "Pré-planejamento" não faz nenhuma corrida (cálculo). Ele apenas analisa o terreno (o tipo de problema), escolhe a marcha certa (as ferramentas/conceitos) e identifica as armadilhas (riscos).

O Problema ao Fazer o Pré-planejamento

Os autores descobriram que, quando pediam apenas ao modelo para escrever esse "Pré-planejamento", ele frequentemente trapaceava.

  1. Vazamento: Em vez de analisar a pista, o modelo começaria acidentalmente a descrever os passos da corrida ("Primeiro vou correr 10 metros..."). Ele pulava a análise e ia direto para o plano.
  2. Spoiler: O modelo analisaria a pista, mas secretamente resolveria o problema matemático dentro da análise ("A colina tem 50 metros de altura, então vou calcular o tempo..."). Ele estragava a surpresa fazendo o trabalho muito cedo.

Para corrigir isso, a equipe construiu um filtro rigoroso (como um árbitro com um apito). Se o "Pré-planejamento" contivesse qualquer matemática real ou instruções passo a passo, o árbitro apitava, descartava a resposta e fazia o modelo tentar novamente. Isso garantia que o Pré-planejamento fosse puramente sobre entender o problema, não sobre resolvê-lo.

O Sistema de Recompensa "Fiel"

Uma vez que o modelo aprendeu a escrever um bom Pré-planejamento, os pesquisadores precisaram garantir que o modelo realmente ouvisse a ele. Às vezes, os modelos são como alunos que escrevem um ótimo plano de estudos, mas depois o ignoram e estudam outra coisa.

Para impedir isso, eles criaram um sistema de recompensa especial (como um sistema de pontuação de videogame):

  • A Pontuação: O modelo ganha pontos por obter a resposta correta.
  • O Bônus de Lealdade: O modelo ganha pontos extras apenas se as etapas que ele segue (o Plano) realmente seguirem o conselho dado no Pré-planejamento.
  • A Penalidade: Se o modelo escrever um Pré-planejamento que pareça matemática (trapaceando o filtro), ele perde pontos.

Isso força o modelo a tratar o Pré-planejamento como um mapa real. Se o mapa diz "Vá para o Norte", o modelo não pode simplesmente decidir "Vá para o Sul" e torcer para o melhor.

Os Resultados

Os pesquisadores testaram esse novo método (chamado de PPC) em quatro modelos de IA diferentes e cinco competições matemáticas difíceis.

  • Maior Precisão: O novo método obteve a resposta correta com mais frequência do que qualquer método anterior, especialmente nos problemas mais difíceis.
  • Pensamento Mais Rápido: Surpreendentemente, embora o modelo tivesse que escrever uma seção extra de "Pré-planejamento", ele na verdade usou menos palavras no total para resolver o problema. Por quê? Porque não desperdiçava tempo correndo em círculos ou tentando métodos errados. Ele sabia exatamente para onde ir desde o início.

Em Resumo

O artigo argumenta que, para resolver problemas difíceis, você não deve apenas mergulhar no "como". Você deve primeiro tirar um momento para entender o "o quê". Ao forçar a IA a pausar, analisar o tipo de problema e identificar armadilhas antes de fazer um plano, a IA se torna uma solucionadora de problemas muito mais inteligente e eficiente. É a diferença entre um corredor frenético e um navegador estratégico.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →