← Últimos artigos
🤖 AI

Parason: Revealing Subtask and Trial Parallelism in LLM Reasoning

O artigo apresenta o Parason, um framework que acelera significativamente o raciocínio de LLMs ao identificar e aproveitar tanto o paralelismo de subtarefas quanto o de tentativas por meio de uma gramática estruturada e um algoritmo de treinamento especializado, alcançando aproximadamente 1,7x de aceleração em benchmarks matemáticos complexos enquanto mantém a precisão.

Autores originais: Zhengyang Zhang, Zijian Zhang, Jiaxuan Gao, Shusheng Xu, Yi Wu, Song Han, Ligeng Zhu

Publicado 2026-08-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhengyang Zhang, Zijian Zhang, Jiaxuan Gao, Shusheng Xu, Yi Wu, Song Han, Ligeng Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os modelos de linguagem de grande escala tornaram-se notavelmente habilidosos em resolver problemas complexos, desde a resolução de enigmas matemáticos difíceis até a escrita de códigos sofisticados. Essa habilidade muitas-vezes advém de uma estratégia simples: permitir que o modelo pense por mais tempo. Ao gerar uma longa cadeia de pensamento passo a passo antes de fornecer uma resposta, esses sistemas conseguem navegar por lógicas complicadas e evitar erros simples. No entanto, essa abordagem possui uma limitação física significativa. A forma padrão como esses modelos funcionam é como uma única pessoa lendo um livro palavra por palavra, estritamente em ordem. Cada pensamento deve esperar que o anterior termine. Quando um problema é extremamente difícil, a cadeia de pensamentos pode se estender por centenas de milhares de palavras, o que significa que o usuário pode esperar minutos, horas ou até dias por uma única resposta. Esse atraso torna a abordagem impraticável para ferramentas de tempo real, como assistentes de codificação ou tutores interativos, onde a velocidade é tão importante quanto a precisão.

Pesquisadores há muito suspeitam que a resposta reside no pensamento paralelo. Em vez de uma única linha de pensamento, imagine uma equipe de especialistas trabalhando em diferentes partes de um problema ao mesmo tempo. Alguns sistemas existentes tentaram fazer isso dividindo uma tarefa grande em peças menores e independentes, resolvendo cada peça separadamente e depois combinando os resultados. Embora útil, esse método perde uma parte crucial de como o raciocínio inteligente realmente funciona. Ao enfrentar um problema verdadeiramente difícil, um pensador inteligente não apenas divide o problema; ele também testa diferentes ideias, vê quais falham e mantém as que funcionam. Eles exploram múltiplos caminhos simultaneamente, descartando os becos sem saída e seguindo os promissores. Este artigo apresenta um novo sistema chamado Parason, que ensina os modelos de linguagem a fazer exatamente isso, transformando o processo lento de arquivo único de pensamento em uma rodovia de várias faixas e rápida.

Os pesquisadores começaram analisando milhares de traços de raciocínio de modelos avançados para ver exatamente como eles pensam. Eles descobriram que o processo de pensamento não é apenas uma linha única de etapas, mas uma mistura de dois tipos de atividade muito diferentes. O primeiro tipo é como uma equipe de construção dividindo um projeto de edifício: uma equipe lança a fundação, outra levanta as paredes e uma terceira instala o telhado. Todas essas tarefas são necessárias e podem ser feitas ao mesmo tempo. Os pesquisadores chamam isso de paralelismo de subtarefas. O segundo tipo é mais parecido com um detetive testando várias teorias ao mesmo tempo. O detetive tenta um suspeito, percebe que ele não se encaixa e imediatamente tenta outro, enquanto um colega verifica uma terceira possibilidade. Apenas um desses caminhos precisa estar correto para resolver o caso, mas o detetive deve explorar todos eles para encontrar o certo. Os pesquisadores chamam isso de paralelismo de tentativa.

O que eles descobriram foi surpreendente. Nos problemas mais difíceis, o estilo de pensamento "detetive" — tentar muitas ideias diferentes e descartar as falhas — compõe a maior parte do trabalho. Na verdade, para alguns dos modelos mais avançados, essa exploração baseada em tentativas representa mais de dois terços das etapas de raciocínio. Sistemas anteriores que focavam apenas em dividir tarefas em pedaços menores estavam essencialmente ignorando a maneira mais comum de esses modelos resolverem problemas difíceis. Eles estavam otimizando para a equipe de construção enquanto o verdadeiro trabalho estava sendo feito pelos detetives.

Para corrigir isso, a equipe construiu um framework que ensina os modelos a reconhecer quando dividir uma tarefa e quando tentar várias ideias ao mesmo tempo. Eles criaram um conjunto especial de regras, como uma linguagem estruturada, que permite ao modelo dizer: "Aqui estão três maneiras diferentes de resolver isso, e eu tentarei todas ao mesmo tempo". O sistema então executa essas diferentes tentativas em paralelo, coletando os resultados. Se uma tentativa falha, o modelo simplesmente segue para a próxima sem ter que esperar que a tentativa fracassada termine antes de iniciar a próxima. Esta é uma mudança significativa em relação à forma antiga, onde o modelo teria que terminar uma ideia, perceber que estava errada e então iniciar a próxima, uma após a outra.

O processo de treinamento utilizou um sistema de recompensa que incentivava o modelo a ser correto e rápido. O modelo era elogiado não apenas por chegar à resposta correta, mas por organizar seus pensamentos de uma forma que permitisse ao computador realizar o trabalho mais rápido. Ao executar essas ramificações paralelas simultaneamente, o sistema reduziu efetivamente o tempo necessário para chegar a uma conclusão. Em testes em competições matemáticas difíceis, o novo sistema alcançou uma aceleração média de cerca de 1,7 vezes em comparação com a abordagem sequencial padrão, mantendo o mesmo alto nível de precisão. Isso significa que um problema que poderia levar dez minutos para ser resolvido agora leva cerca de seis minutos, sem sacrificar a qualidade da solução.

Os pesquisadores também observaram que, quanto mais difícil o problema, mais essa abordagem paralela ajudava. Nos problemas mais difíceis, a quantidade de trabalho economizado era a maior. Isso ocorre porque problemas difíceis naturalmente geram mais becos sem saída e exigem mais exploração de diferentes possibilidades. Ao permitir que o modelo explore essas possibilidades lado a lado, em vez de uma após a outra, o sistema transforma o que antes era uma espera longa e lenta em um processo muito mais eficiente. O estudo sugere que o futuro do raciocínio da inteligência artificial não é apenas sobre pensar por mais tempo, mas sobre pensar em muitas direções ao mesmo tempo, imitando a maneira como especialistas humanos enfrentam os desafios mais complexos do mundo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →