← Últimos artigos
🤖 AI

Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning

O artigo introduz o Funnel of Thoughts (FoT), um método de inferência livre de treinamento que reduz significativamente os custos computacionais e a latência para Grandes Modelos de Raciocínio ao podar trajetórias de raciocínio improdutivas precocemente com base em marcadores de hesitação lexical, enquanto preserva a precisão da votação de múltiplas amostras completa.

Autores originais: Chanhee Park, Sungbin Han, Jeongho Yoon, Seongtae Hong, Heuiseok Lim

Publicado 2026-08-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Chanhee Park, Sungbin Han, Jeongho Yoon, Seongtae Hong, Heuiseok Lim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A inteligência artificial moderna atingiu um ponto em que seus modelos de raciocínio mais poderosos não fornecem simplesmente uma única resposta a uma questão difícil. Em vez disso, eles geram cadeias de pensamento longas e sinuosas, explorando múltiplos caminhos para uma solução antes de se estabelecerem em uma conclusão final. Esse processo imita a deliberação humana, mas introduz um desafio único: ao serem questionados sobre o mesmo problema repetidamente, esses modelos frequentemente produzem respostas diferentes e, por vezes, contraditórias. Para garantir a confiabilidade, os engenheiros adotaram uma estratégia de pedir ao modelo que gere muitas tentativas diferentes, ou "rollouts", e então selecionar a resposta mais comum entre elas. Este método, conhecido como votação por maioria, melhora significamente a precisão em tarefas complexas, como matemática avançada. No entanto, isso vem com um preço elevado. Como essas cadeias de raciocínio podem se estender por milhares de palavras, executar dezenas delas simultaneamente consome uma quantidade massiva de poder computacional. O custo cresce rapidamente à medida que as cadeias se tornam mais longas, o que significa que a parte mais cara do processo é frequentemente o próprio final, onde o modelo pode ficar preso em um ciclo de autocorreção desnecessária ou hesitação.

Uma equipe de pesquisadores da Universidade da Coreia desenvolveu um novo método chamado "Funnel of Thoughts" (Funil de Pensamentos) para resolver essa ineficiência sem sacrificar a precisão. O trabalho deles aborda um problema específico: em um conjunto de trinta e duas diferentes tentativas de raciocínio, muitas vezes algumas delas são improdutivas. Essas tentativas específicas tendem a entrar em espirais de repetição, questionando incessantemente sua própria lógica ou ficando presas em estados de "não-resposta", enquanto consomem a maior parte dos recursos computacionais. Os pesquisadores descobriram que essas tentativas falhas se revelam através de um padrão simples e observável no texto que geram. Elas utilizam frequentemente marcadores de hesitação específicos — palavras e frases como "Espere", "Na verdade", "talvez" ou "Deixe-me reconsiderar". Ao contar com que frequência esses marcadores aparecem, o sistema pode identificar quais caminhos de raciocínio têm probabilidade de falhar muito antes de terminarem.

O novo método funciona executando todas as trinta e duas tentativas em paralelo, tal como antes, mas introduz um "funil" que estreita progressivamente o campo. Em pontos de verificação específicos ao longo do caminho, o sistema verifica duas coisas. Primeiro, se uma tentativa já produziu uma resposta clara e final, ela é imediatamente salva em um banco seguro, e o sistema interrompe a geração de texto para aquela tentativa específica. Isso preserva o voto do caminho bem-sucedido sem desperdiçar mais energia. Segundo, para as tentativas que ainda estão em execução, o sistema calcula a densidade desses marcadores de hesitação. Se uma tentativa estiver repleta de sinais de incerteza, ela é podada, ou interrompida, precocemente. Isso permite que o sistema descarte os caminhos improdutivos e espiralados, mantendo os produtivos que provavelmente levarão à solução correta.

Os resultados desta abordagem são substanciais. Ao utilizar este método, os pesquisadores foram capazes de reduzir o custo computacional total, medido pelas operações de atenção exigidas pelo modelo, em quase metade. Em testes do mundo real em uma única placa gráfica de alto desempenho, isso se traduziu em uma redução no tempo de processamento de mais de trinta e sete por cento. Crucialmente, esta eficiência não veio à custa da precisão. O método manteve o mesmo alto nível de correção que a abordagem tradicional de executar todas as trinta e duas tentativas até o fim. De fato, em alguns problemas difíceis, o novo método de fato melhorou o resultado final. Isso aconteceu porque o método tradicional às vezes permitia que algumas tentativas improdutivas e repetitivas dominassem o voto final simplesmente porque eram as únicas que terminavam, enquanto o novo método removeu essas distrações precocemente, permitindo que a resposta correta emergisse mais claramente.

Os pesquisadores testaram esta técnica em seis modelos de raciocínio de grande escala diferentes e em uma variedade de benchmarks matemáticos desafiadores. Eles descobriram que o sinal dos marcadores de hesitação era consistente em todos os modelos, independentemente de sua arquitetura interna ou tamanho. O método também se mostrou robusto quando aplicado a tarefas fora da matemática, como responder a questões científicas complexas ou gerar código, desde que o sistema pudesse identificar quando uma resposta final havia sido alcançada. A ideia fundamental é que o sistema não precisa compreender o conteúdo do raciocínio para saber quando parar; ele só precisa reconhecer o padrão de indecisão. Isso permite que o método funcione sem qualquer treinamento adicional ou ferramentas externas complexas, baseando-se apenas no texto que o modelo já está produzindo.

Este trabalho sugere que a parte mais cara do raciocínio da inteligência artificial é frequentemente a menos produtiva. Ao aprender a reconhecer os sinais precoces de um modelo ficando estagnado, podemos impedi-lo de desperdiçar recursos em caminhos que não levarão a lugar nenhum. O "Funnel of Thoughts" demonstra que é possível tornar esses sistemas poderosos significativamente mais rápidos e baratos de executar, mantendo-os tão inteligentes quanto antes. Ele oferece uma maneira prática de escalar o uso de modelos de raciocínio avançados, tornando-os mais viáveis para aplicações do mundo real, onde velocidade e custo são fatores críticos. As descobertas indicam que o futuro da IA eficiente pode não residir na construção de modelos maiores, mas em formas mais inteligentes de gerir os que já possuímos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →