← Últimos artigos
💬 NLP

Self-Consistency from Only Two Samples: CoT-PoT Ensembling for Efficient LLM Reasoning

Este artigo apresenta uma abordagem híbrida de ensemble que combina o raciocínio Chain-of-Thought (CoT) e Program-of-Thought (PoT) para melhorar a precisão e reduzir drasticamente o custo computacional da autoconsistência em LLMs, permitindo que a maioria das tarefas seja resolvida com apenas duas amostras.

Autores originais: Raman Saparkhan, Majd Hawasly, Md Rizwan Parvez, Mohammad Raza

Publicado 2026-04-21
📖 4 min de leitura☕ Leitura rápida

Autores originais: Raman Saparkhan, Majd Hawasly, Md Rizwan Parvez, Mohammad Raza

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você precisa resolver um problema matemático difícil e decide pedir ajuda a um grupo de amigos.

A técnica tradicional, chamada Auto-Consistência, funciona assim: você pergunta a 40 amigos diferentes a mesma coisa, espera que cada um pense um pouco e escreva a resposta, e depois escolhe a resposta que mais amigos repetiram. O problema? Isso é caro e demorado. Você gasta muita energia (computação) para ter certeza.

Os autores deste paper (Raman Saparkhan e colegas) trouxeram uma ideia genial: e se, em vez de perguntar a 40 pessoas iguais, você perguntasse a apenas duas pessoas com "personalidades" totalmente diferentes?

Eles chamam isso de CoT-PoT Ensembling. Vamos entender com uma analogia simples:

1. Os Dois Tipos de "Amigos" (CoT e PoT)

Imagine que você tem dois tipos de consultores para resolver um problema de logística (como calcular o tempo de espera de um ônibus):

  • O Consultor "Falante" (CoT - Chain of Thought): Ele pensa em voz alta. "Bem, o ônibus sai às 8:00, demora 15 minutos, então chega às 8:15. Se eu multiplicar isso por 3..." Ele usa a linguagem natural, passo a passo. É flexível, mas às vezes ele erra a conta de cabeça (faz 5335=853 - 35 = 8).
  • O Consultor "Programador" (PoT - Program of Thought): Ele não fala, ele escreve código. Ele cria uma fórmula no computador: tempo_espera = (hora_chegada - hora_saida) % intervalo. Ele executa o código e o computador dá o resultado exato. Ele é ótimo em matemática, mas às vezes entende errado o que o problema pede (usa a fórmula errada).

2. O Grande Truque: A Concordância Mágica

O segredo do paper é que esses dois consultores cometem erros diferentes.

  • O "Falante" erra na conta.
  • O "Programador" erra na lógica da fórmula.

Se o "Falante" diz "A resposta é 10" e o "Programador" (que calculou com o computador) também diz "A resposta é 10", a chance de estarem certos é enorme. É como se dois especialistas de áreas diferentes chegassem à mesma conclusão independentemente.

3. A Revolução: Parar no "2"

Aqui está a parte mais incrível.

  • O método antigo: Você precisava de 40 tentativas para ter certeza.
  • O novo método: Você pede a opinião do "Falante" e do "Programador".
    • Se eles concordarem? Parou! Você já tem a resposta.
    • Se não concordarem? Você pede mais uma rodada.

Os autores descobriram que, na maioria das vezes (cerca de 78,6% dos casos), esses dois consultores concordam logo na primeira rodada. Ou seja, você só precisa de 2 amostras (uma de cada) para resolver o problema com alta precisão.

Isso é como se, em vez de pedir para 40 pessoas votarem, você pedisse para um juiz e um engenheiro conversarem. Se os dois disserem "Sim", o caso está encerrado.

4. Por que isso é tão eficiente?

Imagine que você está tentando adivinhar o resultado de um jogo de futebol.

  • Se você perguntar a 40 torcedores do mesmo time, todos vão dizer "Nosso time vai ganhar" (mesmo que estejam errados). Eles pensam igual.
  • Se você perguntar a um torcedor do time A e a um analista de estatística do time B, e ambos disserem "O time A vai ganhar", a chance de ser verdade é muito maior, porque eles chegaram lá por caminhos diferentes.

O paper mostra que, ao misturar essas duas formas de pensar (texto e código), o modelo de Inteligência Artificial:

  1. Acerta mais: A precisão aumenta.
  2. Gasta menos: Reduz o número de tentativas em 9,3 vezes. Em vez de 40, usa-se em média apenas 4 a 5, e na maioria das vezes apenas 2.

Resumo da Ópera

Os pesquisadores criaram um sistema onde a Inteligência Artificial "conversa consigo mesma" de duas formas diferentes (falando e programando). Quando as duas versões concordam, o sistema para imediatamente.

É como ter um duplo-check instantâneo. Em vez de gastar horas e dinheiro gerando 40 respostas, você gera apenas duas, verifica se elas batem, e se baterem, você já tem a solução. É mais rápido, mais barato e, ironicamente, mais inteligente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →