← Últimos artigos
💬 NLP

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

CopT é um framework de raciocínio sem treinamento que inverte o paradigma padrão de cadeia de pensamento ao gerar primeiro uma resposta preliminar e, em seguida, empregar verificadores contrastivos em espaço contínuo para acionar dinamicamente reflexão em política apenas quando necessário, melhorando significativamente a precisão e reduzindo custos de tokens em diversas tarefas de raciocínio.

Autores originais: Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

Publicado 2026-05-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive brilhante tentando resolver um mistério.

O Jeito Antigo (Cadeia de Pensamento):
Tradicionalmente, quando Modelos de Linguagem de Grande Escala (LLMs) tentam resolver um problema, eles agem como um detetive que insiste em escrever um relatório policial de 10 páginas antes de poder dizer quem é o culpado. Eles pensam, pensam, pensam, anotam cada passo e então dão a resposta.

  • O Problema: Às vezes, o detetive já sabe a resposta no primeiro segundo. Mas, como as regras dizem "pense primeiro", ele continua escrevendo o relatório de qualquer maneira. Isso desperdiça tempo (tokens) e energia, mesmo que a resposta fosse óbvia. Isso é chamado de "raciocínio performativo" — pensar apenas pelo sake de pensar.

O Jeito Novo (CopT):
O artigo apresenta o CopT (Pensamento Contrastivo em Política). Ele inverte o roteiro. Em vez de pensar antes de responder, o CopT age como um detetive que grita uma resposta de rascunho imediatamente.

  • Passo 1: O Cheque Intuitivo. O modelo diz: "Acho que a resposta é X."
  • Passo 2: O Espelho Mágico. Antes de aceitar essa resposta, o CopT usa um "Espelho Mágico" especial (um mecanismo contrastivo) para verificar se a resposta é confiável.
    • Ele examina a resposta usando uma visão padrão (tokens discretos).
    • Ele examina a resposta usando uma visão "embaçada e incerta" (incorporações contínuas que seguram todas as possibilidades de "talvez" que o modelo considerou).
    • Se o modelo estiver confiante, as duas visões combinam perfeitamente. Se o modelo estiver chutando ou confuso, as duas visões colidem.
  • Passo 3: A Decisão.
    • Se o espelho disser "Parece Bom": O detetive aceita a resposta imediatamente. Não há necessidade de escrever o relatório longo. Resultado: Economia enorme de tempo e dinheiro.
    • Se o espelho disser "Parece Instável": O detetive diz: "Ok, preciso pensar mais." Mas aqui está a parte inteligente: eles não apenas esquecem sua primeira tentativa. Eles usam um "interruptor de visibilidade". Eles podem esconder a primeira tentativa instável se estiver confundindo-os, ou mantê-la visível se for uma dica útil, enquanto fazem o pensamento profundo para corrigi-la.

A Metáfora Central: A "Lente Embaçada" vs. A "Lente Nítida"

Para entender o "Espelho Mágico" (o verificador contrastivo), imagine olhar para uma pintura através de duas lentes diferentes:

  1. A Lente Nítida (Entrada Discreta): Você vê as pinceladas finais e nítidas que o modelo decidiu pintar. Esta é a "resposta de rascunho".
  2. A Lente Embaçada (Entrada Contínua): Você vê a paleta inteira de cores que o modelo estava considerando antes de escolher o traço final. Isso inclui todos os "e se" e incertezas.

Como o CopT usa isso:
O CopT pergunta: "A Lente Nítida parece a mesma que a Lente Embaçada?"

  • Sim: O modelo estava seguro. A resposta provavelmente está correta. Pare de pensar, economize os tokens.
  • Não: A Lente Embaçada mostra que o modelo estava realmente muito confuso ou considerando muitas possibilidades diferentes, mesmo tendo escolhido uma cor específica. A resposta provavelmente está errada. Comece a pensar (pensamento em política) para corrigi-la.

Por Que Isso Importa (De Acordo com o Artigo)

O artigo afirma que este método é um divisor de águas porque impede que o modelo "execute" pensamentos desnecessários.

  • Velocidade e Custo: Em problemas fáceis onde o modelo sabe a resposta instantaneamente, o CopT ignora completamente o longo processo de pensamento. O artigo mostra que isso corta o "custo" (número de palavras/tokens gerados) pela metade em alguns casos.
  • Pensamento Mais Inteligente: Em problemas difíceis onde a primeira tentativa está errada, o CopT não desiste apenas. Ele usa o "Espelho Mágico" para perceber: "Espere, estou confuso", e então se envolve em pensamento profundo apenas quando necessário.
  • Sem Treinamento Necessário: Isso não é um novo modelo que precisa de anos de treinamento. É uma nova maneira de usar modelos existentes. É como dar a um detetive inteligente um novo conjunto de regras a seguir, em vez de ensiná-lo um novo idioma.

O "Interruptor de Visibilidade"

Quando o modelo percebe que precisa pensar mais, ele precisa decidir se continua olhando para sua primeira tentativa (possivelmente errada).

  • Se o processo de pensamento ficar confuso, o CopT pode esconder a primeira tentativa para que o modelo não se confunda com seu próprio erro.
  • Se a primeira tentativa tiver uma boa dica nela, o CopT a mostra para ajudar a guiar a correção.
    Isso é controlado por uma segunda verificação do "Espelho Mágico" durante o processo de pensamento.

Resumo

O CopT é uma maneira mais inteligente de usar o raciocínio de IA. Em vez de forçar a IA a pensar por muito tempo antes de falar, ele permite que a IA fale primeiro, verifica se essa fala é confiável usando um "detector de incerteza" especial, e só a força a pensar profundamente se o detector disser: "Ei, isso não parece certo". Isso torna a IA mais rápida, mais barata e tão inteligente (ou mais inteligente) em problemas difíceis.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →