← Últimos artigos
💬 NLP

Scaling Evaluation-time Compute with Reasoning Models as Evaluators

Este artigo demonstra que empregar modelos de raciocínio como avaliadores com aumento de computação em tempo de teste — especificamente por meio de avaliação passo a passo do processo — melhora significativamente a precisão da avaliação e pode aprimorar as capacidades de resolução de problemas de um LM por meio de reranking, espelhando os benefícios da escalabilidade da computação durante a geração.

Autores originais: Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

Publicado 2026-05-20
📖 4 min de leitura☕ Leitura rápida

Autores originais: Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está fazendo uma prova de matemática difícil. Geralmente, para obter uma nota melhor, você pode tentar pensar mais ou escrever mais etapas para resolver o problema. Este artigo faz uma pergunta fascinante: e se, em vez de apenas pensar mais sobre a resposta, você pensasse mais sobre a correção da resposta?

Aqui está a ideia central do artigo, detalhada com analogias simples:

1. O Jeito Antigo: O "Corretor Rápido"

Tradicionalmente, quando usamos IA para verificar se a resposta de outra IA está correta, usamos um "Avaliador Direto". Pense nisso como um caixa de fast-food. Você entrega o cupom (a resposta) e ele diz instantaneamente: "Isso parece bom" ou "Isso parece ruim". Eles não param para pensar por que é bom ou ruim; apenas dão uma nota rápida baseada em padrões que já viram antes.

2. A Nova Ideia: O "Corretor com Raciocínio"

Os pesquisadores tentaram algo diferente. Eles usaram um tipo especial de IA chamado Modelo de Raciocínio para fazer a correção. Pense nisso como um professor titular que se recusa a apenas dar uma olhada na resposta.

Em vez de dar uma nota rápida, esse "professor" força a si mesmo a escrever um longo e detalhado ensaio (uma "Cadeia de Pensamento") explicando seu raciocínio. Ele pode dizer:

  • "Espere, deixe-me verificar a etapa 3 novamente..."
  • "Hmm, essa lógica parece instável."
  • "Deixe-me voltar atrás e ver se há uma maneira melhor."
  • "Ok, verifiquei tudo e estou confiante."

O artigo chama isso de "Escalonamento do Cálculo no Tempo de Avaliação". Em português claro: Gastar mais tempo e esforço mental para corrigir a prova, em vez de gastar mais tempo tentando resolver a prova.

3. As Duas Maneiras de Corrigir

Os pesquisadores testaram duas maneiras para esse "professor" corrigir:

  • Avaliação de Resultado: Olhar para a resposta final e perguntar: "O resultado está correto?" (Como verificar a nota final em uma prova).
  • Avaliação de Processo: Olhar para cada etapa individual da solução e perguntar: "Esta etapa específica é lógica?" (Como verificar o trabalho mostrado no papel da prova).

A Grande Descoberta: O "professor" (Avaliador com Raciocínio) ficou muito melhor em corrigir quanto mais foi forçado a "pensar" e escrever suas etapas de raciocínio. Assim como um aluno fica melhor em resolver problemas de matemática pensando por mais tempo, o corretor fica melhor em encontrar erros pensando por mais tempo.

4. O Jogo "Melhor de N": Qualidade vs. Quantidade

Para testar se essa correção melhorada realmente ajuda, eles jogaram um jogo chamado Melhor de N.

  • O Cenário: Imagine que uma IA geradora cria 64 respostas diferentes para um problema difícil.
  • A Estratégia Antiga: Usar um "Corretor Rápido" para verificar rapidamente todas as 64 respostas e escolher a melhor.
  • A Nova Estratégia: Usar o "Corretor com Raciocínio" (o professor) para analisar profundamente apenas 8 respostas, mas analisá-las muito cuidadosamente.

O Resultado: O "Corretor com Raciocínio" escolhendo o melhor de apenas 8 respostas teve um desempenho melhor do que o "Corretor Rápido" escolhendo o melhor de 64 respostas.

A Analogia: É como contratar um detetive especialista para investigar 8 pistas muito minuciosamente, em vez de contratar 100 estagiários para dar uma olhada rápida em 64 pistas. A investigação profunda encontrou a verdade com mais frequência do que a busca ampla e superficial.

5. Por Que Isso Funciona?

O artigo descobriu que o "Corretor com Raciocínio" é especialmente bom em detectar erros ocultos.

  • Às vezes, uma IA obtém a resposta final correta, mas usou um método errado para chegar lá (como chutar o número certo em uma prova de matemática).
  • O "Corretor Rápido" pode dizer: "Ótimo trabalho!" porque a resposta está certa.
  • O "Corretor com Raciocínio" olha para as etapas, vê o erro e diz: "Espere, a resposta está certa, mas a lógica é falha", e a rejeita.

Resumo

O artigo prova que gastar mais poder de computação para avaliar uma resposta é tão eficaz quanto gastar mais poder para gerar a resposta.

Ao forçar o corretor de IA a "pensar em voz alta" e verificar cada etapa cuidadosamente, podemos obter melhores resultados com menos tentativas. É uma mudança de "tentar mais para obter a resposta certa" para "pensar mais para encontrar a resposta certa".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →