← Últimos artigos
💬 NLP

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

Este artigo apresenta o "Think-with-Rubrics", um paradigma inovador que transforma as rubricas de avaliadores externos em orientações de raciocínio internas ao fazer com que os LLMs gerem rubricas juntamente com as respostas durante o treinamento, resultando em melhorias consistentes de desempenho em relação às bases de recompensa existentes.

Autores originais: Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

Publicado 2026-05-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a escrever uma história, resolver um enigma ou seguir um conjunto complexo de instruções. No passado, ensinávamos esses robôs deixando-os tentar adivinhar e, só depois de terminarem, avaliávamos seu trabalho. Se errassem, dizíamos: "Aqui está a nota, tente novamente". Isso é como um professor devolver uma prova com um "F" vermelho no final, mas sem anotações sobre como corrigir os erros específicos.

O artigo "Think-with-Rubrics" (Pense com Rubricas) propõe uma maneira mais inteligente de ensinar. Em vez de apenas avaliar a resposta final, ele ensina o robô a elaborar sua própria folha de avaliação antes mesmo de começar o trabalho.

Veja como o artigo desmonta isso, usando analogias simples:

1. O Problema: O Crítico "Pós-Jogo"

Atualmente, a maioria dos treinamentos de IA usa Rubricas como Recompensas. Pense nisso como um treinador esportivo que só aparece depois que o jogo termina. O treinador olha o placar final e diz: "Você errou a bola três vezes". O jogador aprende com o placar, mas não tinha a lista de verificação do treinador em mente enquanto jogava. Ele não pôde usar as regras para guiar seus movimentos em tempo real.

2. A Solução: O Treinador "Pré-Jogo"

Os autores introduzem o Think-with-Rubrics. Isso altera o processo de pensamento do robô. Agora, antes de o robô escrever uma única palavra da resposta, ele deve primeiro gerar uma Rubrica (uma lista de verificação de regras) para si mesmo.

  • A Analogia: Imagine que você está assando um bolo.
    • Jeito Antigo: Você assa o bolo, prova e, então, o juiz diz: "Está muito salgado e a cobertura está bagunçada". Você tenta novamente na próxima vez.
    • Jeito Novo (Think-with-Rubrics): Antes de ligar o forno, você escreve uma lista de verificação: "1. Use exatamente 2 xícaras de farinha. 2. Sem sal. 3. A cobertura deve ser lisa". Você então assa o bolo enquanto verifica constantemente sua própria lista.

Ao forçar a IA a escrever as regras primeiro, as regras tornam-se parte de seu "processo de pensamento", em vez de apenas uma nota externa.

3. Como o Treinamento Funciona (O Sistema de "Dupla Verificação")

O artigo descreve um processo de treinamento com duas etapas principais, como um estudante se preparando para uma grande prova:

  • Etapa 1: Aprendendo o Formato (Aquecimento SFT)
    O robô é mostrado exemplos de como escrever uma lista de verificação seguida de uma resposta. Ele aprende a estrutura: <Rubrica> e depois <Resposta>. É como ensinar um aluno a formatar corretamente sua lição de casa para que o professor possa lê-la.

  • Etapa 2: O Aprendizado por Reforço (A Fase do "Treinador")
    É aqui que a mágica acontece. O robô gera sua própria lista de verificação e resposta. Em seguida, um "Verificador" (um juiz inteligente) checa duas coisas:

    1. A Verificação Dourada: A resposta correspondeu à lista de verificação perfeita, feita por humanos? (Esta é a nota externa).
    2. A Autoverificação: A resposta realmente seguiu a própria lista de verificação do robô? (Esta é a consistência interna).

A Chave da Descoberta:
O artigo descobriu que, se você usar apenas a "Verificação Dourada" (a nota humana), o robô fica melhor em seguir regras humanas, mas ainda pode ser bagunçado em seu próprio pensamento. Mas, se você adicionar a "Autoverificação", o robô aprende a ser consistente consigo mesmo.

4. A Descoberta Surpreendente: Autoevolução

A descoberta mais emocionante no artigo é que o robô pode, na verdade, ensinar a si mesmo sem precisar de nenhuma lista de verificação de um professor humano!

  • A Analogia: Imagine um aluno que é tão bom em criar seus próprios guias de estudo e depois segui-los que, eventualmente, obtém notas melhores do que os alunos que dependem apenas do gabarito do professor.
  • O Resultado: O artigo mostra que um modelo treinado apenas para seguir suas próprias listas de verificação geradas por si mesmo (sem listas de verificação "Douradas" humanas) teve desempenho tão bom quanto, e às vezes até melhor do que, modelos treinados com listas de verificação humanas. Isso sugere que a IA pode "autoevolucionar", ficando melhor em criar suas próprias regras e, em seguida, segui-las.

5. Por Que Funciona Melhor

Os autores explicam que esse método funciona porque corrige um problema específico: Inconsistência.
Muitas vezes, uma IA pode pensar: "Preciso ser breve", mas então escreve um parágrafo longo. É uma desconexão entre o que ela acha que deveria fazer e o que ela realmente faz.

  • O Think-with-Rubrics força a IA a declarar: "Serei breve", e então prova isso imediatamente ao escrever uma resposta curta.
  • O treinamento recompensa a IA não apenas por estar certa, mas por ser consistente com seu próprio plano.

Resumo dos Resultados

O artigo testou isso em vários benchmarks (como IFEval e IFBench) e descobriu:

  • O novo método consistentemente superou os antigos métodos de "Rubrica como Recompensa" em uma média de cerca de 3,87 pontos.
  • Funcionou bem tanto em modelos de IA grandes quanto pequenos.
  • Tornou o processo de pensamento da IA mais curto e eficiente (condensando o "pensamento" em uma lista de verificação estruturada).

Em resumo: O artigo ensina a IA a parar de adivinhar e começar a planejar. Ao fazer a IA escrever seu próprio livro de regras antes de começar a trabalhar e, em seguida, recompensá-la por seguir esse livro de regras, a IA torna-se mais confiável, mais consistente e capaz de melhorar a si mesma sem supervisão humana constante.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →