← Últimos artigos
💻 computer science

EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

O artigo apresenta o EvoLM, um método de pós-treinamento auto-supervisionado que permite que modelos de linguagem melhorem iterativamente, alternando entre a geração de rubricas discriminativas específicas para cada instância e a otimização do desempenho da política usando essas rubricas como recompensas, alcançando assim resultados superiores sem depender de supervisão externa humana ou de modelos.

Autores originais: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

Publicado 2026-05-06
📖 4 min de leitura☕ Leitura rápida

Autores originais: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um estudante (o Modelo de Política) a escrever redações perfeitas. Da maneira antiga, você precisaria de um professor rigoroso (um humano ou uma IA superinteligente) para ler cada redação, atribuir uma nota e dizer ao estudante o que ele fez de errado. Isso é caro, lento e limitado pela inteligência desse professor.

EVOLM é um novo método que permite que o estudante se torne seu próprio professor, mas com um toque inteligente. Em vez de apenas adivinhar como uma redação "boa" se parece, o estudante aprende a escrever uma lista de verificação específica (chamada de Rubrica) para cada redação que escreve.

Veja como o processo funciona, dividido em etapas simples:

1. Os Dois Papéis: O Escritor e o Criador da Lista de Verificação

Neste sistema, o mesmo modelo de IA desempenha dois papéis ao mesmo tempo:

  • O Escritor (Política): Esta parte gera respostas a perguntas.
  • O Criador da Lista de Verificação (Gerador de Rubrica): Esta parte analisa a pergunta e escreve um conjunto específico de regras (uma rubrica) sobre como julgar a resposta.

Pense nisso como um chef que não apenas cozinha a refeição, mas também escreve o cartão de receita após cozinhar, explicando exatamente por que o prato é bom ou ruim.

2. O Ciclo de Feedback de "Viagem no Tempo"

Como o sistema sabe se a lista de verificação é boa? Ele não precisa de um humano para dizer "Bom trabalho!". Em vez disso, usa Viagem no Tempo.

  • Etapa A: A IA escreve uma resposta hoje.
  • Etapa B: Ela olha para trás, para uma resposta que escreveu alguns dias atrás (uma "versão anterior" de si mesma).
  • Etapa C: Ela assume que a nova resposta é melhor porque a IA tem estado aprendendo.
  • Etapa D: O Criador da Lista de Verificação cria uma rubrica para julgar ambas as respostas.

O objetivo é simples: A rubrica deve ser capaz de distinguir claramente a resposta "nova e melhor" da resposta "velha e pior". Se a rubrica for vaga, não conseguirá detectar a diferença. Se a rubrica for precisa e específica, atribuirá uma pontuação alta à nova resposta e uma baixa à antiga.

3. A Dança da Co-evolução

É aqui que a mágica acontece. Os dois papéis se alternam melhorando um ao outro em um ciclo:

  1. O Escritor melhora: Usando as listas de verificação, o Escritor aprende a produzir respostas melhores para obter pontuações mais altas.
  2. O Criador da Lista de Verificação fica mais preciso: À medida que o Escritor melhora, as respostas antigas parecem ainda piores em comparação. Para continuar distinguindo entre "bom" e "excelente", o Criador da Lista de Verificação precisa escrever regras mais específicas e mais detalhadas. Não pode apenas dizer "Gramática boa"; tem que dizer "A frase deve usar uma vírgula após a frase introdutória".

Com o tempo, as listas de verificação evoluem de rótulos vagos como "Torne interessante" para instruções concretas e verificáveis como "A resposta deve conter o número 144 derivado do perímetro de 48".

4. O Truque do "Juiz Pequeno"

Geralmente, você precisa de uma IA gigante e superinteligente para corrigir redações complexas. Mas o EVOLM usa uma pequena IA congelada (um juiz pequeno) para fazer a pontuação real.

Como o Criador da Lista de Verificação aprendeu a escrever regras tão específicas e concretas (por exemplo, "Verifique se a palavra 'inovação' aparece duas vezes"), até mesmo uma IA pequena e simples pode seguir as instruções perfeitamente. É como dar a uma criança pequena um mapa do tesouro muito específico: ela não precisa ser um detetive; apenas precisa seguir o mapa.

Por que isso é importante?

  • Nenhum Professor Externo Necessário: O sistema não precisa de humanos para corrigir milhares de redações ou pagar por APIs de IA caras. Ele cria seu próprio sinal de treinamento a partir de seu próprio desempenho passado.
  • Quebra o Teto: Se você depender de um professor humano, a IA nunca poderá ficar melhor do que esse humano. Se depender de uma IA específica como professora, a IA fica presa no nível desse professor. Com o EVOLM, o "professor" da IA (a rubrica) evolui com a IA, então o teto continua subindo.
  • Funciona: O artigo mostra que essa IA que se ensina sozinha (usando um modelo pequeno de 8 bilhões de parâmetros) realmente superou sistemas que usavam o GPT-4 (um modelo muito maior e mais caro) para gerar as regras.

Em resumo: O EVOLM é um ciclo de autoaperfeiçoamento onde uma IA aprende a escrever suas próprias rubricas detalhadas de avaliação. Ao comparar constantemente seu eu atual com seu eu passado, ela força-se a escrever regras cada vez mais precisas, o que, por sua vez, ajuda-a a aprender a escrever respostas melhores, tudo isso sem precisar que um humano interfira.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →