← Últimos artigos
🤖 AI

Cross-Entropy Games and Frost Training

Este artigo apresenta o Frost Training, um método inovador que aproveita os gradientes da função de recompensa no espaço de incorporação — anteriormente utilizados para jailbreaking — para acelerar e aprimorar a otimização de políticas baseada em Monte Carlo para tarefas de LLM como juiz, resultando em saídas com pontuação mais alta e convergência de treinamento mais rápida.

Autores originais: Arthur Renard, Franck Gabriel, Valentin Hartmann, Clément Hongler

Publicado 2026-05-28
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Arthur Renard, Franck Gabriel, Valentin Hartmann, Clément Hongler

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a escrever uma história. Você lhe dá o início de uma frase e o final muito distante, e pede que ele preencha o meio. Isso é chamado de tarefa de "preenchimento".

Geralmente, para ensinar o robô, você usa um método chamado Monte Carlo. Pense nisso como um jogo de "adivinha e verifique".

  1. O robô adivinha uma parte do meio.
  2. Um professor rigoroso (o "Juiz") lê e atribui uma pontuação.
  3. Se a pontuação for boa, o robô aprende; se for ruim, ele tenta novamente.
  4. O robô continua adivinhando aleatoriamente até ter sorte o suficiente para encontrar uma ótima resposta.

O problema é que isso é lento e desperdiçador. O robô pode adivinhar uma frase terrível, receber uma pontuação baixa e depois adivinhar outra terrível, nunca percebendo por que foi ruim ou como corrigir apenas olhando para a pontuação.

A Nova Ideia: "Frost Training"

Os autores deste artigo, do Xent Labs, propõem um novo método chamado Frost Training. Eles o chamam de "Frost" como uma referência ao poeta Robert Frost e ao seu poema The Road Not Taken. A ideia é explorar as "estradas não tomadas" pelo robô.

Em vez de apenas esperar que o robô adivinhe uma boa resposta, o Frost Training usa um truque matemático para examinar a "vizinhança" de cada chute que o robô faz.

A Analogia: O Hiker Cego vs. O Guia com uma Bússola

  • Treinamento Padrão (GRPO): Imagine um hiker cego tentando encontrar o topo de uma montanha. Ele dá um passo, sente se o terreno está mais alto e, se estiver, continua. Se ele pisar em um buraco, volta. Ele só conhece o ponto onde está de pé.
  • Frost Training: Imagine o mesmo hiker, mas agora ele tem uma bússola que aponta ligeiramente para cima em todas as direções ao seu redor. Mesmo que o hiker esteja parado em um vale, a bússola diz a ele: "Ei, se você desse apenas um passo para a esquerda, estaria mais alto".

Na linguagem do artigo, essa "bússola" é o gradiente. Como o "Juiz" (o sistema de pontuação) é um tipo de IA que usa matemática (entropia cruzada), ele possui uma estrutura oculta e suave. Os pesquisadores perceberam que podiam calcular esse sinal de "bússola" para ver como a pontuação mudaria se o robô trocasse apenas uma palavra em sua frase por uma palavra diferente.

Como Funciona (O Algoritmo "Frost-GRPO")

Aqui está o processo passo a passo que eles usam, simplificado:

  1. O Chute: O robô (o "Jogador") escreve algumas seções do meio diferentes para a história.
  2. A Varredura "E Se": Antes mesmo do professor corrigir as respostas do robô, o sistema Frost examina rapidamente cada palavra nessas respostas. Ele pergunta: "E se trocássemos esta palavra por aquela?".
    • Ele usa um atalho matemático rápido (uma expansão de Taylor) para estimar a pontuação dessas novas versões "e se" sem realmente escrevê-las completamente.
  3. A Troca: Se a matemática disser: "Trocar esta palavra tornaria a história muito melhor", o sistema seleciona essa nova versão.
  4. O Teste Real: O sistema então pede ao Professor rigoroso que avalie essas versões "e se" para garantir que a matemática estava correta.
  5. A Atualização: Se uma versão "e se" for realmente melhor do que o chute original do robô, o sistema substitui o chute original do robô por essa versão melhor.
  6. Aprendizado: O robô então aprende com essa versão atualizada e melhor.

Por Que É Melhor (Os Resultados)

O artigo testou isso em uma tarefa específica: preencher texto ausente em histórias. Eles compararam seu novo método "Frost" com o método padrão "GRPO".

  • Encontrar o Melhor Pico Mais Rápido: Em uma configuração "Best-of-K" (onde você olha para a única melhor resposta entre muitas tentativas), o Frost Training encontrou respostas com pontuação muito mais alta muito mais rápido. Foi como o hiker com a bússola encontrando o pico da montanha na metade do tempo.
  • Mantendo a Criatividade: O treinamento padrão frequentemente faz o robô "colapsar". Ele fica com medo de cometer erros e começa a repetir as mesmas frases seguras e chatas. O Frost Training manteve as respostas do robô diversas e criativas (alta "entropia") enquanto ainda as tornava de alta qualidade.
  • Eficiência: Eles mostraram que o Frost Training poderia alcançar os mesmos resultados do método padrão, mas com menos "passadas para frente" (etapas computacionais), ou melhores resultados com a mesma quantidade de poder de computação.

A Conclusão

O artigo afirma que, para uma família específica de tarefas chamada Jogos de Entropia Cruzada (onde a recompensa é baseada na probabilidade de uma frase estar correta), não precisamos depender de adivinhações cegas. Ao usar o sinal de "gradiente" oculto (a bússola) para sugerir pequenas e inteligentes mudanças nos chutes do robô antes mesmo de corrigirmos, podemos treinar o robô para escrever histórias melhores e mais criativas muito mais rápido.

Eles validaram isso mostrando que seu método, Frost-GRPO, superou consistentemente o método padrão ao encontrar conclusões de texto com a pontuação mais alta, mantendo ao mesmo tempo o estilo de escrita do robô variado e natural.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →