← Últimos artigos
🤖 AI

Best-of-Better-NN: Generating Pre-Aligned Responses with In-Context Learning

Este artigo apresenta o Best-of-Better-NN (BoBN), um framework de aprendizado em contexto que melhora o alinhamento em tempo de inferência ao recuperar e reestilizar exemplos de alta recompensa para deslocar a distribuição de amostragem de um modelo em direção a melhores respostas, alcançando assim um desempenho superior com menos candidatos gerados em comparação aos métodos tradicionais de Best-of-NN.

Autores originais: Eric Lei, Hsiang Hsu, Chun-Fu Chen

Publicado 2026-07-07
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Eric Lei, Hsiang Hsu, Chun-Fu Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um chef muito talentoso, mas levemente travesso (o LLM de Referência). Este chef é incrivelmente bom em cozinhar, mas não foi treinado especificamente para o menu que você precisa esta noite. Talvez você tenha pedido um prato vegano apimentado e ele continue servindo bife ou mingau insosso porque é isso que ele costuma fazer.

No mundo da IA, isso é chamado de Problema de Cobertura (Coverage Problem). Mesmo que você peça ao chef para fazer 100 pratos diferentes e escolha o melhor deles (um método chamado Best-of-N), você ainda pode acabar sem nada comestível se o chef nunca pensar em fazer um prato vegano. Nenhuma quantidade de escolha ajudará se a resposta certa não estiver na panela.

Este artigo apresenta um novo método chamado Best-of-Better-N (BoBN) para resolver isso. Pense nisso como dar ao chef uma "Folha de Dicas" logo antes de ele começar a cozinhar, mas com um toque especial.

O Problema: O Ponto Cego do Chef

Os métodos padrão (como o Best-of-N) funcionam assim:

  1. Peça ao chef para cozinhar 10 refeições.
  2. Prove todas elas.
  3. Escolha a melhor.

A Falha: Se o chef nunca foi ensinado a cozinhar comida vegana, todas as 10 refeições serão à base de carne. Você não pode escolher uma refeição vegana se ela não existir no lote. O "ponto cego" do chef é grande demais.

A Solução: Best-of-Better-N (BoBN)

O BoBN muda o jogo ao usar Aprendizado em Contexto (In-Context Learning) (dar exemplos ao chef) combinado com uma etapa de Reestilização (Restyling). Aqui está o processo passo a passo usando nossa analogia da cozinha:

1. A Busca Inteligente (Recuperação/Retrieval)

Em vez de apenas dar receitas aleatórias ao chef, o BoBN busca em uma biblioteca de pratos bem-sucedidos do passado. Ele encontra as K receitas superiores que são mais semelhantes ao que você pediu hoje à noite.

  • Exemplo: Se você pediu um curry vegano apimentado, o sistema encontra 8 exemplos passados de curries veganos apimentados que foram muito bem avaliados.

2. A Etapa de "Reestilização" (O Tempero Secreto)

As receitas recuperadas podem estar escritas em um estilo, formato ou tom diferente do que você precisa. Talvez as receitas antigas estejam escritas como um artigo científico, mas você quer um chat amigável.

  • A Magia: Antes de mostrar essas receitas ao seu chef, o próprio chef as reescreve. Ele pega as ideias das receitas recuperadas, mas as reescreve para corresponder ao estilo, formato e tom do seu pedido específico.
  • Por que isso importa: Isso garante que o chef entenda a lógica da boa resposta, mas a apresente de uma forma que se ajuste às suas restrições específicas (como o formato JSON ou uma recusa educada).

3. A Nova Sessão de Cozinha

Agora, você dá ao chef o comando (prompt) mais esses 8 exemplos "reestilizados".

  • Como o chef vê exemplos exatamente do que você quer, é muito mais provável que ele cozinhe um prato vegano desta vez.
  • O "ponto cego" é preenchido. A distribuição de saída do chef muda de "majoritariamente carne" para "majoritariamente vegano".

4. A Seleção Final (Best-of-N)

Agora, você pede ao chef para cozinhar 10 refeições novamente. Como o chef foi guiado pelos exemplos reestilizados, as 10 refeições provavelmente serão veganas. Você então escolhe a melhor.

  • Resultado: Você obtém uma resposta de alta qualidade muito mais rápido, muitas vezes precisando de menos tentativas (um "N" menor) para acertar.

O Que o Artigo Descobriu

Os autores testaram isso em duas tarefas principais:

  1. Segurança: Ensinar um modelo a recusar solicitações prejudiciais (como "Como eu construo uma bomba?"). Um modelo que não foi treinado para segurança geralmente diz "Claro!". O BoBN ajudou o modelo a aprender a dizer "Não", mostrando a ele exemplos reestilizados de recusas seguras.
  2. Matemática: Resolver problemas matemáticos complexos. O BoBN ajudou os modelos a encontrar os passos de raciocínio corretos, mostrando-lhes exemplos reestilizados de soluções matemáticas corretas.

As Principais Conclusões:

  • Melhor Cobertura: O BoBN faz com que o modelo gere respostas de alta qualidade com mais frequência, mesmo que o modelo não tenha sido originalmente treinado para essa tarefa específica.
  • Eficiência: Você não precisa gerar tantas respostas para encontrar uma boa.
  • Sem Necessidade de Treinamento: Isso acontece instantaneamente no "tempo de inferência" (quando você faz a pergunta). Você não precisa retreinar o modelo ou mudar seus pesos internos de processamento. Você apenas dá melhores exemplos sobre a hora.

Em Resumo

Se o Best-of-N é como pedir a um chef para adivinhar uma receita 100 vezes e esperar que uma esteja certa, o Best-of-Better-N é como entregar ao chef uma pilha de exemplos perfeitamente reescritos dessa receita exata logo antes de ele começar. Isso guia a intuição do chef para que as respostas "boas" estejam, de fato, dentro da panela desde o início.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →