← Últimos artigos
🤖 AI

Autoregressive Direct Preference Optimization

Este artigo propõe a Otimização de Preferência Direta Autorregressiva (ADPO), uma nova variante que reformula o objetivo DPO ao aplicar explicitamente suposições autorregressivas antes do modelo de Bradley-Terry, resultando em uma função de perda deslocada e na identificação de medidas distintas de comprimento de token e de feedback para uma otimização de preferência aprimorada.

Autores originais: Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

Publicado 2026-06-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Ensinando um Robô a Escrever Melhor

Imagine que você está ensinando um robô a escrever histórias. Você tem um livro "Padrão de Ouro" (o modelo de referência) e um robô "Estudante" (o modelo que está aprendendo). Você quer que o Estudante escreva histórias que os humanos prefiram em relação às histórias do Padrão de Ouro.

Por muito tempo, a melhor maneira de fazer isso foi o DPO (Direct Preference Optimization). Pense no DPO como um professor que lê a história inteira que o estudante escreveu, compara com a história do Padrão de Ouro e dá uma única nota: "Bom" ou "Ruim".

O Problema:
O artigo argumenta que esse sistema de avaliação de "tudo ou nada" é um pouco ineficiente. Grandes Modelos de Linguagem (LLMs) não escrevem histórias em um único salto gigante; eles as escrevem palavra por palavra (ou token por token), como uma pessoa digitando uma frase. No entanto, o antigo método DPO espera até o fim para dar o feedback. É como um treinador que espera o fim de uma maratona para dizer ao corredor: "Você correu bem", sem nunca corrigir sua postura enquanto ele corria.

A Solução: ADPO (DPO Autoregressivo)

Os autores propem um novo método chamado ADPO. Em vez de esperar a história terminar para dar uma nota, o ADPO fornece feedback passo a passo, conforme a história está sendo escrita.

A Analogia "Filme vs. Fotografia"

  • DPO Antigo (A Fotografia): Imagine tirar uma foto de uma pintura terminada. Você olha para o quadro inteiro e diz: "Isto é melhor que aquilo". Você não sabe quais pinceladas o tornaram melhor.
  • Novo ADPO (O Filme): Imagine assistir ao artista pintar o quadro em tempo real. O ADPO observa a primeira pincelada, depois a segunda, depois a terceira. Ele pergunta: "Esta pincelada específica foi boa? A próxima foi melhor?". Ele aprende a preferir o processo de escrita, não apenas o resultado final.

As Duas Regras de "Comprimento"

Uma das descobertas mais interessantes do artigo é que existem, na verdade, duas maneiras diferentes de medir o comprimento ao ensinar esses modelos, e o método antigo as confundia.

  1. Comprimento de Token (A Contagem de Palavras): É quantas palavras o modelo realmente digita. (ex: "O gato sentou" = 3 palavras).
  2. Comprimento de Feedback (As Unidades de Avaliação): É em quantos blocos o professor decide avaliar de uma vez.

O Jeito Antigo: O professor sempre avaliava a história inteira como um único bloco (Comprimento de Feedback = 1), independentemente de quantas palavras havia nela.
O Novo Jeito (ADPO): O professor pode escolher avaliar a história em blocos. Eles podem avaliar cada palavra individualmente (Comprimento de Feedback = Contagem de Palavras), ou podem avaliar a cada 10 palavras, ou a cada parágrafo.

O artigo mostra que, ao dividir a história em blocos menores (fazendo o "Comprimento de Feedback" corresponder ao "Comprimento de Token"), o modelo aprende mais rápido e escreve melhor.

Como Funciona (A "Matemática" Simplificada)

No método antigo, a matemática era assim:

Pegue a história inteira, calcule a diferença e, então, aplique uma "sigmoide" (uma função de suavização) para obter uma pontuação.

No novo método ADPO, a matemática inverte a ordem:

Calcule a diferença para cada etapa, aple a "sigmoide" em cada etapa e, então, some todas elas.

A Analogia:

  • Jeito Antigo: Você mistura todos os ingredientes de um bolo, assa o bolo, prova o bolo inteiro e só então decide se precisa de mais açúcar. (Tarde demais para corrigir a massa).
  • Novo Jeito: Você prova a massa após adicionar a farinha, depois após os ovos, depois após o açúcar. Você ajusta a receita conforme avança.

Os Resultados: Isso Funciona?

Os autores testaram este novo método em dois tipos de tarefas:

  1. Problemas Matemáticos: Eles pediram aos modelos para resolver problemas matemáticos complexos de interpretação de texto.
  2. Conversas: Eles pediram aos modelos para conversar com humanos.

As Descobertas:

  • Melhores Notas: Em quase todos os testes, os modelos treinados com o método ADPO obtiveram pontuações mais altas do que aqueles treinados com o antigo método DPO.
  • Quanto mais granular, melhor: Os modelos tiveram o melhor desempenho quando o "Comprimento de Feedback" era muito pequeno (verificando cada palavra individualmente). Isso provou que os modelos se beneficiam de um feedback constante e detalhado.
  • Sem Custo Extra: Embora verificar cada palavra pareça que levaria mais tempo, os autores descobriram que o tempo adicional necessário foi insignificante (menos de 6% mais lento).

Resumo

O artigo apresenta o ADPO, uma maneira mais inteligente de treinar modelos de IA. Em vez de esperar que a IA termine uma tarefa para dar uma nota a ela, o ADPO fornece feedback em cada etapa do processo. Ao tratar a escrita da IA como uma sequência de pequenos passos, em vez de um grande bloco único, os modelos aprendem a fazer escolhas melhores durante todo o processo de geração, resultando em um raciocínio matemático mais apurado e conversas melhores.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →