← Últimos artigos
💬 NLP

Offline Preference Optimization via Maximum Marginal Likelihood Estimation

Este artigo apresenta o MMPO, um método de otimização de preferência offline estável e simplificado que alinha Grandes Modelos de Linguagem com as preferências humanas ao maximizar a log-verossimilhança marginal, eliminando assim a necessidade de modelos de recompensa explícitos enquanto supera os modelos de referência em qualidade de alinhamento e preservação de capacidade geral.

Autores originais: Saeed Najafi, Alona Fyshe

Publicado 2026-01-27
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Saeed Najafi, Alona Fyshe

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Panorama Geral: Ensinando um Robô a ser "Educado"

Imagine que você tem um robô muito inteligente (um Grande Modelo de Linguagem) que leu quase tudo o que existe na internet. Ele consegue escrever histórias, resolver problemas matemáticos e responder perguntas. No entanto, ele é um pouco como um adolescente brilhante, mas caótico: ele sabe como falar, mas nem sempre sabe o que os humanos realmente querem ouvir. Às vezes ele é rude, às vezes é confuso e, às vezes, ele simplesmente inventa coisas.

Para consertar isso, precisamos "alinhar" o robô com as preferências humanas. A forma padrão atual de fazer isso é chamada de RLHF (Aprendizado por Reforço com Feedback Humano). Pense nisso como contratar um treinador rigoroso que observa o robô, dá pontos para boas respostas e retira pontos para respostas ruins. Mas esse processo é bagunçado, caro e o robô frequentemente fica confuso com as regras inconsistentes do treinador.

Recentemente, um método mais simples chamado DPO foi inventado. É como pular o treinador e apenas mostrar ao robô duas respostas (uma boa e uma ruim) e dizer: "Escolha a boa". Isso funciona melhor, mas ainda possui algumas peculiaridades e pode ser instável se você ajustar as configurações demais.

Este artigo apresenta um novo método chamado MMPO. Os autores dizem: "Vamos tentar um ângulo completamente diferente". Em vez de tentar ensinar o robô a escolher o vencedor, eles tratam o problema como uma estimativa de verossimilhança marginal.

A Ideia Central: O Jogo do "Melhor Palpite"

Para entender o MMPO, imagine que você está tentando adivinhar o final de uma história de mistério. Você conhece o começo (o prompt) e tem dois finais possíveis:

  1. O Final Bom: Aquele que os humanos preferem.
  2. O Final Ruim: Aquele que os humanos não gostam.

A Forma Antiga (DPO/RLHF):
Os métodos antigos são como um jogo de "Quente ou Frio". Eles calculam uma pontuação para o Final Bom, uma pontuação para o Final Ruim e então tentam empurrar o Final Bom para cima e o Final Ruim para baixo. É um pouco como tentar equilibrar uma gangorra; se você empurrar demais de um lado, o conjunto todo tomba (instabilidade).

A Nova Forma (MMPO):
Os autores propõem uma abordagem diferente baseada em Verossimilhança Marginal Máxima (MML).

Imagine que você é um detetive tentando descobrir qual é a probabilidade de um determinado "Final Bom" ter sido o final real da história, dado que você tem apenas algumas pistas (os dois finais que você está observando).

Em vez de comparar os dois finais diretamente um contra o outro, o MMPO pergunta: "Se olharmos para todas as formas possíveis de esta história terminar, qual é a probabilidade de o 'Final Bom' ser aquele que realmente aconteceu?"

Para fazer isso, a matemática analisa tanto o Final Bom quanto o Final Ruim como "amostras" (pistas) para estimar essa probabilidade.

  • Não precisa de um "Treinador" separado (Modelo de Recompensa) para dizer o que é bom.
  • Não precisa forçar o robô a ser "criativo" (Maximização de Entropia) apenas por fazer isso.

O Truque de Mestre: Como Funciona Sem um Treinador

O artigo afirma que, ao usar essa matemática de "Melhor Palpite", o robô aprende implicitamente a preferir a resposta boa sem que lhe seja dito explicitamente para fazê-lo.

Aqui está a analogia:
Imagine que você está ensinando um cachorro a sentar.

  • RLHF: Você tem um treinador com um estalido (clicker) e petiscos. Você estala quando o cachorro senta e não estala quando ele não senta.
  • DPO: Você mostra ao cachorro uma foto dele sentado e uma foto dele em pé e diz: "Eu gosto mais da foto dele sentado".
  • MMPO: Você simplesmente olha para a foto do "sentar" e calcula a probabilidade de este ser o comportamento correto com base nas evidências que você possui.

O artigo prova matematicamente que, quando você realiza esse cálculo, a matemática naturalmente empurra o robô a escolher o "Final Bom" com mais frequência. É como se a própria matemática atuasse como o sistema de recompensa. O robô aprende a aumentar a probabilidade da resposta boa e diminuir levemente a ruim, tudo em um único movimento suave.

Por Que Isso é Melhor? (Os Resultados)

Os autores testaram isso em robôs de diferentes tamanhos (desde pequenos robôs de "brinquedo" até robôs grandes e "cerebrais"). Aqui está o que descobriram:

  1. É Mais Estável:
    Pense em sintonizar um rádio. Com os métodos antigos (DPO), se você girar o botão (um ajuste chamado β\beta) apenas um pouquinho, a música pode virar estática ou cortar completamente. Com o MMPO, o rádio permanece claro não importa o quanto você gire o botão. É muito mais difícil "quebrar" o treinamento.

  2. Mantém o Robô Inteligente:
    Às vezes, quando você ensina um robô a ser educado, ele esquece como fazer matemática ou contar piadas. Ele se torna um "puxa-saco" que é seguro, mas entediante.
    O artigo mostra que o MMPO é melhor em manter a inteligência original do robô. Ele aprende a ser educado sem esquecer como ser um assistente de propósito geral.

  3. Vence Com Mais Frequência:
    Quando colocaram seu novo método contra os antigos em uma competição (AlpacaEval), o MMPO consistentemente venceu ou empatou em primeiro lugar, especialmente nos modelos menores e mais eficientes.

Os Ingredientes do "Segredo do Sucesso"

O artigo também realizou experimentos para ver quais partes de sua receita eram essenciais. Eles descobriram dois ingredientes principais que fizeram a mágica funcionar:

  • Normalização por Lote (In-Batch Normalization): Isso é como garantir que todos em uma sala de aula sejam avaliados na mesma escala. Se um aluno tira um A+ e outro tira um F, o professor ajusta as notas para que a comparação seja justa. Isso evita que um exemplo estranho prejudique toda a lição.
  • Sem "Entropia Extra": Eles descobriram que tentar forçar o robô a ser "diverso" (maximização de entropia) na verdade o tornava pior. Eles deixaram a matemática fazer o trabalho naturalmente.

Resumo

Em suma, este artigo diz: "Pare de tentar construir um sistema de recompensa complexo para ensinar aos robôs o que os humanos gostam. Em vez disso, use um truque estatístico simples que trata as preferências humanas como pistas. Este truque ensina naturalmente o robô a ser útil, mantém a estabilidade e garante que ele não esqueça como ser inteligente."

Eles chamam este novo método de MMPO (Otimização de Preferência de Verossimilhança Marginal Máxima), e acreditam que é uma maneira mais simples e confiável de alinhar a IA com os valores humanos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →