← Últimos artigos
🤖 machine learning

Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning

Este artigo apresenta o PROSPER\texttt{PROSPER}, um algoritmo comprovadamente eficiente baseado no conceito da teoria dos jogos de Vencedor de Blackwell de Entropia Máxima, para abordar preferências intransitivas no ajuste fino de preferências multiobjetivo sem escalarização, demonstrando desempenho superior em modelos de linguagem grandes utilizando feedback de avaliadores multiobjetivo.

Autores originais: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

Publicado 2026-05-07
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a escrever uma história perfeita. Você tem um "Juiz" (outro sistema de IA) que lê as histórias do robô e fornece feedback. Normalmente, pedimos ao Juiz para dar uma única pontuação, como "8 em 10". Mas aqui está o problema: o Juiz frequentemente fica confuso. Ele pode dizer que a História A é melhor que a História B, e a História B é melhor que a História C, mas depois, estranhamente, dizer que a História C é melhor que a História A.

Isso é chamado de intransitividade (ou um ciclo). É como o jogo Pedra, Papel e Tesoura: Pedra vence Tesoura, Tesoura vence Papel, mas Papel vence Pedra. Não existe um único "melhor" movimento. Quando isso acontece, o robô fica confuso porque não sabe em qual direção aprender.

Este artigo apresenta uma nova maneira de ensinar o robô, mesmo quando o Juiz é inconsistente e as regras são complicadas.

O Problema: O Juiz Confuso e a Armadilha do "Escalar"

Normalmente, quando um Juiz precisa avaliar uma história em vários aspectos diferentes (como: É engraçada? É segura? É factual?), ele tenta fundir todas essas pontuações em um único número. Os autores chamam isso de escalarização.

  • A Analogia: Imagine que você está avaliando um aluno. Você precisa avaliá-lo em Matemática, Arte e Corrida. Se você apenas somar tudo em uma única "Pontuação Total", você pode perder o fato de que o aluno é um gênio em Matemática, mas péssimo em Arte. Se o Juiz tentar combinar tudo isso em um único número, frequentemente cria esses ciclos confusos (A > B > C > A), porque está tentando forçar uma peça quadrada em um buraco redondo.

A Solução: O "Vencedor Blackwell de Entropia Máxima"

Os autores propõem uma nova maneira de encontrar a melhor estratégia para o robô, que eles chamam de Vencedor Blackwell de Entropia Máxima (vamos chamá-lo de "Robô Super-Adaptável").

Em vez de perguntar: "Qual história é absolutamente a melhor?" (o que pode não existir), eles perguntam: "Qual estratégia do robô é a mais difícil de vencer, não importa qual regra específica o Juiz decida focar hoje?"

  • A Analogia: Imagine um jogador de xadrez que não tenta ser o melhor em uma abertura específica. Em vez disso, ele joga de uma forma que garante que nunca perca feio, seja o oponente atacando pela esquerda, pela direita ou pelo centro. Ele é robusto contra qualquer fraqueza específica que o oponente possa explorar. Este "Robô Super-Adaptável" é aquele que vence com mais frequência contra o pior cenário possível.

O Algoritmo: PROSPER

Para realmente ensinar o robô a ser esse "Super-Adaptável", os autores criaram um algoritmo chamado PROSPER.

  • O Jeito Antigo: Normalmente, para ensinar um robô a lidar com múltiplos juízes, você precisa simular um jogo gigante e caótico onde o robô joga contra um "vilão" que tenta enganá-lo. Isso é lento e computacionalmente caro.
  • O Jeito PROSPER: Os autores encontraram um truque matemático. Eles perceberam que, em vez de jogar um jogo complexo com um vilão, podem simplesmente usar uma regressão simples (um tipo de ajuste matemático) para ensinar o robô.
  • A Analogia: Pense assim: em vez de contratar um parceiro de treino para te dar socos no rosto para ensinar você a desviar (o que é difícil e perigoso), você apenas assiste a um vídeo dos socos e aprende o padrão matematicamente. O PROSPER permite que o robô aprenda diretamente com o feedback do Juiz, sem precisar simular uma batalha complexa. Ele transforma um jogo multijogador em uma tarefa de lição de casa de jogador único.

O Que Eles Fizeram e Descobriram

A equipe testou isso em Modelos de Linguagem de Grande Escala (LLMs) usando um conjunto de dados onde o Juiz avaliava as respostas com base em listas de verificação específicas (rubricas).

  1. A Verificação da Realidade: Eles confirmaram que, quando você pede a um Juiz de IA para examinar vários critérios diferentes (como segurança, estilo e fatos) separadamente, ele ainda fica confuso e cria ciclos. Dividir os critérios ajuda um pouco, mas não resolve o problema completamente.
  2. O Resultado: Quando usaram o PROSPER para treinar o robô, o robô ficou muito melhor em seguir instruções e conversar naturalmente do que robôs treinados com métodos mais antigos.
  3. A Prova: Eles lançaram os robôs treinados (com tamanhos de 3 bilhões e 7 bilhões de parâmetros) e mostraram que eles venceram todos os outros métodos em testes padrão para seguir instruções e conversas gerais.

Resumo

Em resumo, quando juízes de IA são inconsistentes e confusos sobre o que faz uma "boa" resposta, os métodos de treinamento padrão falham. Este artigo diz: "Não tente encontrar a única resposta perfeita. Em vez disso, encontre a estratégia que é robusta o suficiente para lidar com qualquer uma das preferências confusas do Juiz." Eles construíram uma ferramenta chamada PROSPER que faz isso de forma eficiente, transformando um problema complexo de teoria dos jogos em um problema matemático simples, resultando em modelos de IA mais inteligentes e confiáveis.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →