← Últimos artigos
💬 NLP

Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization

Este artigo apresenta a Otimização de Política Descorrelacionada por Recompensa (RDPO), um método inovador que emprega normalização de quantis sensível à magnitude e branqueamento de Mahalanobis para estabilizar a estimativa de vantagem em aprendizado por reforço multi-recompensa, melhorando assim o desempenho do modelo em seguimento de instruções, escrita e robustez, sem comprometer as capacidades de raciocínio ou programação.

Autores originais: Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai

Publicado 2026-05-14
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está treinando um robô muito inteligente (uma IA) para realizar muitas tarefas diferentes ao mesmo tempo: escrever histórias, resolver problemas de matemática, codificar software e seguir instruções rigorosas. Para ensinar o robô, você fornece feedback (recompensas) após cada tentativa.

O problema é que esses sinais de feedback são confusos. Alguns são notas simples de "aprovado/reprovado" (como um interruptor binário), outros são pontuações de 0 a 100, e alguns são opiniões complexas. Além disso, esses sinais frequentemente se sobrepõem. Por exemplo, uma resposta longa pode ganhar pontos por ser "detalhada", mas perder pontos por ser "muito prolixa", e a pontuação de "detalhada" pode estar matematicamente vinculada à pontuação de "prolixa".

Quando você tenta somar todas essas pontuações misturadas para dizer ao robô como melhorar, o treinamento se torna caótico. O robô pode ficar confuso com uma pontuação enorme, ignorar as outras ou ficar preso em um loop porque dois sinais estão lutando entre si.

Os autores deste artigo propõem um novo método chamado RDPO (Otimização de Política Descorrelacionada por Recompensa) para corrigir essa bagunça. Pense no RDPO como um "Limpa-Sinal" em duas etapas que prepara o feedback antes de o robô aprender com ele.

Etapa 1: O "Filtro de Equidade" (Normalização Quantílica Consciente da Magnitude)

O Problema: Imagine que você está avaliando uma turma. Um aluno recebe uma nota de 100, outro recebe 99 e um terceiro recebe 0. Se você olhar apenas para os números brutos, a diferença entre 99 e 100 parece minúscula, mas a diferença entre 0 e 99 é enorme. No treinamento de IA, se um tipo de recompensa (como uma verificação de "aprovado/reprovado") tiver uma lacuna enorme, ela pode afogar todo o outro feedback, fazendo com que o robô foque apenas naquela única coisa e ignore tudo o mais.

A Solução: O RDPO usa um "Filtro de Equidade" chamado Normalização Quantílica Consciente da Magnitude.

  • Como funciona: Em vez de olhar para os números brutos, ele analisa a classificação e as lacunas entre as tentativas. Ele comprime as lacunas enormes (para que um 100 não seja infinitamente melhor que um 99) e estica as lacunas minúsculas (para que um 99 e um 100 ainda sejam distintos).
  • A Analogia: Imagine uma corrida onde um corredor termina em 10 segundos e outro em 100 segundos. Se você olhar apenas para o tempo, o segundo corredor parece terrível. Mas, se você normalizar a corrida para que todos sejam julgados com base no desempenho relativo ao grupo, o segundo corredor recebe uma chance justa de melhorar sem ser esmagado pela vantagem massiva do primeiro corredor. Isso garante que nenhuma tentativa única "ruim" ou "atípica" sequestre o processo de aprendizado do robô.

Etapa 2: O "Cancelador de Ruído" (Branqueamento de Mahalanobis)

O Problema: Às vezes, os sinais de feedback são redundantes. Imagine que você tem dois sensores: um mede "quanto o robô falou" e outro mede "quanto o robô falou". Se você somar essas duas pontuações, está contando a mesma informação duas vezes. Ou, imagine dois sensores que são opostos: um diz "seja mais longo" e o outro diz "seja mais curto". Se você apenas os somar, eles se cancelam mutuamente, e o robô não recebe nenhuma direção clara.

A Solução: O RDPO usa um "Cancelador de Ruído" chamado Branqueamento de Mahalanobis.

  • Como funciona: Ele analisa a relação entre os diferentes sinais de feedback. Se dois sinais estiverem dizendo a mesma coisa (correlacionados), ele reduz o peso de um para que não haja contagem dupla. Se estiverem lutando entre si, ele os ajusta para que o robô receba uma instrução clara e equilibrada.
  • A Analogia: Pense em uma banda onde o baterista e o baixista estão tocando exatamente o mesmo ritmo. Soa embaçado e redundante. O "Cancelador de Ruído" é como um engenheiro de som que abaixa ligeiramente o baixo para que a seção rítmica soe nítida e clara, em vez de embaçada. Isso garante que o robô aprenda com informações únicas, e não com ruído repetido.

Os Resultados

Os autores testaram esse método em um grande modelo de IA chamado LongCat-Flash. Eles o treinaram em quatro tipos de tarefas:

  1. Seguimento de Instruções: Fazer exatamente o que você pede.
  2. Escrita Geral: Criar boas histórias ou artigos.
  3. Raciocínio Matemático: Resolver quebra-cabeças lógicos.
  4. Codificação: Escrever programas de computador.

O que aconteceu?

  • Escrita e Instruções: O robô ficou significativamente melhor em seguir instruções e escrever textos de alta qualidade. Tornou-se mais robusto ao receber prompts difíceis ou complicados.
  • Matemática e Codificação: O robô performou tão bem quanto os melhores métodos anteriores. Ele não piorou em matemática ou codificação; manteve-se competitivo enquanto melhorava muito nas outras tarefas.

A Conclusão

O artigo afirma que, ao limpar os sinais de feedback (tornando-os justos e removendo redundâncias) antes de a IA aprender, o processo de treinamento se torna muito mais estável. Isso permite que a IA melhore em trabalhos complexos e multitarefa (como escrever e seguir regras) sem perder a capacidade de resolver problemas de matemática ou escrever código. É uma maneira mais inteligente de misturar diferentes tipos de elogios e críticas para que a IA aprenda as lições corretas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →