← Últimos artigos
🤖 AI

A Better Spur Should Start From Each Objective

O artigo propõe a Otimização de Preferência Multi-Marginal (MMPO), um framework de granularidade fina que aborda recompensas esparsas e conflitos de otimização em Aprendizado por Reforço Multi-Objetivo do mundo real ao intervir nos níveis de dados, gradiente e restrição para alcançar um alinhamento estável e de alto desempenho através de diversas tarefas.

Autores originais: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

Publicado 2026-09-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mercado digital, a página de um produto é frequentemente uma densa parede de texto, repleta de especificações técnicas e jargões de marketing que podem sobrecarregar um comprador. Para preencher a lacuna entre a informação complexa e a compreensão humana, a inteligência artificial é cada vez mais incumbida de um trabalho duplo: identificar as palavras mais importantes em uma descrição de produto e, em seguida, escrever uma explicação curta e clara para elas. Isso não é meramente um exercício de edição de texto; é um exercício de equilíbrio. O sistema deve satisfazer regras offline rigorosas, como garantir que as palavras extraídas sejam precisas e cubram toda a gama de recursos do produto, enquanto simultaneamente persegue objetivos online, como maximizar os cliques dos usuários e minimizar as rejeições. Esses objetivos frequentemente puxam em direções opostas. Um recurso que gera muitos cliques pode ser genérico demais para ser preciso, enquanto um termo técnico altamente preciso pode ser obscuro demais para interessar um navegador casual. Quando programas de computador tentam otimizar todos esses objetivos conflitantes ao mesmo tempo, eles frequentemente tropeçam, oscilando violentamente ou ficando presos em um ciclo onde a melhoria de uma métrica causa o colapso de outra.

Pesquisadores do Instituto de Tecnologia de Harbin, da JD.com e da Academia Chinesa de Ciências desenvolveram um novo método para resolver este problema específico de objetivos conflitantes. Eles chamam sua abordagem de Otimização de Preferência Multi-Marginal, um sistema projetado para impedir que o computador trate todos os objetivos como um único amontoado confuso de instruções. Em vez de forçar o modelo a encontrar uma única "melhor" resposta que faça concessões em tudo, o novo framework trata cada objetivo como uma faixa separada em uma rodovia. Primeiro, ele limpa os dados que recebe, suavizando os sinais ruidosos e esparsos que vêm do comportamento real do usuário, como cliques e curtidas, que podem ser enganosos se tomados pelo valor de face. Ao ajustar como o computador vê essas recompensas, o sistema garante que informações raras, mas valiosas, não sejam ignoradas simplesmente porque aparecem com menos frequência do que termos comuns.

A inovação central reside em como o sistema lida com o próprio processo de aprendizado. Quando o computador tenta melhorar seu desempenho, ele gera atualizações matemáticas baseadas em seus objetivos. Em métodos antigos, essas atualizações eram simplesmente somadas, o que frequentemente fazia com que as instruções para um objetivo cancelassem ou distorcessem as instruções para outro. O novo método separa essas atualizações antes que sejam aplicadas. Ele identifica quais partes do sinal de aprendizado são essenciais para a precisão básica e quais partes são específicas das preferências do usuário, então projeta os sinais de preferência em um espaço onde eles não interfiram nas regras principais. Isso permite que o modelo aprenda a ser mais interessante para os usuários sem esquecer acidentalmente como ser preciso.

Além disso, os pesquisadores adicionaram um mecanismo de segurança para evitar que o sistema se torne muito agressivo no final de seu treinamento. À medida que os modelos melhoram, eles às vezes se fixam em um objetivo de forma tão intensa que negligenciam os outros, levando a uma queda repentina na qualidade geral. O novo sistema usa a própria capacidade do modelo de seguir instruções para estabelecer um limite. Ele pede ao modelo que gere exemplos de comportamento perfeito sob condições ideais e usa esses exemplos para definir uma zona de segurança para atualizações futuras. Se o modelo tentar forçar demais em uma direção, este guia interno o puxa suavemente de volta, garantindo que o progresso permaneça constante e equilibrado em todas as métricas.

Os resultados desta abordagem foram testados em um conjunto de dados de produtos reais de e-commerce, envolvendo 65.232 produtos de treinamento e 8.879 produtos de avaliação, juntamente com dados de comportamento do usuário coletados ao longo dos últimos três meses. O sistema foi comparado com vários outros métodos avançados e mostrou-se significativamente mais estável e eficaz. Em testes offline, alcançou uma pontuação de completude de 94,11 por cento e uma precisão de 73,43 por cento, superando métodos anteriores por margens amplas. Crucialmente, conseguiu atingir uma taxa de cobertura alvo de 22,82 por cento, o que é quase perfeito, enquanto outros métodos ou ficavam aquém ou ultrapassavam a marca. Essas melhorias não foram apenas teóricas; quando implementado em um teste online ao vivo com compradores reais, o sistema impulsionado por este novo método aumentou o número de pedidos realizados em 3,14 por cento e o valor total desses pedidos em 5,07 por cento em comparação com o padrão anterior.

O sucesso deste framework estende-se além das compras online. Os pesquisadores também o aplicaram a tarefas envolvendo o uso de ferramentas e geração de código de computador, áreas onde múltiplas restrições devem ser atendidas simultaneamente. Nesses testes, o método produziu consistentemente melhores resultados do que as abordagens padrão, particularmente ao evitar o "colapso de modo", onde um modelo encontra uma solução fácil e a repete incessantemente. Em vez disso, o novo sistema manteve uma gama diversificada de saídas de alta qualidade enquanto aderia a regras estritas. Ao desacoplar objetivos conflitantes e fornecer uma maneira estruturada de equilibrá-los, este trabalho oferece uma solução prática para tornar a inteligência artificial mais confiável em ambientes complexos do mundo real, onde múltiplos objetivos concorrentes são a norma.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →