← Últimos artigos
🤖 machine learning

PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models

Este artigo apresenta o PageLLM, um framework de recompensa multi-granular que aproveita o feedback implícito do usuário para otimizar simultaneamente a coerência em nível de página e o posicionamento em nível de item para busca e recomendação de páginas inteiras, alcançando melhorias significativas nas métricas de classificação e nos KPIs comerciais de produção sem exigir anotações humanas custosas.

Autores originais: Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

Publicado 2026-05-26
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o gerente de um enorme e movimentado departamento digital. Cada vez que um cliente entra, você tem um vasto armazém de produtos para mostrar a ele. Sua função não é apenas escolher alguns bons itens; você precisa organizar uma página de compras inteira para ele.

Este é o desafio da Otimização de Página Completa (WPO). Não basta encontrar o sapato certo; você precisa decidir:

  • Onde colocar os sapatos na página?
  • Você deve mostrá-los ao lado de meias ou ao lado de uma barraca?
  • Você está mostrando muitos sapatos vermelhos e poucos azuis?
  • A página está muito bagunçada ou é entediante e repetitiva?

Por muito tempo, os computadores lutaram com isso porque eram muito "burros" para entender a imagem completa, ou precisavam de gerentes humanos caros para avaliar manualmente cada layout de página.

Aí entra o PageLLM, um novo sistema que usa um "Assistente Superinteligente" (um Modelo de Linguagem de Grande Escala) para projetar essas páginas automaticamente. Mas aqui está o problema: os autores descobriram que simplesmente dizer à IA "faça uma boa página" não funciona bem. É como dizer a um chef: "Prepare uma refeição deliciosa", sem especificar se ele deve focar no sabor do bife (o item individual) ou no equilíbrio de todo o cardápio (o layout da página).

Veja como o PageLLM resolve isso, usando analogias simples:

1. O Problema: O Chef "Cego"

As tentativas anteriores de usar IA para isso tinham dois grandes problemas:

  • O Gargalo da "Avaliação Humana": Para ensinar uma IA, geralmente você precisa que humanos olhem duas páginas diferentes e digam: "Gosto mais da Página A do que da Página B". Fazer isso para milhões de usuários é caro e lento demais.
  • O Erro do "Grão Único": A maioria dos sistemas de IA olhava para o problema de apenas uma maneira.
    • Alguns olhavam apenas para itens individuais (por exemplo: "O usuário clicou neste sapato específico?"). Isso é como um chef que se importa apenas se o bife está cozido, ignorando que a sopa está fria e a salada murcha.
    • Outros olhavam apenas para a página inteira (por exemplo: "Esta página parece diversificada?"). Isso é como um chef que se preocupa com o equilíbrio do cardápio, mas não percebe que o bife está queimado.

2. A Solução: O Sistema de Recompensa "Bilateral"

Os autores perceberam que, para ensinar a IA, você precisa de dois tipos diferentes de feedback trabalhando juntos, como um chef com dois olhos: um olho para os detalhes, outro para a imagem geral.

Eles construíram um sistema chamado PageLLM que usa "feedback implícito" (o que os usuários realmente fazem, como cliques e compras) em vez de pedir que humanos avaliem páginas. Eles transformaram esses dados confusos em quatro tipos de "cenários de treinamento":

  1. Relevância: Mostrar itens que o usuário definitivamente não quer.
  2. Classificação: Trocar a ordem dos itens para ver se o usuário se importa com quem está em primeiro lugar.
  3. Diversidade: Mostrar uma página cheia de apenas um tipo de item (por exemplo, apenas sapatos vermelhos) para ensinar à IA que a variedade é boa.
  4. Redundância: Mostrar muitos itens semelhantes agrupados para ensinar à IA a espalhar as coisas.

3. O Truque de Mágica: Recompensas "Grossas" e "Finas"

Esta é a inovação central. O PageLLM treina duas cabeças de recompensa separadas (pense nelas como dois juízes diferentes) nos mesmos dados:

  • Juiz A (O Treinador de Nível de Página): Este juiz olha para a página de compras inteira de uma vez. Ele pergunta: "Esta é uma lista equilibrada e coerente? Ela cobre diferentes categorias?" Ele é ótimo em detectar se todo o cardápio é entediante ou repetitivo.
  • Juiz B (O Treinador de Nível de Item): Este juiz olha para itens individuais e suas posições. Ele pergunta: "Mover este item da posição 5 para a posição 2 fez o usuário clicar mais?" Ele é ótimo em detectar detalhes minúsculos e cruciais que a imagem geral perde.

Por que ambos?
O artigo descobriu que, se você usar apenas o Juiz A, a IA cria uma página bonita, mas perde os itens específicos que os usuários querem comprar. Se você usar apenas o Juiz B, a IA escolhe ótimos itens, mas os organiza de forma bagunçada e confusa.

  • O Resultado: Quando você combina os dois juízes, a IA fica 46,8% melhor em classificar itens corretamente do que usando apenas um juiz. É como ter um regente (Juiz A) garantindo que a orquestra toque junta, enquanto um treinador de solistas (Juiz B) garante que cada violinista acerte a nota certa.

4. Prova do Mundo Real

A equipe não testou isso apenas em um laboratório; eles tentaram em um site real de comércio eletrônico com 10 milhões de usuários.

  • O Resultado: O sistema aumentou as vendas totais da loja (GMV) em 0,44% e o número de cliques em 0,14%.
  • Por que isso importa: Em um negócio com milhões de clientes, uma pequena porcentagem como essa se traduz em dezenas de milhares de vendas extras.

5. O Bônus da Implantação "Preguiçosa"

Um efeito colateral inteligente deste sistema é que ele é fácil de implementar. Como o "Treinador de Nível de Página" (Juiz A) é tão bom em olhar para a lista inteira, a empresa pode usar apenas essa parte em seus servidores de computador existentes e mais lentos (CPUs) enquanto atualiza gradualmente seus servidores poderosos (GPUs) para executar a IA completa. É como poder usar um esboço do cardápio antes de ter a foto completa em alta definição pronta.

Resumo

O PageLLM é uma nova maneira de organizar páginas de compras online. Em vez de pedir que humanos avaliem cada página, ele ensina uma IA mostrando a ela "exemplos ruins" de layouts de página (muito repetitivos, ordem errada, falta de variedade). Ele usa dois loops de feedback diferentes — um para a imagem geral e outro para os detalhes minúsculos — para garantir que a IA crie páginas que sejam tanto logicamente equilibradas quanto perfeitamente sincronizadas com o que o usuário deseja clicar. O resultado é uma experiência de compras mais inteligente e lucrativa, sem a necessidade de uma equipe de avaliadores humanos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →