← Últimos artigos
🤖 AI

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

Este artigo apresenta o OSMF, um framework unificado que aborda as limitações da geração de imagens publicitárias de tamanho único ao agrupar usuários dinamicamente e empregar um Modelo de Linguagem Grande Multimodal Sensível ao Grupo com ajuste fino via Group-DPO para alinhar diversas preferências de clique por grupo, alcançando assim o estado da arte em métricas offline e online.

Autores originais: Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

Publicado 2026-02-04
📖 4 min de leitura☕ Leitura rápida

Autores originais: Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando um outdoor digital massivo que exibe anúncios para milhões de pessoas. No passado, a estratégia era "Um Tamanho Serve para Todos" (One Size Fits All). Você criava um anúncio perfeito para um par de sapatos e o mostrava para todo mundo. O objetivo era obter o maior número total de cliques.

Mas aqui está o problema: Nem todo mundo gosta da mesma coisa.

  • Um adolescente pode amar um anúncio de tênis com um fundo de pista de skate urbana e rústica.
  • Um avô pode preferir o mesmo tênis em um cenário de jardim ensolarado e limpo.
  • Se você mostrar o anúncio da "pista de skate" para o avô, ele não clicará. Se você mostrar o anúncio do "jardim" para o adolescente, ele também não clicará.

O artigo apresenta um novo sistema chamado OSMF (One Size, Many Fits - Um Tamanho, Muitos Ajustes) para corrigir isso. Em vez de criar um único anúncio para todos, ele cria um anúncio exclusivo para grupos específicos de pessoas, tudo a partir do mesmo cérebro computacional.

Veja como funciona, dividido em etapas simples:

1. O "Agrupamento Inteligente" (PAAG)

A Analogia: Imagine um organizador de festas que não apenas separa os convidados por idade ou gênero. Em vez disso, ele observa o cardápio (o produto) e os convidados juntos.

  • Se o produto é um smartphone, o organizador percebe que homens e mulheres podem ter gostos muito diferentes.
  • Se o produto são tênis de corrida, o organizador percebe que a idade importa mais do que o gênero.
  • O que o artigo faz: O sistema utiliza uma ferramenta chamada PAAG (Product-Aware Adaptive Grouping - Agrupamento Adaptativo Consciente do Produto). Ele observa o produto e o histórico do usuário para classificar dinamicamente as pessoas nos "clubes" certos. Não utiliza regras rígidas; ele descobre: "Para este produto específico, estas 50.000 pessoas querem, na verdade, a mesma coisa".

2. O "Super-Tradutor" (G-MLLM)

A Analogia: Pense em um mestre chef que consegue cozinhar para uma multidão, mas que geralmente faz uma única panela grande de sopa. O novo sistema é como um chef que consegue mudar instantaneamente as receitas com base em quem está sentado à mesa.

  • O sistema utiliza um G-MLLM (Group-aware Multimodal Large Language Model - Modelo de Linguagem de Grande Escala Multimodal Consciente de Grupo). Este é um IA superinteligente que entende tanto texto quanto imagens.
  • Antes de começar a cozinhar, ele é "pré-treinado" para entender os "sabores" (preferências) específicos de cada grupo. Ele aprende que o Grupo A gosta de "cores vibrantes" e o Grupo B gosta de "estilos minimalistas".

3. O "Teste de Sabor" (Group-DPO)

A Analogia: Imagine que o chef prepara duas versões de um prato. Um grupo de provadores (um modelo de recompensa) experimenta as duas e diz: "O Grupo A amou a versão apimentada, mas o Grupo B odiou".

  • O sistema utiliza uma técnica chamada Group-DPO. Ele não pergunta apenas: "Qual imagem é melhor?". Ele pergunta: "Qual imagem é melhor para este grupo específico?".
  • Ele compara dois anúncios para o mesmo produto. Se o anúncio "urbano" recebe mais cliques do grupo de adolescentes, a IA aprende a criar mais anúncios "urbanos" para eles. Se o anúnção do "jardim" vence com os idosos, ela aprende isso também.
  • Isso garante que a IA não se confunda com gostos conflitantes. Ela aprende a ser um camaleão, mudando seu estilo para cada grupo.

4. O "Livro de Receitas Massivo" (Dataset GAIP)

A Analogia: Para ensinar um chef a cozinhar para 40 milhões de pessoas, você precisa de um livro de receitas enorme com feedback real.

  • Os pesquisadores não conseguiram encontrar um livro público com tantos dados, então escreveram o seu próprio.
  • Eles criaram o GAIP, um conjunto de dados contendo 40 milhões de usuários e 600.000 grupos distintos. É como ter um registro de exatamente no que 600.000 tipos diferentes de pessoas clicaram quando viram 40 milhões de anúncios diferentes. Esta é a primeira vez que um "mapa de preferências" tão grande e detalhado foi tornado público.

O Resultado

Quando testaram este sistema:

  • Offline (Simulações): Ele previu cliques melhor do que qualquer método anterior.
  • Online (Mundo Real): Quando realmente exibiram os anúncios em um grande site de e-commerce, a abordagem "Um Tamanho, Muitos Ajustes" obteve significativamente mais cliques do que os métodos antigos de "Um Tamanho Serve para Todos".

Em resumo: O artigo diz: "Pare de tentar agradar a todos com um único anúncio. Use o agrupamento inteligente para descobrir o que cada um gosta, treine uma super-IA para entender esses grupos específicos e gere anúncios personalizados para cada um deles. Isso funciona melhor, e temos os dados para provar."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →