← Últimos artigos
🤖 AI

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

O artigo propõe o HOBA, um framework de aprendizado por reforço hierárquico que integra um grande modelo de linguagem para o ajuste adaptativo de hiperparâmetros, um agente SARSA com correção de viés para seleção dinâmica de modelos especialistas e um pool diversificado de especialistas para execução de lances, superando assim as limitações de sistemas de lances treinados offline por meio de uma significativa adaptabilidade online e valor de negócio comprovado em implantações de larga escala.

Autores originais: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

Publicado 2026-07-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine uma casa de leilões gigante e de alta velocidade onde milhões de pessoas tentam comprar fatias minúsculas de atenção a cada segundo. Este é o mundo da publicidade online. Os anunciantes querem mostrar seus anúncios para as pessoas certas sem gastar todo o seu orçamento em um único minuto. Para fazer isso, eles usam "agentes de lances" — programas de computador que decidem quanto pagar por um espaço publicitário. Pense nesses agentes como pilotos de carros de corrida. Alguns pilotos são muito cuidadosos e seguem um livro de regras rigoroso (como um controlador PID), enquanto outros são como grandes mestres que estudaram milhares de corridas passadas para aprender os melhores movimentos (como o Aprendizado por Reforço offline).

O problema é que a pista de corrida muda constantemente. O clima muda, outros pilotos ficam mais rápidos e as regras da estrada evoluem. Um piloto que apenas segue um livro de regras estático pode bater quando a pista fica escorregadia. Um piloto que tenta aprender novos movimentos enquanto corre a 200 milhas por hora pode perder o controle e ficar sem combustível (orçamento) em segundos. Cientistas têm tentado construir um piloto que seja ao mesmo tempo seguro e inteligente o suficiente para se adaptar em tempo real, mas é um equilíbrio delicado. Se você deixar o computador aprender com muita liberdade, ele pode cometer um erro desastroso. Se você não deixar que ele aprenda nada, ele será deixado para trás quando o mercado mudar.

É aqui que o artigo "HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising" entra em cena. Os pesquisadores da Kuaishou Technology propõem uma nova maneira de gerenciar esses pilotos de corrida chamada HOBA. Em vez de tentar ensinar um único piloto a fazer tudo, eles constroem uma equipe de três níveis que trabalha junta como um chefe de equipe, um estrategista e um piloto.

No topo da equipe está um "Estrategista" alimentado por um Modelo de Linguagem de Grande Escala (LLM). Imagine isso como um treinador sábio que observa o panorama geral uma vez a cada hora. Este treinador não decide a velocidade exata para cada curva; em vez disso, ele observa o clima, os níveis de combustível e a competição, e então escreve um novo conjunto de instruções para a equipe. Ele pode dizer: "Hoje, seja um pouco mais agressivo" ou "Mantenha os gastos lentos e constantes". Este treinista aprende com um banco de memória de corridas passadas, usando um ciclo "Pensar-Agir-Observar-Refletir" para se tornar mais inteligente ao longo do tempo.

No meio está um "Gerente Tático", um agente inteligente que faz um check-in a cada dois minutos. Seu trabalho é escolher o melhor "piloto" de uma garagem de especialistas pré-treinados. A garagem contém diferentes tipos de pilotos: um é ótimo em correções rápidas (PID), outro é bom em planejamento de longo prazo (MPC) e outros são especialistas que aprenderam com conjuntos de dados massivos (como IQL ou Decision Transformers). O Gerente Tático não adivinha aleatoriamente; ele usa uma ferramenta especial de "ajuste causal" para garantir que não seja enganado pela sorte. Por exemplo, se um piloto venceu uma corrida apenas porque o clima estava perfeito, o gerente sabe que não deve culpar o piloto por essa vitória. Ele escolhe o piloto que é verdadeiramente o melhor ajuste para o momento atual.

Na base estão os próprios "Pilotos". Estes são os especialistas que realmente realizam os lances para cada leilão de anúncio, o que acontece em milissegundos. Eles seguem as regras definidas pelo Estrategista e a escolha feita pelo Gerente Tático. Crucialmente, esses pilotos não mudam seus próprios cérebros enquanto correm. Eles são ferramentas seguras e pré-testadas. O "aprendizado" acontece apenas na camada intermediária, onde a equipe decide qual piloto usar. Isso mantém o sistema seguro contra erros selvagens que esgotariam o orçamento, permitindo ao mesmo tempo que se adapte rapidamente a um mercado em mudança.

Os pesquisadores testaram este sistema de duas maneiras. Primeiro, eles o executaram em um ambiente simulado chamado AuctionNet, que é como uma versão de videogame do mercado de anúncios. Nestes testes, o HOBA superou consistentemente os melhores métodos existentes, melhorando o desempenho em até 12% em cenários difíceis e imprevisíveis. Segundo, e mais importante, eles o testaram no mundo real. Eles realizaram um teste massivo em uma plataforma de publicidade ao vivo com milhares de campanhas e milhões de dólares de orçamento.

Os resultados foram impressionantes. No teste do mundo real, o HOBA ajudou os anunciantes a atingirem suas metas de custo 3,6% mais vezes do que o sistema antigo. Isso significa que eles obtiveram mais valor pelo seu dinheiro sem gastar excessivamente. O sistema também aumentou o valor total das conversões em 8,1% e melhorou o retorno sobre o investimento em 3,3%. Talvez o mais importante seja que ele fez tudo isso sem quebrar o orçamento ou causar o caos. O sistema provou que, ao dividir o trabalho entre um treinador estratégico, um gerente tático e uma equipe de pilotos especializados, você pode criar um sistema de publicidade que é ao mesmo tempo seguro e incrivelmente adaptável. É um lembrete de que, às vezes, a maneira mais inteligente de vencer uma corrida não é ter um super-piloto, mas sim uma equipe perfeita trabalhando junta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →