← Últimos artículos
🤖 AI

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

El artículo propone HOBA, un marco de aprendizaje por refuerzo jerárquico que integra un modelo de lenguaje de gran tamaño para el ajuste adaptativo de hiperparámetros, un agente SARSA con corrección de sesgo para la selección dinámica de modelos expertos y un conjunto diverso de expertos para la ejecución de pujas, superando así las limitaciones de los sistemas de licitación entrenados fuera de línea mediante una adaptabilidad en línea significativa y un valor de negocio probado en despliegues a gran escala.

Autores originales: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

Publicado 2026-07-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una casa de subastas gigante y de alta velocidad donde millones de personas intentan comprar diminutas porciones de atención cada segundo. Este es el mundo de la publicidad en línea. Los anunciantes quieren mostrar sus anuncios a las personas adecuadas sin gastar todo su presupuesto en un solo minuto. Para lograrlo, utilizan "agentes de puja" (bidding agents): programas informáticos que deciden cuánto pagar por un espacio publicitario. Piensa en estos agentes como pilotos de carreras. Algunos pilotos son muy cuidadosos y siguen un libro de reglas estricto (como un controlador PID), mientras que otros son como grandes maestros que han estudiado miles de carreras pasadas para aprender los mejores movimientos (como el Aprendizaje por Refuerzo fuera de línea o offline Reinforcement Learning).

El problema es que la pista de carreras cambia constantemente. El clima cambia, otros pilotos se vuelven más rápidos y las reglas de la carretera evolucionan. Un piloto que solo sigue un libro de reglas estático podría chocar cuando la pista se vuelve resbaladiza. Un piloto que intenta aprender nuevos movimientos mientras compite a 200 millas por hora podría perder el control y quedarse sin combustible (presupuesto) en segundos. Los científicos han estado tratando de construir un piloto que sea tanto seguro como lo suficientemente inteligente como para adaptarse en tiempo real, pero es un equilibrio delicado. Si dejas que la computadora aprenda con demasiada libertad, podría cometer un error desastroso. Si no dejas que aprenda en absoluto, se quedará atrás cuando el mercado cambie.

Aquí es donde entra el artículo "HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising". Los investigadores de Kuaishou Technology proponen una nueva forma de gestionar estos pilotos de carreras llamada HOBA. En lugar de intentar enseñar a un solo piloto a hacer todo, construyen un equipo de tres niveles que trabaja en conjunto como un equipo de pits, un estratega y un piloto.

En la cima del equipo se encuentra un "Estratega" impulsado por un Modelo de Lenguaje Grande (LLM). Imagina esto como un entrenador sabio que observa el panorama general una vez cada hora. Este entrenador no decide la velocidad exacta para cada curva; en su lugar, observa el clima, los niveles de combustible y la competencia, y luego escribe un nuevo conjunto de instrucciones para el equipo. Podría decir: "Hoy, sean un poco más agresivos", o "Mantengan el gasto lento y constante". Este entrenador aprende de un banco de memoria de carreras pasadas, utilizando un ciclo de "Pensar-Actuar-Observar-Reflexionar" para volverse más inteligente con el tiempo.

En el medio está un "Gestor Táctico", un agente inteligente que hace un control cada dos minutos. Su trabajo es elegir al mejor "piloto" de un garaje de expertos preentrenados. El garaje contiene diferentes tipos de pilotos: uno es excelente para correcciones rápidas (PID), otro es bueno para la planificación a largo plazo (MPC), y otros son expertos que aprendieron de conjuntos de datos masivos (como IQL o Decision Transformers). El Gestor Táctico no adivina al azar; utiliza una herramienta especial de "ajuste causal" para asegurarse de que no sea engañado por la suerte. Por ejemplo, si un piloto ganó una carrera solo porque el clima era perfecto, el gestor sabe que no debe culpar al piloto por esa victoria. Elige al piloto que es verdaderamente el más adecuado para el momento actual.

En la base están los "Pilotos" propiamente dichos. Estos son los expertos que realmente realizan las pujas para cada subasta de anuncios, lo cual ocurre en milisegundos. Ellos siguen las reglas establecidas por el Estratega y la elección realizada por el Gestor Táctico. Crucialmente, estos pilotos no cambian sus propios cerebros mientras compiten. Son herramientas seguras y probadas. El "aprendizaje" ocurre solo en la capa intermedia, donde el equipo decide qué piloto usar. Esto mantiene al sistema a salvo de cometer errores salvajes que agoten el presupuesto, permitiéndole al mismo tiempo adaptarse rápidamente a un mercado cambiante.

Los investigadores probaron este sistema de dos maneras. Primero, lo ejecutaron en un entorno simulado llamado AuctionNet, que es como una versión de videojuego del mercado publicitario. En estas pruebas, HOBA superó consistentemente a los mejores métodos existentes, mejorando el rendimiento hasta en un 12% en escenarios difíciles e impredecibles. Segundo, y lo más importante, lo probaron en el mundo real. Realizaron una prueba masiva en una plataforma publicitaria en vivo con miles de campañas y millones de dólares de presupuesto.

Los resultados fueron impresionantes. En la prueba del mundo real, HOBA ayudó a los anunciantes a alcanzar sus objetivos de costos un 3.6% más a menudo que el sistema anterior. Esto significa que obtuvieron más valor por su dinero sin gastar de más. El sistema también aumentó el valor total de las conversiones en un 8.1% y mejoró el retorno de la inversión en un 3.3%. Quizás lo más importante es que lo hizo todo sin agotar el presupuesto ni causar caos. El sistema demostró que, al dividir el trabajo en un entrenador estratégico, un gestor táctico y un equipo de pilotos especializados, se puede crear un sistema publicitario que es tanto seguro como increíblemente adaptable. Es un recordatorio de que, a veces, la forma más inteligente de ganar una carrera no es tener un súper piloto, sino tener un equipo perfecto trabajando en conjunto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →