← Últimos artículos
🤖 machine learning

CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer

Este artículo presenta CADET, un transformador de solo decodificador condicionado por contexto implementado en LinkedIn que supera desafíos clave en la predicción de CTR de anuncios mediante innovaciones como el modelado de post-puntuación multi-torre y la atención de compuerta propia, logrando un aumento del 11.04% en el CTR sobre la línea base de producción.

Autores originales: David Pardoe, Neil Daftary, Miro Furtado, Aditya Aiyer, Yu Wang, Liuqing Li, Tao Song, Lars Hertel, Young Jin Yun, Senthil Radhakrishnan, Zhiwei Wang, Tommy Li, Khai Tran, Ananth Nagarajan, Ali Naqvi
Publicado 2026-08-12
📖 9 min de lectura🧠 Análisis profundo

Autores originales: David Pardoe, Neil Daftary, Miro Furtado, Aditya Aiyer, Yu Wang, Liuqing Li, Tao Song, Lars Hertel, Young Jin Yun, Senthil Radhakrishnan, Zhiwei Wang, Tommy Li, Khai Tran, Ananth Nagarajan, Ali Naqvi, Yue Zhang, Renpeng Fang, Avi Romascanu, Arjun Kulothungun, Deepak Kumar, Praneeth Boda, Fedor Borisyuk, Ruoyan Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás caminando por un mercado digital masivo y bullicioso. Cada segundo, miles de carteles digitales aparecen parpadeando, tratando de captar tu atención. Algunos carteles son para zapatos, otros para ofertas de empleo y algunos para café. Las personas que gestionan este mercado tienen un trabajo difícil: necesitan adivinar en qué cartel te detendrás a mirar antes de que siquiera lo veas. Este juego de adivinanzas se llama predicción de la "Tasa de Clics" (CTR, por sus siglas en inglés). Durante mucho tiempo, los mejores adivinadores fueron como contables súper inteligentes que miraban una lista de tus hábitos pasados y los detalles del cartel para hacer un cálculo. Pero recientemente, un nuevo tipo de IA "generativa" ha empezado a aparecer en otras áreas, como la recomendación de películas o canciones. Estas nuevas IA son como narradores de historias; en lugar de solo procesar números, leen toda una historia de lo que has hecho antes y predicen qué pasará después. La gran pregunta para los dueños del mercado era: ¿Podemos usar esta nueva IA de "narración de historias" para adivinar en qué anuncios harás clic, incluso cuando las reglas del juego cambian después de que se realiza la suposición?

Esto es exactamente lo que el equipo de LinkedIn se propuso resolver con su nuevo sistema, llamado CADET. Construyeron un "transformer de solo decodificador" (decoder-only transformer), que es una forma elegante de decir que crearon una IA que lee una secuencia de eventos (como tus clics y visualizaciones pasadas) y predice el futuro en un solo paso fluido. Pero los anuncios son complicados. A diferencia de recomendar una película, el éxito de un anuncio a menudo depende de cosas que no se conocen hasta después de que la IA hace su suposición, como exactamente dónde terminará el anuncio en la pantalla. Si la IA se equivoca porque no sabía que el anuncio estaría en la parte inferior de la página en lugar de la superior, todo el sistema se confunde.

Los investigadores descubrieron que, al dotar a su IA de un conjunto especial de herramientas, podían resolver este rompecabezas. Enseñaron al modelo a imaginar diferentes escenarios de "¿qué pasaría si..." para donde podría aterrizar el anuncio, y construyeron un mecanismo de "autocontrol" (self-gating) que actúa como un portero, evitando que la IA se distraiga con información ruidosa o confusa. También le dieron a la IA un sentido especial del tiempo, permitiéndole entender que un clic de hace cinco minutos es diferente a uno de hace cinco meses. Lo más importante es que se aseguraron de que la IA no utilizara información que no tendría en el mundo real durante su entrenamiento. Cuando probaron este nuevo sistema en el mercado real de LinkedIn, no solo funcionó; funcionó significativamente mejor que los antiguos y complejos sistemas que reemplazaron. La nueva IA sugirió que los usuarios tenían un 11.04% más de probabilidades de hacer clic en los anuncios, demostando que un enfoque unificado de narración de historias puede superar a la antigua máquina de múltiples partes.

La Historia de CADET: Un Narrador para Anuncios

Entonces, ¿cómo lo construyeron? Desglosemos la magia de CADET (Context-Conditioned Ads Decoder-Only Transformer) en conceptos sencillos y cotidianos.

El problema del "Huevo o la Gallina"
Imagina que eres un chef intentando adivinar cuánto disfrutará un cliente una comida. Pero aquí está el truco: tienes que adivinar el disfrute antes de saber dónde está sentada la mesa. Si la mesa está justo al lado de la cocina, el cliente podría estar hambriento y emocionado. Si está en un rincón oscuro, podrían estar de mal humor. En el mundo de los anuncios, la "mesa" es la posición del anuncio en la pantalla. La IA tiene que predecir si harás clic en un anuncio, pero aún no sabe si ese anuncio estará en la parte superior (donde todos lo ven) o muy abajo en la parte inferior. Este es el problema del "huevo o la gallina": la predicción depende de la posición, pero la posición depende de la predicción.

CADET resuelve esto siendo un maestro de los escenarios de "¿qué pasaría si...". En lugar de hacer una sola suposición, tiene múltiples "cabezales de predicción" (piensa en ellos como diferentes chefs en la cocina). Un chef adivina: "Si este anuncio está arriba, ¿harás clic?". Otro chef adina: "Si está abajo, ¿harás clic?". El modelo aprende a producir todas estas respuestas a la vez. Cuando el anuncio se coloca realmente, el sistema simplemente elige la respuesta del chef que acertó sobre la ubicación. De esta manera, la IA nunca se confunde por el misterio de dónde terminará el anuncio.

El Portero (Atención de Autocontrol / Self-Gated Attention)
En una habitación concurrida, a veces una persona ruidosa ahoga a todas las demás. En la IA, esto se llama "sumidero de atención" (attention sink), donde el modelo se enfoca demasiado en un token (una pieza de datos) e ignora el resto, lo que lleva a malas suposiciones. Los investigadores dotaron a CADET de un "portero" llamado mecanismo de atención de autocontrol (self-gated attention mechanism).

Piensa en el cerebro de la IA como un pasillo concurrido. Cada vez que una pieza de información intenta pasar, el portero la revisa. Si la información es ruidosa o no es muy útil, el portero atenúa sus luces (la controla hacia abajo) para que no distraiga al modelo. Si la información es importante, el portero deja que brille. Esto sucede dos veces: una cuando la información llega por primera vez (nivel de representación) y otra cuando la IA intenta conectar diferentes piezas de información (nivel de interacción). Esto mantiene el entrenamiento suave y estable, evitando que la IA se vuelva loca o se quede estancada en patrones erróneos.

La Máquina del Tiempo (Timestamp RoPE)
La mayoría de los modelos de IA cuentan pasos: "Paso 1, Paso 2, Paso 3". Pero en el mundo real, el tiempo no es solo cuestión de pasos; se trata de cuándo sucedieron las cosas. Un clic que ocurrió hace 10 segundos es muy diferente a uno que ocurrió hace 10 meses.

CADET utiliza un tipo especial de "máquina del tiempo" llamada Codificación Posicional Rotatoria basada en marcas de tiempo (Timestamp-based Rotary Positional Embedding - RoPE). En lugar de contar pasos, la IA mira la hora real del reloj (timestamps de Unix) de cada evento. Puede entender que la brecha entre dos eventos es corta (como segundos) o larga (como meses). Esto ayuda al modelo a darse cuenta de que tu comportamiento cambia con el tiempo. Si hiciste clic en un anuncio de empleo ayer, podrías seguir interesado hoy, pero si hiciste clic en él hace seis meses, probablemente ya no lo estés. Este sentido del tiempo permite a la IA aprender patrones en diferentes escalas, desde el momento inmediato hasta las tendencias a largo plazo.

La Regla de "No Hacer Trampa" (Enmascaramiento de Sesión)
Cuando entrenas una IA, quieres que aprenda como un estudiante, no como un tramposo. En el mundo real, cuando se muestra un anuncio, el sistema no sabe inmediatamente si hiciste clic en él; hay un pequeño retraso (como unos segundos o minutos) mientras los datos viajan. Si la IA se entrena con datos donde puede "ver" el clic antes de lo que debería, aprende a usar información que no debería tener. Pensará: "¡Ah, sabía que hiciste clic porque vi el resultado!", pero en el mundo real, no tendrá esa información.

Para evitar esto, los investigadores utilizaron el enmascaramiento de sesión (session masking). Imagina a un profesor cubriendo la clave de respuestas en un examen. Durante el entrenamiento, la IA se ve obligada a mirar solo la información que habría estado disponible en ese momento exacto. Si un clic ocurre 30 segundos después, la IA es ciega a él durante el entrenamiento del momento actual. Esto asegura que cuando la IA vaya al mundo real (servicio en línea), no se confunda ni haga malas suposiciones porque esté dependiendo de información que realmente no puede ver.

El Impulso de Velocidad (Ingeniería de Producción)
Finalmente, construir una IA inteligente es una cosa; hacerla lo suficientemente rápida para manejar miles de millones de anuncios cada día es otra. El equipo utilizó algunos trucos ingeniosos de ingeniería. "Empaquetaron" los datos de forma compacta, como organizar una maleta para que no haya espacio desperdiciado, lo que hizo que el entrenamiento fuera mucho más rápido. También construyeron motores de "FlashAttention" personalizados (partes de software especializadas) que permiten a la IA calificar cientos de anuncios a la vez en una sola pasada ultrarrápida, en lugar de revisarlos uno por uno.

Los Resultados: Una Gran Victoria para LinkedIn

Cuando el equipo puso a prueba a CADET en el feed principal de LinkedIn, los resultados fueron impresionantes. Compararon su modelo contra su antiguo sistema altamente optimizado (una mezcla de diferentes modelos trabajando juntos). El nuevo modelo CADET no solo estuvo a la altura; aplastó a la competencia.

En una prueba en línea a gran escala, CADET logró un aumento del 11.04% en las tasas de clics en comparación con el sistema anterior. Esto significa que, por cada 100 anuncios mostrados, significativamente más personas se detuvieron a mirar. Curiosamente, debido a que los anunciantes en LinkedIn suelen gastar sus presupuestos de forma automática, el gasto total no cambió mucho, pero el valor de esos clics aumentó. El costo por clic cayó un 10.9%, lo que significa que los anunciantes obtuvieron un mejor retorno de su inversión.

El artículo sugiere que este éxito proviene de combinar una IA de "narración de historias" unificada con correcciones inteligentes para los problemas específicos de los anuncios (como la posición y el tiempo). Demuestra que un modelo único y bien diseñado puede vencer a un equipo complejo de modelos más antiguos. Aunque los investigadores señalan que aún queda trabajo por hacer —como manejar incluso más tipos de escenarios de "¿qué pasaría si..."—, su trabajo demuestra que los transformers de solo decodificador están listos para tomar el mando en el mundo de la publicidad en línea.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →