← Últimos artículos
🤖 AI

M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction

El artículo propone M3TR, un marco multimodal de recuperación mejorada temporal que aprovecha un Proceso de Mamba-Hawkes para modelar la dinámica de retroalimentación del usuario autoexcitante y un mecanismo de recuperación consciente del tiempo para capturar la evolución de la popularidad, logrando así un rendimiento de vanguardia en la predicción de la popularidad de microvídeos.

Autores originales: Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Bo Peng, Cheng Hua, Haibing Guan

Publicado 2026-08-19
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Bo Peng, Cheng Hua, Haibing Guan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el vasto y agitado océano del contenido de video de formato corto, donde se suben millones de clips cada día, una sola pregunta impulsa los motores de los algoritmos de recomendación: ¿qué video capturará la atención del mundo y por cuánto tiempo? Predecir esta popularidad no es simplemente una cuestión de contar "me gusta" o veces que se comparte; es un intento de pronosticar el comportamiento futuro de una multitud basándose en las reacciones fugaces y, a menudo, caóticas de los individuos. Durante años, los investigadores han intentado construir modelos que puedan ver el futuro del éxito de un video analizando su contenido: cómo se ve, cómo suena y qué dice el texto sobre él. También han intentado rastrear cómo los usuarios interactúan con un video a lo largo del tiempo, tratando esas interacciones como un simple gráfico de líneas que sube o baja. Sin embargo, estos enfoques a menudo pierden de vista el ritmo más profundo y complejo del compromiso humano. No logran comprender que una ráfaga de "me gusta" puede desencadenar una ola de veces que se comparte, o que una repentina inundación de comentarios negativos puede matar instantáneamente el impulso de un video, independientemente de lo hermoso que sea el video en sí.

Un equipo de investigadores de la Universidad Jiao Tong de Shanghái y la Universidad Queen's de Belfast ha propuesto una nueva forma de resolver este rompecabezas, introduciendo un sistema que llaman M3TR. En lugar de solo mirar de qué está hecho un video, o tratar la retroalimentación del usuario como un número simple que cambia con el tiempo, este nuevo enfoque trata la popularidad como una secuencia de eventos viva y palpitante. Los investigadores se dieron cuenta de que para predecir el futuro de un video, se debe entender la cadena de reacción específica e intrincada de las reacciones humanas. Construyeron un sistema que aprende a reconocer el "ADN temporal" único del éxito de un video. Esto significa que el sistema no solo pregunta: "¿Es este video sobre gatos?". Pregunta: "¿Sigue este video el mismo patrón de emoción y declive que otros videos que se hicieron famosos, incluso si esos otros videos eran sobre cocina o baile?". Al combinar una comprensión profunda de cómo las interacciones de los usuarios se influyen entre sí con un motor de búsqueda inteligente que encuentra videos con historias de popularidad similares, el equipo creó una herramienta que ve el futuro con más claridad que nunca.

El núcleo de su descubrimiento reside en cómo modelaron la forma en que la gente reacciona a los videos. En el pasado, los sistemas a menudo trataban un "me gusta", un "compartir" y un "comentario" como eventos independientes, o simplemente los sumaban en una sola puntuación. Los investigadores sabían que esto era erróneo. Comprendieron que estas acciones están profundamente conectadas: un aumento de "me gusta" puede fomentar más veces que se comparte, mientras que una ola de comentarios controvertidos puede suprimir el compromiso posterior. Para capturar esto, desarrollaron un nuevo método que ve la retroalimentación del usuario como una serie de eventos autoexcitables, donde una acción desencadena naturalmente la siguiente, pero donde la naturaleza de ese activador puede cambiar según el contexto. Utilizaron una arquitectura de red neuronal sofisticada para aprender los patrones a largo plazo en estas secuencias, permitiendo que el sistema vea que un tipo específico de comentario podría señalar el fin de la popularidad de un video, incluso si el video todavía está recibiendo "me gusta". Esta capacidad de distinguir entre el impulso positivo y un pico falso fue un avance crítico.

Una vez que el sistema pudo mapear con precisión la compleja historia de las interacciones de un video, los investigadores enfrentaron el siguiente desafío: cómo usar ese conocimiento para predecir el futuro. Los métodos tradicionales buscarían otros videos que se vieran o sonaran similares. Si tenías un video sobre un gato, el sistema buscaría otros videos de gatos. Los investigadores encontraron que este enfoque era defectuoso. Un video sobre un gato podría tener un ascenso lento y constante en popularidad, mientras que otro video de un gato podría explotar instantáneamente y luego desvanecerse. El contenido era el mismo, pero la historia de su éxito era completamente diferente. Su nuevo sistema, M3TR, cambió las reglas de la búsqueda. En lugar de solo emparejar el contenido, emparejó la "historia" de la popularidad. Buscó en una enorme biblioteca de videos históricos para encontrar ejemplos que compartieran el mismo patrón de compromiso: videos que ascendieron y descendieron de la misma manera, independientemente de si eran sobre gatos, autos o cocina.

Este cambio del emparejamiento de contenido al emparejamiento de patrones resultó ser increíblemente poderoso. Cuando los investigadores probaron su sistema con datos del mundo real de dos grandes conjuntos de datos, los resultados fueron sorprendentes. El nuevo modelo superó significativamente a todos los métodos anteriores, reduciendo el error en sus predicciones hasta en un 19.3 por ciento. En términos más simples, fue mucho más preciso al adivinar cuántas personas verían, darían "me gusta" o compartirían un video en las horas y los días siguientes. El sistema fue particularmente bueno manejando los casos más difíciles: videos que comenzaron con fuerza pero luego se desvanecieron, o videos que permanecieron latentes antes de volverse virales repentinamente. Al aprender de la trayectoria específica de videos pasados, el modelo podía detectar las señales sutiles de que un video estaba a punto de estancarse o despegar, algo que los modelos anteriores perdían por completo.

Los investigadores también demostraron que su enfoque es práctico para el uso en el mundo real. Si bien el sistema requiere una cantidad significativa de potencia de cómputo para construir su biblioteca de patrones de video, este trabajo se realiza de antemano, fuera de línea (offline). Una vez construida la biblioteca, el sistema puede realizar predicciones para nuevos videos en tiempo real, encontrando los ejemplos históricos más relevantes en una fracción de segundo. Este proceso de dos pasos asegura que el sistema siga siendo rápido y eficiente para los usuarios, incluso a medida que la biblioteca de datos crece para incluir millones de videos. El estudio confirma que comprender la historia dinámica y evolutiva de cómo las personas interactúan con el contenido es mucho más importante para la predicción que simplemente analizar el contenido en sí. Al escuchar el ritmo de la atención humana en lugar de solo mirar la imagen, los investigadores han proporcionado una forma nueva y más confiable de navegar por el impredecible mundo de los medios virales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →