← Neueste Arbeiten
🤖 AI

M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction

Das Papier schlägt M3TR vor, ein zeitlich erweitertes, auf Retrieval basierendes multimodales Framework, das einen Mamba-Hawkes-Prozess nutzt, um die selbst-erregenden Dynamiken des Nutzerfeedbacks zu modellieren, sowie einen zeitbewussten Retrieval-Mechanismus, um die Popularitätsentwicklung zu erfassen, wodurch eine State-of-the-Art-Leistung bei der Vorhersage der Popularität von Mikro-Videos erzielt wird.

Ursprüngliche Autoren: Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Bo Peng, Cheng Hua, Haibing Guan

Veröffentlicht 2026-08-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Bo Peng, Cheng Hua, Haibing Guan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In dem riesigen, aufgewühlten Ozean der Kurzvideo-Inhalte, in dem täglich Millionen von Clips hochgeladen werden, treibt eine einzige Frage die Motoren der Empfehlungsalgorithmen an: Welches Video wird die Aufmerksamkeit der Welt auf sich ziehen, und wie lange? Die Vorhersage dieser Popularität ist nicht bloß eine Frage des Zählens von Likes oder Shares; es ist der Versuch, das zukünftige Verhalten einer Menge basierend auf den flüchtigen, oft chaotischen Reaktionen des Einzelnen vorherzusagen. Jahrelang haben Forscher versucht, Modelle zu entwickeln, die die Zukunft des Erfolgs eines Videos vorhersagen können, indem sie dessen Inhalt analysieren – wie es aussieht, wie es klingt und was der Text darüber sagt. Sie haben auch versucht zu verfolgen, wie Nutzer mit einem Video interagieren, indem sie diese Interaktionen als eine einfache Linie behandelten, die steigt oder fällt. Diese Ansätze übersehen jedoch oft den tieferen, komplexeren Rhythmus des menschlichen Engagements. Sie versäumen es zu verstehen, dass ein Schub an Likes eine Welle von Shares auslösen kann oder dass eine plötzliche Flut negativer Kommentare die Dynamik eines Videos sofort stoppen kann, ungeachtet dessen, wie schön das Video selbst ist.

Ein Team von Forschern der Shanghai Jiao Tong University und der Queen's University Belfast hat einen neuen Weg vorgeschlagen, um dieses Rätsel zu lösen, und führt ein System ein, das sie M3TR nennen. Anstatt nur zu betrachten, woraus ein Video besteht, oder das Nutzerfeedback als eine einfache Zahl zu behandeln, die sich im Laufe der Zeit verändert, betrachtet dieser neue Ansatz Popularität als eine lebendige, atmende Sequenz von Ereignissen. Die Forscher erkannten, dass man, um die Zukunft eines Videos vorherzusagen, die spezifische, komplizierte Kettenreaktion menschlicher Reaktionen verstehen muss. Sie bauten ein System, das lernt, die einzigartige „temporale DNA“ des Erfolgs eines Videos zu erkennen. Das bedeutet, das System fragt nicht nur: „Ist dieses Video über Katzen?“ Es fragt: „Folgt dieses Video demselben Muster von Begeisterung und Rückgang wie andere Videos, die berühmt wurden, selbst wenn diese anderen Videos über Kochen oder Tanzen waren?“ Durch die Kombination eines tiefen Verständnisses dafür, wie Nutzerinteraktionen einander beeinflussen, mit einer intelligenten Suchmaschine, die Videos mit ähnlichen Popularitätsverläufen findet, schuf das Team ein Werkzeug, das die Zukunft klarer sieht als je zuvor.

Der Kern ihrer Entdeckung liegt darin, wie sie die Art und Weise modellierten, wie Menschen auf Videos reagieren. In der Vergangenheit behandelten Systeme ein „Like“, ein „Share“ und einen „Kommentar“ oft als unabhängige Ereignisse oder addierten sie einfach zu einem einzigen Score zusammen. Die Forscher wussten, dass dies falsch war. Sie verstanden, dass diese Handlungen tief miteinander verbunden sind: Ein Anstieg der Likes kann mehr Shares fördern, während eine Welle kontroverser Kommentare weiteres Engagement unterdrücken kann. Um dies zu erfassen, entwickelten sie eine neue Methode, die Nutzerfeedback als eine Serie selbst-erregender Ereignisse betrachtet, bei denen eine Aktion natürlich die nächste auslöst, wobei die Art des Auslösers je nach Kontext variieren kann. Sie verwendeten eine ausgeklügelte neuronale Netzwerkarchitektur, um die langfristigen Muster in diesen Sequenzen zu lernen, was es dem System ermöglichte zu erkennen, dass eine bestimmte Art von Kommentar das Ende der Popularität eines Videos signalisieren könnte, selbst wenn das Video noch immer Likes erhält. Diese Fähigkeit, zwischen positivem Momentum und einem falschen Gipfel zu unterscheiden, war ein entscheidender Durchbruch.

Nachdem das System in der Lage war, die komplexe Historie der Interaktionen eines Videos präzise abzubilden, standen die Forscher vor der nächsten Herausforderung: Wie nutzt man dieses Wissen, um die Zukunft vorherzusagen? Traditionelle Methoden suchten nach anderen Videos, die ähnlich aussahen oder klangen. Wenn man ein Video über eine Katze hatte, suchte das System nach anderen Katzenvideos. Die Forscher fanden diesen Ansatz fehlerhaft. Ein Video über eine Katze könnte einen langsamen, stetigen Anstieg der Popularität erleben, während ein anderes Katzenvideo sofort explodieren und dann schnell wieder verblassen könnte. Der Inhalt war derselbe, aber die Geschichte ihres Erfolgs war völlig unterschiedlich. Ihr neues System, M3TR, änderte die Regeln der Suche. Anstatt nur den Inhalt abzugleichen, glich es die „Geschichte“ der Popularität ab. Es durchsuchte eine riesige Bibliothek historischer Videos, um Beispiele zu finden, die denselben Interaktionsmuster teilten – Videos, die auf die gleiche Weise aufstiegen und fielen, unabhängig davon, ob sie von Katzen, Autos oder Kochen handelten.

Dieser Wechsel vom Inhaltsabgleich zum Musterabgleich erwies sich als unglaublich leistungsstark. Als die Forscher ihr System an realen Daten aus zwei großen Datensätzen testeten, waren die Ergebnisse beeindruckend. Das neue Modell übertraf alle bisherigen Methoden signifikant und reduzierte den Fehler in seinen Vorhersagen um bis zu 19,3 Prozent. Einfacher ausgedrückt: Es war weitaus genauer darin, zu erraten, wie viele Menschen in den kommenden Stunden und Tagen ein Video ansehen, liken oder teilen würden. Das System war besonders gut darin, die schwierigsten Fälle zu bewältigen: Videos, die stark begannen und dann abflachten, oder Videos, die unauffällig blieben, bevor sie plötzlich viral gingen. Durch das Lernen aus der spezifischen Trajektorie vergangener Videos konnte das Modell die subtilen Anzeichen erkennen, dass ein Video kurz vor dem Stillstand oder dem Durchbruch stand – etwas, das ältere Modelle völlig übersehen hatten.

Die Forscher demonstrierten auch, dass ihr Ansatz für die reale Anwendung praktikabel ist. Obwohl das System eine erhebliche Menge an Rechenleistung benötigt, um seine Bibliothek von Videomustern aufzubauen, wird diese Arbeit im Voraus, also offline, erledigt. Sob einer die Bibliothek aufgebaut ist, kann das System Vorhersagen für neue Videos in Echtzeit treffen, indem es die relevantesten historischen Beispiele in einem Bruchteil einer Sekunde findet. Dieser zweistufige Prozess stellt sicher, dass das System für Nutzer schnell und effizient bleibt, selbst wenn die Bibliothek der Daten auf Millionen von Videos anwächst. Die Studie bestätigt, dass das Verständnis der dynamischen, sich entwickelnden Geschichte der Interaktion mit Inhalten weitaus wichtiger für die Vorhersage ist als die bloße Analyse des Inhalts selbst. Indem sie dem Rhythmus der menschlichen Aufmerksamkeit lauschten, anstatt nur das Bild zu betrachten, haben die Forscher einen neuen, zuverlässigeren Weg gefunden, um durch die unvorhersehbare Welt der viralen Medien zu navigieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →