Predicting Post Virality with Temporal Cross-Attention over Trend Signals
Dit artikel introduceert ViralityNet, een nieuwe architectuur die de voorspelling van de virale verspreiding van Reddit-berichten verbetert door interne berichtkenmerken te combineren met exogene temporale signalen van pieken in pagina-aanroepen van Wikipedia via een temporair kruisaandachtsmechanisme, en aantoont dat het integreren van dynamieken van real-world aandacht aanzienlijk beter presteert dan basismodellen die uitsluitend tekst gebruiken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert te raden welke van je vrienden' socialemediaberichten "viraal" zullen gaan—duizenden likes en comments krijgen—en welke genegeerd zullen worden.
De meeste computerprogramma's proberen dit op te lossen door alleen naar het bericht zelf te kijken. Ze lezen de titel, tellen het aantal woorden, controleren of het op een vrijdag is geplaatst en kijken hoeveel volgers de gebruiker heeft. Het is alsof je probeert te voorspellen of een nummer een hit wordt door alleen de tekst te lezen, zonder ooit de radio te hebben gehoord of te weten waar mensen momenteel over zingen.
Dit artikel stelt dat deze aanpak een enorm stuk van de puzzel mist: timing en context. Een bericht over een specifiek onderwerp kan saai zijn op een willekeurige dinsdag, maar als datzelfde onderwerp plotseling het grootste nieuwsverhaal ter wereld wordt, kan dat bericht in populariteit exploderen.
Hieronder wordt uitgelegd hoe de auteurs, Sarvagya Somvanshi en Mohan Xu, een nieuw systeem genaamd ViralityNet hebben gebouwd om dit op te lossen, in eenvoudige bewoordingen:
1. Het "weerbericht" van het internet
De auteurs beseften dat je om virale verspreiding te voorspellen moet weten wat de "publieke stemming" op dat exacte moment is. Om dit te doen, gebruikten ze bezoekcijfers van Wikipedia-pagina's als een "weerbericht" voor de online aandacht.
- De analogie: Stel je voor dat je een visser bent. Je kunt naar je boot (het bericht) en je vistuig (de tekst) kijken, maar om een grote vis te vangen, moet je weten waar de vissen op dit moment zijn.
- De methode: Ze hielden bij welke Wikipedia-artikelen elke dag een plotselinge, enorme piek in bezoekersaantallen kregen. Als "Artificial Intelligence" plotseling 100.000 meer views had dan normaal, betekende dit dat de hele wereld plotseling bezeten was van AI. ViralityNet gebruikt deze gegevens om te zien of een Reddit-bericht "op de golf" van het huidige publieke belang meereist.
2. De "superlezer" (De architectuur)
Ze bouwden een neurale netwerk (een type AI) genaamd ViralityNet. Denk hierbij aan een superlezer die een Reddit-bericht tegelijkertijd door vier verschillende lenzen bekijkt:
- De titel: Wat zegt de kop?
- De inhoud: Wat is het daadwerkelijke verhaal?
- De structuur: Wanneer is het geplaatst? Hoe lang is het?
- De community: In welke "club" (subreddit) zit het? (Een bericht in een financiële club wordt anders beoordeeld dan één in een gaming-club).
Het geheime ingrediënt:
Meestal worden deze vier lenzen gewoon met elkaar gemengd. Maar ViralityNet heeft een speciale "Cross-Attention"-functie.
- De analogie: Stel je voor dat je een nieuwsartikel leest. Terwijl je leest, kijk je voortdurend uit het raam om te zien wat er op straat gebeurt. Als je een parade ziet, besteed je extra aandacht aan het deel van het artikel over de parade.
- Hoe het werkt: ViralityNet leest het Reddit-bericht en kijkt vervolgens direct naar een "schuifvenster" van de 512 meest trending Wikipedia-onderwerpen van de afgelopen week. Het vraagt zich af: "Past dit bericht bij waar de wereld momenteel over praat?" Als het antwoord ja is, verhoogt het de voorspelling dat het bericht viraal zal gaan.
3. Hoe ze succes maten
Ze testten dit op bijna 800.000 Reddit-berichten uit 10 verschillende communities (zoals r/technology, r/politics en r/gaming) over een periode van drie jaar.
- Het doel: Voorspellen of een bericht in de top 10% van de engagement voor zijn specifieke community zou komen.
- Het resultaat:
- De oude manier (alleen naar de tekst kijken) was oké, maar niet geweldig.
- De nieuwe manier (ViralityNet), die het "Wikipedia-weerbericht" includeerde, was consistent beter.
- Het verbeterde de nauwkeurigheid met een kleine maar betekenisvolle marge. Het systeem leerde dat een bericht over een beurscrash veel waarschijnlijker viraal gaat als mensen op dat moment op Wikipedia naar die aandelen zoeken.
4. Belangrijke nuances
Het artikel benadrukt een paar interessante details:
- Context telt: Het systeem werkte het beste in communities waar de buitenwereld belangrijk is (zoals r/technology of r/stocks). Het had iets meer moeite in communities die worden gedreven door inside jokes of specifieke cultuur (zoals r/gaming), waar het "globale weer" minder belangrijk is dan de "lokale sfeer".
- Tijd is cruciaal: Het systeem leerde dat engagement-normen van jaar tot jaar veranderen. Een bericht dat in 2021 1.000 upvotes krijgt, kan als "viraal" worden beschouwd, terwijl je in 2023 misschien 5.000 nodig hebt. Het model leerde zich hierop aan te passen.
- Het is geen magie: Het systeem is niet perfect. Het wordt soms misleid. Als een bericht bijvoorbeeld een titel heeft die klinkt als een trending onderwerp maar eigenlijk een grap of slechte kwaliteit is, kan het systeem zijn succes overschatten. Omgekeerd mist het soms berichten die viraal gaan puur vanwege humor of woede, wat niets te maken heeft met huidige nieuwstrends.
De conclusie
De belangrijkste boodschap is simpel: Content wordt niet viraal in een vacuüm.
Om te voorspellen wat in brand zal vliegen, kun je niet alleen naar het hout kijken (het bericht); je moet ook naar de wind kijken (de huidige publieke aandacht). Door de tekst van een bericht te combineren met real-time data over wat de wereld momenteel leest en waarover nadenkt, hebben de auteurs aangetoond dat we aanzienlijk betere voorspellingen kunnen doen over wat online populair zal worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.