Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling
Dieses Paper präsentiert ein produktiv eingesetztes Framework für die Empfehlung von Kurzvideos auf einer Skala von einer Milliarde Nutzern, das die traditionellen Einschränkungen der Sequenzmodellierung überwindet, indem es dünnbesetzte Video-IDs durch kompakte semantische IDs ersetzt und einen Global-Aware Compression Transformer einführt, um ultra-lange Nutzerverhaltenssequenzen effizient zu modellieren, was zu signifikanten Reduzierungen der Rechenkosten und erheblichen Verbesserungen des Nutzerengagements führt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Bibliothekar, der versucht, den perfekten Leser zu bedienen. Aber anstatt nur einiger Bücher hat dieser Leser tausende und nochmals tausende Kurzvideos gesehen. Ihre Aufgabe ist es, sich alle von ihnen zu merken, um zu erraten, was der Leser als Nächstes sehen möchte.
Das Papier beschreibt ein neues System, das Google gebaut hat, um genau dies für Kurzvideos (wie TikTok oder YouTube Shorts) zu tun. Sie standen vor zwei massiven Problemen, die diese Aufgabe nahezu unmöglich machten, und sie haben diese mit zwei cleveren Tricks gelöst.
Die zwei großen Probleme
1. Das „Namensschild“-Problem (Repräsentations-Engpass)
Stellen Sie sich vor, jedes Video auf der Welt hat eine eindeutige, zufällige ID, wie eine Seriennummer auf einem Toaster.
- Das Problem: Wenn man eine Milliarde Videos hat, benötigt man eine Milliarde verschiedene ID-Tags. Diese Tags sind nur zufällige Zahlen; sie sagen einem nichts über das Video aus. Ein Video über „Katzen“ und ein Video über „Autos“ könnten völlig unterschiedliche IDs haben, die nichts miteinander zu tun haben.
- Das Ergebnis: Der Computer muss jede einzelne Interaktion separat auswendig lernen. Es ist, als würde man versuchen, sich eine Milliarde zufällige Telefonnummern zu merken. Zudem hat das System keine Vorstellung davon, worum es geht, wenn ein neues Video (ein „Cold Start“) erscheint, da es diese zufällige ID noch nie zuvor gesehen hat.
2. Das „Gedächtnis-Überlastungs“-Problem (Rechen-Engpass)
Stellen Sie sich vor, Sie lesen ein Buch, bei dem jede Seite mit jeder anderen Seite verbunden ist.
- Das Problem: Um die Historie eines Nutzers von 2.000 Videos zu verstehen, versucht ein Standard-Computergehirn (ein Transformer), jedes einzelne Video mit jedem anderen Video zu vergleichen. Wenn man die Anzahl der Videos verdoppelt, vervierfacht sich die Arbeit nicht nur; sie vervierfacht sich tatsächlich. Es wird so schwerfällig, dass der Computer keinen Speicher mehr hat, abstürzt oder zu lange braucht, um zu antworten.
Die Lösung: Zwei neue Tricks
Die Autoren haben ein System entwickelt, das beide Probleme gleichzeitig löst.
Trick #1: Das „Smarte Kategorien“-System (Semantisch-native IDs)
Anstatt zufällige Seriennummern zu verwenden, haben sie den Videos bedeutungsvolle Etiketten gegeben, die darauf basieren, worum es in ihnen tatsächlich geht.
- Die Analogie: Stellen Sie sich vor, anstatt zufälliger Nummern ist jedes Video mit einer „Kategorie“ und einer „Unterkategorie“ beschriftet.
- Der alte Weg: Video #99283 (Zufällig).
- Der neue Weg: Video = „Gaming“ + „Shooter“.
- Wie es funktioniert: Sie haben eine spezielle KI verwendet, um Videos in einer Hierarchie zu gruppieren. Für die lange Historie der Videos verwendeten sie nur die obersten zwei Ebenen dieser Hierarchie (z. B. nur „Gaming“ und „Shooter“).
- Der Vorteil:
- Kleinere Bibliothek: Sie benötigen keine Milliarde Tags mehr; sie benötigen nur noch Tags für die Kategorien. Dies schrumpft den Speicherbedarf für das „Wörterbuch“ der Videos.
- Besseres Erraten: Wenn ein Nutzer „Gaming-Shooter“-Videos liebt und ein neues Video erscheint, das ebenfalls ein „Gaming-Shooter“-Video ist, weiß das System sofort, dass es dieses empfehlen soll, selbst wenn es das Video noch nie gesehen hat. Es löst das „Cold Start“-Problem.
Trick #2: Die „Gruppierungs“-Strategie (Global-bewusste Kompression)**
Anstatt jedes einzelne Video nacheinander zu betrachten, gruppiert das System sie in „Super-Chunks“.
- Die Analogie: Stellen Sie sich vor, Sie lesen ein 2.000-seitiges Tagebuch.
- Der alte Weg: Sie lesen jedes einzelne Wort und versuchen, jedes Wort mit jedem anderen Wort zu verbinden. Erschöpfend!
- Der neue Weg: Sie nehmen jeweils 4 Seiten auf einmal und kleben sie zu einer einzigen „Super-Seite“ zusammen. Jetzt müssen Sie nur noch 500 „Super-Seiten“ lesen.
- Wie es funktioniert: Sie nehmen 4 aufeinanderfolgende Videos und stapeln sie zu einem einzigen großen „Super-Token“ zusammen. Dies reduziert die Anzahl der Elemente, die der Computer verarbeiten muss, um das Vierfache.
- Der Vorteil:
- Geschwindigkeit: Da es weniger Elemente zum Vergleichen gibt, arbeitet der Computer viel schneller und verbraucht deutlich weniger Speicher (92 % weniger!).
- Intelligenteres Lesen: Durch das Zusammenkleben der Seiten kann der Computer die Details innerhalb dieser Gruppe sehen (wie etwa, wie der Nutzer auf eine bestimmte Sequenz von Videos reagiert hat), während er gleichzeitig das große Ganze im Blick behält.
- Der „Globale Anker“: Sie haben am Anfang der Liste ein spezielles „Globales Frage“-Token hinzugefügt. Denken Sie an einen Bibliothekar, der fragt: „Was ist der allgemeine Vibe dieses Menschen?“ Dies hilft dem System, die spezifischen Details der jüngsten Videos mit der langfristigen Persönlichkeit des Nutzers in Einklang zu bringen.
Die Ergebnisse
Als sie dies in der realen Welt mit Milliarden von Nutzern testeten:
- Es war schneller: Das System verbrauchte viel weniger Computerspeicher und lief viel schneller.
- Es erinnerte sich mehr: Da es schneller war, konnten sie eine Videohistorie von 2.000 Videos einspeisen anstatt nur 800.
- Die Menschen waren glücklicher: Nutzer schauten mehr Videos, die sie mochten, verbrachten mehr Zeit mit dem Anschauen und entdeckten mehr neue Inhalte, die ihnen gefielen.
Zusammenfassung
In dem Paper geht es darum, eine Empfehlungs-Engine zu bauen, die sich an die gesamte Videohistorie eines Nutzers erinnern kann, ohne dabei Kopfschmerzen zu bekommen. Dies erreichten sie, indem sie Videos bedeutungsvolle Namen anstatt zufälliger Nummern gaben und indem sie Videos in Chunks gruppierten, damit der Computer nicht jedes einzelne Video einzeln berechnen muss. Das Ergebnis ist ein System, das schneller, kostengünstiger im Betrieb und besser darin ist, Empfehlungen auszusprechen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.