TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems
TokenMinds ist ein industrieller Systemansatz, der das PLUM-Framework erweitert, um sowohl diskrete, semantisch fundierte Nutzer-Token als auch dichte Embeddings über eine vortrainierte LLM-Architektur zu generieren, wodurch Lang- und Kurzvideo-Verhaltensweisen erfolgreich vereinigt werden, um Kosten zu senken und gleichzeitig einen komplementären Wert in groß angelegten YouTube-Ranking-Systemen nachzuweisen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, den Filmgeschmack einer Person zu verstehen. In der alten Zeit versuchten Empfehlungssysteme (wie die auf YouTube), dies zu tun, indem sie die gesamte Videohistorie einer Person in eine einzige, winzige, dichte „Zusammenfassungskarte“ pressten. Denken Sie daran wie der Versuch, einen ganzen Roman zu beschreiben, indem man nur einen Satz auf einen Klebezettel schreibt. Dabei gehen die Nuancen, die spezifischen Details und der einzigartige Geschmack der Geschichte verloren.
Andere Systeme versuchten, einen langen, detaillierten Absatz über den Nutzer zu schreiben. Aber diese Absätze waren oft vage und erfassten allgemeine Themen (wie „sie mögen Katzen“), anstatt die spezifischen, tiefen Muster dessen, was sie tatsächlich gesehen und wann, zu erfassen.
TokenMinds ist ein neues System von Google DeepMind und YouTube, das dies löst, indem es den Nutzern eine „digitale ID-Karte“ aus diskreten Token (wie einem Satz spezifischer, bedeutungsvoller Codes) gibt und die alte „Zusammenfassungskarte“ (dichte Embeddings) als Backup behält.
So funktioniert es, unterteilt in einfache Analogien:
1. Die „Semantische ID“ (Die magische Postleitzahl)
Anstatt jedem Video eine zufällige Nummer zu geben (wie „Video #49201“), gibt TokenMinds jedem Video eine Semantische ID (SID).
- Die Analogie: Stellen Sie sich vor, jedes Video hat eine „Postleitzahl“, die darauf basiert, worum es eigentlich geht. Ein Video über das „Backen von Sauerteigbrot“ könnte eine Postleitzahl haben, die mit
Essen-Backen-Brotbeginnt. Ein Video über das „Reparieren eines Waschbeckens“ könnte mitHaus-Sanitärbeginnen. - Warum es hilft: Wenn ein Nutzer ein Video über „Sauerteig“ schaut, sieht das System nicht nur eine zufällige Nummer; es sieht den Teil des Codes „Essen-Backen“. Dies hilft dem System, die Bedeutung hinter dem Aufruf zu verstehen, nicht nur die ID.
2. Die „Dual-Output“-Engine (Der Werkzeugkasten mit zwei Werkzeugen)
TokenMinds verwendet eine spezielle KI-Architektur (Encoder-Decoder), die wie ein Schweizer Taschenmesser fungiert. Sie erzeugt zwei Dinge gleichzeitig:
- Das dichte Embedding (Die Zusammenfassungskarte): Dies ist der klassische, kontinuierliche Zahlenvektor, den bestehende Systeme bereits nutzen können. Es ist wie ein schneller Schnappschuss der „Vibe“ des Nutzers.
- Die SID-Token (Der detaillierte Code): Dies ist der neue Teil. Die KI generat eine Liste spezifischer „Postleitzahlen“, die die zukünftigen Interessen des Nutzers repräsentieren. Es ist, als würde die KI sagen: „Basierend auf dem, was du geschaut hast, wirst du wahrscheinlich Folgendes wollen:
Essen-Backen-Brot,Tech-Programmieren-PythonundSport-Basketball.“
Der Vorteil: Das System erhält das Beste aus beiden Welten. Es hält die alten Systeme zufrieden (durch Nutzung der Zusammenfassungskarte), während es eine neue Ebene des präzisen, semantischen Verständnisses hinzufügt (durch die Token). Das Team stellte fest, dass die Verwendung von beidem zusammen besser funktioniert als die Verwendung von nur einem der beiden.
3. Die „Asynchrone“ Auslieferung (Das Vorbestellsystem)
Das Generieren dieser detaillierten Token ist eine schwere Aufgabe, vergleichbar mit dem Kochen einer komplexen Mahlzeit. Wenn man versuchen würde, sie zu kochen, während der Kunde bereits an der Theke wartet, wäre es zu langsam.
- Die Analogie: TokenMinds nutzt ein „Vorbestellsystem“. Es generiert die „ID-Karte“ und die „Tokens“ des Nutzers im Hintergrund (asynchron), während der Nutzer einfach nur stöbert. Wenn der Nutzer tatsächlich auf „Empfehlen“ klickt, greift das System einfach auf die vorgefertigte Karte aus einem schnellen Lagerfach zu. Das bedeutet, dass das System Milliarden von Nutzern handhaben kann, ohne langsamer zu werden.
4. Der „Universelle Übersetzer“ (Ein Modell für alle Videos)
YouTube hat zwei sehr unterschiedliche Arten von Videos: Langform (wie eine 20-minütige Dokumentation) und Kurzform (wie 15-sekündige Shorts). Normalerweise benötigt man zwei verschiedene Modelle, um diese zu verstehen, da Menschen sie unterschiedlich konsumieren.
- Die Analogie: TokenMinds ist wie ein universeller Übersetzer. Es verwendet dasselbe „Postleitzahlen“-System für sowohl lange als auch kurze Videos. Es kann in die Historie eines Nutzers schauen, der eine 20-minütige Kochshow und einen 15-sekündigen Koch-Hack gesehen hat, und erkennen: „Ah, diese Person liebt Kochen!“
- Das Ergebnis: Anstatt zwei separate, teure Modelle zu trainieren und zu betreiben, verwenden sie ein Modell für beide Aufgaben. Dies senkte ihre Rechenkosten um 50 % beim Training und um 31 % beim Serving, ohne an Qualität einzubüßen.
5. Die Ergebnisse (Der Beweis)
Das Team testete dies mit echtem YouTube-Traffic (Milliarden von Nutzern).
- Bessere Empfehlungen: Als sie diese neuen Token in das Ranking-System integrierten, stellten sie einen messbaren Anstieg bei der Interaktion der Menschen mit den Videos sowie bei deren Zufriedenheit fest.
- Effizienz: Durch die Kombination der Modelle für lange und kurze Videos sparten sie eine enorme Menge an Computerleistung.
- Diversität: Das System rät nicht einfach immer wieder das Gleiche; es generiert eine vielfältige Liste potenzieller Interessen, ganz ähnlich wie ein menschlicher Freund, der eine Vielzahl von Dingen vorschlägt, die einem gefallen könnten.
Kurz gesagt: TokenMinds ist eine intelligentere und effizientere Art zu verstehen, was Nutzer wollen. Es hört auf, zu versuchen, den komplexen Geschmack einer Person in eine einzige Zahl zu pressen, und gibt stattdin eine Reihe aussagekräftiger „Codes“ aus, die ihre Interessen beschreiben – und das alles auf einer einzigen, kosteneffizienten Engine, die alle Arten von Videoinhalten verarbeiten kann.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.