← Nieuwste papers
🤖 AI

TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems

TokenMinds is een industrieel schaalbaar systeem dat het PLUM-framework uitbreidt om zowel discrete, semantisch gegronde gebruikers-tokens als dichte embeddings te genereren via een vooraf getrainde LLM-architectuur, waarmee het succesvol gedrag van zowel lange als korte video's verenigt om kosten te verlagen terwijl het complementaire waarde demonstreert in grootschalige YouTube-rangschikkingssystemen.

Oorspronkelijke auteurs: Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hon
Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hong, Li Wei, Xinyang Yi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de smaak van een persoon in films probeert te begrijpen. In de oude dagen probeerden aanbevelingssystemen (zoals die van YouTube) dit te doen door de volledige kijkgeschiedenis van een persoon samen te persen in één enkele, kleine, dichte "samenvattingskaart". Denk hierbij aan het proberen te beschrijven van een hele roman door slechts één zin op een plaknotitieblokje te schrijven. Je verliest veel van de nuance, de specifieke details en de unieke smaak van het verhaal.

Andere systemen probeerden een lange, gedetailleerde paragraaf over de gebruiker te schrijven. Maar deze paragrafen waren vaak vaag en legden algemene onderwerpen vast (zoals "ze houden van katten") in plaats van de specifieke, diepe patronen van wat ze daadwerkelijk keken en wanneer.

TokenMinds is een nieuw systeem ontwikkeld door Google DeepMind en YouTube dat dit oplost door gebruikers een "digitale ID-kaart" te geven die bestaat uit discrete tokens (zoals een reeks specifieke, betekenisvolle codes) én de oude "samenvattingskaart" (dichte embeddings) als back-up te bewaren.

Hier is hoe het werkt, uitgelegd met eenvoudige analogieën:

1. De "Semantische ID" (De Magische Postcode)

In plaats van elke video een willekeurig nummer te geven (zoals "Video #49201"), geeft TokenMinds elke video een Semantische ID (SID).

  • De Analogie: Stel je voor dat elke video een "postcode" heeft op basis van waar het echt over gaat. Een video over "het bakken van zuurdesembrood" heeft misschien een postcode die begint met Food-Baking-Bread. Een video over "het repareren van een gootsteen" begint misschien met Home-Plumbing.
  • Waarom het helpt: Als een gebruiker een video over "zuurdesem" bekijkt, ziet het systeem niet alleen een willekeurig nummer; het ziet het "Food-Baking" deel van de code. Dit helpt het systeem om de betekenis achter de kijkervaring te begrijpen, niet alleen de ID.

2. De "Dual-Output" Engine (De Set met Twee Gereedschappen)

TokenMinds gebruikt een speciale AI-architectuur (encoder-decoder) die werkt als een Zwitsers zakmes. Het produceert twee dingen tegelijkertijd:

  • De Dichte Embedding (De Samenvattingskaart): Dit is de klassieke, continue numerieke vector die bestaande systemen al gebruiken. Het is als een snelle snapshot van de 'vibe' van de gebruiker.
  • De SID Tokens (De Gedetailleerde Code): Dit is het nieuwe deel. De AI genereert een lijst met specifieke "postcodes" die de toekomstige interesses van de gebruiker vertegenwoordigen. Het is alsof de AI zegt: "Op basis van wat je hebt bekeken, zul je waarschijnlijk interesse hebben in: Food-Baking-Bread, Tech-Coding-Python en Sports-Basketball."

Het Voordeel: Het systeem krijgt het beste van twee werelden. Het houdt de oude systemen tevreden (door de samenvattingskaart te gebruiken) terwijl het een nieuwe laag van precieze, semantische begrijpelijkheid toevoegt (de tokens). Het onderzoek toonde aan dat het gebruik van beide samen beter werkt dan het gebruik van één van beide alleen.

3. De "Asynchrone" Levering (Het Pre-order Systeem)

Het genereren van deze gedetailleerde tokens is zwaar werk, zoals het bereiden van een complex gerecht. Als je het gerecht zou proberen te koken terwijl de klant aan de toonbank staat te wachten, zou het te langzaam gaan.

  • De Analogie: TokenMinds gebruikt een "pre-order" systeem. Het genereert de "ID-kaart" en de "tokens" van de gebruiker op de achtergrond (asynchroon) terwijl de gebruiker gewoon aan het browsen is. Wanneer de gebruiker daadwerkelijk op "aanbevelen" klikt, pakt het systeem gewoon de vooraf gemaakte kaart uit een snelle opslaglocker. Dit betekent dat het systeem miljarden gebruikers kan afhandelen zonder te vertragen.

4. De "Universele Vertaler" (Eén Model voor Alle Video's)

YouTube heeft twee zeer verschillende soorten video's: Long-Form (zoals een 20-minuten durende documentaire) en Short-Form (zoals 15-seconden durende Shorts). Meestal heb je twee verschillende modellen nodig om deze te begrijpen, omdat mensen ze anders consumeren.

  • De Analogie: TokenMinds is als een universele vertaler. Het gebruikt hetzelfde "postcodesysteem" voor zowel lange als korte video's. Het kan naar de kijkgeschiedenis van een gebruiker kijken die een 20-minuten durende kookshow en een 15-seconden durende kookhack heeft bekeken, en beseffen: "Ah, deze persoon houdt van koken!"
  • Het Resultaat: In plaats van twee aparte, dure modellen te trainen en te draaien, gebruiken ze één model voor beide taken. Dit heeft hun computerkosten met 50% voor training en met 31% voor het serveren (serving) verlaagd, zonder kwaliteitsverlies.

5. De Resultaten (Het Bewijs)

Het team heeft dit getest op echt YouTube-verkeer (miljarden gebruikers).

  • Betere Aanbevelingen: Wanneer ze deze nieuwe tokens toevoegden aan het rankingsysteem, zagen ze een meetbare toename in hoe vaak mensen de video's bekeken en hoe tevreden ze waren.
  • Efficiëntie: Door de modellen voor lange en korte video's te combineren, bespaarden ze een enorme hoeveelheid computerkracht.
  • Diversiteit: Het systeem gokte niet steeds hetzelfde; het genereerde een diverse lijst van potentiële interesses, net zoals een menselijke vriend die een verscheidenheid aan dingen voorstelt die je leuk zou kunnen vinden.

Kortom: TokenMinds is een slimmere, efficiëntere manier om te begrijpen wat gebruikers willen. Het stopt met het proberen te persen van de complexe smaak van een persoon in één enkel getal en geeft in plaats daarvan een reeks betekenisvolle "codes" die hun interesses beschrijven, terwijl het op een enkele, kosteneffectieve engine draait die alle soorten video-inhoud kan verwerken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →