← Nieuwste papers
🤖 AI

Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling

Dit artikel presenteert een in productie geïmplementeerd framework voor korte video-aanbevelingen op een schaal van een miljard gebruikers, dat de traditionele beperkingen van sequentiemodellering overwint door ijle Video-ID's te vervangen door compacte Semantische ID's en een Global-Aware Compression Transformer te introduceren om ultra-lange gebruikersgedragssequenties efficiënt te modelleren, wat resulteert in significante reducties in computationele kosten en substantiële verbeteringen in gebruikersbetrokkenheid.

Oorspronkelijke auteurs: Ruixiao Sun, Diego Uribe Mora, Zhimeng Jiang, Yuanzhen Lin, Jiarui Wang, Yuening Li, Danfeng Guo, Zhizhong Chen, Chuan He, Liang Liu

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ruixiao Sun, Diego Uribe Mora, Zhimeng Jiang, Yuanzhen Lin, Jiarui Wang, Yuening Li, Danfeng Guo, Zhizhong Chen, Chuan He, Liang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een bibliothecaris bent die probeert de perfecte boekentip te geven aan een lezer. Maar in plaats van een paar boeken, heeft deze lezer duizenden en duizenden korte video's bekeken. Jouw taak is om ze allemaal te onthouden om te kunnen raden wat de lezer als volgende wil zien.

Dit document beschrijft een nieuw systeem dat Google heeft gebouwd om precies dit te doen voor korte video's (zoals TikTok of YouTube Shorts). Ze stuitten op twee enorme problemen die deze taak bijna onmogelijk maakten, en ze hebben dit opgelost met twee slimme trucs.

De Twee Grote Problemen

1. Het "Naamkaartje"-probleem (Representatie-bottleneck)
Stel je voor dat elke video ter wereld een uniek, willekeurig ID-nummer heeft, zoals een serienummer op een broodrooster.

  • Het probleem: Als je een miljard video's hebt, heb je een miljard verschillende ID-tags nodig. Deze tags zijn slechts willekeurige getallen; ze zeggen niets over de video. Een video over "katten" en een video over "auto's" kunnen ID's hebben die totaal niet op elkaar lijken.
  • Het resultaat: De computer moet elke interactie afzonderlijk onthouden. Het is alsof je een miljard willekeurige telefoonnummers probeert te onthouden. Ook wanneer er een nieuwe video (een "cold start") verschijnt, heeft het systeem geen idee waar het over gaat omdat het die willekeurige ID nog nooit heeft gezien.

2. Het "Geheugenoverbelasting"-probleem (Computationele bottleneck)
Stel je voor dat je een boek probeert te lezen waarbij elke pagina met elke andere pagina verbonden is.

  • Het probleem: Om de geschiedenis van 2.000 video's van een gebruiker te begrijpen, probeert een standaard computerbrein (een Transformer) elke video met elke andere video te vergelijken. Als je het aantal video's verdubbelt, wordt de hoeveelheid werk niet alleen dubbel, maar verviervoudigt het. Het wordt zo zwaar dat de computer het geheugen vol laat lopen en crasht, of te langzaam reageert.

De Oplossing: Twee Nieuwe Trucs

De auteurs bouwden een systeem dat beide problemen tegelijk oplost.

Truc #1: Het "Slimme Categorie"-systeem (Semantisch-natuurlijke ID's)

In plaats van willekeurige serienummers, gaven ze video's betekenisvolle labels gebaseerd op waar ze daadwerkelijk over gaan.

  • De analogie: Stel je voor dat in plaats van willekeurige nummers, elke video wordt gelabeld met een "Categorie" en een "Subcategorie".
    • Oude manier: Video #99283 (Willekeurig).
    • Nieuwe manier: Video = "Gaming" + "Shooter".
  • Hoe het werkt: Ze gebruikten een speciale AI om video's in een hiërarchie te groeperen. Voor de lange geschiedenis van video's gebruikten ze alleen de bovenste twee niveaus van deze hiërarchie (bijvoorbeeld alleen "Gaming" en "Shooter").
  • Het voordeel:
    • Kleinere bibliotheek: Ze hebben geen miljard tags meer nodig; ze hebben alleen tags nodig voor de categorieën. Dit verkleint de geheugenruimte die nodig is voor het "woordenboek" van video's.
    • Beter raden: Als een gebruiker van "Gaming-Shooter" video's houdt, en er komt een nieuwe video uit die ook "Gaming-Shooter" is, weet het systeem direct dat deze aanbevolen moet worden, zelfs als het de nog nooit eerder heeft gezien. Dit lost het "cold start"-probleem op.

Truc #2: De "Groeperingsstrategie" (Global-Aware Compressie)

In plaats van elke video één voor één te bekijken, groepeert het systeem ze in "super-chunks".

  • De analogie: Stel je voor dat je een dagboek van 2.000 pagina's leest.
    • Oude manier: Je leest elke pagina één voor één en probeert elk woord met elk ander woord te verbinden. Uitputtend!
    • Nieuwe manier: Je neemt telkens 4 pagina's en plakt ze samen tot één "Super-Pagina". Nu hoef je nog maar 500 "Super-Pagina's" te lezen.
  • Hoe het werkt: Ze nemen 4 opeenvolgende video's en stapelen deze samen tot één grote "Super-Token". Dit vermindert het aantal items dat de computer moet verwerken met een factor 4.
  • Het voordeel:
    • Snelheid: Omdat er minder items vergeleken moeten worden, werkt de computer veel sneller en gebruikt hij veel minder geheugen (92% minder!).
    • Slimmer lezen: Door de pagina's aan elkaar te plakken, kan de computer de details binnen die groep zien (zoals hoe een gebruiker reageerde op een specifieke reeks video's), terwijl hij toch het grote plaatje behoudt.
    • De "Global Anchor": Ze voegden een speciale "Global Question" token toe aan het begin van de lijst. Denk aan een bibliothecaris die vraagt: "Wat is de algemene vibe van dit persoonlijkheidsprofiel?" Dit helpt het systeem om de specifieke details van de recente video's in balans te brengen met de langetermijnpersoonlijkheid van de gebruiker.

De Resultaten

Toen ze dit in de echte wereld testten met miljarden gebruikers:

  1. Het was sneller: Het systeem gebruikte veel minder computergeheugen en draaide veel sneller.
  2. Het onthield meer: Omdat het sneller was, konden ze 2.000 video's aan geschiedenis voeden in plaats van slechts 800.
  3. Mensen waren gelukkiger: Gebruikers keken meer video's die ze leuk vonden, besteedden meer tijd aan kijken en ontdekten meer nieuwe inhoud die ze leuk vonden.

Samenvatting

De paper gaat over het bouwen van een aanbevelingsmachine die de volledige videogeschiedenis van een gebruiker kan onthouden zonder hoofdpijn te krijgen. Ze deden dit door video's betekenisvolle namen te geven in plaats van willekeurige nummers, en door video's in groepen te verdelen zodat de computer niet voor elk item afzonderlijk berekeningen hoeft uit te voeren. Het resultaat is een systeem dat sneller is, goedkoper in gebruik en betere aanbevelingen doet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →