← Nieuwste papers
🤖 AI

Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design

Het artikel introduceert Kunlun, een verenigde architectuur voor grootschalige aanbevelingssystemen die voorspelbare schaalwetten vaststelt door de slechte schaalefficiëntie aan te pakken via laag-niveau optimalisaties zoals Generalized Dot-Product Attention en Hierarchical Seed Pooling, naast hoog-niveau innovaties zoals Computation Skip, waardoor de schaalefficiëntie wordt verdubbeld en een significante productie-impact wordt bereikt in Meta Ads.

Oorspronkelijke auteurs: Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Y
Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Yuzhen Huang, Chao Chen, Yue Dong, Yi Yang, Shuo Chang, Xiaorui Gan, Wenlin Chen, Santanu Kolay, Darren Liu, Jade Nie, Chunzhi Yang, Ellie Wen, Jiyan Yang, Huayu Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, razendsnelle digitale marktplaats beheert (zoals de een die Meta gebruikt voor hun advertenties). Elke seconde zijn er miljoenen mensen aan het scrollen, en het systeem moet raden op welke advertentie elke persoon zal klikken. Om deze gokjes te wagen, gebruikt het systeem een "brein" (een machine learning-model) dat naar twee soorten aanwijzingen kijkt:

  1. Het Verhaal (Sequentie): Wat de gebruiker onlangs heeft gedaan (bijv. "Ik klikte op een schoen, toen op een hoed, en daarna op een rugzak").
  2. De Snapshot (Context): Wie de gebruiker op dit moment is (bijv. "Het regent," "Ze zijn in New York," "Ze zijn 25 jaar oud").

Een lange tijd was het bouwen van een "brein" dat zowel het verhaal als de snapshot efficiënt kon verwerken, alsof je een racewagen probeerde te besturen met vierkante wielen. Het werkte wel, maar het was ontzettend traag en verspilde veel brandstof (rekenkracht). De onderzoekers noemen dit probleem "gebrekkige schalingsefficiëntie." Kortom, wanneer ze probeerden het brein groter te maken om slimmer te worden, werd het niet snel genoeg slimmer om de extra kosten te rechtvaardigen.

Maak kennis met Kunlun. Genoemd naar een gebergte dat diverse pieken verenigt, is Kunlun een nieuwe architectuur die is ontworpen om deze vierkante wielen te repareren. Het artikel beweert dat het de problemen oplost door het systeem te optimaliseren op twee niveaus: het "fundament" (laagniveau) en de "verkeersbeheer" (hoogniveau).

Hier is hoe Kunlun werkt, met alledaagse analogieën:

1. De Laagniveau-oplossingen: De motor repareren

De oude systemen hadden onderdelen die inefficiënt waren, waardoor de computer "motor" (de GPU) stil kwam te staan terwijl hij wachtte op data. Kunlun vervangt deze door hoogwaardige onderdelen:

  • GDPA (De Gepersonaliseerde Vertaler):
    • Het Probleem: Het oude systeem probeerde het "Verhaal" te vertalen op basis van de "Snapshot" via een onhandig, stapsgewijs proces dat tijd verspilde.
    • De Oplossing: Kunlun gebruikt GDPA (Generalized Dot-Product Attention). Denk aan dit als een vertaler die niet alleen woord voor woord vertaalt, maar direct de context van de hele zin begrijpt. Het voegt stappen samen zodat de computer niet telkens hoeft te stoppen en te starten, waardoor de motor veel soepeler loopt.
  • HSP (De Samenvatter):
    • Het Probleem: Gebruikers hebben lange geschiedenissen (duizenden klikken). Het oude systeem probeerde elke klik individueel te lezen, wat overweldigend was.
    • De Oplossing: HSP (Hierarchical Seed Pooling) is als een slimme redacteur. In plaats van een biografie van 500 pagina's te lezen, leest het het boek, schrijft een samenvatting van 10 pagina's en vervolgens een abstract van 1 pagina. Het condenseert de lange geschiedenis tot een compacte, krachtige samenvatting die het systeem daadwerkelijk kan gebruiken zonder erdoor overbelast te raken.
  • Sliding Window Attention (De Lokale Focus):
    • Het Probleem: Het oude systeem probeerde de allereerste dingen die een gebruiker ooit deed te vergelijken met wat diegene op dit moment doet. Maar meestal is wat je vorige week deed veel belangrijker dan wat je vorig jaar deed.
    • De Oplossing: Sliding Window Attention vertelt het systeem: "Kijk niet naar de hele geschiedenis; kijk alleen naar de laatste paar pagina's." Het focust op recente interacties, wat een enorme hoeveelheid rekenkracht bespaart terwijl de voorspellingen accuraat blijven.

2. De Hoogniveau-oplossingen: Slimme Verkeerscontrole

Zelfs met een geweldige motor kun je brandstof verspillen als je de verkeerde kant op rijdt of bij elk rood licht stopt. Kunlun verandert de manier waarop middelen worden verdeeld:

  • CompSkip (De Snelle Rijstrook):
    • Het Probleen: Het oude systeem dwong het brein om bij elke stap exact hetzelfde zware werk te doen, zelfs wanneer dat niet nodig was.
    • De Oplossing: CompSkip is als een slim verkeerslichtsysteem. Het realiseert zich dat sommige stappen geen volledige "zelfcontrole" (Self-Attention) nodig hebben en sommige geen volledige "samenvatting" (HSP) vereisen. Het slaat de onnodige stappen over op alternerende lagen. Als de auto rechtdoor gaat, hoeft hij niet elke seconde in de achteruitkijkspiegel te kijken. Dit bespaart enorme hoeveelheden energie.
  • Event-Level Personalization (De VIP-behandeling):
    • Het Probleem: Het oude systeem behandelde een "klik" (een sterk signaal) hetzelfde als een "impressie" (het simpelweg zien van een advertentie). Het verspilde middelen aan laagwaardige gebeurtenissen.
    • De Oplossing: Kunlun geeft VIP-behandeling aan belangrijke gebeurtenissen. Als een gebruiker op het punt staat iets te kopen (een hoogwaardige gebeurtenis), wijst het systeem meer rekenkracht en diepere analyse toe. Als het slechts een informeel browsen is, wordt er een lichtere, snellere aanpak gebruikt. Het is als een restaurant dat een volledig proefmenu geeft aan een VIP-gast en een snelle koffie aan iemand die er slechts even langs komt.

Het Resultaat: De "Scaling Law"

Het artikel beweert dat door deze oplossingen te combineren, Kunlun iets bereikt waar de industrie mee worstelde: Voorspelbare Schalingswetten (Scaling Laws).

In het verleden betekende het verdubbelen van de rekenkracht niet altijd het verdubbelen van de intelligentie. Met Kunlun is de relatie voorspelbaar en efficiënt.

  • Efficiëntieboost: Op de nieuwste supercomputers (NVIDIA B200 GPU's) gebruikt Kunlun de hardware twee keer zo efficiënt als eerdere methoden (een sprong van 17% naar 37% benutting).
  • Impact in de echte wereld: Dit is niet alleen een laboratoriumexperiment. Meta heeft Kunlun ingezet in haar belangrijkste advertentiemodellen. Het resultaat? Een verbetering van 1,2% in belangrijke zakelijke statistieken. In de wereld van advertenties, waar dagelijks miljarden beslissingen worden genomen, is dat kleine percentage een enorme overwinning.

Samengevat: Kunlun is een slimmere, slankere en beter georganiseerde manier om aanbevelingssystemen te bouwen. Het stopt met het verspillen van brandstof aan vierkante wielen, slaat onnodige stops over en geeft VIP-behandeling aan de belangrijkste aanwijzingen, waardoor het systeem aanzienlijk slimmer wordt naarmate het groter wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →