Towards a Densing Law for User Representation Learning at Billion-Scale Capacity
Dit artikel stelt de "User Behavioral Densing Law" voor, een kwantitatief schaleringspatroon dat de gegevensgrootte koppelt aan de minimale voldoende tokenisatiecapaciteit, en introduceert ALGN, een adaptieve tokenisatiemethode die de bottlenecks bij miljarden schaal aan data overwint en bestaande baselines overtreft in het leren van gebruikersrepresentaties.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de digitale wereld laat elke klik, aankoop en zoekopdracht een spoor achter. Voor de bedrijven die de platforms bouwen die we dagelijks gebruiken, zijn deze sporen niet slechts records; ze zijn het grondmateriaal voor het begrijpen van wie wij zijn. Door de lange, kronkelende geschiedenis van iemands acties te analysen, proberen kunstmatige intelligentiesystemen een enkele, krachtige samenvatting te maken van de voorkeuren en gewoonten van dat individu. Deze samenvatting, vaak een gebruikersrepresentatie genoemd, fungeert als een digitale vingerafdruk die helpt beslissen welk nieuws wordt getoond, welke producten worden aanbevolen of welke advertenties worden weergegeven. Jarenlang was de heersende overtuiging onder ingenieurs simpel: om deze vingerafdrukken nauwkeuriger te maken, heb je simpelweg meer data nodig. De logica leek sluitend — voer het systeem meer gebruikers, langere geschiedenissen van hun levens en grotere computerbreinen om dit allemaal te verwerken, en de resultaten zullen vanzelf beter worden.
Echter, een nieuwe studie daagt deze aanname van "meer is beter" uit. Onderzoekers van Ant Group en Zhejiang University onderzochten of deze strategie van eindeloze expansie daadwerkelijk werkt bij het omgaan met de enorme schaal van echte wereldgegevens, zoals de miljarden transacties die door Alipay worden verwerkt. Ze ontdekten dat er een punt is waarop het toevoegen van meer ruwe informatie niet langer helpt, maar juist schaadt. Net zoals een kamer zo vol kan raken met meubels dat het onmogelijk is om te bewegen, kan een systeem zo overspoeld raken met repetitieve, laagwaardige data dat het zijn vermogen verliest om te zien wat er echt toe doet. Het team ontdekte dat de flessenhals niet de grootte van het computermodel is, maar de kwaliteit en dichtheid van de informatie die erin wordt gevoed. Ze stellen een nieuwe aanpak voor die zich richt op het comprimeren van deze enorme geschiedenis tot een compacte, hoogwaardige samenvatting, waardoor het systeem meer kan leren van minder.
De onderzoekers begonnen door de grenzen van de traditionele aanpak te testen op een dataset met honderden miljoenen gebruikers. Ze verhoogden systematisch het aantal gebruikers, de lengte van het tijdvenster dat zij observeerden, en de omvang van het computermodel zelf. Ze ontdekten dat de prestaties aanvankelijk snel verbeterden, maar daarna tegen een harde muur aanliepen. Wanneer ze voorbij een bepaald punt meer gebruikers toevoegden, of naar geschiedenissen keken die langer waren dan ongeveer zestig dagen, leerde het systeem niets nieuws meer. De extra data bestond grotendeels uit dezelfde oude gewoonten die keer op keer werden herhaald, zoals iemand die tien jaar lang elke ochtend dezelfde koffie koopt. Zelfs toen ze het computermodel aanzienlijk groter maakten, slaagde het er niet in slimmer te worden; het memoriseerde simpelweg deze repetitieve details zonder werkelijke inzichten te verkrijgen in de ware voorkeuren van de gebruiker. Dit fenomeen, dat de auteurs de "raw behavioral scaling wall" noemen, toonde aan dat het simpelweg op de problemen gooien van meer data niet langer een levensvatbare strategie was.
Om door deze muur heen te breken, introduceerde het team een methode van "densen" (verdichten) van de data. In plaats van het systeem de volledige, rommelige geschiedenis van ruwe gebeurtenissen te voeren, vertaalden ze die gebeurtenissen eerst naar een compacte set digitale tokens, vergelijkbaar met hoe een boek kan worden samengevat in een paar kernzinnen zonder de rode draad te verliezen. Ze gebruikten een techniek die vergelijkbare gedragingen groepeert en redundantie wegstreept, waarbij alleen de meest informatieve signalen worden behouden. Toen ze hun modellen trainden op deze gecomprimeerde, getokeniseerde versies van de gebruikersgeschiedenissen, waren de resultaten opmerkelijk. Het systeem bleef verbeteren naarmate de data groter werd, terwijl het systeem dat getraind was op ruwe data al gestagneerd was. De gecomprimeerde data stelden het model in staat om het bos te zien in plaats van verdwaald te raken tussen de bomen, waardoor het vermogen behield om te leren en zich aan te passen, zelfs wanneer het inputvolume enorm was.
De studie ging verder door een precieze regel te definiëren voor hoeveel compressie er nodig is naarmate de data groeit. Ze ontdekten dat de hoeveelheid "ruimte" die nodig is om een gebruikerssamenvatting op te slaan, niet in directe proportie hoeft te groeien met de hoeveelheid ruwe data. In plaats daarvan volgt het een voorspelbaar patroon waarbij de benodigde capaciteit langzaam groeit naarmate het datavolume toeneemt. Dit betekent dat voor een systeem dat een miljard gebruikers verwerkt, u niet een miljard keer meer geheugen of rekenkracht nodig heeft; u heeft alleen een zorgvuldig berekende, veel kleinere hoeveelheid hoogwaardige tokens nodig. Deze ontdekking, die zij de "Behavioral Densing Law" noemen, biedt een wiskundige gids voor ingenieurs om precies te weten hoeveel compressie ze moeten toepassen voor een gegeven hoeveelheid data, zodat ze geen middelen verspillen aan onnodige informatie.
Ten slotte ontwikkelden de onderzoekers een nieuwe tool genaamd het Adaptive Length Gated Network om deze wet in de praktijk te brengen. Eerdere methoden behandelden de geschiedenis van elke gebruiker op dezelfde manier, waarbij ze voor iedereen dezelfde hoeveelheid gecomprimeerde ruimte toewezen, ongeacht hoe complex hun leven ook was. De nieuwe tool is slimmer; hij kijelt naar elke gebruiker individueel en beslist hoeveel detail er behouden moet blijven. Voor een gebruiker met een zeer routinematig, voorspelbaar leven, wijst het een zeer korte samenvatting toe. Voor een gebruiker met een complexe, diverse set aan interesses en gewoonten, wijst het een langere, gedetailleerdere samenvatting toe. Deze dynamische aanpak zorgt ervoor dat er geen rekenkracht wordt verspild aan saaie, repetitieve data, terwijl complexe gebruikers nog steeds de aandacht krijgen die ze nodig hebben. In hun tests presteerde deze adaptieve methode niet alleen beter dan alle vorige systemen qua nauwkeurigheid, maar gebruikte het ook aanzienlijk minder rekencapaciteit, wat bewijst dat efficiëntie en prestaties hand in hand kunnen gaan.
De implicaties van dit werk reiken veel verder dan een enkele app of website. Het suggereert een fundamentele verschuiving in hoe we intelligente systemen voor de toekomst bouwen. In plaats van de eindeloze race om meer data te verzamelen en grotere modellen te bouwen, ligt de weg vooruit in het leren extraheren van meer waarde uit de data die we al hebben. Door de focus te leggen op de dichtheid van informatie in plaats van op de loutere omvang, kunnen we systemen bouwen die niet alleen nauwkeuriger zijn, maar ook efficiënter en duurzamer. De studie demonstreert dat in het tijdperk van big data het krachtigste instrument niet een grotere emmer is, maar een beter filter.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.