← Nieuwste papers
💬 NLP

Self-supervised User Profile Generation for Personalization

Het artikel introduceert BUMP, een zelfgesuperviseerd framework dat een groot taalmodel traint om gebruikersprofielen te genereren voor personalisatie met behulp van een bidirectionele in-batch ranking-doelstelling met GRPO, waardoor de noodzaak voor dure labels voor downstream-taken wordt geëlimineerd terwijl prestaties worden behaald die vergelijkbaar met of beter dan gesuperviseerde methoden zijn.

Oorspronkelijke auteurs: Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao, Neil Shah

Gepubliceerd 2026-06-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao, Neil Shah

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar ietwat vergeetachtige assistent hebt (de AI). Je wilt dat deze assistent jou zo goed kent dat hij e-mails kan schrijven, films kan aanbevelen of vragen kan beantwoorden precies zoals jij dat wilt.

Het probleem is dat je over de jaren heen duizenden interacties met deze assistent hebt. Als je de assistent bij elke vraag je hele geschiedenis voert, raakt hij overweldigd, traag en in de war. Het is alsof je een hele bibliotheek probeert te lezen om één specifiek boek te vinden.

De Oplossing: Een "Gebruikers-ID-kaart"
In plaats van de hele bibliotheek op de assistent af te branden, stelt het papier voor om voor elke gebruiker een korte, natuurlijke "ID-kaart" of profiel te maken. Dit profiel vat samen wie je bent en waar je van houdt. De assistent leest deze korte kaart voordat hij je vraag beantwoordt, waardoor het voelt alsof hij je persoonlijk kent.

De Oude Manier vs. De Nieuwe Manier (BUMP)

  • De Oude Manier: Om de AI te leren hoe hij deze ID-kaarten moet schrijven, hadden onderzoekers meestal een leraar nodig die elke kaart beoordeelde. "Deze kaart is goed voor het aanbevelen van films," zou de leraar zeggen. "Deze is slecht voor het schrijven van e-mails." Dit is duur, traag en vereist dat een mens gegevens labelt voor elke nieuwe taak.
  • De Nieuwe Manier (BUMP): De auteurs hebben een systeem ontwikkeld genaamd BUMP (Bidirectional User Modeling via Profiles). Dit leert de AI om deze profielen te schrijven zonder enige menselijke leraren of labels. Het gebruikt een "zelfcontrole"-methode.

Hoe BUMP werkt: De "Twee Spiegels"-test
Stel je een kamer voor vol mensen (een batch gebruikers). De AI probeert een profiel te schrijven voor Persoon A. Om te zien of het profiel goed is, voert hij twee tests uit met behulp van een kleine, bevroren "Rechter"-AI:

  1. De "Wie ben ik?"-test (Voorwaartse richting):
    De AI laat de rechter het nieuwe profiel van Persoon A zien en een stapel recente activiteiten van Persoon A en verschillende andere mensen.

    • De Vraag: "Welke van deze activiteiten behoren volgens dit profiel bij Persoon A?"
    • Het Doel: Als het profiel goed is, moet de rechter de activiteiten van Persoon A gemakkelijk kunnen onderscheiden van die van anderen.
  2. De "Wie ben ik?"-test (Achterwaartse richting):
    De AI laat de rechter één van de recente activiteiten van Persoon A zien en een stapel profielen van Persoon A en de andere mensen.

    • De Vraag: "Bij wiens profiel past deze activiteit het best?"
    • Het Doel: Als het profiel goed is, moet de rechter direct het profiel van Persoon A kiezen boven de anderen.

Als de AI beide tests kan doorstaan, weet hij dat hij een profiel heeft geschreven dat de identiteit van die specifieke persoon werkelijk vastlegt. Hij leert door deze tests keer op keer te proberen, waarbij hij de "Rechter" gebruikt om een score te geven, zonder ooit een mens nodig te hebben die zegt: "Goed gedaan."

De "Hard Mode" Upgrade (BUMP+)
Soms vindt de "Rechter" het te makkelijk om mensen uit elkaar te houden (bijvoorbeeld het vergelijken van het profiel van een chef met dat van een rockster is overduidelijk). Om de AI slimmer te maken, voegt BUMP+ een "Hard Mode" toe. Het zoekt specifiek naar mensen die zeer vergelijkbaar zijn met de gebruiker (zoals twee chefs) en dwingt de AI om een profiel te schrijven dat hen toch van elkaar kan onderscheiden. Dit maakt het profiel veel nauwkeuriger.

De Resultaten
De paper heeft dit getest op een standaard set taken (LaMP). Ze ontdekten dat:

  • Hun zelflerende systeem (BUMP+) net zo goed presteerde als, of zelfs beter dan, systemen die dure menselijke labeling vereisten.
  • Hun systeem, draaiend op een relatief klein open-source model, een enorme, dure, gesloten-bron AI (Gemini-3-Pro) versloeg bij personalisatietaken.
  • Het werkt door de lange geschiedenis van een gebruiker te comprimeren tot een korte, nuttige samenvatting die de AI laat aanvoelen als een oude vriend.

In een Notendop
BUMP is een manier om een AI te leren een perfecte "gebruikersbiografie" voor je te schrijven, niet door een mens zijn werk te laten beoordelen, maar door de AI een spelletje "match het profiel aan de persoon" te laten spelen tegen een menigte andere gebruikers. Het is een slimmere, goedkopere en schaalbaardere manier om AI persoonlijk te laten aanvoelen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →