← Nieuwste papers
🤖 AI

Group Preference Collapse in Personalized Multimodal Large Language Models

Dit artikel introduceert PrefMoE, een op voorkeuren gericht framework dat de "groepsvoorkeurscollaps" in gepersonaliseerde multimodale grote taalmodellen aanpakt door voorkeuren te deconstrueren in gedeelde prototypen en gepersonaliseerde residuen, waardoor de individuele responsgeneratie wordt verbeterd terwijl de drift naar dominante populatieniveau-keuzes wordt gemitigeerd.

Oorspronkelijke auteurs: Fan Lyu, Wenqi Zhang, Joost van de Weijer

Gepubliceerd 2026-07-28
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Fan Lyu, Wenqi Zhang, Joost van de Weijer

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, magische bibliotheek binnenloopt waar de boeken terug kunnen praten tegen je. Dit zijn niet zomaar boeken; dit zijn "Multimodale Grote Taalmodellen" (MLLM's). Denk aan hen als superintelligente bibliothecarissen die afbeeldingen kunnen zien, tekst kunnen lezen en de wereld om hen heen begrijpen. Normaal gesproken, als je ze een vraag stelt, geven ze een heel goed, algemeen antwoord dat voor bijna iedereen werkt. Maar wat als je wilde dat de bibliothecaris specifiek jou kende? Wat als je wilde dat hij wist dat jij een hekel hebt aan pittig eten, houdt van vintage mode en altijd de voorkeur geeft aan wandelen boven zwemmen? Dat is het doel van "gepersonaliseerde" AI: om het model te laten fungeren als een vriend die jouw unieke smaak kent, in plaats van een robot die de smaak van de gemiddelde persoon kent.

Echter, er is een lastig probleem wanneer je probeert één bibliothecaris te leren om honderden verschillende mensen tegelijkertijd te kennen. Het paper dat je nu gaat lezen, duikt in een hoekje van de informatica genaamd "Gepersonaliseerde Multimodale Grote Taalmodellen". Het behandelt een specifieke hoofdpijn: wanneer een AI probeert de voorkeuren van veel verschillende gebruikers te leren, raakt hij vaak in de war en stopt hij met naar het individu luisteren. In plaats van te onthouden dat jij van jazz houdt en jouw vriend van rock, begint de AI te denken dat iedereen van het meest populaire muziekgenre houdt. Het is alsoak een ober die, na het bedienen van te veel tafels, besluit om aan iedereen het "meest populaire gerecht" te serveren, en daarbij vergeet dat jij specifiek om de salade vroeg. Dit paper onderzoekt waarom dit gebeurt en probeert het te oplossen, zodat de AI eindelijk jouw specifieke smaak in het leven kan onthouden.

Het Grote "Groepsknuffel"-probleem

De auteurs van dit paper ontdekten een glitch die ze "Group Preference Collapse" noemen. Stel je een klaslokaal voor waar de leraar elke leerling vraagt wat hun lievelingskleur is. Als de leraar echt goed is, onthoudt hij dat Alex van blauw houdt, Sam van groen en Jordan van paars. Maar in dit "collapse"-scenario raakt de leraar overweldigd. Hij merkt op dat "Blauw" de meest populaire reactie in de kamer is, dus begint hij ervan uit te gaan dat iedereen van blauw houdt. Zelfs als Sam zijn hand opsteekt en zegt: "Nee, ik hou echt van groen!", knikt de leraar alleen maar en zegt: "Geweldig, jij houdt ook van blauw."

In de wereld van AI gebeurt dit wanneer een model probeert te leren van veel gebruikers. De "luide" of veelvoorkomende voorkeuren (zoals van yoga houden of casual kleding dragen) overstemmen de stillere, meer specifieke voorkeuren. Het model wordt ongevoelig voor individuele eigenaardigheden en neigt naar de "gemiddelde" keuze. Het paper laat zien dat zelfs als je de AI vertelt: "Hé, ik ben Anderson, en ik hou van tuinieren," de AI nog steeds kan raden dat je van yoga houdt omdat, nou ja, veel mensen in de trainingsdata van yoga houden. Het is niet dat de AI je negeert; het is dat hij vergeten is hoe hij moet luisteren naar de unieke signalen die jou tot jou maken.

De Oplossing: PrefMoE (De Slimme Bibliothecaris)

Om dit op te lossen, hebben de onderzoekers een nieuw systeem gebouwd genaamd PrefMoE. Zie dit als het geven van een supergeorganiseerd archiefsysteem en een set gespecialiseerde assistenten aan de AI-bibliothecaris.

1. Het scheiden van de "Wie" van de "Wat"
Eerst splitst het systeem de informatie van de gebruiker in twee verschillende emmers.

  • De Profiel-emmer (De "Wie"): Deze bevat stabiele feiten over jou, zoals je foto of een beschrijving die zegt: "Ik ben een 25-jarige student." Deze feiten veranderen niet veel.
  • De Voorkeursemmer (De "Wat"): Deze bevat jouw specifieke smaken, zoals "Ik hou van bohemian mode" of "Ik haat horrorfilms." Dit zijn de dingen die jou uniek maken.

Oude methoden probeerden al deze informatie in één grote hoop te proppen, wat de "Groepsknuffel"-problematiek veroorzaakte. PrefMoE houdt ze gescheiden zodat de AI niet in de war raakt.

2. De Prototyp en de Residuele (Het Gemiddelde versus de Twist)
Hier wordt het slim. Het systeem beseft dat iedereen bepaalde gemeenschappelijke smaken deelt (de "Prototype"). Bijvoorbeeld, de meeste mensen houden wel van "reizen". Maar PrefMoE stopt daar niet. Het zoekt naar de "Residual" — de kleine, unieke twist die jouw reisstijl anders maakt. Misschien hou je van reizen, maar haat je specifiek kamperen en hou je alleen van luxe cruises.

  • De Prototype: "Ik hou van reizen." (Gedeeld door velen)
  • De Residual: "Maar ik hou alleen van luxe cruises." (Uniek voor jou)

Het paper vond dat zonder speciale bescherming, de AI de neiging heeft om de "Residual" te negeren en zich gewoon aan de "Prototype" te houden. PrefMoE gebruikt een speciale wiskundige truc genaamd counterfactual augmentation. Stel je voor dat de AI "geestgebruikers" creëert door de voorkeuren van verschillende mensen te mengen en te matchen (bijvoorbeeld de liefde van Anderson voor tuinieren combineren met de liefde van Bella voor yoga). Door te trainen op deze samengestelde combinaties, leert de AI om aandacht te besteden aan de specifieke details in plaats van aan het groepsgemiddelde. Het gebruikt ook een techniek genaamd decorrelatie, wat zoiets is als tegen de AI zeggen: "Hé, meng je reistitels niet met je modevoorkeuren; houd ze in hun eigen vakjes."

3. De Gespecialiseerde Assistenten (De MoE Router)
Ten slotte gebruikt PrefMoE een "Mixture of Experts" (MoE) systeem. Stel je voor dat de AI een team van specialisten heeft. Wanneer je een vraag stelt, kijkt een slimme "router" naar wat je vraagt en beslist welke specialist hij moet oproepen.

  • Als je vraagt: "Wat draagt deze persoon?", roept de router de Profiel-specialist op (die naar je foto kijkt).
  • Als je vraagt: "Welke activiteit zou deze persoon leuk vinden?", roept de router de Voorkeurs-specialist op (die jouw specifieke likes en dislikes controleert).

Dit zorgt ervoor dat de AI niet zomaar gokt op basis van wat populair is; hij haalt actief de juiste informatie over jou op voor de specifieke vraag.

Wat de Cijfers Zeggen

De onderzoekers hebben dit nieuwe systeem getest op verschillende AI-modellen, waaronder enkele zeer populaire zoals LLaVA en Qwen. Ze vergeleken hun nieuwe methode met standaard manieren om AI te trainen.

De resultaten waren vrij duidelijk. In een test met een model genaamd LLaVA-1.5-7B, kreeg de standaard manier van trainen (Full Fine-Tuning) ongeveer 44,13% van de tijd het juiste antwoord als het ging om het raden van een specifieke gebruikersvoorkeur. Met PrefMoE steeg dat aantal naar 67,33%.

Nog belangrijker is dat ze maten hoe vaak de AI de "Groepsknuffel"-fout maakte (het voorspellen van de populaire keuze in plaats van de keuze van de gebruiker). De standaardmethode stortte in naar de groepsvoorkeur in 34,25% van de gevallen. PrefMoE verminderde deze ramp tot slechts 12,33%. In de sterkste modellen die ze testten, bereikte PrefMoE een nauwkeurigheid van 78,93%, terwijl het delegeerfout laag hield op 10,96%.

De Conclusie

Het paper suggereert dat om AI werkelijk persoonlijk te maken, we haar niet alleen meer data kunnen voeren of moeten vertellen om "slimmer te zijn". We moeten haar leren hoe ze de algemene menigte van het individu kan onderscheiden. Door gebruikersinformatie op te splitsen in stabiele profielen en unieke voorkeuren, en door een slim systeem te gebruiken om vragen naar de juiste "expert" te routeren, kunnen we voorkomen dat de AI gokt wat de meerderheid wil en kunnen we haar helpen begrijpen wat jij echt wilt.

Natuurlijk geven de auteurs toe dat het nog niet perfect is. Als je de AI geen duidelijke instructies geeft over je voorkeuren, of als de afbeelding niet genoeg aanwijzingen geeft, kan de AI er nog steeds naast zitten. Maar deze nieuwe aanpak suggerekt een veelbelovend pad vooruit: een pad waarbij de digitale bibliothecaris eindelijk onthoudt dat jij, specifelijk, de voorkeur geeft aan het rustige boekencafé boven het luidruchtige concert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →