HorizonBench: Long-Horizon Personalization with Evolving Preferences
Het paper introduceert HorizonBench, een nieuw benchmark met gesimuleerde zesmaandelijkse gesprekken en grondwaarheid voor het volgen van veranderende gebruikersvoorkeuren, en onthult dat huidige modellen vooral falen in het bijwerken van hun geloof over de gebruiker wanneer voorkeuren evolueren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Samenvatting van het onderzoek: "HorizonBench" – Waarom AI-verjaardagskaarten vergeten, maar jouw nieuwe hobby wel onthoudt
Stel je voor dat je een gesprek voert met een zeer slimme, maar soms wat stijve vriend. Jullie praten al maandenlang. In het begin vind je het geweldig als die vriend je verhalen vertelt met veel poëzie en geduldige uitleg. Maar dan, halverwege het jaar, krijg jij een nieuwe baan als CEO. Je leven verandert: je hebt minder tijd, meer stress en je wilt nu directheid en actie, geen poëzie meer.
Het probleem? Die slimme vriend vergeet je verandering niet, maar hij onthoudt je oude voorkeur te goed. Als je hem nu vraagt: "Hoe moet ik dit gesprek aanpakken?", geeft hij je nog steeds die lange, poëtische verhalen uit het begin van het jaar, terwijl je nu juist een snelle, zakelijke checklist nodig hebt. Hij heeft je nieuwe situatie niet geïntegreerd in zijn beeld van jou.
Dit is precies het probleem dat dit nieuwe onderzoek, genaamd HorizonBench, aan de kaak stelt.
1. Het Probleem: De "Oude Foto" in het hoofd van de AI
Vroeger dachten we dat AI gewoon heel goed was in het onthouden van feiten. Maar dit onderzoek laat zien dat AI moeite heeft met het bijwerken van zijn geloof over wie jij bent.
- De analogie: Stel je voor dat je AI een fotoboek heeft van jou. In het begin van het jaar staat er een foto van jou in een joggingpak. Later in het jaar heb je een pak aan en ben je een CEO geworden. Als je AI alleen naar de eerste foto kijkt, denkt hij nog steeds dat je in een joggingpak loopt. Hij heeft de "nieuwe foto" niet op de juiste plek in zijn hoofd geplaatst.
- De term: De onderzoekers noemen dit "Long-Horizon Personalization" (Langdurige personalisatie). Het gaat niet om wat je gisteren zei, maar om hoe je voorkeuren veranderen over maanden, door gebeurtenissen in je leven (zoals een nieuwe baan, een verhuizing of een relatiebreuk).
2. De Oplossing: Een "Simulatie-Simulator"
Het grootste probleem bij het testen van AI is dat we in het echte leven niet precies weten wanneer en waarom iemand van gedachten verandert. We kunnen niet met zekerheid zeggen: "Deze AI heeft de nieuwe voorkeur niet gezien, of hij heeft hem gezien maar niet begrepen."
Om dit op te lossen, hebben de onderzoekers een speciale machine gebouwd (een data-generator) die een compleet nieuwe wereld creëert:
- Ze hebben 360 fictieve mensen bedacht, elk met een gedetailleerd "mentaal landkaartje" (een grafiek van hun gedachten, voorkeuren en levensgebeurtenissen).
- Deze machine laat deze mensen 6 maanden lang chatten met een AI-assistent.
- Omdat de machine de "waarheid" kent (ze hebben het landkaartje zelf gemaakt), weten ze precies: "Op dag 45 veranderde deze gebruiker van voorkeur omdat hij CEO werd."
Dit is als een realityshow voor AI, maar dan met een script dat perfect bekend is. Ze kunnen nu precies zien waar de AI faalt.
3. De Test: HorizonBench
Uit deze simulaties hebben ze HorizonBench gemaakt, een enorme test met bijna 4.300 vragen.
- De test: De AI krijgt een gesprek van 6 maanden lang (ongeveer 163.000 woorden, dat is als een dik boek!) te lezen.
- De vraag: Aan het einde van het gesprek moet de AI kiezen welke van de 5 mogelijke antwoorden het beste past bij de huidige voorkeur van de gebruiker.
- De valstrik: Eén van de 5 antwoorden is perfect, maar gebaseerd op de oude voorkeur (de "oude foto"). Een ander antwoord is perfect, maar gebaseerd op de nieuwe voorkeur.
4. De Resultaten: De AI zit vast in het verleden
Ze hebben 25 van de slimste AI-modellen ter wereld (zoals GPT-5, Claude, Gemini) deze test laten doen. Het resultaat was verrassend slecht:
- De beste AI haalde slechts 52,8% goed. Dat is nauwelijks beter dan raden (20%).
- Veel AI's scoorden zelfs onder de 20%. Ze deden het slechter dan een willekeurige gok!
- Waarom? Als de AI een fout maakte, koos hij in meer dan een derde van de gevallen voor het antwoord dat gebaseerd was op de oude voorkeur.
De conclusie: De AI's zijn goed in het zoeken naar informatie in een lang gesprek (retrieval), maar ze zijn slecht in het updaten van hun kennis (belief update). Ze plakken de oude voorkeur als een sticker op hun hoofd en vergeten die er nooit af te halen, zelfs niet als er een hele nieuwe levensverandering is gebeurd.
5. Waarom is dit belangrijk?
Stel je voor dat je een therapeut, een coach of een persoonlijke assistent hebt die je al jaren kent. Als die persoon je oude voorkeuren blijft gebruiken terwijl je leven drastisch is veranderd, is dat niet alleen vervelend, maar kan het zelfs schadelijk zijn.
Dit onderzoek toont aan dat we AI niet alleen slimmer moeten maken in het onthouden van lange verhalen, maar dat we ze moeten leren verandering te omarmen. Ze moeten leren dat "ik ben gisteren zo, maar ik ben vandaag anders" een normaal menselijk proces is.
Kortom: HorizonBench is als een spiegel die we voor de AI houden. Het laat zien dat hoewel deze modellen kunnen lezen als een bibliotheek, ze nog niet kunnen "voelen" of begrijpen dat mensen veranderen. En dat is de volgende grote stap voor slimme AI.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.