← Nieuwste papers
💬 NLP

DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings

Het artikel introduceert DynamicMem, een synthetische benchmark voor lange termijn met 15 maanden aan gebruikersactiviteit over meerdere apps met evoluerende, impliciete profielen, om kritieke beperkingen in het vermogen van huidige LLM-agenten om langetermijngeheugen in real-world settings te onderhouden en bij te werken, te evalueren en te onthullen.

Oorspronkelijke auteurs: Wenya Xie, Shengming Zhou, Zelin Li, Pouya Parsa, Shuang Zhou, Xinheng Ding, Chinmay Arvind, Guanchu Wang, Vladimir Braverman, Ali Payani, Yantao Zheng, Zirui Liu

Gepubliceerd 2026-06-23
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wenya Xie, Shengming Zhou, Zelin Li, Pouya Parsa, Shuang Zhou, Xinheng Ding, Chinmay Arvind, Guanchu Wang, Vladimir Braverman, Ali Payani, Yantao Zheng, Zirui Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een persoonlijke assistent inhuurt om je te helpen met je leven. Je wilt dat deze persoon onthoudt wie je bent, wat je elke dag doet en waar je van houdt. Maar hier is de crux: je verandert. Je krijgt misschien een nieuwe baan, begint met hardlopen voor marathons, of besluit plotseling dat je geen koffie meer lekker vindt. Een goede assistent moet je oude zelf onthouden wanneer dat belangrijk is, maar ook weten wanneer hij zijn geheugen moet bijwerken om je nieuwe zelf te reflecteren.

Het paper "DynamicMem" betoogt dat we, terwijl we deze AI-assistenten testen, ze een zeer oneerlijke en onrealistische test hebben gegeven. Hier is een eenvoudige uitsplitsing van wat ze hebben ontdekt en wat ze hebben gebouwd om dit te oplossen.

Het Probleem: De "Statische Snapshot"-valstrik

Stel je voor dat je probeert te testen hoe goed een bibliothecaris je leesgewoonten onthoudt.

  • De Oude Manier: Je geeft de bibliothecaris een lijst van 10 boeken die je vorige week hebt gelezen en vraagt: "Wat heb je gelezen?" De bibliothecaris heeft het goed. Daarna vraag je: "Wat ben je nu aan het lezen?" De bibliothecaris zegt nog steeds die oude boeken, omdat de test nooit veranderde.
  • De Realiteit: In het echte leven is je "geheugen" niet zomaar een lijst met feiten. Het is een rommelig, verspreid spoor van aanwijzingen. Je zegt niet: "Ik houd van gezond eten." In plaats daarvan koop je op maandag boerenkool, zoek je op dinsdag naar smoothie-recepten en zeg je op vrijdag je pizza-abonnement op. De aanwijzingen zijn verspreid over verschillende apps (Amazon, Spotify, Google, je fitness tracker).

De auteurs zeggen dat bestaande tests te simpel zijn. Ze behandelen je leven als een bevroren foto, niet als een bewegende film. Ze testen niet of een AI kan omgaan met:

  1. Verschillende snelheden van verandering: Sommige dingen veranderen onmiddellijk (een nieuwe auto kopen), sommige veranderen langzaam (je muzieksmaak), en sommige zijn gewoon routines (je ochtendkoffie).
  2. Externe oorzaken: Je stopt niet zomaar willekeurig met het leuk vinden van koffie. Misschien is het winter, of heb je een nieuwe baan gekregen. Echte veranderingen hebben een reden.
  3. Verspreide bewijslast: De AI moet je profiel samenstellen uit kleine, losstaande acties over 16 verschillende apps.

De Oplossing: DynamicMem (De "15-Maanden Film")

Om dit op te lossen, heeft het team DynamicMem gebouwd. Denk aan dit als een gesimuleerde levensfilm voor 10 verschillende mensen, die 15 maanden lang loopt.

  • De Cast: Ze hebben 10 unieke "persona's" gecreëerd (zoals een software engineer in Pittsburgh of een student in Londen).
  • Het Plot: Deze mensen beleven hun leven gedurende 15 maanden. Ze wisselen van baan, verhuizen, veranderen hun trainingsroutine en verschuiven hun voorkeuren.
  • De Aanwijzingen: Elke actie wordt vastgelegd in 16 verschillende apps (zoals Amazon, Spotify, Gmail, UberEats). Als een gebruiker een nieuwe hobby begint, ziet de AI de persoon gear zoeken, het kopen en het vervolgens gebruiken.
  • De Schaal: Dit is enorm. Elke gebruiker heeft ongeveer 2,2 miljoen woorden aan geschiedenis. Dat is alsof je 10 volledige romans per persoon leest.

De Test: Twee manieren om de assistent te controleren

Ze vroegen niet alleen: "Herinner je je dit?" Ze testten de assistenten op twee manieren op verschillende momenten in de 15 maanden:

  1. De "State Completion" Test (De Quiz):
    • Vraag: "Wat is de huidige trainingsroutine van de gebruiker?"
    • Doel: Kan de AI alle verspreide logs bekijken en de gaten correct invullen? (bijv. "Ze rennen op dinsdag en donderdag om 6 uur 's ochtends.")
  2. De "Gepersonaliseerde Service" Test (De Taak):
    • Vraag: "Het is zondagochtend. De gebruiker heeft net koffie ingeschonken. Waar moet de assistent de gebruiker aan herinneren?"
    • Doel: Kan de AI die herinnering gebruiken om daadwerkelijk te helpen? (bijv. "Vergeet je budgetcontrole om 9:30 uur niet!")

Wat ze ontdekten (De "Gotchas")

Ze hebben 5 verschillende AI-geheugensystemen getest. Hier is wat er misging:

1. De "Lang Geheugen" Paradox

  • De Verrassing: Naarmate de geschiedenis langer werd (meer maanden aan data), werd de AI slechter in het beantwoorden van de "Quiz" (State Completion). Maar de AI bleef goed in het uitvoeren van de "Taak" (Gepersonaliseerde Service).
  • Waarom? De "Quiz" vereist het vinden van één specifiek, exact feit verborgen in een berg data. Naarmate de berg groter wordt, is het moeilijker om die ene naald te vinden. Maar de "Taak" is flexibeler; de AI kan elke gerelateerde aanwijzing gebruiken om een goede taak uit te voeren, dus het hebben van meer data helpt het juist.

2. De "Update" Strijd

  • Het Probleem: AI-systemen zijn goed in het onthouden van dingen die hetzelfde blijven, maar slecht in het vergeten van dingen die veranderen.
  • De Metafoor: Stel je een whiteboard voor. Als je "Ik hou van Jazz" opschrijft en later "Ik hou van Rock", dan houdt een slechte AI beide vast. Het raakt in de war. Het faalt specifiek op Voorkeuren (waar je van houdt) en Gewoonten (wat je doet), omdat die vaak impliciet zijn en niet expliciet worden benoemd.

3. De "Retrieval" Bottleneck (Het Ophalen van Informatie)

  • De Belangrijkste Bevinding: In meer dan 93% van de gevallen was het probleem niet dat de AI "dom" was of geen goed antwoord kon formuleren. Het probleem was dat het geheugensysteem de juiste aanwijzingen niet in de eerste plaats vond.
  • De Les: Het maakt niet uit hoe slim de antwoord-generator is als de bibliothecaris de verkeerde boeken naar de tafel brengt. De grootste ruimte voor verbetering zit in de geheugen-retrieval zelf, niet in de "hersenen" van de AI.

De Kernboodschap

DynamicMem is een nieuwe, realistische sportschool om AI-assistenten te testen. Het laat zien dat hoewel AI beter wordt in onthouden, het nog steeds moeite heeft met:

  • Het samenvoegen van een gebruikersleven uit verspreide aanwijzingen.
  • Het bijwerken van het geheugen wanneer het leven van een gebruiker verandert (zoals een nieuwe baan of een nieuwe hobby).
  • Het onderscheid maken tussen wat nu waar is en wat vorig jaar waar was.

Het paper concludeert dat om echt behulpzame persoonlijke assistenten te bouwen, we moeten stoppen met ze te testen op statische lijsten en moeten beginnen met het testen op lange, rommelige, evoluerende verhalen van het echte leven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →