← Nieuwste papers
🤖 AI

RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts

Dit artikel introduceert RECON, een nieuwe benchmark bestaande uit 24 langlopende dossierbestanden binnen de strafrechtelijke, medische en financiële domeinen, ontworpen om de beperkingen van huidige op LLM gebaseerde agenten te evalueren bij het uitvoeren van complexe compositionele redeneertaken zoals multi-hop bewijstreconstructie, conflictresolutie en contrafactische analyse, waarbij zelfs de sterkste systemen slechts 22,4% nauwkeurigheid behalen.

Oorspronkelijke auteurs: Mihir Shriniwas Arya

Gepubliceerd 2026-07-21
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mihir Shriniwas Arya

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een mysterie probeert op te lossen, maar de aanwijzingen liggen niet gewoon verspreid in een kamer; ze zijn begraven in een bibliotheek ter grootte van een kleine stad. Dit is de wereld van Large Language Models (LLM's), de superintelligente computerbreinen achter chatbots en digitale assistenten. Deze modellen zijn geweldig in lezen en praten, maar ze hebben een lastige zwakte: geheugen. Denk aan geheugen niet alleen als een harde schijf waar feiten worden opgeslagen, maar als het vermogen van een detective om zich niet alleen te herinneren wat er is gebeurd, maar ook hoe de ene gebeurtenis tot de andere leidde. Als een getuige van verhaal verandert, of een labtest als vals wordt bewezen, weet een goede detective welke oude conclusies nu gebroken zijn en welke nog steeds standhouden. De grote vraag die onderzoekers stellen is: kunnen deze AI-detectives deze complexe, veranderende verhalen daadwerkelijk volgen over duizenden pagina's, of raken ze simpelweg in de war en verzinnen ze dingen?

Maak kennis met RECON, een nieuwe "stress test" ontworpen om te zien of AI-agenten complexe, langlopende verhalen kunnen aan kunnen waarbij feiten veranderen, elkaar tegenspreken en door het narratief rimpelen als een golf. De onderzoekers bouwden 24 enorme dossiers — sommige zo lang als 100.000 woorden — die uiteenlopen van criminele onderzoeken en medische mysteries tot financiële fraude. Dit zijn geen saaie lijsten met data; het zijn dynamische verhalen waarin een aanwijzing gevonden op Dag 1 op Dag 5 als vals bewezen kan worden, wat de AI dwingt om uit te zoeken welke van zijn eerdere vermoedens nu onjuist waren. De test controleert zes specifieke vaardigheden, zoals het leggen van een keten van 15 aanwijzingen, bepalen wat er zou zijn gebeurd als een sleutelgebeurtenis op een ander tijdstip had plaatsgevonden, of beslissen welke getuige liegt wanneer twee mensen verschillende verhalen vertellen.

De resultaten van dit experiment zijn een beetje een reality check voor de AI-wereld. Zelfs de slimste geteste AI-systemen hadden grote moeite. De beste niet-gespecialiseerde AI gaf minder dan 23% van de tijd het juiste antwoord. Om dat in perspectief te plaatsen: als je een mens dezelfde puzzels zou laten oplossen met de volledige tekst voor zich, zou die persoon het veel beter doen. De studie toonde aan dat het probleem niet alleen is dat de AI niet de juiste pagina in het boek kan vinden (retrieval); de echte flessenhals is redeneren. Zelfs toen de AI het "spiekbriefje" kreeg (een perfecte, gestructureerde kaart van alle feiten en hoe ze met elkaar verbonden zijn), kreeg hij nog steeds slechts ongeveer 55% van de antwoorden goed. Dit suggereert dat hoewel AI steeds beter wordt in het lezen van lange boeken, het de kunst van het verbinden van de punten nog niet onder de knie heeft wanneer het verhaal eronder verandert. De onderzoekers concluderen dat voor AI om echt als een betrouwbare agent in echte banen te kunnen fungeren, het veel beter moet worden in het begrijpen van hoe feiten van elkaar afhankelijk zijn, in plaats van ze alleen maar te onthouden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →