← Nieuwste papers
🤖 AI

ProEvent: An Event-centric Benchmark for Proactive Agents

Het artikel introduceert ProEvent, de eerste event-gecentreerde benchmark voor het evalueren van het vermogen van proactieve agenten om autonoom gebruikersgebeurtenissen uit instant messaging-chats te volgen, wat onthult dat huidige grote taalmodellen aanzienlijk moeite hebben met timing, evenementannulering en impliciete redenering.

Oorspronkelijke auteurs: Guanzhen Li, Liangming Pan, Leye Wang

Gepubliceerd 2026-07-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Guanzhen Li, Liangming Pan, Leye Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente digitale assistent hebt die niet alleen wacht tot je om hulp vraagt, maar je leven als een havik in de gaten houdt en raadt wat je nodig hebt nog voordat je het zelf zegt. Dit is de droom van "proactieve agenten". In tegenstelling tot een gewone robot die ongebruikt blijft zitten totdat je op een knop drukt, is een proactieve agent als een persoonlijke chefkok die begint met het snijden van groenten zodra hij de knoflook ruikt, of een vriend die je een paraplu aanreikt op het moment dat de lucht grijs wordt. De grote uitdaging in de informatica op dit moment is om deze digitale breinen te leren dit te doen zonder in de war te raken door de rommelige, chaotische realiteit van het menselijk leven. We weten dat computers geweldig zijn in het volgen van strikte regels, maar het echte leven zit vol verborgen hints, overlappende gesprekken en mensen die van gedachten veranderen zonder "annuleren" te zeggen. Als we willen dat deze agenten echt behulpzaam zijn, moeten ze in staat zijn om onze toekomstige plannen te volgen — zoals een wandeling in de natuur of een vergadering — simpelweg door naar onze tekstberichten te luisteren, en ze moeten precies weten wanneer ze de mond moeten houden en wanneer ze moeten inspreken.

Maak kennis met PROEVENT, een nieuwe "trainingsgrond" ontworpen door onderzoekers om te testen of deze digitale assistenten werkelijk klaar zijn voor de echte wereld. Denk aan PROEVENT als een gigantisch, hoogwaardig videospelniveau waarbij de speler een AI is die de agenda van een mens beheert. In plaats van de AI een net lijstje met afspraken te geven, voeden de onderzoekers het met een stroom van rommelige, realistische chatgesprekken. De AI moet luisteren naar gesprekken tussen vrienden, collega's en familieleden, uitzoeken welke evenementen worden gepland, en vervolgens de agenda dienovereenkomstig bijwerken. Maar hier komt de twist: de chats zitten vol met afleidingen. Er zijn zijgesprekken over niets, mensen die halverwege hun plannen wijzigen, en berichten die klinken als een annulering maar dat niet zijn. De AI moet tegelijkertijd een detective, een griffier en een tijdmanager zijn.

De onderzoekers hebben deze test gebouwd door duizenden nep, maar zeer realistische chatlogs te creëren. Ze programmeerden "personages" met verschillende persoonlijkheden en doelen, en simuleerden complexe scenario's waarin mensen vergadertijden onderhandelen, plannen afzeggen omdat ze zich ziek voelen, of proberen iets te plannen dat nooit echt plaatsvindt. Ze voegden zelfs "ruis" toe — willekeurige berichten die niets met het hoofdevenement te maken hebben — om te zien of de AI afgeleid zou raken. Het doel was simpel: kan de AI een tijdsschema correct opbouwen en bijwerken door alleen deze chats te lezen?

Toen ze acht verschillende krachtige AI-modellen door deze test lieten gaan, waren de resultaten een mix van "niet slecht" en "oh nee". De grootste verrassing was dat de AI's de neiging hebben om overijverig te zijn. Stel je een hond voor die naar elke bewegende blaadje blaft; deze AI's probeerden constant de agenda bij te werken, zelfs wanneer er niets was veranderd. Sterker nog, voor sommige modellen zoals DeepSeek-V3.2 probeerden ze zelfs meer dan 96% van de tijd wijzigingen aan te brengen terwijl ze gewoon stil hadden moeten blijven. Ze waren zo bang om een kans om te helpen te missen, dat ze uiteindelijk chaos veroorzaakten.

Nog een grote hindernis was annulering. Als een gebruiker zegt: "Ik voel me niet goed, misschien kan ik er niet bij zijn," weet een mens dat dit een annulering is. De AI's waren eigenlijk best goed in het opmerken dat een verwijdering nodig zou kunnen zijn (ze vingen ongeveer de helft van de werkelijke annuleringen op), maar ze hadden moeite om er zeker van te zijn. Ze verwijderden regelmatig evenementen die nog steeds plaatsvonden of verwijderden de verkeerde plannen volledig. Het artikel suggereert dat zelfs de meest geavanceerde modellen, zoals het model genaamd GPT-5.1, slechts in ongeveer 26,7% van de lastige scenario's het juiste antwoord gaven. Dat betekent dat ze in ongeveer drie van de vier gevallen de planning verpestten.

De studie toonde ook aan dat deze digitale breinen een vreemde blinde vlek hebben: ze begrijpen niet echt wie ze helpen. Wanneer een gebruer zegt: "Ik ga niet naar het feestje," verwijdert de AI vaak alleen de naam van de gebruiker van de gastenlijst, maar laat het feestje op de agenda staan. Het is als een ober die, wanneer je zegt dat je vol zit, alleen je naam van de reservering haalt maar de tafel voor je gedekt laat. De AI bekijkt het evenement van buitenaf, als een externe waarnemer, in plaats van in de schoenen van de gebruiker te stappen en te beseffen: "Oh, ik (de gebruiker) ga niet, dus dit evenement is voor mij voorbij."

Kortom, hoewel deze AI-agenten slimmer worden, zijn ze nog niet echt klaar om jouw proactieve levensmanager te zijn. Ze zijn te springerig, raken in de war van complexe gesprekken en hebben moeite om het verschil te begrijpen tussen een "misschien" en een "nee". De onderzoekers hopen dat ze, door PROEVENT te gebruiken om precies aan te tonen waar deze AI's falen, toekomstige versies zullen leren om geduldiger, nauwkeuriger en eindelijk meer als een behulpzame menselijke vriend te zijn die precies weet wanneer hij je die paraplu moet aanreiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →