← Nieuwste papers
💻 computer science

PAUSE: A User-Centric Benchmark for Personal AI Assistants in Unified Service Environments

Dit artikel introduceert PAUSE, een gebruikerscentrische benchmark die is ontworpen om persoonlijke AI-assistenten te evalueren in realistische, stateful service-omgevingen door de beperkingen van bestaande gefragmenteerde benchmarks aan te pakken via multi-regime evaluatie, en onthult dat zelfs state-of-the-art modellen moeite hebben met taken die een persistent state-redeneren en configuratiebewustzijn vereisen.

Oorspronkelijke auteurs: Haoyu Chen, Xirui Shi, Yuyao Wang, Jerry Chen, Di Niu

Gepubliceerd 2026-07-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haoyu Chen, Xirui Shi, Yuyao Wang, Jerry Chen, Di Niu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je net een superintelligente robot-butler hebt gebouwd. Je hebt hem geleerd hoe hij deuren moet openen, lichten moet aanzetten en zelfs pizza moet bestellen. Maar er is een addertje onder het gras: in de echte wereld leeft je robot niet in een vacuüm. Hij leeft in jouw huis, met jouw regels. Misschien heb je een geheime code voor de voordeur, een specif으로 tijdstip waarop de lichten niet aan mogen staan, of een regel dat de robot niet aan de koekjestrommel mag komen tenzij je hem eerst toestemming geeft. Dit is de wereld van "Persoonlijke AI-assistenten." Dit zijn niet zomaar chatbots die trivia beantwoorden; het zijn digitale helpers die ontworpen zijn om jouw leven te beheren, van je gezondheidsgegevens tot je boodschappenlijstje. Maar hier komt de grote vraag: kunnen deze robots de rommelige, ingewikkelde realiteit van jouw leven echt aan, waarbij dingen veranderen, toestemmingen lastig zijn en ze moeten onthouden wat er vijf minuten geleden is gebeurd om te weten wat ze nu moeten doen? Wetenschappers hebben geprobeerd deze robots te testen, maar de meeste van hun tests zijn als het spelen van een videogame waarbij de regels simpel zijn en de wereld telkens opnieuw wordt gereset. Ze testen eigenlijk niet of de robot de "echte zaak" aankan, een verenigde, toestandafhankelijke omgeving waar jouw persoonlijke instellingen en machtigingen ertoe doen.

Maak kennis met een nieuwe studie genaamd PAUSE, die fungeert als een gigantische, realistische hindernisbaan voor deze AI-assistenten. De onderzoekers, een team van de Universiteit van Alberta, hebben een gesimuleerde wereld gebouwd die precies aanvoelt als het digitale leven van een echt persoon. In deze wereld moet de AI verschillende diensten beheren — zoals het controleren van je trainingslogs, het beheren van je gezondheidsafspraken of het kopen van boodschappen — terwijl het rekening houdt met jouw specifieke machtigingen en de huidige status van je accounts. Denk aan een "kies je eigen avontuur"-boek waarbij de AI elk aspect van de keuzes die je hebt gemaakt, elk wachtwoord dat je hebt ingesteld en elk abonnement dat je hebt, moet bijhouden, terwijl het probeert een taak te voltooien. Het team heeft een pijplijn ontwikkeld om honderden van deze lastige scenario's te genereren, variërend van eenvoudige gegevensopvragingen tot complexe, meerstaps boodschappenmissies waarbij de AI jou om hulp moet vragen als het tegen een muur van machtigingen aanloopt.

Toen ze de nieuwste en beste AI-modellen door deze PAUSE-test haalden, waren de resultaten een flinke reality check. Zelfs de meest geavanceerde, dure AI-modellen van grote techbedrijven hadden moeite. Hoewel ze goed waren in eenvoudige taken, daalde hun succespercentage aanzienlijk wanneer ze moesten redeneren over complexe, veranderende toestanden of verborgen systeemregels moesten ontdekken. Sterker nog, bij de moeilijkste taken die dit soort "toestandsafhankelijk redeneren" vereisten, slaagden zelfs de beste modellen er niet in om de taak in meer dan 30% van de gevallen te voltooien, wat betekent dat ze de grens van 70% succes niet haalden. De studie suggereert dat alleen goed zijn in het aanroepen van tools niet genoeg is; de AI moet veel beter worden in het begrijpen van het "waarom" en "hoe" van jouw persoonlijke digitale omgeving. De onderzoekers ontdekten dat de grootste hindernis niet het vermogen van de AI was om te praten of te lezen, maar het vermogen om te onthouden en te redeneren over de onzichtbare regels van jouw leven, zoals een robot die vergeet dat hij jouw toestemming nodig heeft voordat hij aan de koekjestrommel mag komen. Dit werk laat niet alleen zien waar de robots falen; het geeft ons een nieuwe, eerlijkere manier om ze te testen zodat we assistenten kunnen bouwen die echt klaar zijn om ons in de echte wereld te helpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →